AI 安全
AI 安全需要同时回答三个问题:系统会不会被攻击,模型自己会不会出错,合法用户会不会借助 AI 放大伤害。 这三个问题要沿数据、模型、应用、行动和现实影响的完整链路检查。只测试模型输出,无法证明接入业务后的系统安全;只沿用传统应用安全,也会遗漏数据投毒、概率性失效、记忆污染和目标劫持。
本目录采用双轴分类。第一条轴定位风险发生在哪里:数据与知识、模型与供应链、模型输出、应用、Agent、个人与社会。第二条轴检查风险来自攻击、正常失效还是授权滥用。NIST、OWASP 或 MITRE 的条目用于补充治理要求、漏洞和攻击技术,不直接充当目录结构。
四个公共工程对象
11 篇文章共用四个工程对象。它们是本系列用于连接各层的设计模型,不代表某项行业标准:
Context Envelope
来源、信任级、租户、ACL、版本、血缘
Release Manifest
Target Manifest 摘要、评测报告、批准与提升证明
Action Envelope
委托主体、资源、动作、参数摘要、审批、有效期
Run Event
因果父事件、策略决定、effect_id、实际副作用
Context Envelope 是数据进入一次运行时的最小投影,让文档、检索片段、记忆和工具结果在进入模型后仍保留来源与权限。KnowledgeArtifact 保存来源与血缘,DataUseEnvelope 保存目的、处理者与留存授权;组装器把二者与当前主体策略求交,得到本次运行的来源、信任、ACL 与去向约束。它服务于数据与知识安全、应用安全和隐私保护。
Release Manifest 为一次上线绑定完整制品组合和评测结果。发布链先用 Target Manifest 冻结模型、Tokenizer、Adapter、量化、运行时、Prompt、知识、工具与策略,评测报告绑定 Target 摘要;通过后,Release Manifest 再绑定 Target、评测报告、批准与提升证明。它解决“测试的是哪个系统、生产实际运行哪个系统”,连接模型供应链安全与安全评测。
Action Envelope 把模型提出的计划转换成模型外可授权的行动请求。它保证不可信内容可以影响计划,却不能自行增加权限,详见 Agent 与工具调用安全。
Run Event 记录权限转换、跨域数据流和现实副作用。评测环境用它判断危险行为是否真正发生,生产环境用它检测、熔断和取证,详见运行监控与事件响应。
四个对象共同支持四条可检查的不变量:不可信上下文不能授予权限;生产运行组合必须与受测组合一致;高后果动作必须经过模型外授权;现实副作用必须能被独立记录、停止、对账或补偿。
四条阅读路径
建立可信基础。 AI 数据与知识安全把知识写入视为延迟生效的行为发布;模型资产与 AI 供应链安全定义复合模型身份;模型安全:对齐与输出安全解释平均行为改善与尾部失效的差异。
控制业务连接。 大模型应用安全寻找混合信任上下文之外的强制边界;Agent 与工具调用安全限制模型可获得的能力与副作用;AI 隐私与机密保护跟踪数据派生物及其可撤销性。
保护人和社会信任。 合成内容与信任安全讨论检测、来源凭证、受管身份和交易授权;AI 滥用与攻防升级分析反馈质量如何决定攻击自动化的放大效果。
形成持续闭环。 AI 风险治理按最大可达后果决定审查与责任;AI 安全评测与红队给出特定版本和攻击预算下的条件性证据;AI 运行监控与事件响应负责上线后的检测、止损、恢复与复盘。
行业框架如何进入体系
NIST AI RMF 用 GOVERN、MAP、MEASURE、MANAGE 组织风险管理;NCSC 的安全 AI 系统开发指南按设计、开发、部署和运行覆盖生命周期。它们适合建立管理闭环与责任接口。
OWASP GenAI Security Project聚焦大模型应用与 Agent 风险,MITRE ATLAS记录针对 AI 系统的对抗战术和技术。它们适合补充攻击场景、测试样本和检测思路。论文、真实披露、协议实现和可复现实验继续回答风险为什么成立、控制能否生效以及适用边界。
这套分类的边界
这里的 AI 安全覆盖网络安全、模型行为安全、隐私与信任风险之间能够通过架构、流程、评测和运行控制降低的交集。公平性、知识产权、劳动影响和更长期的前沿对齐问题会影响治理,只有在它们改变具体安全目标、责任或控制措施时才进入本目录。
用 AI 做代码审计、告警研判和授权渗透属于“AI 赋能安全”。它会改变攻防效率,也要接受这里定义的权限、评测和审计约束。现有的安全大模型评测体系和AI 驱动的全链路自动化网络攻击继续作为这条分支的专题材料。