人工智能安全
做好 AI 安全,先要理解和构建 AI。智能工程是基础层,AI 系统安全、AI 赋能安全和 AI 滥用防御是三条安全主线。 基础层提供模型、Agent、上下文、工具调用、使用实践与工程化能力,后三条主线分别回答如何保护 AI 系统、如何用 AI 做好安全工作,以及如何防范攻击者借 AI 放大伤害。
一个基础层与三条安全主线
| 层次 | AI 的角色 | 读者要解决的问题 |
|---|---|---|
| 智能工程 | 基础能力 | 理解模型、Agent、上下文、工具与工程实践,为安全分析和控制建立共同基础 |
| AI 系统安全 | 被保护的对象 | 数据、模型、应用和 Agent 如何安全、可控地接入业务 |
| AI 赋能安全 | 安全工作的工具 | 如何获得可信的漏洞发现、授权验证和安全任务结果 |
| AI 滥用防御 | 攻击者使用的工具 | 如何应对 AI 放大的网络攻击、欺诈和信任风险 |
智能工程不是独立主题,而是安全主线的前置基础。主归属也不等于风险互斥。一个用于漏洞挖掘的 Agent,其建设方法属于 AI 赋能安全,自身的提示注入与工具越权风险仍要按 AI 系统安全评估。共用机制通过链接引用,不在多个目录复制正文。
定位具体风险时,继续使用双轴:第一条轴检查风险发生在数据与知识、模型与供应链、模型输出、应用、Agent,还是个人与社会;第二条轴区分外部攻击、正常失效和授权滥用。双轴用于检查覆盖,三条主线用于选择阅读入口,不将两种分类混在同一层目录里。
四个公共工程对象
本系列用四个工程对象连接安全边界。它们是文章采用的设计模型,不代表某项行业标准:
Context Envelope
来源、信任级、租户、ACL、版本、血缘
Release Manifest
Target Manifest 摘要、评测报告、批准与提升证明
Action Envelope
委托主体、资源、动作、参数摘要、审批、有效期
Run Event
因果父事件、策略决定、effect_id、实际副作用
Context Envelope 是数据进入一次运行时的最小投影,让文档、检索片段、记忆和工具结果保留来源与权限。KnowledgeArtifact 保存来源与血缘,DataUseEnvelope 保存目的、处理者与留存授权;组装器把二者与当前主体策略求交,得到本次运行的来源、信任、ACL 与去向约束。详见数据与知识安全、应用安全和隐私保护。
Release Manifest 为一次上线绑定完整制品组合和评测结果。发布链先用 Target Manifest 冻结模型、Tokenizer、Adapter、量化、运行时、Prompt、知识、工具与策略,评测报告绑定 Target 摘要;通过后,Release Manifest 再绑定 Target、评测报告、批准与提升证明。它连接模型供应链安全与系统安全评测,回答受测系统和生产运行系统是否一致。
Action Envelope 把模型提出的计划转换成模型外可授权的行动请求。不可信内容可以影响计划,不能自行增加权限,详见 Agent 与工具调用安全。
Run Event 记录权限转换、跨域数据流和现实副作用。评测环境用它判断危险行为是否真正发生,生产环境用它检测、熔断和取证,详见运行监控与事件响应。
四个对象共同支持四条可检查的不变量:不可信上下文不能授予权限;生产运行组合必须与受测组合一致;高后果动作必须经过模型外授权;现实副作用必须能被独立记录、停止、对账或补偿。
五条阅读路径
打基础。 先读智能工程,重点理解模型能力边界、上下文工程、Agent 架构与工具调用,再进入具体安全问题。
做架构。 从数据与知识、模型制品、模型行为进入,再检查应用、工具和数据流转的强制边界。
管上线。 依次阅读风险治理、系统安全评测与红队、运行监控与事件响应,把能力、证据、责任和停止条件连起来。
建安全 AI。 从漏洞挖掘进入问题选择,再读自动化渗透架构与能力和落地评测。实战演讲作为历史方案补充,不替代持续维护的方法文章。
防 AI 滥用。 从攻击能力放大和合成内容与信任进入,分别检查技术攻击链和身份、交易与传播链。
行业框架如何进入体系
NIST AI RMF 用 GOVERN、MAP、MEASURE、MANAGE 组织风险管理;NCSC 的安全 AI 系统开发指南按设计、开发、部署和运行覆盖生命周期。它们用于建立管理闭环与责任接口,不直接充当文件目录。
OWASP GenAI Security Project和 MITRE ATLAS用于补充风险、攻击场景、测试样本和检测思路。论文、真实披露、协议实现与可复现实验继续回答控制是否有效及其适用边界,不能仅用框架引用代替有效性证据。
这套分类的边界
本目录聚焦可以通过架构、流程、评测和运行控制降低的网络安全、模型行为、隐私与信任风险。公平性、知识产权、劳动影响和长期前沿对齐问题,只有在改变具体安全目标、责任或控制措施时进入专题。
文章按主要问题归位;演讲、教程和复盘用 content_type 与徽标区分形式,不与技术主题并列成分类。智能工程作为基础层保留通用 AI 原理、使用方法、组织转型与项目实践,并通过稳定 /ai 路由继续访问。