跳到主要内容

人工智能安全

做好 AI 安全,先要理解和构建 AI。智能工程是基础层,AI 系统安全、AI 赋能安全和 AI 滥用防御是三条安全主线。 基础层提供模型、Agent、上下文、工具调用、使用实践与工程化能力,后三条主线分别回答如何保护 AI 系统、如何用 AI 做好安全工作,以及如何防范攻击者借 AI 放大伤害。

一个基础层与三条安全主线

层次AI 的角色读者要解决的问题
智能工程基础能力理解模型、Agent、上下文、工具与工程实践,为安全分析和控制建立共同基础
AI 系统安全被保护的对象数据、模型、应用和 Agent 如何安全、可控地接入业务
AI 赋能安全安全工作的工具如何获得可信的漏洞发现、授权验证和安全任务结果
AI 滥用防御攻击者使用的工具如何应对 AI 放大的网络攻击、欺诈和信任风险

智能工程不是独立主题,而是安全主线的前置基础。主归属也不等于风险互斥。一个用于漏洞挖掘的 Agent,其建设方法属于 AI 赋能安全,自身的提示注入与工具越权风险仍要按 AI 系统安全评估。共用机制通过链接引用,不在多个目录复制正文。

定位具体风险时,继续使用双轴:第一条轴检查风险发生在数据与知识、模型与供应链、模型输出、应用、Agent,还是个人与社会;第二条轴区分外部攻击、正常失效和授权滥用。双轴用于检查覆盖,三条主线用于选择阅读入口,不将两种分类混在同一层目录里。

四个公共工程对象

本系列用四个工程对象连接安全边界。它们是文章采用的设计模型,不代表某项行业标准:

Context Envelope
来源、信任级、租户、ACL、版本、血缘

Release Manifest
Target Manifest 摘要、评测报告、批准与提升证明

Action Envelope
委托主体、资源、动作、参数摘要、审批、有效期

Run Event
因果父事件、策略决定、effect_id、实际副作用

Context Envelope 是数据进入一次运行时的最小投影,让文档、检索片段、记忆和工具结果保留来源与权限。KnowledgeArtifact 保存来源与血缘,DataUseEnvelope 保存目的、处理者与留存授权;组装器把二者与当前主体策略求交,得到本次运行的来源、信任、ACL 与去向约束。详见数据与知识安全应用安全隐私保护

Release Manifest 为一次上线绑定完整制品组合和评测结果。发布链先用 Target Manifest 冻结模型、Tokenizer、Adapter、量化、运行时、Prompt、知识、工具与策略,评测报告绑定 Target 摘要;通过后,Release Manifest 再绑定 Target、评测报告、批准与提升证明。它连接模型供应链安全系统安全评测,回答受测系统和生产运行系统是否一致。

Action Envelope 把模型提出的计划转换成模型外可授权的行动请求。不可信内容可以影响计划,不能自行增加权限,详见 Agent 与工具调用安全

Run Event 记录权限转换、跨域数据流和现实副作用。评测环境用它判断危险行为是否真正发生,生产环境用它检测、熔断和取证,详见运行监控与事件响应

四个对象共同支持四条可检查的不变量:不可信上下文不能授予权限;生产运行组合必须与受测组合一致;高后果动作必须经过模型外授权;现实副作用必须能被独立记录、停止、对账或补偿。

五条阅读路径

打基础。 先读智能工程,重点理解模型能力边界、上下文工程、Agent 架构与工具调用,再进入具体安全问题。

做架构。数据与知识模型制品模型行为进入,再检查应用、工具和数据流转的强制边界。

管上线。 依次阅读风险治理系统安全评测与红队运行监控与事件响应,把能力、证据、责任和停止条件连起来。

建安全 AI。漏洞挖掘进入问题选择,再读自动化渗透架构能力和落地评测实战演讲作为历史方案补充,不替代持续维护的方法文章。

防 AI 滥用。攻击能力放大合成内容与信任进入,分别检查技术攻击链和身份、交易与传播链。

行业框架如何进入体系

NIST AI RMFGOVERNMAPMEASUREMANAGE 组织风险管理;NCSC 的安全 AI 系统开发指南按设计、开发、部署和运行覆盖生命周期。它们用于建立管理闭环与责任接口,不直接充当文件目录。

OWASP GenAI Security ProjectMITRE ATLAS用于补充风险、攻击场景、测试样本和检测思路。论文、真实披露、协议实现与可复现实验继续回答控制是否有效及其适用边界,不能仅用框架引用代替有效性证据。

这套分类的边界

本目录聚焦可以通过架构、流程、评测和运行控制降低的网络安全、模型行为、隐私与信任风险。公平性、知识产权、劳动影响和长期前沿对齐问题,只有在改变具体安全目标、责任或控制措施时进入专题。

文章按主要问题归位;演讲、教程和复盘用 content_type 与徽标区分形式,不与技术主题并列成分类。智能工程作为基础层保留通用 AI 原理、使用方法、组织转型与项目实践,并通过稳定 /ai 路由继续访问。