跳到主要内容

AI 系统安全

这里把 AI 视为被保护的对象,回答一个问题:数据、模型、应用和 Agent 接入业务后,哪些危险后果仍然可达,哪些控制可以独立阻断它们? 模型受到攻击和正常运行出错,可能穿过同一条数据或行动路径,因此要同时检查对抗场景和非恶意失效。

建立可信基础

先读 AI 数据与知识安全,检查知识、记忆和反馈的来源、权限与撤销;再读 模型资产与 AI 供应链安全,确认被评测和被发布的是同一组制品;模型安全:对齐与输出安全讨论模型行为改善的作用与边界。

控制业务连接

大模型应用安全检查不可信内容进入上下文后的信任边界。系统能够调用工具时,继续阅读 Agent 与工具调用安全,将模型的提议与真实授权分开。AI 隐私与机密保护沿数据及其派生物检查用途、留存和删除。

建立上线与运行闭环

AI 风险治理明确可接受的能力、责任人与停止权;AI 系统安全评测与红队为特定版本和测试条件提供发布证据;AI 运行监控与事件响应负责上线后的检测、止损、恢复与复盘。

三组文章共用总览中的四个公共工程对象,不分别发明一套来源、版本、授权和事件口径。

与相邻栏目的边界

用 AI 做代码审计、告警研判或授权渗透,进入 AI 赋能安全。防范攻击者借 AI 放大攻击、欺诈和信任风险,进入 AI 滥用防御。通用模型原理、上下文组织和 Agent 工程方法,放在 智能工程,这里只保留它们对应的安全边界。