质量评估和安全

Agent 比普通应用危险得多——根本原因是「指令由 LLM 运行时生成,不可预测」,且失败模式往往是「看起来正常地干了一件错事」。这一章系统地讲清楚 Agent 安全的防御体系和质量验证手段。

安全不是一个功能,而是一个贯穿设计、实现、部署、运维全生命周期的工程纪律。这里的文章按「威胁认知 → 执行层防御 → 数据流防御与验证」的递进逻辑组织。

章节目录

1. AI 安全概览与信任边界

建立 Agent 安全的整体认知。讲清楚为什么 Agent 比普通应用危险、Prompt 注入(尤其间接注入)为什么是头号威胁、数据流经的五个信任边界、消息角色的四种信任级别,以及八条核心防御原则。

对应官方文档:代理安全

2. 工具审批与 CodeAct 沙盒执行

讲两道「执行层」的确定性防线。工具审批(ApprovalRequiredAIFunction / ToolApprovalAgent)让高风险操作停下来等人确认;CodeAct 沙盒执行(Hyperlight VM 隔离 vs LocalCodeAct AST 白名单 vs 托管代码解释器)让 LLM 生成的代码跑在炸不穿的笼子里。

对应官方文档:CodeAct代码解释器

3. FIDES 信息流控制与质量评估

讲「数据流层」的确定性防御和「事后验证」。FIDES 给每段内容打标签、随工具调用传播、在敏感工具执行前确定性地检查策略(目前仅 Python);质量评估框架(LocalEvaluator / FoundryEvals / MEAI 安全评估器)衡量 Agent 的质量、安全和正确性。

对应官方文档:使用 FIDES 的代理安全性Evaluation

参考资料