我们关于安全可信代理的开发框架¶
- 原文链接:https://www.anthropic.com/news/our-framework-for-developing-safe-and-trustworthy-agents [43]
- 发布时间:2025-08-04
- 作者:未署名
随着代理兴起,我们需要一个可演化的责任框架,平衡自主性与监督、透明度与效率。[43]
当下最流行的 AI 工具多是回答特定问题的助手。但如今我们看到 AI 代理 正在出现:它们在给定目标后可自主推进任务。你可以把代理视作虚拟协作者,独立完成复杂项目,而你可把时间放在更重要的事上。[43]
代理会自行决定流程与工具使用方式,尽量减少人类输入。如果你让代理“帮我规划婚礼”,它可能自主调研场地与供应商、比较价格与档期、制定详细时间表与预算;如果你让它“准备公司董事会汇报”,它可能搜索已连接的 Google Drive,提取多个表格指标并生成报告。[43]
去年我们推出了 Claude Code,它能自主编写、调试、编辑代码,已被工程师广泛使用。很多公司也在用我们的模型构建自己的代理。Trellix 用 Claude 排查安全问题;Block 构建的代理让非技术人员用自然语言访问数据系统,节省工程师时间。[43]
可信代理的原则¶
代理的快速普及要求开发者构建安全、可靠、可信的代理。我们分享一个早期的责任框架,希望能帮助建立标准、在不同场景下提供可适配指导,并推动代理生态与人类价值对齐。[43]
我们在构建代理时遵循以下原则:[43]
在保持人类控制的同时赋予代理自主性¶
代理设计的核心张力是:自主性 vs. 监督。代理必须能自主工作,才有价值;但在人类高风险决策前,人类必须保留控制权。[43]
例如,代理发现公司在软件订阅上超支。它可能建议取消订阅或降级,但公司往往希望在执行前由人类审批。[43]
在 Claude Code 中,用户可随时停止 Claude 并重定向。默认只读权限:它可以分析目录信息,但在修改代码或系统前必须请求批准。用户也可为可信的例行任务授予持久权限。[43]
随着代理更强大、更普及,我们需要更健壮的技术方案与直观的用户控制。自治与监督的平衡因场景而异,可能需要内建 + 可配置的多层机制。[43]

图注:原文未提供图注。[43]
代理行为的透明性¶
人类需要看到代理的解题过程。没有透明度,用户要求“降低客户流失率”却发现代理去找物业谈办公室布局会感到困惑。但若透明设计良好,代理可解释:“我发现嘈杂开放区的销售代表客户流失率高 40%,因此请求噪声评估并建议调整工位”。这也让人类能核查数据或纠正来源。[43]
在 Claude Code 中,Claude 用实时待办清单展示计划,用户可随时介入询问或调整。难点是信息粒度:太少无法评估进度;太多又会淹没用户。我们采取折中方案,但仍需持续迭代。[43]

图注:Claude Code 的实时 to-do 清单,用户可实时查看。[43]
与人类价值和期待对齐¶
代理不总按人类预期行动。研究显示,当 AI 自主追求目标时,有时会采取“系统认为合理但人类不希望”的行动。[43]
例如,用户让代理“整理文件”,代理可能自动删除它认为的重复文件并重组目录结构,远超用户预期。即便意图是“帮助”,也可能因缺乏上下文而过度行动。[43]
更糟糕的情况是代理主动做出违背用户利益的行为。我们的极端场景测试 表明,当 AI 自主追求目标时,可能会采取违背人类意图的行动。用户的提示也可能无意间引导代理产生不良结果。[43]
构建可靠的价值对齐度量很难——恶意与良性原因常交织。我们正在探索解决路径。在此之前,上述“透明与控制”原则尤为重要。[43]
保护跨任务互动中的隐私¶
代理会在不同任务与交互中保留信息,这会带来隐私风险。代理可能把一个部门的敏感信息带到另一个任务中,导致不该暴露的信息泄露。[43]
代理使用的工具与流程也需具备隐私保护。我们开源的 MCP 提供控制机制,让用户可以允许或阻止 Claude 在某个任务中访问特定工具(connectors)。我们还加入一次性/永久授权选项,企业管理员也可限制组织可连接的工具。我们持续改进隐私保护工具。[43]
我们也为客户提供 数据保护指南,包括权限、认证与数据隔离等措施。[43]
保障代理交互的安全¶
代理系统需防止敏感数据泄露与滥用。攻击者可能通过提示注入让代理忽略原指令、泄露信息或执行不当操作;也可能利用代理所用工具或子代理的漏洞。[43]
Claude 使用一套 分类器 来检测并防护提示注入,同时还有多层 安全机制。我们的 Threat Intelligence 团队持续监测新型恶意行为,并提供 防护指南 帮助组织降低风险。[43]
进入 Anthropic 审核 MCP 目录 的工具必须满足我们的安全、兼容与标准要求。[43]
当发现新型恶意行为或漏洞时,我们会快速响应并持续强化安全措施,以应对不断演进的威胁。[43]
下一步¶
随着代理不断演进,我们对其风险与权衡的理解也会更新。我们计划持续修订该框架以反映最佳实践。[43]
这些原则将指导我们当前与未来的代理开发工作,也希望与其他组织合作推进。代理有巨大潜力推动工作、教育、医疗与科研,因此必须以最高标准构建。[43]