发布 computer use、新版 Claude 3.5 Sonnet 与 Claude 3.5 Haiku¶
- 原文链接:https://www.anthropic.com/news/3-5-models-and-computer-use [47]
- 发布时间:2024-10-22
- 作者:未署名
我们发布新版 Claude 3.5 Sonnet、全新 Claude 3.5 Haiku,并开放 computer use 公测。[47]
更新(2024-12-03): 调整 Claude 3.5 Haiku 定价:输入 $0.80/MTok,输出 $4/MTok。[47]
今天我们发布 升级版 Claude 3.5 Sonnet 与全新 Claude 3.5 Haiku。升级版 Claude 3.5 Sonnet 在各项基准上全面提升,尤其在编码领域显著增强。Claude 3.5 Haiku 在许多评测上达到 Claude 3 Opus(上一代最大模型)的水平,同时保持 Haiku 系列的速度优势。[47]
我们还推出一项公测能力:computer use。在 API 上,开发者可让 Claude 像人一样操作电脑:看屏幕、移动光标、点击按钮、输入文本。Claude 3.5 Sonnet 是首个在公测阶段提供 computer use 的前沿模型。[47]
目前该能力仍处于 实验阶段,存在操作笨拙与错误率高的问题。我们提前发布以获取开发者反馈,并预计其会快速进步。[47]
Asana、Canva、Cognition、DoorDash、Replit 与 The Browser Company 已开始探索该能力,用于完成需要数十乃至数百步骤的任务。例如 Replit 使用 Claude 3.5 Sonnet 的 computer use 与 UI 导航能力为其 Replit Agent 开发关键功能。[47]
升级版 Claude 3.5 Sonnet 已面向所有用户。开发者可立即在 Anthropic API、Amazon Bedrock 与 Google Cloud Vertex AI 上使用 computer use 公测。Claude 3.5 Haiku 将于本月晚些时候发布。[47]

图注:原文未提供图注。[47]
Claude 3.5 Sonnet:行业领先的软件工程能力¶
升级版 Claude 3.5 Sonnet 在多项基准上提升,尤其在代理式编码与工具使用任务上表现突出。[47]
- 在编码上,SWE-bench Verified 从 33.4% 提升到 49.0%,超过所有公开模型,包括 OpenAI o1-preview 等推理模型和专用编码系统。[47]
- 在 TAU-bench(工具使用任务)中,零售域从 62.6% 提升至 69.2%,航空域从 36.0% 提升至 46.0%。[47]
- 价格与速度与前代保持一致。[47]
早期客户反馈显示,这是一大跃迁。GitLab 在 DevSecOps 任务中测试后发现推理能力提升 10% 且无额外延迟。Cognition 用其进行自动评测,编码、规划与问题解决均显著提升。The Browser Company 认为其自动化网页工作流表现优于此前测试过的模型。[47]
新模型的联合预部署测试由美国与英国安全研究机构(US AISI / UK AISI)完成。[47]
我们也评估了灾难性风险,结果表明该模型仍适用我们的 Responsible Scaling Policy 中的 ASL-2 标准。[47]
Claude 3.5 Haiku:速度与性价比的 SOTA¶
Claude 3.5 Haiku 是最快模型的新一代。在类似速度下,它在各项能力上全面提升,并在多项智能基准上超过 Claude 3 Opus。[47]
它在编码任务上尤为强:SWE-bench Verified 得分 40.6%,超过许多使用公开 SOTA 模型的代理系统,包括原版 Claude 3.5 Sonnet 与 GPT-4o。[47]
低延迟、更强指令遵循与更准确工具使用,使其适合用户产品、专业子代理任务,以及基于大量数据(如购买历史、价格或库存记录)生成个性化体验。[47]
Claude 3.5 Haiku 将于本月晚些时候上线我们的 API、Amazon Bedrock 与 Google Cloud Vertex AI,初期为文本模型,后续加入图像输入。[47]
以负责任方式教 Claude 使用电脑¶
computer use 是一种全新方向:不再为特定任务设计专用工具,而是教模型通用电脑技能,使其可使用广泛的软件。开发者可以用其自动化流程、构建与测试软件、进行开放式研究任务。[47]
为实现通用技能,我们构建了 API,让 Claude 能感知并操作电脑界面。开发者可让 Claude 将指令(如“用电脑和在线数据填表”)转化为操作步骤(如打开表格、浏览网页、填写表单)。[47]
在 OSWorld 上,Claude 3.5 Sonnet 的截图模式得分 14.9%,显著高于下一名 7.8%。在允许更多步骤的情况下,得分可达 22.0%。[47]
虽然我们预计该能力会快速提升,但当前仍不完美。滚动、拖拽、缩放等操作仍有挑战,因此建议开发者从低风险任务开始。由于 computer use 可能带来垃圾信息、虚假信息、欺诈等风险,我们采取主动策略:开发新分类器识别何时使用 computer use 以及是否发生危害。更多安全讨论见 developing computer use。[47]
展望¶
从早期部署中学习将帮助我们理解更强 AI 系统的潜力与影响。[47]