跳转至

第 5 章:Computer Use 与屏幕操作

Computer Use 的核心不是“模型更会点击”,而是把 UI 操作标准化成一种可调用的工具通道。工具文档把它描述为一个具备视觉输入与交互输出的能力:模型先获取屏幕状态,再以一系列受控动作完成任务。你可以把它理解成“远程操控一台受限的计算机”,而不是把桌面完全交给模型。[15]

为什么需要这种通道?因为现实系统里仍有大量流程只存在于 UI 层,API 并不完整,或者权限难以开放。Computer Use 让 agent 可以在不改造系统的情况下完成任务,尤其适合自动化重复流程、跨系统操作、以及快速验证界面行为。[15]

Anthropic 的工程文章强调,Computer Use 的能力提升并不只是“识别更准、点击更稳”,而是通过模型迭代让多步骤 UI 任务更一致。换句话说,这类能力从“演示性玩法”走向“可工程化的工具”,前提是有明确边界与审计机制。[46][47]

UI 通道的特殊之处在于它的操作面广、变化多。UI 元素随版本变化,动作可能不可逆,结果也可能难以复现。工程上需要把它当作高权限工具来治理:限定能访问的系统范围、限定任务类型、提供可回放日志,让它成为“最后一公里”而不是默认通道。[15][46]

在实际系统里,Computer Use 常常与其他工具协作:模型先用检索或文件工具拿到目标信息,再通过 UI 完成提交或验证。它的价值不在于替代 API,而是在 API 缺席的地方补齐执行能力。[15]