OSWorld-Human:人类效率基准¶
原文链接: OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents [97]
论文信息¶
- 年份:2025 [97]
- 作者:Reyna Abhyankar, Qi Qi, Yiying Zhang [97]
- 作者背景(研究领域):计算机使用代理/效率评测 [97]
- 前后血缘关系(同主题):前序:OSWorld;后续:无(人类效率对照方向代表)
主旨¶
OSWorld-Human 的主旨是引入人类完成任务的效率基准,用于量化计算机使用代理与人类之间的时间与动作差距。[97]
背景与问题定义¶
论文指出仅关注任务成功率不足以衡量代理的实用性,代理可能“能完成但效率过低”。因此需要引入人类效率作为上限参照,帮助工程团队理解优化目标。[97]
方法与机制¶
OSWorld-Human 在 OSWorld 任务上采集人类完成轨迹,记录时间、动作数与错误恢复过程。评测将代理表现与人类效率进行对比,以揭示主要瓶颈。[97]
实验与结果¶
实验显示,代理在跨应用任务上的效率仍显著落后于人类,尤其在重复操作与错误恢复阶段差距明显。[97]
关键数据结果¶
- 人类效率基准为评估代理“可用性”提供了可量化参照。[97]
工程启示(优化点)¶
- 优化动作路径长度,减少冗余步骤。
- 监控任务时间成本,设置效率门槛。
- 对高频操作引入快捷策略或宏命令。
- 记录动作序列,识别效率瓶颈。
局限与延伸¶
人类轨迹采集成本高且存在任务差异,难以覆盖所有场景。延伸方向包括:自动化效率评估、与用户体验指标结合,以及在更多操作系统与应用生态中扩展基准。[97]