跳转至

Mind2Web:通用网页代理数据集

原文链接: Mind2Web: Towards a Generalist Agent for the Web [93]

论文信息

  • 年份:2023 [93]
  • 作者:Xiang Deng, Yu Gu, Boyuan Zheng, Shijie Chen, Samuel Stevens, Boshi Wang, Huan Sun, Yu Su [93]
  • 作者背景(研究领域):网页代理/交互数据 [93]
  • 前后血缘关系(同主题):前序:WebShop;后续:WebArenaWebVoyager

主旨

Mind2Web 的主旨是提供大规模真实网页任务数据,覆盖多站点、多类型 UI 操作,为训练通用网页代理提供高质量轨迹与指令对齐数据。[93]

背景与问题定义

论文指出现有网页代理数据集规模有限、站点单一,难以训练可迁移的通用代理。真实网页任务包含大量噪声与变体,需要更广泛的数据覆盖才能形成稳健能力。[93]

方法与机制

Mind2Web 收集跨站点的真实任务与操作轨迹,保留 DOM 状态、用户指令和动作序列。数据集强调从自然语言指令到具体 UI 操作的映射,为训练和评测提供统一基准。[93]

实验与结果

实验显示,使用 Mind2Web 数据训练的模型在跨站点任务中具备更好的泛化能力。论文强调,覆盖面与任务多样性是提升网页代理稳定性的关键因素。[93]

关键数据结果

  • 数据集规模与任务多样性显著高于此前网页代理数据集,为通用网页代理提供训练基础。[93]

工程启示(优化点)

  • 保留 DOM 结构与动作轨迹,便于调试与回放。
  • 强化指令到动作的对齐标注,减少解释歧义。
  • 覆盖多站点、多任务场景,提升可迁移性。
  • 将数据集用于回归测试,监控代理退化。

局限与延伸

Mind2Web 虽覆盖广泛,但仍无法穷尽所有网页结构与动态交互,尤其是登录、权限与个性化内容。未来方向包括:引入更复杂的交互场景、动态页面与权限控制的标准化数据,以及与多模态观察融合的网页代理训练。[93]