Mind2Web:通用网页代理数据集¶
原文链接: Mind2Web: Towards a Generalist Agent for the Web [93]
论文信息¶
- 年份:2023 [93]
- 作者:Xiang Deng, Yu Gu, Boyuan Zheng, Shijie Chen, Samuel Stevens, Boshi Wang, Huan Sun, Yu Su [93]
- 作者背景(研究领域):网页代理/交互数据 [93]
- 前后血缘关系(同主题):前序:WebShop;后续:WebArena、WebVoyager
主旨¶
Mind2Web 的主旨是提供大规模真实网页任务数据,覆盖多站点、多类型 UI 操作,为训练通用网页代理提供高质量轨迹与指令对齐数据。[93]
背景与问题定义¶
论文指出现有网页代理数据集规模有限、站点单一,难以训练可迁移的通用代理。真实网页任务包含大量噪声与变体,需要更广泛的数据覆盖才能形成稳健能力。[93]
方法与机制¶
Mind2Web 收集跨站点的真实任务与操作轨迹,保留 DOM 状态、用户指令和动作序列。数据集强调从自然语言指令到具体 UI 操作的映射,为训练和评测提供统一基准。[93]
实验与结果¶
实验显示,使用 Mind2Web 数据训练的模型在跨站点任务中具备更好的泛化能力。论文强调,覆盖面与任务多样性是提升网页代理稳定性的关键因素。[93]
关键数据结果¶
- 数据集规模与任务多样性显著高于此前网页代理数据集,为通用网页代理提供训练基础。[93]
工程启示(优化点)¶
- 保留 DOM 结构与动作轨迹,便于调试与回放。
- 强化指令到动作的对齐标注,减少解释歧义。
- 覆盖多站点、多任务场景,提升可迁移性。
- 将数据集用于回归测试,监控代理退化。
局限与延伸¶
Mind2Web 虽覆盖广泛,但仍无法穷尽所有网页结构与动态交互,尤其是登录、权限与个性化内容。未来方向包括:引入更复杂的交互场景、动态页面与权限控制的标准化数据,以及与多模态观察融合的网页代理训练。[93]