MintAct:面向数字环境的统一视觉智能体
研究人员推出 MintAct,这是一系列参数规模为 20 亿、40 亿和 80 亿的视觉语言模型。该模型统一支持用户界面定位、移动端、桌面端和网页环境中的多步骤导航,以及视觉工具使用。研究团队构建了可扩展的环境与强化学习基础设施,用于跨领域轨迹数据收集和在线训练。实验结果显示,MintAct 在这些能力上的表现可与各领域专用模型相当,并在 OSWorld-Verified 上取得 48.9 分。研究人员称其在多个基准测试中达到当前最佳水平。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。