AI 新闻中心

AI 新闻中心 过去30天分析了 4729 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

GraphForge:通过图谱锚定的工作空间合成训练实用型智能体

GraphForge 是一个为能够处理文件和工具的智能体生成并验证训练任务的框架。它从职业相关的种子数据出发,利用真实文件组建工作空间,并通过证据图谱表示文件之间的关系。任务描述和评估标准均由图谱推导,使任务要求和验证项能够对应到作为依据的文件。研究使用 2,169 条 GraphForge 轨迹对 Qwen3.6-27B 进行微调,使其在 OpenHands 上的 GDPVal 得分达到 144

通过扩展与蒸馏文本嵌入改进扩散模型

这项研究探讨哪种文本嵌入最适合作为连续扩散语言模型的潜在空间。在同一模型系列中扩大规模能够提升生成效果,但 T5Gemma-2 的嵌入会把合理替代词的表示分隔得过远。研究人员将 T5Gemma-2 解码得到的概率蒸馏到学生编码器中,使替代表示彼此靠近,形成更适合扩散的潜在空间。在 OpenWebText 上,该中型扩散模型在熵值与真实文本相当时,生成困惑度达到 17.8,并在这一指标上超过 GPT

观点|AI与现代评论家

一位 20 世纪 40 年代低成本科幻作品的大师曾有一个计划,而这个计划正在奏效。他想让我们为未来做好准备。

EgoTools:评估真实第一人称视频中的工具中心推理能力

EgoTools推出了用于评估模型理解真实第一人称视频中工具使用情况的数据集和基准测试。EgoTools-Data包含100小时的音频同步视频、密集字幕、详细讲述及补充三维信息;EgoTools-Bench则包含1,000道涉及感知、几何、操作流程和因果推理的问题。Gemini-3.1-Pro的总体准确率为66.9%,但在感知与视觉依据判断方面仅为51.7%。使用该数据进行微调后,Qwen3-VL

InterEvolve:面向人形机器人移动与操作的测试时奖励程序进化

InterEvolve研究人形机器人如何在不重新训练的情况下,利用已有技能完成训练期间未接触过的移动与操作任务。具备物体感知能力的行为模型和LLM代理利用执行反馈及经过验证的程序,迭代改进奖励程序;数值优化器则调整其参数。在仿真中,该方法为多种任务和长时序动作组合生成了相应行为。部分进化出的技能还借助机载第一人称视角感知,在Unitree G1上实现了自主运行。