AI 新闻中心

AI 新闻中心 过去24小时分析了 155 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

RealCompanion:通过推理长期真实对话评测人类理解能力的基准

RealCompanion收录了10段与AI伴侣建立的真实关系,共27,218条消息,时间跨度最长达120天。基准数据包括对话,以及据此整理的个人档案、人物设定、对话标准答案和问题;每项内容都标明了所依据的消息。研究发现,相关记忆很少是必需的,所需信息也很少来自久远以前。简单地检索近期消息,就能为95.9%的问题找到所需内容,但实际需要记忆的问题仅占2.2%。受测方法也无法可靠判断何时需要调用记忆

从梯度到能力:理解多教师在线策略蒸馏

这项研究考察多个经强化学习训练的教师模型信号,如何影响共享学生模型的参数更新和学习结果。基于 Qwen3-1.7B 的实验显示,按 token 求平均会使较长回答获得更高权重,而 Adam 会缩小教师梯度差异在最终更新中的体现。BF16 舍入也会掩盖许多细微变化。基于概率最高的 64 个 token 计算的 KL 梯度与全词表梯度接近,但其对数学准确率的影响取决于平均方式。

OpenAI 将在欧盟为 ChatGPT 和 Codex 文本输出添加隐形水印

OpenAI 计划在未来几周内,为欧盟符合条件的 ChatGPT 和 Codex 用户提供带有机器可识别隐形水印的部分文本输出。名为 textGrain 的技术会在选词过程中嵌入统计信号,供检测器识别。该功能上线时不会在全球默认启用;API 客户可选择为部分模型开启水印。OpenAI 还计划向获批的研究人员和专业组织开放检测器。工具只会报告是否检测到 OpenAI 水印,不会透露用户身份、提示内容

WEFT:扩展通用智能体的工具使用后训练

WEFT 将可扩展的智能体系统构建、由执行结果驱动的迭代改进和稳定的后训练结合起来,用于训练工具使用智能体。它不只扩展可执行环境,还纳入任务、智能体 harness 和评估器。该方法利用执行轨迹定位失败原因并修改相关组件,同时通过采样和信用分配技术提升训练稳定性。MegaMCP 在并发运行时管理相互隔离且可恢复的状态。据报告,在 BFCL V4、τ²-Bench 和 Claw-Eval 上,8B

从运行时反馈中学习:通过失败库自我进化的视觉-语言-动作模型

FailBank 是一个由四个阶段组成的框架,利用运行时反馈持续改进视觉-语言-动作(VLA)模型。基于控制障碍函数的固定安全模块提出修正建议,同时仍由策略控制动作。有用的建议会转化为修正目标;未经修正且成功的动作则保留为受控 LoRA 更新的参照。在 VLA-Arena 基准测试中,使用两个难度级别和两种基础模型,与基础策略相比,FailBank 将任务成功率分别提高 8.5 和 6.9 个百分