PAWBench:距离概率对齐的世界模型还有多远?
PAWBench提出将概率对齐作为评估世界模型的标准。模型不仅要生成一条合理的轨迹,还应在相同的初始观测和行动条件下,正确复现各种可能结果的分布。该基准及PAWEval评测协议在50个场景和11个现有系统上分析了重复视频生成结果。没有任何受测模型能够持续匹配参考概率,同时覆盖全部有效的物理行为。研究还考察了语言提示、初始噪声和模型训练是否能够改变模型的预测分布。
AI 新闻中心 过去30天分析了 911 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
PAWBench提出将概率对齐作为评估世界模型的标准。模型不仅要生成一条合理的轨迹,还应在相同的初始观测和行动条件下,正确复现各种可能结果的分布。该基准及PAWEval评测协议在50个场景和11个现有系统上分析了重复视频生成结果。没有任何受测模型能够持续匹配参考概率,同时覆盖全部有效的物理行为。研究还考察了语言提示、初始噪声和模型训练是否能够改变模型的预测分布。
Zero-WAM是一种因果视频—动作模型,使机器人能够依据人类视频示范执行训练中未见过的操作任务。研究人员构建了HumanGen数据集,通过自动化流程生成涵盖8600项任务的74200组人类—机器人上下文学习配对。在RoboTwin 2.0模拟环境中,Zero-WAM在7项未见任务上取得47.0%的平均成功率,比最强的视频—动作基线高29.5个百分点。真实世界测试涵盖多物体场景、长时序操作以及精细
该研究提出 UrbanGround,这是一个用于评估多模态大语言模型代理在复杂城市环境中表现的测试平台。研究团队利用覆盖香港全域的三维地理空间数据,构建了一个具有物理约束的香港城市复制环境,使代理能够以第一人称视角探索城市,并通过交互式地图进行导航。研究考察局部视觉感知能否支持空间问题回答、远距离导航,以及对路线和行人运动变化的适应。当前的多模态大语言模型代理在视觉识别和短距离空间推理方面表现出一
中国国光量超人工智能研究团队宣布,将量子技术引入大语言模型的核心决策与推理流程,并推出面向科研和学术领域的“玄幂”模型系列。团队称,该模型在科研科普、任务路由和智能体决策等特定任务中,相较主流开源模型具有更深入的专业理解、更清晰的任务判断和更短的决策路径。此次公告未提供独立技术验证或基准测试结果。
该研究分析了进化策略(ES)作为一种面向大语言模型推理能力的内存高效后训练方法。与群组相对策略优化(GRPO)相比,ES能够保持更高的候选解多样性,并在Pass@K指标上取得更好表现。GRPO容易出现熵坍缩,而ES在提升Pass@1的同时,可以覆盖更多推理路径。研究提出的序列式GRPO-ES训练策略,结合了GRPO获取最佳答案的优势与ES更广泛的覆盖能力。研究还发现,尽管模型整体参数可能发生较大漂
该研究提出了一个用于生成和评估 LLM 智能体交互数据的两层框架。研究将智能体数据表示为环境、任务、交互以及可选验证器的组合,并通过 ACE 视角——准确性、复杂性和多样性——分析如何生成有环境依据、内部一致、符合特定学习者能力且不重复的经验数据。文献显示,相关研究正逐步转向基于执行结果的准确性、相对于学习者的复杂性,以及超越表面变化的数据多样性。研究指出,核心挑战并非简单增加数据量,而是在智能体
VGI-Bench 是一个用于评估视频生成模型视觉推理能力的基准测试,包含 27 项任务和 810 个实例,并按任务领域和技能标签进行分类。评估结果显示,当前生成系统能够解决部分基于视觉的推理任务,但整体可靠性仍然不足。即使是表现最强的模型 Seedance 2.0,按照该研究的评估标准也只达到 51.0%。研究还分析了输出失败模式、对输入条件的敏感性、合成数据微调带来的性能迁移边界,以及去噪过程
一种新的机器学习框架旨在提高计算蛋白质设计的成功率,同时推动设计结果摆脱对自然界已有蛋白质序列的重复。
Prefix Sliding 研究提出了一种降低语言模型长时间推理内存成本的方法。模型不再通过完整注意力机制保留全部推理轨迹,而是仅保留包含关键指令和工具信息的前缀,以及最近几千个词元组成的窗口。这样,无论推理持续多久,内存需求都能保持在固定上限内。研究人员称,在无需额外训练的情况下,该方法可让现有模型提速最多三倍,同时保持性能。结合强化学习后,模型还能处理超过十万个词元的推理轨迹,并取得更好表现
一项针对1000多名学生的随机研究,考察了ChatGPT的使用和批判性思维训练对原创性、学习表现以及完成真实大学作业成果的影响。
Google DeepMind 正在试行一套系统,将对专有人工智能模型的外部评估置于加密保护的环境中进行。该方法旨在减少基准测试污染,即模型或开发者提前了解测试内容并针对测试进行调整,同时保护知识产权。此举的目标是提高外部独立评估人工智能模型性能的可信度。
一项研究考察大语言模型在不同语言中是否具备相同能力,并将语言影响与知识水平及通用基准测试表现区分开来。在多语言自我对弈实验中,同一模型的两个实例分别使用不同语言,在六种文本游戏中对战。模型、规则、状态空间和可用行动均保持不变。研究人员在八种语言上评估了三个开放权重模型,发现模型的对战能力、无效行动数量和策略倾向会因语言不同而显著变化。空间推理、基于卡牌的决策以及最优行动选择中都出现了特定语言的失误
谷歌推出了面向前沿专有 AI 模型的双盲评估方法。外部评估机构可在加密黑箱环境中测试模型,但无法查看模型权重;谷歌也无法获取评估方的测试提示词。该方案旨在防止模型提前接触测试数据,从而避免“基准污染”。谷歌与新加坡人工智能安全研究所、OpenMined、AVERI 及 MLCommons 合作,利用机密计算对 Gemini Flash Lite 进行了测试。这项试点有望提升评估的独立性和可信度,尤
伦敦大学学院医院外科医生利用专门开发的 AI 系统,协助为一名 48 岁患者切除良性垂体肿瘤。手术期间,系统实时分析内镜画面、追踪手术器械位置,并标出重要血管和神经可能所在的区域,帮助医生避开肿瘤附近的关键结构。AI 并未接管手术,所有判断和操作仍由外科医生完成。研究团队使用数百段垂体肿瘤手术视频训练和评估该系统,目前正准备开展更大规模的临床试验。患者表示,手术后周边视野明显改善,术前的疲劳、眩晕
LibriBrain100是一个面向可复现神经语音解码评估的大规模MEG数据集,包含超过100小时的高质量记录。其中约80小时来自单一受试者,规模远超同类数据集。研究人员使用现有解码模型进行词语分类基准测试,取得当前领先表现。为研究单个受试者数据有限时多受试者数据的价值,团队还从32名受试者处各采集了约40分钟数据。数据集、评估基础设施、Python库以及带有公开排行榜的竞赛将以开放方式发布。该项