AI 新闻中心

AI 新闻中心 过去30天分析了 912 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

千问上线 Qwen3.8-Omni-Flash:支持百万级上下文,30项评测平均提升超26%

千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入,以及 100 万 token 上下文。千问称,该模型在 30 项评测中的平均得分较 Qwen3.5-Omni-Plus 提升超过 26%。据介绍,改进主要覆盖音视频 Agent、编程、GUI 操作和长程任务等场景。千问还表示,音频及音视频输入的 API 价格大幅下降。模型已在千问 AI 平台开放体验

PrismML发布Bonsai 2 27B,将Qwen压缩至5.9GB

PrismML发布了Bonsai 2 27B,这是阿里巴巴Qwen3.8 27B的压缩版本。该模型大小为5.9GB,理论上可在智能手机上运行。PrismML表示,它在基准测试中保留了Qwen原模型98.2%的成绩。此次发布的重点是模型压缩技术及其端侧运行潜力,而不是这家目前尚未获得大额融资、知名度有限的人工智能初创公司。

WeVisDoc:从覆盖范围到能力,提升稳健的端到端文档解析

WeVisDoc 是一个面向稳健端到端文档解析的两阶段数据驱动框架。第一阶段通过异构数据和保持结构的退化合成,扩大语义、结构与外观覆盖范围。第二阶段在固定的视觉—结构聚类中测量解析器的剩余错误,并据此指导针对性数据构建和目标标记令牌预算的重新分配。WeVisDoc-4B 在 OmniDocBench v1.6 上取得 95.38 分,在 PureDocBench 的三个测试轨道上平均取得 75.5

Figure发布Helix 2.5,在30个陌生家庭实现56%零样本成功率

Figure于9月17日发布人形机器人神经网络Helix 2.5。该模型基于公司的人类行为数据集Index预训练,并在旧金山湾区30个此前未采集数据的家庭中测试。在整理客厅、折叠毛巾和铺床三类任务中,Helix 2.5的零样本成功率达到56%,而从零开始训练的同条件策略为9%。测试使用了训练数据未涵盖的家庭环境和物品,且只有完整完成任务才计为成功。Figure表示,Helix 2.5仅使用Heli

十部门推动加快人工智能、量子计算赋能药物研发

工业和信息化部、国家发展改革委等十部门发布“十五五”医药工业发展规划,提出加快人工智能、量子计算、超级计算和计算医学等新技术在药物研发中的应用。规划支持医药企业、高校、科研院所和医疗机构开展联合攻关,并将基因编辑、分子精准递送、细胞编程、先进组学、生物制造等列为重点方向。该文件主要提出产业政策目标和技术布局,并未公布具体的人工智能研发成果或已验证的重大突破。

反思、修订、复用:无需训练的 GUI 智能体技能进化

EvoSkill-GUI 是一个无需额外训练的框架,使 GUI 智能体能够根据执行反馈在部署阶段修订可复用技能。每项技能都以结构化软件包形式管理,包含检索元数据、可执行计划、备用定位方法、失败恢复规则、无障碍工具和失败案例。在“反思—修订—复用”循环中,智能体会诊断失败的执行轨迹,并有针对性地更新技能文件。在 MobileWorld、AndroidWorld 和 OSWorld 三个基准测试中,该

面向多模态大语言模型细粒度感知的区域级策略优化

Vision-RL2 在避免大幅增加视觉 token 成本的同时,提升多模态大语言模型(MLLM)的细粒度视觉感知能力。该方法先从压缩视图中定位相关区域,再将更高分辨率集中到选定证据上。研究人员通过区域级强化学习优化轻量级候选区域网络,并使用冻结的 MLLM 读取器评估各区域对答案的贡献。在六个细粒度基准和四个 MLLM 骨干模型上,Vision-RL2 在所有视觉 token 预算下都提升了准确

Video DeltaNet 提出面向直播视频生成的混合注意力机制

Video DeltaNet 将局部 Softmax 注意力与双向线性记忆结合起来,以降低视频扩散模型处理长时空令牌序列的成本。其 Video Delta Attention 机制在联合处理空间令牌的同时,每帧更新一次记忆;分阶段的教师模型对齐流程则将这一新路径引入预训练模型。在 MiniMax H3 实现中,该混合方法用于视频到视频的交互,而涉及文本或音频的交互仍保留 Softmax 注意力。结

UFO:面向多模态图像生成全条件对齐的评估链

UFO 是一个统一框架,用于评估多模态图像生成系统是否能同时满足文本和视觉条件。该方法将整体对齐目标拆分为细粒度、相互解耦的原子评估单元,并通过通用或专用功能调用逐一验证。实验表明,在参与评测的方法中,UFO 与人工偏好的相关性最高,平均相关性提升了 15.25%。研究人员还提出 UFO-Bench,用于在文本与视觉条件的多种交互场景下全面评估图像定制模型。

特权信息能为策略内自蒸馏带来什么?

一项研究分析了解答或完整推理过程等参考信息,能为语言模型的策略内自蒸馏带来多少额外价值。研究人员构建了 AMPLE-Math 数据集,包含 5,319 道数学题,每道题提供六种共享同一答案的推理视图,并将使用参考信息的蒸馏与条件匹配的无参考蒸馏进行比较。结果显示,在启用思考能力的评估中,Qwen3-1.7B 的大部分性能提升都可以由无参考蒸馏解释。参考信息带来的额外收益在 Qwen 上较为有限,在

When2Think:面向高效混合推理模型的难度感知长度控制

大型推理模型在复杂任务上表现出色,但常在简单问题上浪费计算资源,在困难问题上又推理不足。When2Think是一种后训练框架,可根据每个问题的难度动态分配推理深度。该方法结合实例级难度感知奖励塑形、基于验证器的奖励以及批次标准化优势,无需训练奖励模型,也无需在线查询参考模型。在数学基准测试中,相比基础模型,AIME24上的Pass@3提升10.0%,Token使用量减少27.9%。在AIME25上

RetireOPD:面向智能体强化学习的自适应退出式在线策略蒸馏

RetireOPD是一种面向智能体强化学习的训练方法。它首先利用环境奖励优化一个具备特定技能的教师模型,再通过在线策略蒸馏,将这些能力传递给没有预设技能的学生模型。当学生与教师之间的性能差距不再缩小,且学生达到教师成功率的目标比例后,学生会自行停止依赖教师,随后仅通过强化学习继续训练。在参数规模为15亿至70亿的Qwen2.5模型上,RetireOPD相比仅使用强化学习的基线,将ALFWorld成

DeepSeek-V4.1-Flash:突破 KV 缓存压缩极限

DeepSeek 发布了 DeepSeek-V4.1-Flash,这是一款拥有 5520 亿骨干参数、支持最长 100 万 token 上下文的多模态混合专家模型。其因果编码器—解码器架构在解码阶段每个 token 激活 160 亿参数,在预填充阶段仅激活 80 亿参数。通过跨层 KV 缓存复用、FP4 KV 缓存和 SWA Bounded Replay 部署优化,该模型将 HBM 中的 KV 缓

人形机器人可“自主做家务”,Figure 发布 Helix 2.5 模型

Figure 发布 Helix 2.5 模型,让人形机器人能够“自主做家务”。该公司表示,其在美国旧金山湾区租了 30 套房子,机器人没有进行额外训练,到达后便开始自行收拾房屋。Helix 2.5 在全球人类行为数据集 Index 上预训练,旨在回答类人机器人能否进入从未见过的家并立即自主工作。基于单一基础模型,机器人产生三种行为:整理客厅、折叠毛巾和整理床铺。在 30 户家庭的测试中,单一 In

RiskChainBench评估混淆平台消息还原与基于证据的网络调查

RiskChainBench评估人工智能模型能否还原使用表情符号、谐音、字符拆分和冗余符号隐藏的平台消息,并调查正确对应的网站。该基准包含来自600个会话的3,600条合成还原输入,以及600个由人工标注的本地网页环境。评估内容包括消息还原、正确跳转和生成有证据引用的风险报告。对10个模型的测试显示,入口Top-1准确率为35.2%至95.2%,网页判断准确率为26.3%至62.8%。31.9%的