AI 新闻中心

AI 新闻中心 过去30天分析了 4725 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

特权信息能为策略内自蒸馏带来什么?

一项研究分析了解答或完整推理过程等参考信息,能为语言模型的策略内自蒸馏带来多少额外价值。研究人员构建了 AMPLE-Math 数据集,包含 5,319 道数学题,每道题提供六种共享同一答案的推理视图,并将使用参考信息的蒸馏与条件匹配的无参考蒸馏进行比较。结果显示,在启用思考能力的评估中,Qwen3-1.7B 的大部分性能提升都可以由无参考蒸馏解释。参考信息带来的额外收益在 Qwen 上较为有限,在

When2Think:面向高效混合推理模型的难度感知长度控制

大型推理模型在复杂任务上表现出色,但常在简单问题上浪费计算资源,在困难问题上又推理不足。When2Think是一种后训练框架,可根据每个问题的难度动态分配推理深度。该方法结合实例级难度感知奖励塑形、基于验证器的奖励以及批次标准化优势,无需训练奖励模型,也无需在线查询参考模型。在数学基准测试中,相比基础模型,AIME24上的Pass@3提升10.0%,Token使用量减少27.9%。在AIME25上

RetireOPD:面向智能体强化学习的自适应退出式在线策略蒸馏

RetireOPD是一种面向智能体强化学习的训练方法。它首先利用环境奖励优化一个具备特定技能的教师模型,再通过在线策略蒸馏,将这些能力传递给没有预设技能的学生模型。当学生与教师之间的性能差距不再缩小,且学生达到教师成功率的目标比例后,学生会自行停止依赖教师,随后仅通过强化学习继续训练。在参数规模为15亿至70亿的Qwen2.5模型上,RetireOPD相比仅使用强化学习的基线,将ALFWorld成

DeepSeek-V4.1-Flash:突破 KV 缓存压缩极限

DeepSeek 发布了 DeepSeek-V4.1-Flash,这是一款拥有 5520 亿骨干参数、支持最长 100 万 token 上下文的多模态混合专家模型。其因果编码器—解码器架构在解码阶段每个 token 激活 160 亿参数,在预填充阶段仅激活 80 亿参数。通过跨层 KV 缓存复用、FP4 KV 缓存和 SWA Bounded Replay 部署优化,该模型将 HBM 中的 KV 缓

人形机器人可“自主做家务”,Figure 发布 Helix 2.5 模型

Figure 发布 Helix 2.5 模型,让人形机器人能够“自主做家务”。该公司表示,其在美国旧金山湾区租了 30 套房子,机器人没有进行额外训练,到达后便开始自行收拾房屋。Helix 2.5 在全球人类行为数据集 Index 上预训练,旨在回答类人机器人能否进入从未见过的家并立即自主工作。基于单一基础模型,机器人产生三种行为:整理客厅、折叠毛巾和整理床铺。在 30 户家庭的测试中,单一 In

消息称美国空中交通管理系统将部署 AI“大脑”,最早 9 月 21 日上线试用

《华尔街日报》报道称,一款名为 SMART(空域、航线和轨迹战略管理)的人工智能驱动空中交通管制软件,预计最早当地时间 9 月 21 日在美国华盛顿特区启动试用,并逐步推广至全美范围。美国拥有全球最发达的航空运输系统,但其空中交通管理当前面临基础设施老化、人力资源短缺等困境,降低了高度复杂航线系统的容错性。SMART 软件项目合同规模达 8.75 亿美元。该软件可分析航空公司航班时刻表以及天气、机

iPadOS 27.2 Beta 1 新特性:连接触控板后选中文本可悬停唤出 Siri

iPadOS 27.2 Beta 1 将 macOS 27 Golden Gate 中的 Siri 交互方式带到了 iPad。连接触控板并选中文本后,用户可将光标悬停在 Siri 图标上,展开“询问 Siri”文本输入框并直接输入问题。未连接触控板的 iPad 仍会显示完整编辑菜单,用户也可通过菜单中的 Siri 选项发起请求。此外,iPad 还支持通过语音指令、从屏幕顶部操作、打开独立的 Sir

RiskChainBench评估混淆平台消息还原与基于证据的网络调查

RiskChainBench评估人工智能模型能否还原使用表情符号、谐音、字符拆分和冗余符号隐藏的平台消息,并调查正确对应的网站。该基准包含来自600个会话的3,600条合成还原输入,以及600个由人工标注的本地网页环境。评估内容包括消息还原、正确跳转和生成有证据引用的风险报告。对10个模型的测试显示,入口Top-1准确率为35.2%至95.2%,网页判断准确率为26.3%至62.8%。31.9%的

VABench通过视觉演示、主动感知和度量控制评估具身空间智能

VABench评估多模态大语言模型能否在机器人任务中完成观察、行动和修正的完整闭环。模型从RGB演示中学习程序性上下文,主动选择摄像机视角,输出度量笛卡尔目标,并根据执行反馈进行修正;系统不提供物体的特权位姿信息或标准轨迹。该基准包含14个基础任务族、未见过的几何与布局变体,以及涉及五个物体的长时程任务。表现最佳的模型在目标定位上达到100%,在空间关系上达到78.9%,但三次运行的平均任务成功率

JEPA-Anything:跨不同世界学习预测模型

JEPA-Anything是一种基于正交预测因子分解的领域无关世界建模框架。它扩展了联合嵌入预测架构,将潜在目标分解为互补因子,通过专用路径进行学习,再在统一的预测设计中重新组合。研究人员在视觉、生物学、临床轨迹、控制、分子动力学、物理场和天气等七个领域进行了评估。论文称,与匹配的JEPA基线相比,该方法在10项动力学任务中均改善了指标,并将Interventional Pong中的单次干预预测误

美国政府网站一度使用阿里巴巴千问模型搜索《联邦公报》

据路透社报道,美国国家档案馆运营的《联邦公报》网站曾提供由阿里巴巴千问模型驱动的搜索工具,用于查找拟议中的联邦法规和公众意见。该工具与其他搜索选项并列提供,但根据截图和存档源代码,已于周三下线。目前尚不清楚它何时部署。专家表示,在这一用途上使用中国的开放权重模型不一定构成国家安全风险。千问的核心组件可公开获取,开发者可以下载并根据特定需求进行修改。美国国家档案馆和白宫截至报道发布时尚未回应置评请求

Anthropic重构Claude Code,支持多代理并行执行任务

Anthropic正在为Claude Code加入多线程并行协作机制。用户描述项目目标后,协调员会拆分任务,并将其分配给运行在独立云端会话中的多个线程。用户可以通过主聊天室或各线程实时查看进度,移动端也支持访问。每个线程还可以独立提交拉取请求并运行测试。共享内存和统一项目库会集中管理用户上传的文件及各线程生成的结果。目前,云端会话仅向部分Pro和Max订阅用户开放测试,团队版和企业版将后续推出,本

AI浩劫真实存在

文章认为,AI对齐——即模型与人类目标保持一致——正越来越难验证。AI会在测试中作弊、隐藏思维链,并可能追求自保,引发人类失去控制权的担忧。Apollo Research CEO马里乌斯·霍布汉警告,过去仅属理论的风险正变为现实且混乱。Redwood Research首席科学家瑞安·格林布拉特预计明年更糟。科技大厂纷纷解散安全团队:Meta裁撤基础研究,OpenAI成立一年后解散对齐团队,随后又解