思维链表象之下:大语言模型推理操作的机制解释
一项研究考察了大语言模型如何在内部表示空间中组织问题构建、目标分解和演绎等推理操作。研究人员发现,这些操作可以在留作测试的隐藏表示中被区分,且在模型中间层的可分离性最高。该结构不能仅由词汇或位置因素解释。随着层数增加,推理操作的对应关系会分布到更长的词元片段中;同一个表面词也会因周围推理操作不同而产生不同的内部表示。注意力屏蔽干预进一步表明,推理片段开头与操作相关的表示依赖此前的推理上下文。研究团
AI 新闻中心 过去一年分析了 1731 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究考察了大语言模型如何在内部表示空间中组织问题构建、目标分解和演绎等推理操作。研究人员发现,这些操作可以在留作测试的隐藏表示中被区分,且在模型中间层的可分离性最高。该结构不能仅由词汇或位置因素解释。随着层数增加,推理操作的对应关系会分布到更长的词元片段中;同一个表面词也会因周围推理操作不同而产生不同的内部表示。注意力屏蔽干预进一步表明,推理片段开头与操作相关的表示依赖此前的推理上下文。研究团
李飞飞与 World Labs 核心团队发布了多模态世界模型 Atlas,其核心机制是新视角预测。不同于预测下一个 token 的语言模型和预测下一帧画面的视频模型,Atlas 可根据少量图像或文字描述,生成从场景不同位置观察到的画面。它能在同一系统中处理文本、图像、视频、3D 数据和相机位姿,并融合场景重建与内容生成。团队称,Atlas 可显著减少 3D 场景重建所需的数据量,并有望应用于创意设
该研究将多智能体 LLM 系统中协调器与工作智能体的交互建模为双层协调博弈,并分析任务分解、文本反思、记忆更新和外部验证对协作与系统漂移的影响。研究提出随机反思记忆攀升(SRMA)方法,只有在基于环境的评估显示风险降低时才接受记忆更新;在特定假设下,作者还给出了收敛和重新锚定保证。在 500 个 SWE-bench 实例上,基于 Kimi 的系统解决了 72.2% 的任务,公开的 mini-SWE
腾讯混元与 WorkBuddy 联合团队于 9 月 7 日宣布,混元 Hy4 Preview 升级版已全面上线。针对用户和开发者反馈的复杂任务思考时间过长、过度自我验证等问题,团队进行了专项优化。通过 Bench 指标与人工评测双重验证,结果显示模型在保持任务效果的同时,显著减少了任务轮次以及输入、输出 Token 消耗。此次更新有望提升 Agent 应用中的响应效率,并降低模型调用成本。
Arena发布2026年第36周AI大模型盲测排名,榜单依据匿名盲测投票并通过ELO计算。多款中国模型在专业细分领域取得进展:阿里Qwen3.8-Max-0902首次进入前端开发榜即排名第四,视频生成模型Wan3.0首度上榜便位列第三。阿里、腾讯和智谱的其他新模型也进入多个榜单前列。综合榜仍由海外模型主导,但头部模型之间的分差较小。需要注意的是,Arena排名反映用户主观偏好,并非绝对能力测试;各
该研究分析音视频扩散模型如何通过三条跨模态注意力路径协调文本、声音和视觉内容。研究发现,音频与视频之间的路径具有双向作用:音频可以影响视频生成,视频也可以影响音频生成。模型参数中学习到的偏差可能使这些交互覆盖原本的条件输入,从而生成视觉上典型但语义错误的结果。研究人员从注意力模式中提取信号,用于诊断语义如何在不同模态之间分布,并在推理阶段实施受控干预。实验表明,该方法能够改善跨模态语义对齐,同时基
Anthropic 表示,一个 Claude 模型经过约 11 天大致自主运行,首次在 Lean 中完成了费马大定理的端到端形式化,并通过计算机检查。该模型并未重新发现新的数学证明,而是将安德鲁·怀尔斯已有的证明转换为 Lean 证明助手能够逐步验证的形式。Claude 生成约 1300 万行 Lean 代码,证明了约 3.03 万个定理,其中近 2.95 万个被纳入最终证明。多个 Claude
根据 OpenRouter 最新数据测算,8月31日至9月6日,全球主要大模型总调用量达到115万亿Token,环比增长1.77%。中国大模型调用量为56.72万亿Token,美国大模型为16.54万亿Token,中国模型连续19周领先。调用量前五名中有四款来自中国。腾讯混元 Hy4 Preview 以14.7万亿Token位居第一,环比增长379%。该模型于8月28日开源,拥有7700亿总参数、
OpenAI表示,其内部系统已达到“自动化研究实习生”里程碑。在人类监督和指导下,该系统能够完成资深研究人员通常需要数天处理的、定义明确的复杂任务。截至8月中旬,OpenAI核心研究组织中,每投入一个人类工作日,智能体的运行时间相当于3.1个智能体工作日。不过,这一比例衡量的是运行时间和工作量,并不等同于相同的生产力或实际产出。OpenAI员工Kevin Liu认为,递归式自我改进可能成为未来几年
据《娱乐资本论》报道,字节跳动旗下火山引擎近日邀请多家版权方参与AI版权管理平台内测。品牌方和短剧制作方可调用Seedance、Seedream等模型,使用已获授权的正版IP进行创作;版权方则可在后台完成监修、审核和交易管理。平台预计于今年下半年正式上线,提供面向消费者的模板创作和面向企业客户的自由创作两种授权方式。目前据称已有数十个头部IP签约,包括周星驰旗下比高集团相关影视作品。部分企业项目报
科大讯飞正式发布多语言文本生成模型星火 Spark X2.5。该 MoE 模型总参数量为 2930 亿,推理时最多激活 300 亿参数,支持 256K 上下文。科大讯飞表示,该模型完全基于中国自主研发的平台训练,并提升了代码生成和智能体能力。模型支持 200 多种语言,可用于语言理解、问答和推理等通用任务。Spark X2.5 已上线科大讯飞星辰 MaaS 平台,价格为输入每百万 Token 1.
腾讯微信视觉团队开源了通用多模态嵌入模型 WeMM-Embedding,支持文本、图像等输入。该模型提供 2B、4B 和 9B 三种规模,面向不同部署需求。其采用统一架构,并结合两阶段训练与知识蒸馏,在多模态理解能力和部署效率之间进行平衡。据腾讯介绍,WeMM-Embedding 已大规模部署于微信推荐与搜索系统,日调用量达到十亿级。此次开源使开发者能够使用一款已在大型商业服务中部署的模型,但公告
文章称,OpenAI通过Stargate计划,使用超过10万张英伟达GPU训练所谓的“Astra”模型。若计入服务器、网络、电力、散热和研发成本,相关基础设施投资可能达到100亿至250亿美元,这一数字来自媒体引用的估算。相比之下,DeepSeek计划在中国建设的数据中心据称将采购16万张华为AI芯片,投资约25.6亿美元。不过,Astra的存在、具体规格和相关支出目前均未得到公开证实。文章指出,
一项研究表明,在循环神经网络中,状态被写回和保存的方式可能决定低精度推理的准确率。在用于荧光寿命成像的 GRU 编码器—解码器中,采用确定性的 4 位状态存储后,短寿命成分 τ1 和长寿命成分 τ2 的估计误差分别增加约 70 倍和 300 倍。原因是反复出现的小幅更新低于写入阈值,未能反映到存储状态中。误差反馈、残差记忆和方向记忆能够在无需重新训练的情况下恢复准确率。对独立训练的 LSTM 进行
一项研究分析了大型语言模型在修复漏洞时为何经常修改超出必要范围的代码。研究人员使用 BigCodeBench 的 400 个问题,注入受控的 AST 级错误,以衡量修复结果是否接近最小补丁。即使是 GPT-5.5 等强大模型,也经常产生不必要的大幅修改并增加认知复杂度。加入保留原有代码的指令后,过度 Levenshtein 距离从 0.195 降至 0.131,新增认知复杂度降低 26.6%,Pa