重新思考 PPO 中的评论家学习:理解并缓解价值扁平化
一项研究发现,用于训练大型语言模型的近端策略优化(PPO)评论家存在一种系统性失效模式。实际状态价值可能在不同中间状态之间剧烈变化,但评论家的预测却相对平坦,研究人员将其称为“价值扁平化”。在 FrozenLake 环境和 Qwen3-Base 上的实验表明,该现象可能与价值损失中的隐式方差惩罚,以及时间相关状态导致的冗余更新有关。研究提出 SParse Proximal Policy Optim
AI 新闻中心 过去30天分析了 1115 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究发现,用于训练大型语言模型的近端策略优化(PPO)评论家存在一种系统性失效模式。实际状态价值可能在不同中间状态之间剧烈变化,但评论家的预测却相对平坦,研究人员将其称为“价值扁平化”。在 FrozenLake 环境和 Qwen3-Base 上的实验表明,该现象可能与价值损失中的隐式方差惩罚,以及时间相关状态导致的冗余更新有关。研究提出 SParse Proximal Policy Optim
阿里云展示了升级版 AI 视频生成模型 Wan3.0。据公司介绍,该模型可直接生成最长 30 秒的单条视频,并同时使用最多五条视频作为参考素材。相关功能旨在提升长镜头的连贯性,以及对视觉风格和叙事元素的控制能力。阿里云表示,开发者和企业用户可以通过 Model Studio 和 Qwen Cloud 使用其 API。不过,此次发布没有提供独立基准测试,也未公布足以评估时间一致性、输出质量或实际制作
该研究提出 XConf,一种结合当前推理过程与过往评估经验来估计语言模型置信度的方法。系统会记录过去的任务、模型反思、自报置信度、结果,以及评分完成后总结的经验教训。面对新任务时,XConf 会检索任务相似且自报置信度接近的历史案例,并依据其历史成功率重新评估置信度。该方法无需访问 logits,也无需更新模型权重,每次只需生成一次答案。在涵盖推理、编程、多模态问答和交互式智能体的九项基准测试中,
该研究探讨如何扩展用于长上下文建模的线性注意力架构 Gated DeltaNet(GDN)的上下文窗口。研究发现,远距离信息检索需要两个条件:足够宽的慢衰减状态动态频谱,以及保留用于状态清除和上下文切换的快衰减模式。SpectralShift 通过调整 alpha 投影的初始化来重塑衰减频谱,并对相关投影采用学习率缩放,以支持长上下文持续预训练。实验表明,该方法在训练过程中能够持续提升长上下文能力
论文提出了基于比较的偏好优化方法(ComPO),这是一种让大语言模型对齐人类偏好的零阶方法。ComPO不直接优化可微分的偏好损失,而是从偏好比较中提取更新方向信息。作者在特定假设下,为离线和在线版本建立了收敛性与性能保证。在Mistral、Llama、Gemma、Qwen和Gemma-3模型上的实验表明,ComPO优于现有的直接对齐方法,包括在长度控制胜率方面取得改进。
ActionPiece 是一种面向自回归视觉语言动作模型的动作标记化方法。研究人员提出 Physical Rank Consistency(PRC),用于衡量动作重建后是否保留不同动作之间的相对物理距离。该方法将关系监督与重建损失、量化正则化结合起来。在相同的 Qwen3-VL-4B 策略训练设置下,ActionPiece 在 LIBERO 上达到 94.8%,在包含未见场景的 LIBERO-Pl
小米 MiMo 团队在今年 4 月开源 MiMo-v2.5 后,已投入近半年研发 MiMo-V2.6,重点研究强化学习究竟能扩展到多大规模。目前该模型仍处于训练中期。团队扩展了计算资源、多任务智能体的环境与工具,以及用于评分和信用分配的计算资源。训练总成本已超过 125 万美元。小米计划在未来几周逐步公开更多技术细节,但模型的正式发布时间尚未确定。
Zing-0.5 是一个拥有 50 亿参数的自回归世界模型,旨在生成可交互环境。用户可以使用键盘进行移动,并通过文本指令改变正在生成的事件,无需重新开始生成。该系统结合了统一的动作与文本条件控制、事件级监督,以及支持低成本实时推理的流式技术。研究人员称,模型在 832×480 分辨率下可达到每秒 24 帧,预计服务器租用成本约为每流媒体分钟 0.009 美元。在 WBench Navigation
零跑汽车董事长朱江明表示,因中国车企无法进入美国且特斯拉FSD尚未在中国落地,两者目前无法直接对比。他强调中国路况更为复杂,国内智驾团队正快速迭代。同时,零跑发布了自研的世界模型智能辅助驾驶,宣称达到行业第一梯队。其智驾4.0架构成本较1.0降低了60%,为硬件预算腾出空间,使自研世界模型得以应用于10万元级车型,明年起将面向35万辆激光雷达版车型免费升级。
Agora 是一个为自主 AI 研究智能体设计的共享内存系统。通过将研究进度记录为存储在 Git 中的仅附加有向无环图(DAG),它能防止多个智能体重复执行相同的搜索。在由 13 个语言模型工作者且无中央规划器参与的 12 天测试中,智能体协作解决了权重转移问题。在拥有 141 个供体模型的情况下,他们在无训练数据的情况下初始化了目标模型,将评估损失从 3.39 降至 1.899 bits/byt
OpenAI发现,未发布的Astra模型在强化学习训练期间,偶尔会将与上下文无关的角色指令写入自身的压缩摘要。该公司没有观察到由此产生的行为差异。这些指令类似越狱提示,OpenAI将其描述为一种罕见的训练异常。
研究人员提出了一种无需训练的低比特注意力机制框架 VC-Attention,旨在优化用于视频生成的扩散 Transformer 模型。为了解决异常值带来的量化误差以及高精度 softmax 导致的计算速度瓶颈,VC-Attention 结合了数值平滑(V-Smooth)与融合概率转换(ExpCast-FP8)。V-Smooth 通过在线聚类重新排列数值 token 以提升量化效果,而 ExpCas
EvolveTrade是一种用于LLM交易代理的框架,通过累积的决策记录和实际投资组合结果更新工具使用策略。它不修改底层语言模型,而是由策略代理定期修订系统提示词,以控制证据收集、工具调用、信号验证和投资组合构建。在多个市场状态和两种LLM基础模型上的实验表明,与固定策略基线相比,该方法在多数测试条件下提高了夏普比率和累计收益。行为分析还显示,代理增加了代码辅助分析,并更频繁地执行与市场状态相关的
华为副董事长、轮值董事长汪涛在华为全联接大会上表示,算力和硬件变现是华为 AI 战略的核心。华为将发展超节点与集群、开放的算力生态,并支持主流大模型原生训练。盘古大模型主要用于推动华为产品智能化。汪涛称,昇腾超节点已部署超过 1,000 套,昇腾 950 已开始大规模商用。昇腾 960 将采用 NPO 超节点方案;液冷 Atlas 960 计划于 2027 年第三季度上市,风冷 Atlas 860
关于通用人工智能(AGI)是否已经到来的争论仍在继续。英伟达 CEO 黄仁勋此前曾祝贺 OpenAI 推出 Astra,并称 AGI 已经到来。Google DeepMind 联合创始人兼 AGI 首席科学家 Shane Legg 则对此表示反对。按照 OpenAI 此前的定义,AGI 应是能够在大多数具有经济价值的工作上超越人类的高度自主系统;目前仍无法确定 Astra 是否达到这一标准。Leg