AI 新闻中心

AI 新闻中心 过去一年分析了 8104 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

难度自适应树结构策略优化扩大RLVR的推理覆盖范围

基于可验证奖励的强化学习(RLVR)能够提升大型推理模型的单次回答准确率,但往往难以扩大以pass@k衡量的内在解题覆盖范围。研究提出DATPO,通过难度自适应树搜索、句子熵引导的分支,以及鼓励兄弟路径多样性的优势项,优化训练阶段的rollout。在数学推理基准测试中,DATPO尤其在pass@k上优于基线方法,并进一步提升了测试时扩展的性能。

Φ-Bench:评估大语言模型能否开发支撑自身运行的基础设施

Φ-Bench 是一项用于评估大语言模型开发和优化 LLM 基础设施能力的基准测试。不同于主要关注孤立内核、预定义算子或既定优化目标的现有基准,Φ-Bench 覆盖整个基础设施栈中的开放式长期任务,从内核级函数补全到端到端系统的实现与优化。针对前沿 LLM 的实验揭示了它们在复杂基础设施工程方面的当前能力与局限,也反映出实现未来 AI 基础设施自主优化仍需解决的挑战。

Show-Harness:仅凭 VLM 智能体即可操控机器人

Show-Harness 是一个通过紧凑语义接口,让视觉语言模型(VLM)控制机器人的框架。VLM 负责选择离散的语义动作,针对具体机器人设计的解释器则以确定性方式将其转换为实际动作。该方法支持利用前沿闭源 VLM 进行零样本机器人控制,也能通过数小时的 GPU 微调,使小型开源 VLM 用于低成本部署。其 GUMI 接口还允许人类和智能体通过图形界面收集演示数据,无需专用遥操作硬件。实验显示,该

OpenAI新董事警告:失去对AI的控制可能造成灾难性后果

曾负责OpenAI对齐研究的保罗·克里斯蒂亚诺加入OpenAI基金会董事会后警告,人类可能在短期内以灾难性且不可逆的方式失去对先进AI系统的控制。他表示,如果没有更强的对齐机制就开发超级智能,可能导致大多数人死亡。克里斯蒂亚诺呼吁加强国际协调,制定共同安全标准,透明分享风险及缓解措施,并在必要时放慢开发速度。他强调,加入董事会并不代表支持或批评OpenAI目前的安全做法。他还指出,强化学习可能促使

Suno v6正式上线:图片、视频和语音备忘录可生成音乐

AI音乐生成平台Suno已在全球推出新一代模型家族Suno v6,包括强调稳定与可控性的v6、面向探索创作的v6-wild,以及面向所有用户、生成速度更快的v6-mini。新版本支持上传图片、视频和语音备忘录生成音乐,并可通过自然语言精准修改歌曲中的特定段落或歌词,而无需重新生成整首作品。用户还可以混合多首歌曲的元素,提取人声、鼓点、乐器或riff后构建新编曲。Suno表示,v6从零开始训练,使用

重新审视后训练中的完整推理轨迹

NAVER AI的一项研究考察了大型语言模型在后训练阶段是否需要完整的推理轨迹。实验表明,完整轨迹带来的收益有限,而即使经过大幅截断的部分轨迹仍然有效。注意力分析和受控的词元删除实验显示,许多中间词元对最终推理质量的贡献很小。使用轨迹的起点和终点进行训练,可能促使模型依靠内部知识推断缺失步骤。该方法对基于强化学习和策略内蒸馏的后训练方法同样有帮助。研究团队已在GitHub上公开代码。

可编程世界模型实现持久化交互环境

Programmable World Model 将世界状态演化与视觉生成分离。代理会把自然语言指令转换为可执行程序,用于定义实体状态和状态转换规则。轻量级引擎维护明确且持久的全局世界状态,包括画面外实体和非视觉属性。系统通过加入状态信息的三维定向边界框,将世界状态连接到负责渲染的预训练视频模型。这一框架支持创建具有预设机制、可直接控制单个实体并能长期保持一致交互的可玩游戏。在新基准 Combat

苹果多项功能不随 iOS 27 首发推出,Siri AI 下月扩展更多语言支持

苹果不会在 iOS 27 和新硬件上市时同步推出所有已公布的软件功能。Apple Intelligence 将随 iOS 27 支持 16 种语言,但初期不支持中国大陆。Siri AI 目前仍处于测试阶段,将先以英语逐步开放,法语、日语、韩语、葡萄牙语和西班牙语预计于 10 月上线。Apple Watch 的 Live Rewind 和 Siri Recap 要等到 2026 年底。信息 App

OpenAI ChatGPT 语音模式支持 GPT-5.6 Sol 和 GPT-6 Astra

OpenAI 更新 ChatGPT 语音模式,允许用户选择底层模型和推理深度。据称,Pro 用户可调用 GPT-5.6 Sol 或 GPT-6 Astra,在网络搜索和复杂推理任务中也会使用指定模型。GPT-Live 的各套餐使用时长和模型访问权限同步调整,原有的“Instant”“Medium”“High”三档独立语音智能等级已停用。

报道称OpenAI未获证实的旗舰模型GPT-6 Astra接入亚马逊云科技

据提供的消息,OpenAI的GPT-6 Astra已接入Amazon Bedrock,但目前没有独立证据确认该模型的存在及其性能。报道声称,企业客户可在亚马逊的安全管控体系下,将其用于财务分析、合同审查等场景。相关安全措施包括全流程加密、限制运维人员在芯片层面的访问,以及不将推理数据用于模型训练或与OpenAI共享。目前尚无独立来源证实GPT-6 Astra已经发布。

Anthropic 遭集体诉讼,被指涉嫌虚假宣传 Claude Max

多名 Claude 用户对 Anthropic 提起集体诉讼,指控该公司误导性宣传每月 100 美元和 200 美元的 Claude Max 套餐。原告称,宣传中相当于 Claude Pro 5 倍或 20 倍的使用额度,实际上只适用于每 5 小时重置的短期会话额度,并不包括每周总使用上限。诉讼指出,这项每周限制在套餐推出时没有得到清晰披露,数月后才被加入。代理律师还表示,消费者必须点击多个晦涩的

《原神》角色声音被 AI 仿冒,米哈游获赔 75 万元

上海市浦东新区人民法院近日宣判一起被称为中国首例涉 AI 声音仿冒的不正当竞争案件。某变声软件未经授权,提供《原神》63 个角色的付费声音资源包,并使用游戏角色一段一分钟的原始音频,混合其他素材训练自有 AI 模型。司法鉴定认为,生成语音与游戏角色原声倾向认定为同一。法院认定,角色的特定音色具有识别商品来源的商业标识功能,判令软件运营方停止相关行为,并赔偿米哈游 75 万元。中国最高人民法院近期发