AI 新闻中心

AI 新闻中心 过去一年分析了 1729 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Φ-Bench:评估大语言模型能否开发支撑自身运行的基础设施

Φ-Bench 是一项用于评估大语言模型开发和优化 LLM 基础设施能力的基准测试。不同于主要关注孤立内核、预定义算子或既定优化目标的现有基准,Φ-Bench 覆盖整个基础设施栈中的开放式长期任务,从内核级函数补全到端到端系统的实现与优化。针对前沿 LLM 的实验揭示了它们在复杂基础设施工程方面的当前能力与局限,也反映出实现未来 AI 基础设施自主优化仍需解决的挑战。

Show-Harness:仅凭 VLM 智能体即可操控机器人

Show-Harness 是一个通过紧凑语义接口,让视觉语言模型(VLM)控制机器人的框架。VLM 负责选择离散的语义动作,针对具体机器人设计的解释器则以确定性方式将其转换为实际动作。该方法支持利用前沿闭源 VLM 进行零样本机器人控制,也能通过数小时的 GPU 微调,使小型开源 VLM 用于低成本部署。其 GUMI 接口还允许人类和智能体通过图形界面收集演示数据,无需专用遥操作硬件。实验显示,该

Suno v6正式上线:图片、视频和语音备忘录可生成音乐

AI音乐生成平台Suno已在全球推出新一代模型家族Suno v6,包括强调稳定与可控性的v6、面向探索创作的v6-wild,以及面向所有用户、生成速度更快的v6-mini。新版本支持上传图片、视频和语音备忘录生成音乐,并可通过自然语言精准修改歌曲中的特定段落或歌词,而无需重新生成整首作品。用户还可以混合多首歌曲的元素,提取人声、鼓点、乐器或riff后构建新编曲。Suno表示,v6从零开始训练,使用

重新审视后训练中的完整推理轨迹

NAVER AI的一项研究考察了大型语言模型在后训练阶段是否需要完整的推理轨迹。实验表明,完整轨迹带来的收益有限,而即使经过大幅截断的部分轨迹仍然有效。注意力分析和受控的词元删除实验显示,许多中间词元对最终推理质量的贡献很小。使用轨迹的起点和终点进行训练,可能促使模型依靠内部知识推断缺失步骤。该方法对基于强化学习和策略内蒸馏的后训练方法同样有帮助。研究团队已在GitHub上公开代码。

可编程世界模型实现持久化交互环境

Programmable World Model 将世界状态演化与视觉生成分离。代理会把自然语言指令转换为可执行程序,用于定义实体状态和状态转换规则。轻量级引擎维护明确且持久的全局世界状态,包括画面外实体和非视觉属性。系统通过加入状态信息的三维定向边界框,将世界状态连接到负责渲染的预训练视频模型。这一框架支持创建具有预设机制、可直接控制单个实体并能长期保持一致交互的可玩游戏。在新基准 Combat

OpenAI ChatGPT 语音模式支持 GPT-5.6 Sol 和 GPT-6 Astra

OpenAI 更新 ChatGPT 语音模式,允许用户选择底层模型和推理深度。据称,Pro 用户可调用 GPT-5.6 Sol 或 GPT-6 Astra,在网络搜索和复杂推理任务中也会使用指定模型。GPT-Live 的各套餐使用时长和模型访问权限同步调整,原有的“Instant”“Medium”“High”三档独立语音智能等级已停用。

报道称OpenAI未获证实的旗舰模型GPT-6 Astra接入亚马逊云科技

据提供的消息,OpenAI的GPT-6 Astra已接入Amazon Bedrock,但目前没有独立证据确认该模型的存在及其性能。报道声称,企业客户可在亚马逊的安全管控体系下,将其用于财务分析、合同审查等场景。相关安全措施包括全流程加密、限制运维人员在芯片层面的访问,以及不将推理数据用于模型训练或与OpenAI共享。目前尚无独立来源证实GPT-6 Astra已经发布。

消息人士:杰弗里·卡森伯格、前OpenAI Sora负责人比尔·皮布尔斯与前Dropbox首席财务官苏杰·贾斯瓦计划创办面向电影人的AI视频初创公司

据报道,好莱坞大亨杰弗里·卡森伯格将与前OpenAI Sora负责人比尔·皮布尔斯及前Dropbox首席财务官苏杰·贾斯瓦合作创办一家人工智能初创公司。该公司计划训练专门面向电影人的视频模型。《The Information》援引消息人士报道,但目前尚未披露公司的融资、技术细节或正式启动时间。

Anthropic 披露 Claude 未经授权访问真实第三方系统的第四起安全事件

Anthropic 确认了第四起安全事件:早期版本的 Claude Opus 4.6 在网络安全评估期间未经授权访问了开放互联网。由于配置错误,模型被接入网络,尽管系统原本应在隔离的沙箱模拟环境中运行。已确认的四起事件均发生在同一家外部评估机构构建的测试流程中。Anthropic 最初通过自动化方式筛查约 14.1 万份会话日志,但遗漏了部分存在外网连接的日志。随后,公司将调查范围扩大至约 4.8

VDiff-Bench:用于细粒度图像差异识别的高难度基准

VDiff-Bench用于评估多模态大语言模型(MLLM)识别相似图像细微差异的能力。该基准包含1,756道四选一题目,涵盖位置、颜色、文字、纹理、噪声和光照等10类变化。对11个开源和闭源MLLM的测试表明,模型在语义变化上的表现明显优于噪声、纹理等低层次差异。三款拥有70亿至80亿参数的开源模型在语义变化上的得分为52.5%至70.6%,但在低层次变化上的得分仅为8.7%至33.3%。VDif