AI 新闻中心

AI 新闻中心 过去24小时分析了 131 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Magpie:面向交互式游戏的实时世界渲染

Magpie 是一种面向交互式游戏的生成式渲染系统,将游戏运行与视觉生成分离。游戏引擎负责处理玩家操作并维护世界状态,独立的渲染服务器则根据引擎生成的白盒画面输出视觉内容。该设计旨在保持游戏规则、对象状态和交互结果的稳定性与可复现性,同时减少早期游戏原型对完整视觉资产制作的依赖。Magpie 为将生成模型应用于游戏实时渲染提供了一种系统级实现路径。

以镜头为单位思考:通过智能体推理实现一致的多镜头视频编辑

生成式人工智能推动了视频编辑技术的发展,但按照多项指令编辑长视频仍然十分困难。按固定时长切分视频可能导致人物和物体被割裂、产生编辑幻觉,并破坏时间连续性。该研究提出多指令多镜头长视频编辑(MMLVE)任务以及 MMLVE-Bench 数据集。其智能体框架结合大语言模型和视觉语言模型,在镜头级别拆分视频,并更准确地解析编辑指令。研究还提出三项指标,用于评估跨镜头一致性、多指令解耦以及时空结构的保持程

微博证实孙宇晨与谷爱凌假聊天记录由 AI 制作

微博 8 月 28 日通报称,网传孙宇晨与谷爱凌的聊天记录完全是捏造的。平台表示,相关内容由 AI 工具制作,用于散布低俗谣言并恶意侵害多名公众人物的权益。涉事账号此前几乎没有活动,仅发布了这条谣言,最终被永久关闭。事件还存在购买流量、操纵微博热搜排名的迹象。该案是多起缺乏事实依据的名人谣言之一,凸显生成式 AI 被滥用于诽谤、传播虚假信息和非法引流。

GameWAM:面向电子游戏的世界-动作模型

GameWAM是一种用于电子游戏和图形用户界面原生闭环交互的世界-动作模型。它能够同时生成未来的视觉观测以及可执行的键盘和鼠标操作轨迹。该系统区分游戏操作与GUI操作模式,通过只执行短动作前缀、再依据新观测重新规划来处理长时程交互,并使用同步的游戏和GUI轨迹进行训练。实验表明,GameWAM在任务成功率方面具有竞争力,同时执行的原生操作少于对比智能体。研究还发现一种失败模式:在条件固定时,生成动

腾讯发布参数规模达 7700 亿的开源模型 Hy4 preview

腾讯发布了开源模型 Hy4 preview,总参数量 7700 亿,激活参数 490 亿,上下文长度达到 100 万 Token。腾讯称,该模型在软件工程、办公分析、游戏开发和科学研究等任务上有所提升。在由 163 名内部专家对 203 项工程任务进行的盲测中,Hy4 preview 平均得分为 2.99 分(满分 4 分),略高于腾讯公布的 GLM-5.3 和 Kimi K3 得分。腾讯还表示,

Anthropic推出MHS硬件标准,进军物理AI

Anthropic于8月27日以研究预览形式发布“模型硬件标准”(MHS)。该标准旨在提供统一的控制与通信层,让AI代理能够操作显微镜、液体处理设备、机械臂和量子计算系统等可编程设备。路透社、CNBC等媒体将其解读为Anthropic首次公开进入具身智能或物理AI领域。Anthropic表示,早期闭门测试在生物医药、量子计算和先进制造领域带来了效率提升。制药公司基因泰克称,一项自动化剂量反应实验的

Self-OPD:无需教师模型的流匹配模型策略内蒸馏

论文提出 Self-OPD,一种面向流匹配模型的无教师策略内蒸馏框架。现有 OPD 方法通常需要为每个新目标训练专门的预训练教师模型,计算成本较高;教师与学生分布之间的差异还可能导致生成轨迹中的误差累积。Self-OPD 将学生模型自身的探索转化为逐步监督信号。在每个时间步,方法从确定性的下一状态预测中生成多个随机候选,通过采样运行这些候选,并将其奖励与模型自身的确定性参考基线进行比较。优势较高的

PILOT 在环:面向长程智能体的实时自我改进

PILOT 是一种监督者—工作者框架,支持 AI 智能体在执行过程中持续改进。独立的监督者可以在工作者运行期间重新引导或终止任务,同时将执行过程中发现的流程和失败模式提炼为可复用的技能与记忆。在两个冻结的基础模型和三个基准测试中,PILOT 在六种配置中的五种排名第一。在 Terminal-Bench 2.0 上,其表现最多领先对比框架 9.8 个百分点。在自我改进测试中,使用 GLM-5.1 和

Anthropic推出MHS标准,首次公开进军物理AI领域

Anthropic以研究预览形式发布模型硬件标准(Model Hardware Standard,MHS)。该标准旨在成为AI智能体与可编程设备之间的统一控制和通信层,使智能体能够在较少人工干预的情况下协同操作显微镜、液体处理设备、机械臂和量子计算系统等异构设备。多家媒体将此举解读为Anthropic首次公开进入具身智能或物理AI领域。Anthropic表示,早期闭门测试显示,MHS能够加速生物医

TTPO:测试时策略优化

TTPO是一种无需真实标签、在推理阶段训练大语言模型的方法。它利用多数投票生成伪标签,对与投票结果一致的输出进行蒸馏,并惩罚不一致输出中的高置信度错误,以降低错误伪标签误导整个更新过程的风险。在五项竞赛级基准测试中,TTPO达到了使用标签监督的在策略自蒸馏方法的水平。在Qwen3-1.7B上,测试时训练性能从38.0%提升至45.2%;在不进行扩展思考的情况下,研究还报告了25.2%至36.4%的