代理式游戏开发:扩展世界模型的可验证数据引擎
该研究认为,扩展世界模型不能只依靠更多爬取的视频和计算资源,还需要能够提供可靠奖励信号的递归式数据引擎。代码智能体可以利用可执行环境,由编译器和运行时系统提供高质量反馈,从而支持强化学习后训练。相比之下,空间生成目前往往依赖CLIP分数等模糊且可能存在偏差的指标。游戏引擎可以自动检查碰撞、物理效果、可导航性和基本可玩性,而开发者则通过接受或拒绝场景提供整体质量信号。研究提出“人类—引擎验证强化学习
AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究认为,扩展世界模型不能只依靠更多爬取的视频和计算资源,还需要能够提供可靠奖励信号的递归式数据引擎。代码智能体可以利用可执行环境,由编译器和运行时系统提供高质量反馈,从而支持强化学习后训练。相比之下,空间生成目前往往依赖CLIP分数等模糊且可能存在偏差的指标。游戏引擎可以自动检查碰撞、物理效果、可导航性和基本可玩性,而开发者则通过接受或拒绝场景提供整体质量信号。研究提出“人类—引擎验证强化学习
中国AI公司阿里巴巴与Moonshot正采取先免费或低价提供模型、再逐步实现盈利的策略。两家公司计划未来通过付费服务及其他商业模式创造收入。
使用受著作权保护的作品训练大模型,正在全球引发诉讼,但法院尚未形成统一的法律标准。围绕OpenAI、微软、Anthropic等公司的案件,争议集中于数据来源、复制行为、模型输出以及对原有内容市场的影响。Anthropic以15亿美元和解的案件区分了训练目的可能具有的转换性,以及从影子图书馆获取盗版书籍的违法性,但该和解并未形成具有约束力的判例。苹果据报道计划投入数亿美元购买新闻内容授权,并按实际使
一汽-大众已在中国开启纯电 SUV ID.AURA T6 的预售。新车搭载 4nm 车规级芯片,以及大众首款 AI 智能座舱“云栖智舱”。驾驶辅助系统采用 192 线激光雷达、算力达 420TOPS 的地平线征程 6H 芯片,以及名为 HS8 的端到端模型。官方称其支持城市全场景导航辅助、跨楼层记忆泊车和循迹倒车等功能。车辆提供 540 公里和 660 公里两种续航版本,预售价为 13.59 万至
腾讯8月28日宣布,WorkBuddy首发接入腾讯混元新一代开源旗舰模型Hy4preview,中国版与国际版同步上线。Hy4preview总参数量达7700亿,激活参数490亿,上下文长度最高可达100万Token,面向编程、办公和科学等生产力场景。该模型还已在Hugging Face、腾讯云TokenHub和OpenRouter上线。Hy4preview提供两周免费体验,上一代模型Hy3的免费使
腾讯控股发布了一款新的基础模型。公司称,该模型在内部测试中的表现超过了中国竞争对手智谱旗下Z.AI和月之暗面Moonshot AI的模型,并有望跻身中国顶尖人工智能企业之列。不过,相关测试结果尚未经过独立基准评测验证。
据《商业内幕》报道,谷歌部分员工已开始试用Gemini 3.8 Flash内部预览版。该模型以“Gemini 3.8 Flash Preview”为名,已上线谷歌内部编程平台Jetski。一名测试员工表示,其当前体验明显优于Gemini 3.7 Flash,但现阶段仍不足以下定论。为追赶OpenAI和Anthropic,谷歌似乎正在缩短模型更新周期,并进一步加大对Flash系列的投入。该系列主打更
GameWAM是一种用于电子游戏和图形用户界面原生闭环交互的世界-动作模型。它能够同时生成未来的视觉观测以及可执行的键盘和鼠标操作轨迹。该系统区分游戏操作与GUI操作模式,通过只执行短动作前缀、再依据新观测重新规划来处理长时程交互,并使用同步的游戏和GUI轨迹进行训练。实验表明,GameWAM在任务成功率方面具有竞争力,同时执行的原生操作少于对比智能体。研究还发现一种失败模式:在条件固定时,生成动
腾讯发布了开源模型 Hy4 preview,总参数量 7700 亿,激活参数 490 亿,上下文长度达到 100 万 Token。腾讯称,该模型在软件工程、办公分析、游戏开发和科学研究等任务上有所提升。在由 163 名内部专家对 203 项工程任务进行的盲测中,Hy4 preview 平均得分为 2.99 分(满分 4 分),略高于腾讯公布的 GLM-5.3 和 Kimi K3 得分。腾讯还表示,
Anthropic于8月27日以研究预览形式发布“模型硬件标准”(MHS)。该标准旨在提供统一的控制与通信层,让AI代理能够操作显微镜、液体处理设备、机械臂和量子计算系统等可编程设备。路透社、CNBC等媒体将其解读为Anthropic首次公开进入具身智能或物理AI领域。Anthropic表示,早期闭门测试在生物医药、量子计算和先进制造领域带来了效率提升。制药公司基因泰克称,一项自动化剂量反应实验的
论文提出 Self-OPD,一种面向流匹配模型的无教师策略内蒸馏框架。现有 OPD 方法通常需要为每个新目标训练专门的预训练教师模型,计算成本较高;教师与学生分布之间的差异还可能导致生成轨迹中的误差累积。Self-OPD 将学生模型自身的探索转化为逐步监督信号。在每个时间步,方法从确定性的下一状态预测中生成多个随机候选,通过采样运行这些候选,并将其奖励与模型自身的确定性参考基线进行比较。优势较高的
TTPO是一种无需真实标签、在推理阶段训练大语言模型的方法。它利用多数投票生成伪标签,对与投票结果一致的输出进行蒸馏,并惩罚不一致输出中的高置信度错误,以降低错误伪标签误导整个更新过程的风险。在五项竞赛级基准测试中,TTPO达到了使用标签监督的在策略自蒸馏方法的水平。在Qwen3-1.7B上,测试时训练性能从38.0%提升至45.2%;在不进行扩展思考的情况下,研究还报告了25.2%至36.4%的
Midjourney已开放V8.2图像编辑模型的公开测试。用户可以通过文本指令修改现有图像,同时融合最多4张参考图,并使用局部重绘和画布扩展功能。该模型还支持个性化设置、情绪板和风格参考。用户可通过Midjourney官网、alpha测试网站或Discord调用。官方表示,测试初期界面可能频繁调整,模型在复杂场景下仍可能出现非预期结果,并邀请用户提交反馈和任务ID。
PAWBench提出将概率对齐作为评估世界模型的标准。模型不仅要生成一条合理的轨迹,还应在相同的初始观测和行动条件下,正确复现各种可能结果的分布。该基准及PAWEval评测协议在50个场景和11个现有系统上分析了重复视频生成结果。没有任何受测模型能够持续匹配参考概率,同时覆盖全部有效的物理行为。研究还考察了语言提示、初始噪声和模型训练是否能够改变模型的预测分布。
蚂蚁集团旗下百灵推出金融增强模型 Ling-3.0-flash-Fin,总参数量为 1240 亿、激活参数为 51 亿。该模型延续 Ling-3.0-flash 的架构和长上下文能力,并通过金融语料持续预训练、领域后训练和工具使用优化,提升对年报、财务工作簿、研究材料及复杂金融任务的处理能力。蚂蚁集团称,模型已在多项金融与智能体基准上进行测试,相较多款通用模型展现出竞争力;其 AA Intelli