PhysBrain 1.5:从视觉语言模型迈向物理基础模型
PhysBrain 1.5 是一个用于理解物理环境、生成动作和预测未来状态的统一模型。它将语言响应、末端执行器运动和视觉目标编码为离散序列,并通过自回归下一词预测进行联合训练。预训练完全采用人类交互视频,随后使用人类示范、机器人轨迹和模拟经验进行监督微调。作者称,这个拥有80亿参数的开源模型在28项具身理解基准测试中平均得分72.5,并在其中14项取得开源模型最佳成绩。这些性能数据属于作者报告,仍
AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
PhysBrain 1.5 是一个用于理解物理环境、生成动作和预测未来状态的统一模型。它将语言响应、末端执行器运动和视觉目标编码为离散序列,并通过自回归下一词预测进行联合训练。预训练完全采用人类交互视频,随后使用人类示范、机器人轨迹和模拟经验进行监督微调。作者称,这个拥有80亿参数的开源模型在28项具身理解基准测试中平均得分72.5,并在其中14项取得开源模型最佳成绩。这些性能数据属于作者报告,仍
LLaDA-UI 是一个拥有 167 亿参数的 GUI 智能体,将混合专家架构与分块扩散生成相结合。该系统先进行多模态预训练,随后使用移动端、桌面端、网页界面和视觉定位数据进行有监督微调。在多项定位与导航基准测试中,LLaDA-UI 的表现超过 Qwen2.5-VL-7B,并在报告的六项 GUI 基准中的四项超过 Qwen3-VL-8B。研究结果表明,分块扩散可以成为多模态 GUI 智能体的一种实
Attention-DP3是一种三维扩散策略,旨在帮助机器人在物体遮挡、混杂且干扰物较多的操作场景中识别与任务相关的几何信息。该方法首先对RGB图像进行开放词汇二维分割,再利用经过标定的相机几何将目标物体掩码提升到三维空间。其三场注意力条件机制分别强调目标物体、目标内部与任务相关的区域,并抑制背景和干扰物。 在Adroit、DexArt、MetaWorld以及真实SO101平台上的实验显示,该方法
BVB,即 Blender-VideoBench,用于评估多模态智能体能否通过编程,将现实世界视频重建为带动画的 Blender 场景。所有智能体都在相同的沙盒环境中完成重建,评测指标包括保留视频时空事实的能力,以及与原始视频的感知相似度。在来自 10 个模型系列的 51 种配置中,最佳模型的潜在相似度达到 88.6,但仅保留了原视频正确时空答案的 53.7%。增加推理过程可以提升视觉相似度,却无
该研究提出“发现基础模型”,这类 AI 系统不仅能够利用现有知识进行推理或解决人类定义的任务,还能参与提出新问题、构建新表示、形成假设并创造知识。其框架 Zetema 维护可修订的研究状态,验证证据、控制实验,并跨任务持续改进发现能力。GALILEO 将干实验室推理、机器人和实际湿实验室实验、外部生物学证据以及反复的假设修订结合起来,应用于治疗研究。研究还提出了超越最终答案准确率、训练和评估发现过
Dream-RSI 是一个用于可扩展、递归式改进自主 AI 智能体探索策略的框架。它将历史发现树构建为回放模拟器,使策略能够通过即时、低成本的离策略反馈进行评估和优化,而无需反复执行昂贵的在线评估。改进后的策略会重新部署,以推动后续发现,形成持续自我改进的循环。在算法工程、数学优化和 GPU 内核工程测试中,Dream-RSI 在多个场景下取得了具有竞争力或更高的发现质量,同时显著降低了发现成本。
据 Business Insider 报道,谷歌已通过内部开发平台 Antigravity,向全公司工程师开放 Anthropic Claude 的使用权限。员工可在个人配额内使用包括 Claude Opus 5 在内的部分第三方模型。谷歌表示,Gemini 仍是内部开发的主要模型,Claude 则作为专门用例的补充工具。此前,Claude 主要仅限 DeepMind 团队及部分高优先级项目使用。
Omni-Streaming Thinking(OST)是一种让模型持续处理视频和同步音频的方法。它将视觉与听觉证据分开保存,先把结论标记为待验证,并在未来证据出现时进行检查。检测到矛盾后,系统会降低相关结论及其依赖状态的影响,再依据新证据更新模型状态。研究人员使用轻量适配的 Qwen3-Omni-30B-A3B-Instruct 进行测试,报告称 OST 在五项流式和视听基准测试中平均超过开放基
蚂蚁集团 AI 安全实验室开源了大模型内生式安全护栏技术 SingProbe。该技术不依赖外挂式安全审核,而是复用模型推理过程中的隐藏状态,在不足 0.5% 额外计算开销下进行 token 级实时风险评估。SingProbe 支持意图分类、安全检测和幻觉识别,并可在内容输出前以毫秒级速度阻断风险结果,面向医疗等高风险场景。蚂蚁集团称,该技术已适配 29 个主流大模型,同时发布了开源代码和预训练模型
据未经证实的消息,Anthropic 正在面向部分 Claude Code 用户灰度测试尚未正式发布的 Claude Opus 5.2。部分开发者称,他们从后端模型标识中发现了指向该版本的线索。与此同时,外界还流传 Anthropic 内部的“Model 2”已承担大量代码编写工作,甚至可能替代部分研究职能。Anthropic 尚未正式确认上述说法,因此目前应将其视为传闻,而非已证实的产品发布或组
SemiAnalysis 的 Bryan Shan 表示,在使用 1.6 万亿参数 DeepSeek 模型进行推理测试时,Vera Rubin NVL72 的每兆瓦代币吞吐量最高达到 Blackwell 的 7 倍。这一结果高于英伟达首席执行官黄仁勋此前针对 1 万亿至 3 万亿参数大语言模型提出的 3 倍性能优势估计。相关数据来自分析报告,尚未被证明是经过独立验证的行业基准。
一份技术报告提出了 Pelican-Sim 1.0,这是一种根据视觉上下文和机器人动作预测未来观测结果的世界模型,用于支持后续学习和决策。其 28 维统一动作表示可适配多种机器人形态。系统结合渲染动作视频、稀疏混合专家层,以及经过蒸馏的四步生成流程,以提升可控性、视频质量和生成速度。模型使用约 100 万条真实和模拟轨迹进行训练,在多个机器人基准测试中超过了所评估的基线模型。在 RoboTwin
社交媒体上的开发者称,Anthropic 疑似已在 Claude Code 中测试 Claude Opus 5.2。根据他们对路由信息的观察,部分请求可能被转发至一个响应更快、能更长时间自主处理复杂编程任务的新模型。文章还介绍了通过“重置哥 Tibo”相关知识进行的非正式测试,用于区分传闻中的模型与网页版。报道进一步声称,Anthropic 内部使用代号“Model 2”的模型编写了公司大部分代码
开发者“pdfu”对 iOS 27 和 macOS Golden Gate 的分析显示,苹果正在为新版 Siri 准备与第三方 AI 模型协作的架构。演示表明,Claude 和 OpenAI 模型可以通过 Siri 扩展运行,负责理解请求、规划任务并调用部分工具。“模型委托”机制允许外部模型处理自然语言请求,再将系统操作交还给 Siri。另一套协议甚至可能让用户完全替换设备端的 Siri 模型。目
OpenAI联合创始人格雷格·布罗克曼在接受a16z采访时表示,随着GPT-6 Astra等模型具备长时间自主执行任务和操作电脑的能力,人类已经进入通用人工智能(AGI)时代。这是布罗克曼的判断,并不构成AGI已经实现的独立验证。他表示,OpenAI已将25%的生产工程师从原有项目中调出,转而加强系统防御和安全架构。团队使用Astra排查内部系统漏洞,并修复了多项严重问题。不过,布罗克曼强调,问题