StreamPI:面向视觉-语言-动作模型的流式多模态时序建模
StreamPI在不增加额外参数的情况下,为基于单帧的视觉-语言-动作模型加入时序推理能力,用于机器人操作。该方法将每组视觉观测和语言指令视为一个时序单元,在单元内部使用双向注意力进行跨模态融合,在单元之间使用因果注意力支持流式推理。通过采用随机帧间隔训练,系统旨在缩小同步训练与真实机器人异步部署之间的差距。StreamPI可以继承预训练单帧模型的权重,并支持单帧和多帧推理。在真实机器人任务和LI
AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
StreamPI在不增加额外参数的情况下,为基于单帧的视觉-语言-动作模型加入时序推理能力,用于机器人操作。该方法将每组视觉观测和语言指令视为一个时序单元,在单元内部使用双向注意力进行跨模态融合,在单元之间使用因果注意力支持流式推理。通过采用随机帧间隔训练,系统旨在缩小同步训练与真实机器人异步部署之间的差距。StreamPI可以继承预训练单帧模型的权重,并支持单帧和多帧推理。在真实机器人任务和LI
V-Rubrics针对视觉语言模型后训练中的信用分配问题提出了一种方法:模型生成的回答可能语言流畅,却包含缺乏视觉证据支持的说法或错误的推理步骤。该方法将参考回答拆分为原子命题,并从视觉忠实度、推理一致性和指令遵循三个方面评估生成回答。研究团队从17个具有视觉依据的数据源构建了V-Rubrics 50K数据集,共包含50,248个样本,并以Qwen3-VL-8B-Instruct为基础模型,使用按
JIT-Agent 是一种为大型语言模型智能体设计的模型,可即时生成适应具体任务的代理框架。该框架负责记忆管理、规划、行动协议,以及工具和技能的编排。JIT-Agent 能根据任务定制框架,为提升执行稳定性进行修复,并利用过往配置的性能信号持续自我演化。根据论文公布的评测结果,JIT-Agent 显著提升了多个模型系列的表现,并使 DeepSeek-V4-Flash 在部分基准测试中超过 GPT-
Perplexity AI 宣布推出 Portable Computer,这是其多模型编排智能体 Perplexity Computer 的本地版本。该应用支持私密工作流,仅在必要时调用云端算力。Portable Computer 搭载 Qwen 3.8 27B 或 Perplexity 后训练的 PPLX 27B 模型。公司还在开发经过微调的 Nemotron 3.5 Lightning 变体,
D^3-MOPD 是一种用于 on-policy 蒸馏的调度器,可将多个领域专家教师模型的知识整合到一个学生模型中。与训练前固定各领域数据比例的方法不同,它会跟踪每个领域的反向 KL 散度变化,并根据剩余提升空间和当前改进速度动态调整采样比例。一个异步监控进程负责执行调度,不会改变核心训练循环。在使用 Qwen3.6-35B-A3B 学生模型和四个领域专家教师模型的实验中,作者报告称,D^3-MO
特斯拉已开始在北美向全系车型推送软件更新 2026.26.6.5。该版本将 FSD(监督版)v14.3.8 与 2026 夏季更新的完整功能整合在一起,新增扩展版 Grok 语音指令、自动导航和首选路线、卡拉 OK 评分、特斯拉 App 中的 FSD 统计、抵达目的地时的目标电量设置,以及 Google Meet、Microsoft Teams 和 Discord 视频会议功能。更新还包括后排屏幕
Thinking Machines Lab 联合创始人、前 OpenAI 研究员巴雷特·佐夫将加入谷歌,出任研究副总裁。佐夫此前曾在 Google Brain 从事大语言模型研究,后来加入 OpenAI 参与 ChatGPT 研发,负责基础模型的后训练和产品部署。谷歌表示,他将把强化学习(RL)和后训练方面的专业经验带到 Gemini 团队。
据报道,智谱AI发布了GLM-5.3-Flash,称其为GLM-5系列首个原生多模态模型。公司表示,该模型在Artificial Analysis Intelligence评测中获得57分,Token价格显著低于多家顶尖竞品。其原生视觉能力可在编程、游戏开发和3D场景搭建过程中观察生成结果,并进行迭代修正。报道还称,该模型基于国产芯片运行,结合SGLang等推理优化技术,并曾在Blender中自主
Code World Model 将世界演化与视觉呈现分离。编程智能体充当世界的“大脑”,负责推理事件及其后果,生成可执行代码以维护持久的世界状态,并按照规则推动世界演化。系统通过一种代理表示,将可执行状态转换为空间和时间约束,再提供给视频模型生成细致的视觉内容。经过游戏数据微调后,MiniMax-H3 能够在由编程智能体构建的简单互动世界中遵循这些约束。该方法为构建具备持久后果和更开放演化能力的
智谱推出并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首款原生多模态模型。智谱称,该模型在 Artificial Analysis Intelligence Index 中获得 57 分,与 Claude Opus 4.8 持平,综合性能超过参数量更大的 GLM-5.2。其标准价格为 GLM-5.3 的十分之一,限时优惠最低可达 Opus 4.8 价格的四十分之一
一项研究表明,传统的对话式大语言模型记忆测试未必能反映用户满意度。在一项为期4个月的部署中,40名用户进行了1,872次会话,涵盖7种记忆条件。针对过往对话事实的直接提问,准确率在19.7%至70.1%之间波动,但用户满意度没有变化。研究人员认为,直接问答测试的是系统在被明确询问时能否检索事实,而真实对话还要求系统识别信息的相关性,并将过往上下文自然融入回答。为此,他们推出MemUse,根据真实用
据 Business Insider 报道,英伟达近几周一直在与 Hugging Face 就收购事宜进行严肃讨论。若交易达成,Hugging Face 的估值将超过130亿美元,可能成为英伟达迄今规模最大的交易之一,但双方尚未达成协议,谈判仍可能破裂。微软也曾与 Hugging Face 会面,但据知情人士透露,双方尚未进入实质谈判。去年年底,Hugging Face 拒绝了英伟达以5亿美元投资
面向消费者的 AI 应用不应要求用户理解产品的内部架构。这篇评论指出,Gemini 及其他 AI 产品的命名和呈现方式过于复杂,容易让用户感到困惑。
谷歌已面向开发者和企业推出 Gemini 3.5 Transcribe 公共预览版。这款语音转文字模型为 Gboard Rambler 提供支持,未来还将登陆 Chrome。谷歌表示,该模型旨在捕捉用户自然的说话方式,更好地理解用户意图,并识别自定义词汇。
这项研究分析了基于大语言模型的智能体在交接过程中如何削弱具有约束力的要求。研究人员在 1,296 个受控合成情境中,通过摘要、计划和其他工作流产物传递安全阻断条件。即使原始信息通常得到保留,那些必须在执行前解决的要求也会反复变成不具约束力的参考事项。在常规交接压缩下,100.0% 的阻断条件被停用,54.2% 的情境出现了被禁止的行动。恢复前提条件、权限、备用方案和执行后果这四个状态字段后,状态保