StreamPI:面向视觉-语言-动作模型的流式多模态时序建模
StreamPI在不增加额外参数的情况下,为基于单帧的视觉-语言-动作模型加入时序推理能力,用于机器人操作。该方法将每组视觉观测和语言指令视为一个时序单元,在单元内部使用双向注意力进行跨模态融合,在单元之间使用因果注意力支持流式推理。通过采用随机帧间隔训练,系统旨在缩小同步训练与真实机器人异步部署之间的差距。StreamPI可以继承预训练单帧模型的权重,并支持单帧和多帧推理。在真实机器人任务和LI
AI 新闻中心 过去一年分析了 4147 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
StreamPI在不增加额外参数的情况下,为基于单帧的视觉-语言-动作模型加入时序推理能力,用于机器人操作。该方法将每组视觉观测和语言指令视为一个时序单元,在单元内部使用双向注意力进行跨模态融合,在单元之间使用因果注意力支持流式推理。通过采用随机帧间隔训练,系统旨在缩小同步训练与真实机器人异步部署之间的差距。StreamPI可以继承预训练单帧模型的权重,并支持单帧和多帧推理。在真实机器人任务和LI
网易有道推出 OpenPods AI 耳机,专为 iPhone 用户设计,计划于 9 月 10 日正式发售,首发优惠价为 1499 元。产品通过 MFi 认证,支持通话和会议录音、实时翻译、语音转写、说话人识别、摘要、待办事项及思维导图生成。AI 助手可针对录音和文档进行问答,并提供来源标注。专用耳机舱内置麦克风、扬声器和 256MB 存储空间,可兼作便携录音机和翻译设备。翻译功能覆盖 20 多种
据路透社报道,Meta 因 AI 智能代理带来的生产力提升低于预期、员工强烈反弹以及内部士气下降,调整了大规模人员重组计划。代号为“Organization Transformation”的 OT 项目原本旨在打造 AI 原生组织,部分团队规模最多可能缩减 60%,剩余工作由少量高技能员工监督虚拟 AI 员工完成。Meta 在首轮调整开始前不久叫停了后续裁员安排。员工还担心公司使用追踪软件收集工作
JIT-Agent 是一种为大型语言模型智能体设计的模型,可即时生成适应具体任务的代理框架。该框架负责记忆管理、规划、行动协议,以及工具和技能的编排。JIT-Agent 能根据任务定制框架,为提升执行稳定性进行修复,并利用过往配置的性能信号持续自我演化。根据论文公布的评测结果,JIT-Agent 显著提升了多个模型系列的表现,并使 DeepSeek-V4-Flash 在部分基准测试中超过 GPT-
Perplexity AI 宣布推出 Portable Computer,这是其多模型编排智能体 Perplexity Computer 的本地版本。该应用支持私密工作流,仅在必要时调用云端算力。Portable Computer 搭载 Qwen 3.8 27B 或 Perplexity 后训练的 PPLX 27B 模型。公司还在开发经过微调的 Nemotron 3.5 Lightning 变体,
该研究提出 AnTrap 基准,用于评估 Android GUI 智能体应对动态运行时异常的鲁棒性,例如意外弹窗和错误操作。AnTrap 将现实世界的异常划分为状态、思考、行动和轮次四个层级、十个细分类别,并在保持任务可完成性的同时注入逼真的扰动。对 16 个主流 GUI 模型的评估显示,所有模型都容易受到动态异常影响,性能也显著下降。对抗性强化学习能够改善部分单步状态和行动陷阱,但状态死锁等深层
特斯拉已开始在北美向全系车型推送软件更新 2026.26.6.5。该版本将 FSD(监督版)v14.3.8 与 2026 夏季更新的完整功能整合在一起,新增扩展版 Grok 语音指令、自动导航和首选路线、卡拉 OK 评分、特斯拉 App 中的 FSD 统计、抵达目的地时的目标电量设置,以及 Google Meet、Microsoft Teams 和 Discord 视频会议功能。更新还包括后排屏幕
据报道,智谱AI发布了GLM-5.3-Flash,称其为GLM-5系列首个原生多模态模型。公司表示,该模型在Artificial Analysis Intelligence评测中获得57分,Token价格显著低于多家顶尖竞品。其原生视觉能力可在编程、游戏开发和3D场景搭建过程中观察生成结果,并进行迭代修正。报道还称,该模型基于国产芯片运行,结合SGLang等推理优化技术,并曾在Blender中自主
由23岁的Noah Shinn创办的AI初创公司Instinct,刚完成由Index Ventures与Benchmark联合领投的2.5亿美元B轮融资,累计融资达到3.5亿美元,估值升至25亿美元。成立仅一年的Instinct正在开发一款AI代理,可连接用户的应用和设备,并通过短信与电话协助处理日常事务。已披露的使用场景包括规划旅行、买菜、购买演唱会门票和取消订阅。产品目前仍处于私密测试阶段,但
FrontierChallenge是一项面向科学工作流AI代理的跨领域基准测试。研究团队从计划中的300项任务中发布并评估了97项,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学以及电化学与环境科学。研究使用三种代理框架测试了12个前沿模型。表现最佳的配置也只完整完成了97项任务中的20项,整体通过率为20.6%。较高的部分得分并不能可靠地转化为完整交付:在分析化学和电化学/环境领域,平均
Code World Model 将世界演化与视觉呈现分离。编程智能体充当世界的“大脑”,负责推理事件及其后果,生成可执行代码以维护持久的世界状态,并按照规则推动世界演化。系统通过一种代理表示,将可执行状态转换为空间和时间约束,再提供给视频模型生成细致的视觉内容。经过游戏数据微调后,MiniMax-H3 能够在由编程智能体构建的简单互动世界中遵循这些约束。该方法为构建具备持久后果和更开放演化能力的
小鹏汽车宣布,第三颗自研图灵AI芯片已正式点亮,并将新版本车载AI系统应用于量产车型。第二代VLA将与VLM融合,具备跨域调度、原生多模态和端侧大模型能力。小鹏介绍,该系统支持通过语音实现靠边停车、就近泊车、模糊导航和复杂行程规划,并可由一个统一系统管理整车。2024年公布的40核心图灵芯片据称可运行30B参数的AI大模型。公司还表示,自2025年第三季度量产搭载以来,图灵芯片累计出货量已超过20
智谱推出并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首款原生多模态模型。智谱称,该模型在 Artificial Analysis Intelligence Index 中获得 57 分,与 Claude Opus 4.8 持平,综合性能超过参数量更大的 GLM-5.2。其标准价格为 GLM-5.3 的十分之一,限时优惠最低可达 Opus 4.8 价格的四十分之一
豆包输入法近日更新至安卓 1.4.2 和 iOS 1.5.2 版本。新版新增“超级互传”,用户登录同一账号后,可在不同设备之间传输复制的文字和图片。同时加入“智能文字整理”功能,可对输入内容进行排版、精炼、润色和纠错。更新还包括更换全新品牌 Logo,以及修复在 Obsidian 中使用语音输入时偶尔出现的内容丢失问题。豆包输入法采用与豆包相同的语音大模型,支持多种方言、英语和中英混合输入,并可在
谷歌近日更新 Gemini Live 语音功能,用户可通过自然语言指令调用 Chat、Spark 和每日简报等能力。谷歌希望 Gemini 能自动理解用户需求并选择合适的功能,减少用户判断和操作步骤。不过,这些服务仍以不同图标和入口呈现,增加了用户的理解与选择成本。每日简报依托 Gmail 和 Google 日历数据提供个性化更新,但信息筛选仍不够精准,可能推送与当前需求无关的提醒。Spark具备