AI 新闻中心

AI 新闻中心 过去一年分析了 1732 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

JoyAI-Echo-1.5 面向长时音视频故事与交互式世界生成

JoyAI-Echo-1.5 是一套面向长视频和交互式世界的音视频生成系统。长视频版本通过跨镜头记忆和从语音中提取的说话人信息,在多个场景中保持角色外观和声音身份的一致性。世界模型版本将导航输入转换为经过校准的六自由度摄像机轨迹,从而支持不同控制器和视角的交互。研究团队还将双向音视频骨干网络改造成因果式少步生成器,并利用模型自行生成的长短期 rollout 进行训练,以提高长时生成的效率和稳定性。

交接成本:LLM 智能体如何延续非原生轨迹

一项研究分析了在长期编程任务中,于低成本、低能力模型与高成本、高能力模型之间切换的影响。接收模型必须延续另一个模型生成的任务轨迹,包括工具使用和代码修改。对 Claude 和 GPT 模型组合的测试显示,切换到更强模型时,即使传递完整轨迹,也只能弥补不到一半的能力差距,同时带来显著的成本溢价。相比之下,切换到更便宜的模型能实现更有利的成本与质量平衡。最佳的轨迹信息量也取决于切换方向。

阿里千问办公上线 Qwen3.8-Flash 和标准模式

阿里旗下千问办公上线最新 Qwen3.8-Flash 模型及全新标准模式。官方称,用户可用更少的 Token 消耗和更高的处理吞吐完成任务。在真实办公场景测试中,标准模式的单任务生成速度据称提升约 100%,平均 Token 消耗减少 75%。官方表示,性能提升来自模型升级、Agent 协同优化,以及针对多步规划、工具选择和上下文压缩的专项调优。千问办公未来将提供标准和高级两种模式,并宣称 95%

Video-IFBench评估多模态大语言模型在视频理解中的指令遵循能力

该研究提出Video-IFBench,用于评估多模态大语言模型在视频理解过程中遵循指令的能力。基准包含1500个样本、32种任务类型,以及涵盖语义和格式要求的39类约束。研究人员测试了20多个近期模型,结果显示,当前模型在处理包含大量约束、语义要求,或需要根据视频和音频内容选择正确条件分支的复杂指令时,仍然面临明显困难。

阿里云下调百炼平台 Qwen3.8-Flash 模型计费价格

阿里云宣布,自2026年8月27日12时(北京时间)起,下调大模型服务平台百炼上的Qwen3.8-Flash使用价格。输入价格将从每单位1.00元降至0.80元,输出价格从3.00元降至2.70元。据介绍,Qwen3.8-Flash是一款支持百万级上下文窗口的多模态模型,可处理超长文档和代码仓库,并用于编程辅助、图文理解及智能体工作流。该模型还兼容OpenAI和Anthropic的接口协议。

门控循环 Transformer 通过循环调制提升表达能力

一项研究提出了 Gated Recurrent Transformer,通过反复执行共享的 Transformer 核心,并利用更新门调节每次循环。该方法旨在减少每层使用独立参数的需求,同时保留深层模型的功能多样性。在相同计算量下,三层模型达到了与 12 层 GPT-2 Small 基线相当的准确率。在参数和数据预算相同的情况下,更深的循环结构取得了 2.76 的验证损失,优于非循环模型的 2.8

MA-VLA:面向多机械臂协作的视觉语言动作模型

MA-VLA是一种用于多机械臂协同操作的视觉语言动作模型。它将协作行为分解为原子动作,分配给不同机械臂,并支持在新任务中重新组合这些动作。其“Arm Shuffle”训练方法会置换各机械臂的观测、状态和分配动作,从而减少对固定角色的依赖。在包含训练阶段未出现的协作模式的基准测试中,现有先进VLA模型大多失败,而MA-VLA在仿真和真实环境评估中均表现稳定。研究团队已公开代码、模型和数据。

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

StreamPI在不增加额外参数的情况下,为基于单帧的视觉-语言-动作模型加入时序推理能力,用于机器人操作。该方法将每组视觉观测和语言指令视为一个时序单元,在单元内部使用双向注意力进行跨模态融合,在单元之间使用因果注意力支持流式推理。通过采用随机帧间隔训练,系统旨在缩小同步训练与真实机器人异步部署之间的差距。StreamPI可以继承预训练单帧模型的权重,并支持单帧和多帧推理。在真实机器人任务和LI

V-Rubrics:通过基于评分标准的强化学习提升视觉忠实度

V-Rubrics针对视觉语言模型后训练中的信用分配问题提出了一种方法:模型生成的回答可能语言流畅,却包含缺乏视觉证据支持的说法或错误的推理步骤。该方法将参考回答拆分为原子命题,并从视觉忠实度、推理一致性和指令遵循三个方面评估生成回答。研究团队从17个具有视觉依据的数据源构建了V-Rubrics 50K数据集,共包含50,248个样本,并以Qwen3-VL-8B-Instruct为基础模型,使用按

JIT-Agent 通过即时演化代理框架扩展智能体能力

JIT-Agent 是一种为大型语言模型智能体设计的模型,可即时生成适应具体任务的代理框架。该框架负责记忆管理、规划、行动协议,以及工具和技能的编排。JIT-Agent 能根据任务定制框架,为提升执行稳定性进行修复,并利用过往配置的性能信号持续自我演化。根据论文公布的评测结果,JIT-Agent 显著提升了多个模型系列的表现,并使 DeepSeek-V4-Flash 在部分基准测试中超过 GPT-

D^3-MOPD:面向高效多教师蒸馏的自适应动态领域调度

D^3-MOPD 是一种用于 on-policy 蒸馏的调度器,可将多个领域专家教师模型的知识整合到一个学生模型中。与训练前固定各领域数据比例的方法不同,它会跟踪每个领域的反向 KL 散度变化,并根据剩余提升空间和当前改进速度动态调整采样比例。一个异步监控进程负责执行调度,不会改变核心训练循环。在使用 Qwen3.6-35B-A3B 学生模型和四个领域专家教师模型的实验中,作者报告称,D^3-MO

特斯拉在北美推送整合 FSD v14.3.8 与夏季功能的 2026.26.6.5 更新

特斯拉已开始在北美向全系车型推送软件更新 2026.26.6.5。该版本将 FSD(监督版)v14.3.8 与 2026 夏季更新的完整功能整合在一起,新增扩展版 Grok 语音指令、自动导航和首选路线、卡拉 OK 评分、特斯拉 App 中的 FSD 统计、抵达目的地时的目标电量设置,以及 Google Meet、Microsoft Teams 和 Discord 视频会议功能。更新还包括后排屏幕

前 OpenAI 研究员巴雷特·佐夫回归谷歌,助力 Gemini 研发

Thinking Machines Lab 联合创始人、前 OpenAI 研究员巴雷特·佐夫将加入谷歌,出任研究副总裁。佐夫此前曾在 Google Brain 从事大语言模型研究,后来加入 OpenAI 参与 ChatGPT 研发,负责基础模型的后训练和产品部署。谷歌表示,他将把强化学习(RL)和后训练方面的专业经验带到 Gemini 团队。

智谱发布GLM-5.3-Flash,大模型价格战进一步升级

据报道,智谱AI发布了GLM-5.3-Flash,称其为GLM-5系列首个原生多模态模型。公司表示,该模型在Artificial Analysis Intelligence评测中获得57分,Token价格显著低于多家顶尖竞品。其原生视觉能力可在编程、游戏开发和3D场景搭建过程中观察生成结果,并进行迭代修正。报道还称,该模型基于国产芯片运行,结合SGLang等推理优化技术,并曾在Blender中自主