AI 新闻中心

AI 新闻中心 过去一年分析了 1727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

vivo发布AI智能体大模型矩阵,预研30B MoE端侧模型

vivo发布了覆盖语音、端侧和云侧应用的新一代AI智能体大模型矩阵,并宣布正在研究可在智能手机上运行的300亿参数MoE模型。公司称,该研究旨在提升多模态理解、长上下文推理和复杂任务自主执行能力。发布会还展示了编程智能体BlueCode预览版,以及OriginOS 7和蓝河操作系统4。30B模型目前仍处于研究开发阶段,实际性能和上市时间尚未公布。

StepAudio 3 Music 技术报告

StepAudio 3 Music 是一款支持显式音乐规划和开放领域文本控制的大规模长时音乐生成模型。系统结合了 50Hz 音乐分词器、基于流匹配的扩散 Transformer,以及可生成 48kHz 音频的 VAE 解码器。混合专家自回归模型会先使用 ABC 记谱法生成编曲计划,再预测音乐分词,将和声、节奏和旋律纳入生成上下文。模型支持歌曲、器乐曲、根据干声生成伴奏,以及最长 5 分 30 秒的

豆包2.1 Pro 0915上线火山方舟,飞书8.0推出团队智能体

字节跳动已将豆包大模型Doubao-Seed-2.1-pro升级至0915版本,并在火山引擎火山方舟平台全面开放API。官方称,新版本强化了证据溯源、权威信源检索、信息时效判断和数据核验,面向多工具调用和长程智能体任务提升稳定性。同时,模型增强了对大型代码仓库的跨文件编程能力,并优化了图像、视频推理的Token效率。飞书8.0推出团队智能体“豆包工作伙伴”,可加入群聊,并在授权范围内调用文档、会议

Decoy Direction Optimization:防御 LLM 消融攻击的后处理方法

开放权重语言模型的安全护栏可能被拒绝特征消融(RFA)绕过。该技术会从残差流中识别并移除代表拒绝行为的线性方向,同时通常保留模型的通用能力。Decoy Direction Optimization(DDO)是一种快速的后处理防御方法,无需针对每个新模型检查点重新进行基础模型微调。它在 MLP 神经元中注入高幅度的非线性诱饵信号,使攻击者误以为找到了拒绝方向,转而消融一个无害的正交特征,而实际的安全

豆包 2.1 Pro 更新至 0915 版本:Agent 任务交付更可靠,多模态 Coding 能力增强

火山引擎宣布将豆包 2.1 Pro 更新至 0915 版本,并通过火山方舟 API 全量上线。此次更新面向企业生产场景,官方称重点提升了 Agent 的证据溯源、权威信源检索、时效判断和数据核验能力,同时增强多模态 Coding、图像与视频理解,以及复杂代码仓库分析能力。模型可据称读取设计稿、工程图纸和操作录屏,将视觉信息转换为前端代码或游戏逻辑。豆包工作、TRAE 和 Doubao-Seed-E

人类构建的最后一个AI:迈向真正的递归式自我改进

本文研究递归式自我改进(RSI),即AI系统将经验和反馈转化为持久性变化,从而提升自身能力以及未来的改进过程。文章首先利用Headroom-Closed Index(HCI)分析现有大语言模型的问题,随后提出一条发展路线:从改进执行和改进策略的自主化,到经验获取自主化、环境适应自主化,最终实现递归式元改进。研究还比较了RSI在科学发现、具身智能和软件工程等场景中的不同需求与发展速度,并将相关研究与

vivo 全面升级蓝心大模型,发布四款核心模型

在 2026 vivo 开发者大会上,vivo 宣布全面升级蓝心大模型,并发布四款核心模型:负责语音理解的 Blue LM-RealTime、负责端侧感知与个人记忆的 Blue LM-Nano,以及面向云侧复杂任务执行的 Blue LM-Flash 和 Blue LM-Pro。vivo 表示,语音模型能够应对嘈杂环境、轻声说话、不同口音、连续表达以及中英文混说。端侧模型可融合处理屏幕内容、图像、视

无需推理轨迹训练专业模型,用于领域专家知识蒸馏

本研究探讨了专业模型仅使用问答对、没有明确推理监督时,如何将领域知识传递给学生模型。研究人员发现,专业模型的优化过程会从潜在的推理轨迹空间中隐式选择一种分布。由于学生模型只继承专业模型采样得到的轨迹,而不继承其参数或优化约束,因此知识蒸馏可以作为观察这一潜在分布的通用探针。在27组专业模型与学生模型的配对中,专业化与泛化能力的特征呈现出极强的相关性。通过明确控制专业模型的分布漂移,可以系统地调节教

漂移约束优化:指令模型微调的关键在于更新方向

一项研究将微调重新定义为:在预先设定的行为漂移预算内选择有效的更新方向。研究人员在 Qwen3-8B 和 Qwen3-14B 上进行测试,发现粗粒度的层选择方法可以克服仅使用最终答案进行微调的局限。所得模型在保持推理能力和通用能力的同时,提升了 100 多种语言的科学推理与多语言翻译表现。代码和模型资源已公开。

PhysStream:结合结构化场景记忆与细粒度运动控制的物理基础视频生成

PhysStream是一种用于物理基础图像到视频生成的自回归模型。它利用从此前生成帧中在线提取的位置图和物体跟踪图,并通过表示速度增量的稀疏信号控制具有物理意义的运动。该模型采用两阶段训练,可在生成包含多个桌面刚体物体的场景过程中进行交互式控制。在合成基准测试中,与最强基线方法相比,PhysStream将运动分布距离降低33%,将轨迹误差降低12%。在真实场景比较中,人类评审在超过85%的情况下更

模态自回归世界动作模型

研究人员推出 ModAR,这是一种在预测机器人动作之前,自回归生成多种未来模态的世界动作模型,包括点轨迹、DINO 特征和深度图。每次预测都可以基于此前生成的模态,因此相比仅预测未来 RGB 图像,能够更高效地捕捉几何、语义和运动信息。在所有测试数据规模下,ModAR 都优于现有世界动作模型方案,观测到的平均成功率达到 75%,高于以视频模型初始化的 Flex-π 的 72%。同时,ModAR 无

vivo 发布四款蓝心大模型,推出系统级蓝心 Harness

vivo 在 2026 年开发者大会上发布四款蓝心大模型。BlueLM-RealTime 采用端到端 MoE 架构,可处理嘈杂环境、口音及中英混合等复杂语音。拥有 30 亿参数的 BlueLM-Nano 支持端侧运行,能够理解屏幕、图像、视频、文本和文件,并积累个人记忆。云侧模型 BlueLM-Flash 和 Pro 搭载自研 Agentic 引擎,可跨设备、应用和场景执行任务。系统级蓝心 Har