AI 新闻中心

AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

宇树科技开源新一代人形机器人基础模型 UnifoLM-WLA-1.0

宇树科技宣布完全开源 UnifoLM-WLA-1.0,这是一款面向通用人形机器人的具身基础模型。公司称,该模型在多项评测中刷新开源模型的最佳成绩。实机测试显示,单一模型可统筹64项任务,覆盖桌面操作和全身移动,并支持跨任务、跨末端执行器泛化。该模型结合大规模多模态感知与理解数据,以及以交互为中心的世界模型,以提升空间感知和理解能力。上述评测和实机表现均来自宇树科技的官方介绍,尚待独立验证。

DeepSeek正式发布V4.1 Flash:原生多模态视觉理解,性能超越V4 Pro并下调API价格

据IT之家报道,DeepSeek正式发布V4.1 Flash,这是其全新模型架构系列中尺寸最小的模型。该模型为5520亿参数的混合专家模型,采用Causal-Encoder-Decoder结构,输入激活80亿参数,输出激活160亿参数。V4.1 Flash原生支持多模态视觉理解,官方称其在包括Agentic Benchmark在内的测试中超过DeepSeek V4 Pro等旗舰模型。新的KV Ca

财跃星辰与上海交通大学开源 Alpha-R1:8B 模型用于资产配置

财跃星辰与上海交通大学研究团队开源发布了金融推理模型 Alpha-R1,模型规模为 80 亿参数。该模型结合语义门控与包含 GRPO 强化学习的两阶段训练,将当前市场状态与候选资产配置策略背后的经济逻辑进行匹配。根据研究团队公布、使用 2025 年市场数据开展的样本外模拟,Alpha-R1 在多个股票池中超过了通用大模型以及多种统计和机器学习方法。消融实验显示,强化学习对结果有较大贡献。不过,相关

SAEScientist-Bench:AI 代理能否自主开展 SAE 可解释性研究?

论文提出 SAEScientist-Bench,用于评估 AI 代理能否借助稀疏自编码器(SAE)自主开展机制可解释性研究。给定一个目标概念,代理需要设计对比探针,并在 Gemma-2-9B-IT 超过 13.1 万个特征的字典中寻找最相关的特征。在 20 个任务和 10 种代理配置中,前沿代理展现出真实的发现能力,但仍明显落后于专家基准。它们在区分目标概念与对比控制数据方面接近专家水平,但在对文

重新审视后训练中的完整推理轨迹

NAVER AI的一项研究考察了大型语言模型在后训练阶段是否需要完整的推理轨迹。实验表明,完整轨迹带来的收益有限,而即使经过大幅截断的部分轨迹仍然有效。注意力分析和受控的词元删除实验显示,许多中间词元对最终推理质量的贡献很小。使用轨迹的起点和终点进行训练,可能促使模型依靠内部知识推断缺失步骤。该方法对基于强化学习和策略内蒸馏的后训练方法同样有帮助。研究团队已在GitHub上公开代码。

通过生成式先验蒸馏实现无配对监督的三维编辑

研究人员提出了 PriorEdit3D,一种无需配对三维训练数据的指令引导三维编辑方法。该框架将图像编辑、视觉语言和图像到三维基础模型中的视觉、语义及几何知识蒸馏到三维编辑模型中。研究还引入三维感知的分布匹配正则化,以减少几何崩溃和不同视角之间的不一致。论文报告的实验结果显示,与现有基线方法相比,该方法在指令遵循能力和多视角一致性方面表现更好。项目代码已在 GitHub 上发布。

中国首个千亿参数级气象模型“风和”获准投入业务使用

中国气象局宣布,生成式人工智能气象服务系统“风和”V1.0通过专家评审,获准投入业务使用。该模型可理解气象服务需求、生成气象内容,支持气象推理与决策,并调用气象工具。官方评估称,风和在多项气象服务任务上的表现优于通用模型。模型使用5000万tokens的高质量气象服务语料进行训练,并整合权威气象数据。风和将为中国气象服务业务提供基础支撑,支持个性化天气查询、服务建议和气象风险预警;其国际版提供中英

OpenWAM:面向世界-动作模型系统化预训练的开放式模块化探索

OpenWAM 是一个用于系统研究机器人世界-动作模型的开放研究框架。其基础设施将生成式骨干、视觉表征、信息流、推理流程和训练数据拆分为可组合模块,从而能够通过受控实验比较不同设计。研究表明,具备足够能力的生成式骨干、紧凑且信息丰富的潜在空间、专门的动作建模能力,以及同步的联合去噪,有助于把世界知识转化为可执行控制。OpenWAM-α 使用约 6,400 小时的人类和机器人第一视角数据进行预训练,

谷歌联合绘制果蝇全脑图谱,开发者尝试用其模拟运行《毁灭战士》

谷歌研究院与霍华德·休斯医学研究所合作,利用人工智能重建了包含超16.6万个神经元的成年雄性果蝇完整中枢神经系统图谱(MaleCNS v1.0)。图谱发布后,开发者Alex Wormuth尝试利用该神经连接组模拟训练《毁灭战士》,通过将游戏画面转化为感觉神经刺激,并在角色受伤时给予多巴胺负反馈,观察其避险能力。另一个开发者也进行了控制《超级马力欧64》的类似尝试。

面壁智能开源 MiniCPM5-2B:在 40 亿参数以下开源模型中排名靠前

面壁智能与 OpenBMB 社区开源了 20 亿参数的 MiniCPM5-2B,这是一款面向端侧设备的语言基础模型,支持工具调用、深度搜索和代码生成等任务。开发方称,该模型已初步具备端侧通用智能体能力。根据引用的 Artificial Analysis Intelligence Index 评测,MiniCPM5-2B 在参数量低于 40 亿的开源基础模型中综合排名第一。在涵盖代码与数学推理、指令

RoboSPA:VLA 模型能否超越简单场景和短期任务?

RoboSPA 是一个用于评估机器人操作中视觉-语言-动作(VLA)模型空间推理和程序推理能力的大规模数据集与基准。它涵盖 10 个任务类别、56 个基础任务,以及分布在五个难度等级中的 280 个变体,空间歧义和程序复杂度逐步提升。数据包含来自多种机器人形态和不同场景的 52.7 万条轨迹。除任务成功率外,RoboSPA 还引入了更细致的诊断指标。实验表明,当前 VLA 模型在复杂空间关系、精确

AuK:用于语音生成与编辑的开源基础模型

一份技术报告介绍了 AuK,这是一款通过自然语言指令和音频上下文统一语音生成与音频编辑的开源基础模型。该模型使用约 30.3 亿条指令—音频实例进行训练,相当于 195 万小时的有效监督数据,覆盖语音生成、内容编辑、增强与分离、副语言编辑和声学编辑五类任务。AuK 将多模态大语言模型、在语音、通用音频和音乐上联合训练的 VAE,以及混合式 Rectified Flow Transformer 结合

全能交互智能体技术报告

该报告介绍了 Gander,这是一个将视频、语音和文本流式输入统一起来的端到端模型,旨在实现连续的多模态交互。其 Cerebellum-Brain 架构由 Cerebellum 负责实时对话与响应,Brain 负责复杂推理、工具调用和智能体任务。Streaming Thinker-Talker 设计支持低延迟、全双工交互,包括用户随时打断、模型主动提供中间反馈以及提出后续问题。内部人工评估显示,G

面向大规模长上下文强化学习后训练的在线协同训练投机解码

研究人员提出了一套端到端系统,通过在线协同训练草稿模型,加速强化学习后训练中成本占比很高的 rollout 生成。该系统将分支注意力融入上下文并行执行,并在不改变流水线调度的情况下,在不同流水线阶段之间传输目标模型的中间特征。在最大规模达1220亿参数的模型上进行的实验显示,rollout 和端到端处理速度均得到显著提升;其上下文并行设计还可扩展至25.6万 token,并比现有方法节省内存。代码