AI 新闻中心

AI 新闻中心 过去一年分析了 1729 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

逐步扩展:面向大规模混合专家模型的计算高效超参数迁移

一项新研究提出了一种两阶段方法,用于高效估计大规模混合专家(MoE)模型的最佳学习率。该方法首先将小型代理模型的结果迁移到不同模型宽度,随后利用缩放定律外推到超大规模的 Token 预算。在预测最高达 10 万亿 Token 的训练任务学习率时,线性回归取得了 0.95 的 R²。研究人员针对采用多头潜在注意力和 Muon 优化器的 MoE 架构,调整了最大更新参数化方法。该方法还被用于从零开始预

阿里巴巴达摩院推出可识别1厘米肝脏肿瘤的AI模型

阿里巴巴达摩院联合中国医科大学附属盛京医院等机构研发DAMO LiON模型,可通过CT影像识别微小肝脏恶性病灶。在为期两个月的前瞻性真实世界临床试验中,该模型分析了1万多名患者的影像,发现15例初次诊断时被遗漏的恶性肿瘤,其中大多数病灶直径约1厘米。医生使用AI辅助阅片后,判读时间减少27%,对恶性肿瘤的敏感性提高11.5%。该模型尤其有助于发现容易被忽视的肝转移,并推动部分患者调整治疗方案。研究

OmniAssistBench:面向 Omni-LLM 的助手式交互基准

OmniAssistBench 是一个用于评估多模态大语言模型作为实时视频助手能力的基准。与静态数据集不同,它测试模型能否在多轮交互中结合视觉状态、用户目标、先验知识和对话历史。研究人员通过逆向分析互联网上的现有视频,推导用户的逻辑目标,并构建沿预设交互路径进行的多轮视频片段。该数据集的建设耗费了超过 1,000 小时的专家工时。Gemini-3-Pro 得分为 66.4 分(满分 100 分),

上汽 MG 07 后续将通过 OTA 升级 Momenta R7 世界模型

上汽 MG 07 已于 2026 成都车展上市,后续计划通过 OTA 升级 Momenta R7 世界模型。Momenta 表示,超过 95% 的用户选择了其智能驾驶辅助方案。目前车辆搭载 Momenta 强化学习大模型,以及芯航途 XHEART X7 大模型专用芯片。升级后,MG 07 预计将支持车位到车位自动驾驶、行车漫游等功能。Momenta 宣称 R7 在多个关键场景的性能可提升数倍,但这

阿里云视频生成模型 Wan3.0 正式上线,支持单次生成 30 秒视频及文档输入

阿里云正式上线视频生成模型 Wan3.0。官方称,该模型单次可生成最长 30 秒的视频,并首次支持将 DOC、XLS、PPT、PDF、Markdown 等文档作为输入。经过十余天公测后,Wan3.0 在指令遵循、跨镜头一致性、音频质量和视频编辑等方面进一步改进。模型已接入阿里云百炼、万相、通义千问等多个平台。480P、720P 和 1080P 视频的 API 价格分别为每秒 0.3 元、0.6 元

AgentMercury 大规模生成可验证的企业场景环境

AgentMercury 是一个研究框架,可根据高层级商业场景自动生成可执行环境。它不为单一任务构建环境,而是创建包含实体、服务、工具、状态以及可验证跨服务不变量的持久化世界。研究团队覆盖 14 个行业和 50 个国家,生成了 4,783 个环境,并将其用于强化学习训练。训练后,Qwen3.5-4B 在企业工作流以及推理、编程、科学计算和工具使用等域外基准测试中均有所提升。此外,对 Qwen3.5

数学自动形式化取得重大进展:OpenBMB开源MathForm,8B模型超越更大模型

OpenBMB开源了MathForm,这是一套用于将自然语言数学表述自动形式化为Lean4的框架、数据集和模型。系统结合检索机制与编译器、语义一致性引导的验证流程,并根据Lean的诊断结果最多进行三轮修正。FormalVerse数据集包含超过36.7万个经过验证的Lean4示例。根据公开测试,使用FormalVerse训练的模型一致性检查率达到60.32%,高于FineLeanCorpus的46.

大语言模型智能体时代的图工程:从个体智能到系统智能

大语言模型智能体正从语言生成器发展为能够执行复杂长期任务的自主系统。文章指出,当任务需要异质专业知识、并行子任务、独立验证和持久状态时,单个智能体的能力或上下文扩展会面临架构限制。作者提出“系统智能”概念,强调将多个专业智能体组织并协调到共同目标之下。“图工程”通过显式、动态且不断演化的图结构表示任务、智能体和系统状态,从而支持复杂目标的组织、异质智能体的协作以及系统演进。文章系统总结了这一范式的

Anthropic 最强模型在 IPO 前遇冷,企业转向低价替代方案

美国企业正逐渐放弃 Anthropic 最强大的模型 Fable 5,转而选择更便宜的替代产品。支付集团 Ramp 的支出数据显示,Fable 5 发布两个月后,企业对其支出仅占 Anthropic 工具总支出的约 11%,此后采用率趋于停滞。分析师认为,主要原因是定价过高,而旧款模型已经能够满足大多数需求。中国及其他地区的低价开放权重模型也为客户提供了更多选择。OpenAI 则凭借价格更低的新模

CLEAR:在保持实用性的同时实现大语言模型安全对齐的连续潜在适配器路由

CLEAR是一种大语言模型安全对齐方法,通过隐藏状态中的轻量级门控机制,连续控制安全低秩适配器的激活强度。该方法旨在减少有害回答,同时避免对良性提示下的基础模型进行不必要的修改。在Llama-3-8B-Instruct测试中,CLEAR将HarmBench攻击成功率从32.3%降至0.5%,并保留了模型大部分实用性。在GSM8K准确率方面,其表现也比全局应用的SFT或LoRA高出最多7.1个百分点

端侧AI格局生变:vivo蓝心登顶手机模型评测榜单

SuperCLUE发布了最新的手机端侧大模型评测结果。vivo蓝心BlueLM 3.5 Nano 3B以89.86分排名第一,据该评测,其表现接近多个主流云端模型。Qwen3.5 9B和Qwen3.5 4B分别以87.82分和85.16分位列第二、第三。端侧模型能够在手机本地处理文本和图像,无需持续联网,因而有助于提升隐私保护和离线使用能力。不过,手机硬件限制了模型规模,也限制了其处理复杂任务的性

谷歌开源模型Gemma下载量突破10亿次,并被用于癌症研究

谷歌表示,其开源模型家族Gemma的累计下载量已超过10亿次,开发者还基于该系列创建了超过10万个定制变体。Gemma目前被用于太空图像分析、医疗报告结构化和生物医学研究。谷歌DeepMind、谷歌研究院与耶鲁大学合作开发的Cell2Sentence-Scale 27B,可将单细胞基因表达数据转换为语言模型能够分析的类文本序列。该模型对4000多种药物进行了虚拟筛选,提出将CK2激酶抑制剂silm

Anthropic旗舰模型失去动能,企业支出仅11%流向Fable5

据《金融时报》报道,美国企业正在减少对Anthropic高价旗舰模型Fable5的使用,转而选择更便宜的替代方案。追踪7万家公司支出的Ramp数据显示,Fable5发布两个月后,仅占Anthropic工具总支出的约11%,近期采用率也趋于平稳。规模更小、价格更低的Opus5,其企业支出已超过Fable5。分析师认为,主要原因是Fable5价格高昂,而多数企业使用旧模型已能满足需求。据报道,Anth

泰康发布照护与医疗专用大模型

泰康保险集团发布了自研的照护与医疗专用大模型1.0版。该模型首先应用于社区养老,可自动生成老年人健康画像、按需求进行分组,并制定个性化照护方案。公司表示,该系统旨在将传统的被动呼叫服务转变为主动风险预警。未来,泰康计划将其扩展至居家养老领域的全天候健康监测。目前尚未公布该模型性能、安全测试结果或实际部署规模的独立评估。

Llama-Mobile:高效的 2.7 位视觉语言模型量化

Llama-Mobile 是一个面向移动设备的视觉语言模型量化框架,旨在资源受限的硬件上实现高效推理。其量化流程利用模型自身生成训练数据,无需访问原始训练环境。新的每参数 2.7 位格式支持在 Arm CPU 上高效运行。研究人员在使用 8 位激活值的情况下,将 Llama 3.2 11B Vision Instruct 压缩至 3.7GB,并在多项标准视觉问答任务中保持了较强性能。