AI 新闻中心

AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

10万张国产算力卡支撑“牛来”:智谱开源GLM-5.3-Flash

智谱宣布上线并以MIT协议开源多模态模型GLM-5.3-Flash(320B-A18B)。该模型总参数320B、激活参数18B,支持100万Token上下文,并采用稀疏注意力与线性注意力混合架构及mHC技术。据Artificial Analysis评测,模型得分57分,与Claude Opus 4.8持平,高于文中提到的GLM-5.2和DeepSeek V4 Pro。智谱称其调用价格仅为部分竞品旗

RetrievalRouter:面向文档检索的模态与架构联合选择

RetrievalRouter 是一个轻量级、面向查询的文档检索路由器。它仅根据查询文本,在文本与多模态流程,以及密集检索与晚交互架构之间选择最适合的检索方案。在金融和科学文档基准测试中,没有任何固定流程能在所有查询上保持最佳表现。与最优固定基线相比,RetrievalRouter 的准确率提高 2.5%,速度提升 12.4 倍。通过一个可调参数,用户可以控制完整的准确率与延迟权衡范围。研究团队已

亚马逊据称将英伟达芯片订单增至三倍,GPU成为全球战略资源

亚马逊与英伟达将扩大双方的战略合作。亚马逊此前已宣布部署超过100万枚英伟达GPU,据称还计划为AWS数据中心追加200万枚芯片,涵盖未来的Blackwell Ultra、Rubin和Rubin Ultra架构,预计于2027年至2028年部署。双方尚未公布具体财务条款。合作范围还将延伸至CPU、网络硬件、软件、开源模型和机器人平台。AWS计划把英伟达Nemotron模型整合进Bedrock和Sa

商汤AI办公助手“商汤小浣熊”桌面端上线 openKylin

openKylin 社区已完成商汤科技 AI 办公助手“商汤小浣熊”桌面端新版本的适配,该应用现已正式登陆这一开源操作系统。商汤小浣熊面向软件研发、数据分析、任务规划和应用开发等场景提供 AI 辅助。商汤称其产品已服务超过 2,000 万用户,并在 8,000 多家企业落地,但这些数据来自公司自身披露。新版本还升级了会员体系并推出新的积分机制。openKylin 用户可通过系统软件商店搜索、安装或

MA-VLA:面向多机械臂协作的视觉语言动作模型

MA-VLA是一种用于多机械臂协同操作的视觉语言动作模型。它将协作行为分解为原子动作,分配给不同机械臂,并支持在新任务中重新组合这些动作。其“Arm Shuffle”训练方法会置换各机械臂的观测、状态和分配动作,从而减少对固定角色的依赖。在包含训练阶段未出现的协作模式的基准测试中,现有先进VLA模型大多失败,而MA-VLA在仿真和真实环境评估中均表现稳定。研究团队已公开代码、模型和数据。

智谱发布GLM-5.3-Flash,大模型价格战进一步升级

据报道,智谱AI发布了GLM-5.3-Flash,称其为GLM-5系列首个原生多模态模型。公司表示,该模型在Artificial Analysis Intelligence评测中获得57分,Token价格显著低于多家顶尖竞品。其原生视觉能力可在编程、游戏开发和3D场景搭建过程中观察生成结果,并进行迭代修正。报道还称,该模型基于国产芯片运行,结合SGLang等推理优化技术,并曾在Blender中自主

VBVR-Pro:面向原生视觉推理的可扩展、可验证套件

VBVR-Pro 是一个闭环测试平台,旨在通过图像和视频生成训练、验证并优化原生视觉推理。该套件包含 300 个程序生成任务、基于任务规则的确定性奖励评分器,并支持大规模多任务强化学习。使用该套件训练的模型在 7 个外部视觉推理基准上表现出迁移能力。研究还比较了 30 多种图像、视频和交错式生成器。视频生成在需要持续跟踪时空状态的任务中表现最佳,而交错式生成提供了计算效率更高的替代方案。研究团队已

价格降至四十分之一:智谱开源原生多模态模型 GLM-5.3-Flash

智谱推出并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首款原生多模态模型。智谱称,该模型在 Artificial Analysis Intelligence Index 中获得 57 分,与 Claude Opus 4.8 持平,综合性能超过参数量更大的 GLM-5.2。其标准价格为 GLM-5.3 的十分之一,限时优惠最低可达 Opus 4.8 价格的四十分之一

MemUse:将对话式 AI 的记忆评估从直接问答转向自然整合

一项研究表明,传统的对话式大语言模型记忆测试未必能反映用户满意度。在一项为期4个月的部署中,40名用户进行了1,872次会话,涵盖7种记忆条件。针对过往对话事实的直接提问,准确率在19.7%至70.1%之间波动,但用户满意度没有变化。研究人员认为,直接问答测试的是系统在被明确询问时能否检索事实,而真实对话还要求系统识别信息的相关性,并将过往上下文自然融入回答。为此,他们推出MemUse,根据真实用

MARS:面向竞赛编程的多专家大语言模型接力系统

MARS是一种面向竞赛编程的提示词驱动多智能体框架,由动态规划、图算法、字符串、几何等领域的专业智能体协作完成任务。系统通过检索增强生成,为每道题目选择合适的专家团队。起始智能体先编写C++17解法,后续智能体在沙盒中运行测试样例,并决定保留、修复或将代码交给下一位专家。在使用Gemma 4的CodeContests测试集上,MARS取得0.624 ± 0.006的通过率,比直接提示高14.4个百

开放世界多智能体环境中的自主数学发现

一项研究考察了不同模型系列的 AI 智能体如何在没有中央协调者或预设流程的开放环境“Station”中开展数学研究。在 12 个构造问题和另外两个案例研究中,该系统在五个问题上取得了相较既有文献的新成果,包括有限域 Kakeya 集合的新无限族、11 维空间中精确的 604 点接吻配置、离散 Kakeya 针问题和符号不确定性问题的新纪录,以及对 Erdős 最小重叠问题下界的显著改进。智能体不仅

第二届世界人形机器人运动会闭幕:智元首参斩获18金,超2500小时真实数据免费开放

第二届世界人形机器人运动会在北京结束,来自16个国家的666支队伍、2056台机器人参加了51个项目的比赛。多项成绩较上届大幅提升。上海具身智能企业智元机器人首次参赛,使用量产机型获得18金、16银、12铜,位列金牌榜和总奖牌榜第一。闭幕式上,组委会还发布了一个包含超过2500小时具身操作数据的数据集,覆盖工业、商超、餐饮、办公、家庭和消防救援等12个应用场景。数据集包含44项作业、100多项技能

Ox Alpha现身:智谱开源原生多模态模型GLM-5.3-Flash,限时价格为GLM-5.3的二十分之一

智谱发布并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型。该混合专家模型总参数量为3200亿,实际激活参数为180亿。正式发布前,模型曾以匿名名称Ox Alpha在OpenCode和OpenRouter上进行测试。智谱称,该模型在Artificial Analysis Intelligence Index中获得57分,与Claude Opus 4.8持平