AI 新闻中心

AI 新闻中心 过去一年分析了 8035 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Agent-G^2:面向智能体强化学习的高斯引导

Agent-G^2是一种用于解决长时程智能体任务中稀疏奖励问题的强化学习方法。它不再采用固定的引导深度,而是从高斯分布中按任务采样需要保留的专家轨迹前缀长度。分布的中心和离散程度根据策略优化过程中已经收集的轨迹在线估计,因此无需额外的探测轨迹或单独的深度预测器。在使用Qwen2.5-1.5B和7B-Instruct进行的ALFWorld及WebShop评估中,该方法在ALFWorld上最高提升7.

FrontierChallenge:评估科学工作流的完成能力

FrontierChallenge是一项面向科学工作流AI代理的跨领域基准测试。研究团队从计划中的300项任务中发布并评估了97项,覆盖量子化学、分子动力学、材料表征、分析化学、生命科学以及电化学与环境科学。研究使用三种代理框架测试了12个前沿模型。表现最佳的配置也只完整完成了97项任务中的20项,整体通过率为20.6%。较高的部分得分并不能可靠地转化为完整交付:在分析化学和电化学/环境领域,平均

Code World Model:让编程智能体成为世界模型的大脑

Code World Model 将世界演化与视觉呈现分离。编程智能体充当世界的“大脑”,负责推理事件及其后果,生成可执行代码以维护持久的世界状态,并按照规则推动世界演化。系统通过一种代理表示,将可执行状态转换为空间和时间约束,再提供给视频模型生成细致的视觉内容。经过游戏数据微调后,MiniMax-H3 能够在由编程智能体构建的简单互动世界中遵循这些约束。该方法为构建具备持久后果和更开放演化能力的

VBVR-Pro:面向原生视觉推理的可扩展、可验证套件

VBVR-Pro 是一个闭环测试平台,旨在通过图像和视频生成训练、验证并优化原生视觉推理。该套件包含 300 个程序生成任务、基于任务规则的确定性奖励评分器,并支持大规模多任务强化学习。使用该套件训练的模型在 7 个外部视觉推理基准上表现出迁移能力。研究还比较了 30 多种图像、视频和交错式生成器。视频生成在需要持续跟踪时空状态的任务中表现最佳,而交错式生成提供了计算效率更高的替代方案。研究团队已

小鹏图灵AI第三颗芯片正式点亮,超级智能体上车

小鹏汽车宣布,第三颗自研图灵AI芯片已正式点亮,并将新版本车载AI系统应用于量产车型。第二代VLA将与VLM融合,具备跨域调度、原生多模态和端侧大模型能力。小鹏介绍,该系统支持通过语音实现靠边停车、就近泊车、模糊导航和复杂行程规划,并可由一个统一系统管理整车。2024年公布的40核心图灵芯片据称可运行30B参数的AI大模型。公司还表示,自2025年第三季度量产搭载以来,图灵芯片累计出货量已超过20

国家统计局:1—7月以算力芯片、存储芯片为代表的集成电路行业利润同比增长18.5倍

国家统计局数据显示,今年1—7月,集成电路行业利润同比增长18.5倍,以算力芯片、存储芯片为代表的产品成为主要增长动力。电子行业利润同比增长1.1倍,拉动规模以上工业企业利润增长9.3个百分点。统计局表示,随着人工智能加快拓展、算力需求持续扩大,相关产品需求和价格上涨,带动了电子行业利润增长。同期,全国规模以上工业企业利润总额同比增长17.6%。

价格降至四十分之一:智谱开源原生多模态模型 GLM-5.3-Flash

智谱推出并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首款原生多模态模型。智谱称,该模型在 Artificial Analysis Intelligence Index 中获得 57 分,与 Claude Opus 4.8 持平,综合性能超过参数量更大的 GLM-5.2。其标准价格为 GLM-5.3 的十分之一,限时优惠最低可达 Opus 4.8 价格的四十分之一

豆包输入法新增跨设备传输,可互传复制的文字和图片

豆包输入法近日更新至安卓 1.4.2 和 iOS 1.5.2 版本。新版新增“超级互传”,用户登录同一账号后,可在不同设备之间传输复制的文字和图片。同时加入“智能文字整理”功能,可对输入内容进行排版、精炼、润色和纠错。更新还包括更换全新品牌 Logo,以及修复在 Obsidian 中使用语音输入时偶尔出现的内容丢失问题。豆包输入法采用与豆包相同的语音大模型,支持多种方言、英语和中英混合输入,并可在

谷歌升级 Gemini Live 语音功能,AI 应用转向“一句话完成任务”

谷歌近日更新 Gemini Live 语音功能,用户可通过自然语言指令调用 Chat、Spark 和每日简报等能力。谷歌希望 Gemini 能自动理解用户需求并选择合适的功能,减少用户判断和操作步骤。不过,这些服务仍以不同图标和入口呈现,增加了用户的理解与选择成本。每日简报依托 Gmail 和 Google 日历数据提供个性化更新,但信息筛选仍不够精准,可能推送与当前需求无关的提醒。Spark具备

经济学家称宇树科技机器人研发投入低于牧原养猪业务

经济学家付鹏质疑中国人形机器人企业宇树科技上市后的估值。根据公司公开招股书,宇树科技2023年、2024年和2025年的研发费用分别为4995.18万元、7001.70万元和1.45亿元,三年合计约2.65亿元。这一绝对金额低于牧原股份养猪业务的年度研发投入。不过,也有观点认为,跨行业直接比较研发费用并不公平,因为牧原的营收规模是宇树科技的数十倍。相比绝对金额,研发费用占营收的比例可能更具参考价值

MemUse:将对话式 AI 的记忆评估从直接问答转向自然整合

一项研究表明,传统的对话式大语言模型记忆测试未必能反映用户满意度。在一项为期4个月的部署中,40名用户进行了1,872次会话,涵盖7种记忆条件。针对过往对话事实的直接提问,准确率在19.7%至70.1%之间波动,但用户满意度没有变化。研究人员认为,直接问答测试的是系统在被明确询问时能否检索事实,而真实对话还要求系统识别信息的相关性,并将过往上下文自然融入回答。为此,他们推出MemUse,根据真实用

英伟达:AI算力供应短缺或将持续至2028财年末

英伟达在财报电话会上表示,AI算力供应短缺至少可能持续至2028财年末。晶圆产能、HBM内存和数据中心电力供应均处于紧张状态,公司目前看不到行业产能过剩风险。据报道,超大规模云服务商在手订单超过2万亿美元,并继续扩大AI基础设施采购。云市场以外的需求,包括主权AI、区域云服务商、企业AI和创新项目,同比增长超过100%,目前约占英伟达业务的一半。英伟达CEO黄仁勋首次给出2028财年全年营收增长7

英伟达据称洽谈以超130亿美元收购 Hugging Face

据 Business Insider 报道,英伟达近几周一直在与 Hugging Face 就收购事宜进行严肃讨论。若交易达成,Hugging Face 的估值将超过130亿美元,可能成为英伟达迄今规模最大的交易之一,但双方尚未达成协议,谈判仍可能破裂。微软也曾与 Hugging Face 会面,但据知情人士透露,双方尚未进入实质谈判。去年年底,Hugging Face 拒绝了英伟达以5亿美元投资