AI 新闻中心

AI 新闻中心 过去一年分析了 1727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

循环语言模型提升组合式工具调用能力

一项研究考察了循环语言模型在复杂工具使用场景中的表现。这类任务要求模型协调多次 API 调用、维护中间状态,并保留工具交互之间的依赖关系。在 API-Bank、BFCL 和 NESTful 测试中,循环计算通常能提升多步骤及依赖感知工具调用的准确率,但对单独 API 调用的提升较小且依赖具体模型。自适应推理只在必要时增加计算量,因此在计算成本与性能之间取得了更好的平衡。

SPADE:在自适应合成可执行环境中进行自博弈

SPADE是一种强化学习框架,让同一个大语言模型同时承担两种角色:设计可执行的训练环境,并作为推理智能体在其中学习行动。每个环境都包含状态转移、奖励函数和验证代码,能够覆盖推理任务以及多步骤工具使用。在最高300亿参数的模型上,SPADE在数学、科学、代码和推理等八项留出测试中,平均比采用固定环境的强基线高5.3分。在工具使用任务上,BFCL-v4提升5.7分,ACEBench-Agent提升13

特斯拉在中国车载系统中接入豆包AI语音模型

特斯拉已在中国分批推送2026.14.13版本更新,覆盖Model 3、Model Y、Model S和Model X。更新接入字节跳动旗下豆包AI语音助手,车主可通过方向盘语音按钮、“Hey, Tesla”唤醒词或滚轮启动。该助手支持导航设置、媒体控制、空调调节和车辆手册查询等功能。据报道,豆包采用端到端语音交互架构,闲聊和信息查询则由DeepSeek提供支持。涉及关键车辆控制的指令仍通过特斯拉

字节跳动重组 Seed 基模团队,或为 5 万亿参数模型铺路

据 LatePost 报道,字节跳动大模型部门 Seed 已完成新一轮组织调整。Seed Foundation Model 新设四个一级部门:负责多模态及大规模预训练数据的 Pretrain Data、负责强化学习和后训练的 Horizon RL、面向企业应用及 Agentic 模型的 Product Posttrain-Work,以及面向消费者对话产品的 Product Posttrain-Ch

PTXBench评估并适配使用架构专用PTX进行GPU内核优化的LLM

PTXBench是一套用于评估和适配大型语言模型的基准测试,旨在利用架构专用PTX优化GPU内核。它在H100和B200 GPU上测量功能正确性、选定目标指令是否在运行时实际执行,以及相对于领先库的加速效果。评估显示,模型能力仍不均衡:在复杂的注意力反向传播工作负载上,成功率明显下降;而执行目标指令也不一定能带来有竞争力的性能。没有任何受测模型能在整套测试中持续达到领先库的水平。对Qwen3.6-

李飞飞:科技行业应更清楚地向公众说明 AI 的价值

AI 研究员李飞飞表示,包括她自己在内的科技从业者,需要更清楚地向公众解释人工智能能够带来的实际价值。她警告,美国社会不断升温的反 AI 情绪可能给全球带来风险。近一年来,美国多地对 AI 数据中心的抵制增加,争议主要集中在水资源和能源消耗上。皮尤研究中心调查显示,随着 AI 越来越多地进入日常生活,一半美国人对此的担忧超过了期待。李飞飞认为,许多亚洲国家更积极的态度,部分源于从基础教育阶段就重视