模型内部的路由器:从冻结式大语言模型中提取原生技能路由能力
一项新研究表明,冻结式语言模型在自身的前向计算中已经包含选择合适技能的信号。Gavel方法只训练两个线性映射,无需将技能文本放入上下文。在Qwen3-32B测试中,Gavel相比渐进式披露和检索后重排序流程,在书面任务上的表现最多高出13.4个百分点;当技能在执行过程中才变得必要时,最多高出21.9个百分点。该方法在三个公开基准以及新建的SkillTraj基准上进行了评估,后者包含372条模拟智能
AI 新闻中心 过去24小时分析了 232 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项新研究表明,冻结式语言模型在自身的前向计算中已经包含选择合适技能的信号。Gavel方法只训练两个线性映射,无需将技能文本放入上下文。在Qwen3-32B测试中,Gavel相比渐进式披露和检索后重排序流程,在书面任务上的表现最多高出13.4个百分点;当技能在执行过程中才变得必要时,最多高出21.9个百分点。该方法在三个公开基准以及新建的SkillTraj基准上进行了评估,后者包含372条模拟智能
ScienceBuddy 是一个交互式科学研究工作空间,旨在帮助科学智能体持续改进。系统将研究人员的请求、反馈和执行证据转化为持续学习任务与评估标准。其核心的“递归中的递归”方法,将智能体运行框架的演进与模型强化学习结合起来:内层递归在固定模型的情况下改进运行框架,外层递归则利用改进后的框架训练模型。项目通过涵盖四类科学任务的案例,展示了研究者互动、框架优化和模型学习,并以研究产品形式发布。
DeepSeek v4.1 主 Attention 算子负责人刘胜与发表《我不得不把才华埋葬在昨天》一文,引发网络讨论。他表示,短短一年内,AI 已从帮助查阅文档、阅读代码和寻找漏洞的工具,发展为能够分析 CUDA、PTX 和 SASS 代码,并独立优化算子的系统。刘胜与预计,再过半年至一年,AI 编写的算子很可能达到甚至超过自己的水平。他认为自己或许不会失业,但可能需要转行,离开曾经热爱的工作。
小米公布了 18 Pro 系列的新款背屏功能。全新的“百变背屏”支持由 AI 生成的小型应用,包括煮蛋计时、喝水打卡、番茄钟、英语单词学习和食谱推荐等。小米 18 Pro 系列预计于本月发布,并将在性能、影像、续航和 AI 功能方面升级。小米表示,上一代背屏应用卡片的日均使用次数超过 400 万次。
据报道,OpenAI 正与投资者洽谈新一轮私人融资,目标估值最高达 1.2 万亿美元。该估值能否成立,取决于公司能否在可能推迟至 2027 年的 IPO 中达到相近水平。OpenAI 营收增长迅速,但推理计算、基础设施和人才成本持续上升,导致巨额运营亏损。不同估计显示,公司 2026 年年化营收可能达到 300 亿至 400 亿美元,但全年运营亏损仍可能达到数百亿美元。微软、英伟达、软银和亚马逊均
Salesforce首席执行官马克·贝尼奥夫否认人工智能正在引发所谓的“SaaSpocalypse”,即软件即服务市场崩溃。英伟达首席执行官黄仁勋也认同他的观点。不过,贝尼奥夫显然具有否认这一情景正在发生的商业利益。
前 TikTok 高管 Melody Chu 和 Jing Liu 联合推出 AI 摄影应用 Superpose,可为用户提供姿势、角度和构图建议。该应用结合计算机视觉与生成式 AI,但并不以大规模背景替换为主要功能。上线约两个月后,Superpose 下载量已超过 2.2 万次,用户生成的姿势接近 19 万个。据报道,其运营公司已完成 220 万美元种子轮融资。应用每天提供 5 次免费生成,付费
OpenAI 宣布,GPT-5.5 将于 10 月 14 日从 ChatGPT、ChatGPT Work 和 Codex 下线,所有订阅方案均受影响。OpenAI 建议仍在 Codex 中使用 GPT-5.5 的用户切换至 GPT-5.6 Sol 或 GPT-6 Astra。GPT-5.5 于今年 4 月发布,官方称其在完成相同任务时比 GPT-5.4 消耗更少 Token。
据报道,字节跳动2026年上半年营收同比增长30%,但净利率降至约16.7%,低于2023年的26%和2024年的21%。利润率下滑被认为与公司加大对大语言模型、视频模型、豆包聊天机器人、AI云服务及Seedance视频生成模型的投入有关。字节跳动未对相关数据置评。主要来自TikTok的海外收入占总营收比例已超过30%,再创历史新高。据报道,公司近期获得约300亿美元贷款,以支持不断增加的AI支出
Lightning Weave 是一种后训练框架,可将多个专业模型分别学到的能力组合到同一个学生模型中。该方法通过在策略分布上进行蒸馏,同时优化推理准确率和效率,并避免训练时并行运行多个实时锚点模型。在数学和编程基准测试中,Lightning Weave 均优于基础模型。以 Qwen3.5-4B 为例,HMMT 2025 的准确率从 59.2% 提升至 64.0%,响应 token 数减少 10.
在远程参加 All-In 峰会时,埃隆·马斯克提议,领先的人工智能公司应在模型发布前相互测试对方的模型。各公司可以交换自己的“测试工具”或测试框架,用于评估模型是否可能协助生物武器或核武器开发,或表现出潜在的欺骗行为。马斯克认为,这种交叉测试有助于推动行业自律,并加快形成 AI 安全共识。不过,他没有提出详细的实施方案,也未说明如何建立具有约束力的执行机制。
公司内部资料显示,一家中国黑客公司利用人工智能,将从外国政府窃取的文件处理成便于警方分析的内容。据称,俄罗斯和巴基斯坦都是其目标。
Salesforce表示,公司已为美国运输安全管理局(TSA)开发一款新的AI智能体,旨在改善旅客的出行体验。目前公开的技术细节有限,系统的部署范围和可量化成效尚未明确。
据彭博社报道,Meta首席执行官马克·扎克伯格表示,公司为专注于安全和防护措施,将Muse的发布推迟了数月。不过,他并未要求其他人工智能实验室在采取行动前也采取同样做法。
Meta首席执行官马克·扎克伯格表示,人工智能实验室应依靠独立评估人员和顾问来确保模型安全。他的立场是加强外部监督,而不是放慢人工智能的发展速度。