AI 新闻中心

AI 新闻中心 过去一年分析了 1377 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

用低资源语言思考:SFT构建了什么、RL修复了什么,以及准确率看不到什么

一项研究对阿里巴巴、OpenAI和英伟达的三款混合专家模型进行微调,使其能够用希腊语推理;每个模型有36亿至40亿个活跃参数。准确率基准几乎没有变化,而且在这一规模下噪声很大:仅改变随机种子,得分就会波动7.7分。真正的变化体现在行为层面。基础模型在1000条推理轨迹中没有一条使用希腊语思考,即使问题本身是希腊语。经过监督微调(SFT)后,模型在约98%的题目中使用问题所用语言进行推理,语法性得到

AI 的下一次重大飞跃将进入现实世界

工程师和投资者正越来越多地投入世界模型,也称为大型行动模型。这类系统旨在让机器人理解周围环境并规划行动,希望像 ChatGPT 改变写作和编程一样推动机器人技术发展。文章介绍了这一新兴的研究和投资趋势,但没有提供已经实现重大技术突破的证据。

迈向量化 ASR 模型的基准优化

一项研究提出了一种方法,用于衡量自动语音识别模型是否针对公开基准进行了优化,却没有相应提升通用转录能力。研究关注音频本身无法唯一确定参考文本,或音频与基准参考文本相矛盾的情况。通过参考文本不一致、遮蔽数字恢复和正字法切换三类行为探测,研究发现,表现最好的开源模型即使面对矛盾、被遮蔽或含糊的音频,也会逐字输出基准参考文本片段。机制分析表明,模型会依赖狭窄的声学线索,选择有利于基准成绩的策略,而不是忠

EXIMO:视觉语言模型引导的VLA策略探索

EXIMO是一种用于高效微调视觉—语言—动作模型(VLA)的方法,面向机器人操作任务。该方法分为三个阶段:视觉语言模型负责规划并拆解复杂的长期任务;系统利用这些规划结果收集组织化数据,并通过模仿学习微调VLA策略;最后使用残差离策略强化学习进一步优化。EXIMO旨在减少对昂贵远程操作数据的依赖,并缓解强化学习在长期任务中的样本效率问题。作者在实验中报告称,该方法在样本效率和最终性能方面均显著优于现

生成式人工智能真的会复制艺术家作品吗?研究人员称仍有争议

麻省理工学院研究人员探讨了“归因衰减”这一概念,以及它对希望保护作品的艺术家可能产生的影响。生成式人工智能长期被指控直接复制艺术作品,相关版权诉讼正在多地法院审理。MIT的一项新研究提出了不同且更细致的观点,可能使法院评估此类案件时面临更复杂的法律问题。

Liquid AI与Hugging Face发布DSpark草稿模型,推理速度最高提升3.18倍

Liquid AI与Hugging Face发布了LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B的DSpark草稿模型检查点。该方法基于投机解码,在贪心解码下不改变输出质量,据称可使GPU整体吞吐量最高提升3.18倍,端侧设备最高提升2.87倍。在端侧智能体场景中,LFM2.5-2.6B的函数调用延迟平均降低57%。使用M4 Max MacBook P

SWE-bench Science:编程代理能否解决科学领域的工程任务?

SWE-bench Science 是一个面向代码仓库的基准测试,用于评估编程代理处理科学软件任务的能力。该基准涵盖来自 98 个 GitHub 仓库、20 个科学领域的 119 项任务,分为问题驱动、专家探索和工程集成三类场景。表现最佳的代理 Claude Code 搭配 Opus-5 (max),pass@1 仍低于 50%。研究发现四种常见失败机制:科学知识或抽象能力不足、探索方向错误或仅进

FlashPrefill V2:面向长上下文大模型服务的块稀疏预填充注意力

FlashPrefill V2 改进了面向长上下文大语言模型预填充阶段的块稀疏注意力方法。新增的均值校正项可在极高稀疏度下抑制近似误差,同时通过 PackGQA 内存访问、warp 专门化、流水线处理和 FP8 推理支持提升实际执行效率。该系统还支持分页 KV 缓存和连续批处理,可作为注意力后端集成到 SGLang 等推理框架中。在 NVIDIA H20 GPU 上进行 128K 上下文测试时,作

Inject、Align、Recover:通过分阶段后训练在无检索条件下内化文档知识

该研究探讨大型语言模型如何内化固定文档集合中的知识,并在推理时不检索原始文档的情况下回答问题。研究提出了三阶段后训练框架IAR(Inject、Align and Recover)。Inject阶段将文档转换为结构化的续写、改写和指令条件重构目标;Align阶段使用仅监督答案的问答数据调整模型;Recover阶段则将领域适配模型与基础指令模型合并,以恢复通用能力。在Common Corpus和CCI

Repo0:设计驱动的从零到完整代码生成

Repo0 是一个根据自然语言需求生成完整软件项目的框架。它通过由需求层 DAG、组件层 DAG 及二者对齐关系组成的 Dual-DAG,显式维护项目架构,并利用模块化指标迭代调整代码仓库结构,直到架构收敛。随后,收敛后的架构会指导测试驱动的代码生成。在 6 个真实代码仓库上使用 GPT-5 mini 和 DeepSeek V3.2 进行评估时,作者报告称 Repo0 在所有测试设置中都取得了最高

4DAnyone:从普通单目视频中将任意人物重建为4D

4DAnyone是一种从未经标定的单目视频中重建4D人物的框架。系统首先生成适合重建且具有多视角一致性的视色视频,然后将其提升为4D Gaussian Splatting表示。该方法通过两项技术解决注意力上下文受限的问题:Reference Context Packing将不断增长的参考视角压缩为固定长度的上下文,Target Context Routing则在去噪过程中促进不同目标视角组之间的信

MemTrapBench评估大语言模型使用记忆时的认知陷阱

MemTrapBench是一项用于评估大语言模型如何受到已存储信息影响的新基准测试。现有记忆评测主要关注信息能否被正确提取、存储和检索,而MemTrapBench进一步考察相关记忆是否会在当前任务中扭曲模型的推理或信念。该基准涵盖两类认知陷阱:推理固着和信念扭曲。研究人员在两个模型系列和五种记忆框架上进行实验,发现所有受测记忆策略的表现都不如不使用记忆的设置,最强方法的性能也下降了超过10%。研究

EnvHarness:让静态环境适应智能体学习

大语言模型智能体通过与环境交互来学习,但现有环境通常由人工构建且保持静态。EnvHarness 提出一个可编程的插件组件层,在不修改底层逻辑或验证器的情况下,改变现有环境的行为。其配套系统 EnvRigger 将目标策略视为黑盒,分析执行轨迹以诊断弱点,生成针对性的组件,并通过新的运行过程进行验证。在覆盖四个领域的五项基准测试中,研究人员报告称,EnvHarness 的表现优于原始环境和面向特定领

WithEveryone:面向群体图像生成的统一规划与身份定位

WithEveryone 是一个用于生成包含最多 10 个指定人物身份的群体图像框架。该方法为每个身份注入带地址的标记,预测结构化的身份与布局规划,并将其作为视觉条件。其布局定位身份损失直接利用标注的人脸区域进行监督,避免依赖不稳定的基于嵌入的人脸匹配。在身份与训练数据不重叠的基准测试中,WithEveryone 的目标场景人脸相似度达到 0.499,高于 GPT-Image-2 的 0.462。

超千亿参数藏语大模型“阳光清言”正式发布

在拉萨举行的2026全球数字经济大会论坛上,通用藏语大模型“阳光清言”正式发布。该模型基于大型基础模型打造,使用海量多源藏语数据进行训练,旨在理解和生成藏语内容及西藏相关知识。项目已完成近两个月的内部测试和两个多月的公开测试,并通过中国网信部门备案。项目发起人、中国工程院院士尼玛扎西表示,由于训练所需算力和高质量数据仍较为不足,模型当前整体表现尚未达到设计目标。新成立的拉萨市纳金数智研究院将开展人