AI 新闻中心

AI 新闻中心 过去一年分析了 1373 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

这条引文真的支持该主张吗?

一项新研究评估了大型语言模型核验法律引文是否真正支持相关主张的能力。模型能够识别93%至100%的错误判例引用,但对法院判决中仅页码错误的引文,识别率只有37%至61%;在法律文书中则为52%至83%。即使采用高推理强度的GPT-5.4,在法院判决中仍会漏掉40%的页码不匹配,在法律文书中会漏掉18%。模型出错时,往往依据主题相似性作出判断,而不是核对被引用页面的具体内容。要求模型验证指定页面可以

Apple Silicon 上的 Nanbeige4.2-3B:修复部署漏洞并降低循环 Transformer 的内存开销

Nanbeige4.2-3B 是一个拥有 30 亿参数的智能体模型,通过在第二次前向传播中复用同一组层,在不增加参数的情况下提高有效深度。研究人员在 Apple Silicon 上发现了 5 个独立问题,导致发布的 checkpoint 无法直接通过 Hugging Face Transformers 运行,包括 RoPE 缓冲区被静默置零,以及调用已移除的缓存 API。分块预填充策略使 32 G

被放大不等于更具预测力:思考模型中的推理行为

一项研究考察了人工智能模型推理轨迹中哪些行为与正确答案相关,以及面向推理的训练是否会放大这些行为。研究人员分析了15个模型在6个文本和视觉语言基准测试中的15,282条标注轨迹,发现了“放大—提升差距”:思考模型显著增强了自我纠错、假设检验和承认不确定性,但这些行为并不是正确性的最佳指标。置信度校准、知识一致性和自我意识与正确答案的关联更强,却几乎没有被放大。研究结果表明,训练目标应奖励经过校准且

Apodex Discovery:用于评估和构建发现型人工智能的现实基准与环境

Apodex Discovery是一套用于开发和评估发现型人工智能的框架,目标是让AI系统执行长期、具备状态管理且可验证的调查。其“重型求解器”将基础模型、工具、控制策略和执行环境结合起来。项目调查了561个行业,汇集423个高价值现实问题,并在首个版本中选出20个。统一的任务—回合结构支持数据、工具、约束、反馈、轨迹记录,以及对中间产物和最终结果的验证。HDS6分别评估工具使用、修复、替代方案、

谁发言很重要:面向意大利议会会议记录的权威感知多视角 RAG

ParliamentRAG 是一个面向意大利众议院会议记录的检索增强生成(RAG)系统,旨在解决三个问题:过度突出发言最频繁的人、无法根据议题评估发言者的专业性,以及在政治敏感文本中错误归属引文来源。系统根据用户查询,结合职业、教育背景和历史发言等可解释因素,估算发言者与当前议题相关的权威性。它会检索相关发言片段,从不同议会党团中识别相关专家,并生成附带引文的摘要。在涵盖15个政策议题、与 Goo

DFM Mimir v1:仅使用获准的后训练数据,10亿参数开源 HRM 模型实现前沿级性能

Danish Foundation Models 发布了 Mimir v1。这是一款基于分层推理模型架构、从零开始训练的10亿参数语言模型。该模型在后训练阶段仅使用获准数据,在英语任务上表现出较强竞争力,并在丹麦语上创下新的最佳成绩。在涵盖英语、数学、代码和丹麦语的20项基准测试中,Mimir v1 超越了 HRM-Text 1B,并可与 Qwen 3.5 4B、Gemma 4 E2B 等更大模型

人形机器人运动会测试真实环境下的消防救援能力

第二届世界人形机器人运动会在北京举行模拟消防救援比赛,23支队伍参赛。机器人需要在30分钟内完成识别危险物质、关闭3个指定阀门和扑灭火源三项任务。当天参赛的12支队伍中,只有3支完成全部挑战。降雨、不断变化的光照和室外环境影响了视觉识别与机械操作。优理奇(UniX AI)的机器人虽然在规定时间内完成任务,但速度明显慢于人类消防员,机械手对准灭火器时也尝试了两次才成功。部分队伍在比赛期间仍使用VR设

迈向通用科学人工智能:科学图像的多模态理解

科学图表和表格包含重要的实验依据,但数字图书馆和多模态人工智能系统仍难以检索和解读这些内容。ALD/E-ImageMiner基准和ICDAR 2026原子层沉积与蚀刻科学图表信息提取竞赛,收录了来自205篇出版物的1,951幅图表,并由专家完成标注。任务涵盖分类、表格数据提取、摘要生成和视觉问答。相关论文探讨如何评估视觉与定量阅读、基于领域知识的推理,以及利用证据进行论证的能力,并提出将“从图像理

AI生成书籍涌入亚马逊,严重挤压人类作者的生存空间

一项针对亚马逊超过1.4万本自出版电子书的研究显示,AI生成内容正凭借数量优势改变出版市场。从2023年初到2026年第一季度,图书目录规模据称扩大了38.3倍,但季度总收入仅增长8.9倍,更多书籍因此争夺增长缓慢的收入池,形成市场稀释效应。含有大量AI内容的书籍占目录20%,但仅贡献12.1%的销量和11.3%的收入。未检测到AI文本的书籍仍占据72.5%的主流收入,但在八大类型中的七类,单本收

SimpleOPD:面向长上下文推理的简单、与分词器无关的在线策略蒸馏

该研究探讨如何通过在线策略蒸馏,将长上下文教师模型的数学证明推理能力迁移到短上下文学生模型。SimpleOPD在共享文本空间中进行蒸馏,仅对齐教师和学生分词器表示为相同文本范围的部分。学生模型参考KL损失以及对特殊终止词元的屏蔽,有助于减少输出过长、频繁截断、师生分布偏移和训练不稳定。在Qwen3、Intern-S2、GLM-4.7和Gemma-4等模型上的实验显示,数学推理能力均获得稳定提升。I

AI行业掀起“降本”潮,企业对大模型支出愈发敏感

AI服务商Writer推出企业旗舰模型Palmyra X6。该模型基于Z.ai开源模型GLM-5.2的后训练变体,并大幅升级了AI代理运行程序(harness)。Writer表示,Palmyra X6在基础任务中最多可为客户降低50%的成本。该公司近期发布的内部研究还称,优化运行程序的效率平均可降低40%的成本,比单纯更换大语言模型更可靠。Palmyra X6现已面向企业客户开放,可与现有工具集成

LittleLearner:在教育控制的知识暴露下研究语言模型

研究人员推出 LITTLECURRICULUM,这是一个包含 880 亿个 token、专门基于美国小学教材构建的预训练语料库。该语料库明确排除了五年级以上课程涉及的概念、事实和词汇。研究人员利用它从头训练出一个拥有 50 亿参数的语言模型 LITTLELEARNER。该模型具备足以进行开放式评估的语言能力,同时保留了清晰且可解释的知识与能力边界。模型和语料库以受控研究沙盒的形式发布,用于研究模型

UniProbe:面向大型视觉语言模型的可学习令牌级幻觉检测器

UniProbe是一种轻量级检测器,旨在以令牌为单位识别大型视觉语言模型生成的幻觉。它无需对整个模型进行高成本微调,而是通过一次前向传播分析模型的内部计算轨迹,包括图像块、查询令牌、生成令牌及其注意力关系。该方法结合图神经网络、Vision Transformer和GRU,整合关系、空间与序列信息。流式版本可在生成过程中检测并重新采样产生幻觉的令牌。作者称,在多种LVLM骨干模型上,UniProb

时间序列基础模型出现预测崩溃

一项研究发现,时间序列基础模型在预测1,000只美国股票的小时收益率时会出现“预测崩溃”:预测结果近乎扁平,股票排名表现也很差。相比之下,在相同条件下预测交易量时,该现象大幅减弱。研究人员认为,原因包括目标变量的可预测性较低,以及按单个序列优化的目标函数无法识别序列之间的结构。最小化平方误差会导致扁平预测,而直接优化横截面相关性虽能改善排名,却可能使预测幅度放大一个数量级以上。研究提出CalibR