AI 新闻中心

AI 新闻中心 过去30天分析了 4630 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

MetroLLM-Bench 评估语言模型作为交通服务终端运行时

MetroLLM-Bench 是一个包含955个案例的基准测试,用于评估语言模型作为交通服务终端的决策层,覆盖六个真实地铁系统。测试内容包括路线规划、票价计算、运营中断、无障碍服务和对抗性输入等。经过参数高效微调的40亿参数 Qwen 3.5 模型在确定性的 Tier 1 评估中获得91.3分,超过受测的 GPT-5.6 系统,并追平更大型的 GPT-5.4 配置;其 Q4_K_M 模型占用空间为

超越求解器判定:用于自动形式化的生成式奖励模型

神经符号系统依赖数学求解器来验证推理,但求解器无法判断形式翻译是否与指定的参考形式化保持严格等价。该研究将一种失效模式定义为“保留判定的不忠实性”(VPU):错误编码仍能成功执行,并产生预期判定。理论分析表明,仅依赖结构和判定结果的验证方法,检测这类案例的能力最多接近随机水平。研究人员提出 Generative Verification(GenV),将离线的 Z3 等价性预言器蒸馏为连续且无需参考

用于视觉文档检索的生成式晚交互嵌入

一项研究分析了晚交互方法用于视觉文档搜索时的存储成本。现有压缩方法通常保留每页约1,000个向量中的一部分,或使用局部平均值,但在严格的存储限制下性能会明显下降;其他方案则需要重新训练编码器。研究人员对三种编码器进行分析后发现,这些向量位于单位球面上,并集中在内在维度仅为5到6的流形附近。将k-means质心归一化到球面表面,可以修正MaxSim分数被系统性低估的问题;与未处理的质心相比,nDCG

DRG-MAPPO:面向协同空战的分层动态角色图多智能体强化学习

该研究提出 DRG-MAPPO,一种用于协同空战决策的多智能体强化学习框架。该方法通过图结构和图注意力机制,建模友军、敌军与威胁之间随时间变化的关系。分层策略动态分配“领导者”和“支援者”等战术角色,低层策略则根据角色信息和关系特征选择离散机动动作。此外,研究设计了目标优先级辅助任务,以促进集中火力等协同行为。在实验中,作者报告了 87% 的胜率。不过,这些结果仅限于所测试的仿真环境,尚不能证明该

UniH³:统一层次化同质性与异质性的全能医学图像复原方法

UniH³是一种使用单一模型处理多种医学影像模态和退化类型的复原框架。该方法通过层次化同质性记忆模块和同质性引导注意力机制,利用不同模态之间共享的解剖结构。同时,层次化异质性平衡器可减少多任务优化过程中的任务冲突。在MedIR-2D-500K和MedIR-3D-3K基准测试中,研究人员报告称,该方法在全能复原和单任务复原方面均取得了当前最佳水平的结果。代码已公开。

负向自蒸馏:通过规避缺陷学习推理

研究人员提出了“负向自蒸馏”(NSD),用于提升大语言模型在复杂推理任务中的表现。该方法针对策略内自蒸馏(OPSD)的一项缺陷:模型可能模仿利用特权信息生成的、过度自信的推理轨迹,从而抑制不确定性表达、探索和自我纠错。NSD不要求模型模仿正确答案,而是让模型偏离由自身生成的、针对具体问题的负向条件,例如“粗心推理者”的行为。研究人员还设计了动态门控机制,自动识别推理关键词元,使梯度更新只针对行为缺

25位菲尔兹奖得主警告:AI在数学领域存在“严重错位”

陶哲轩、邓煜、彼得·舒尔茨等25位菲尔兹奖得主发表联合声明,警告AI公司与数学界之间正出现日益严重的目标错位。声明承认,大语言模型近几个月在解决困难数学问题方面进步明显,但将数学问题主要用作基准测试,可能损害概念理解、严谨写作、成果署名以及人与人之间的知识传承。声明指出,解题只是实现理解和洞察的手段,并非数学研究的最终目的。大量生成且未经充分验证的答案还可能破坏研究环境,引发抄袭和署名争议。AI有

纽约特斯拉致命车祸引发 Autopilot 责任争议

一辆特斯拉 Model Y 在曼哈顿撞上人行道防护棚、公交站牌和脚手架,导致一名 27 岁女乘客死亡。警方称,司机血液酒精浓度为 0.229%,远高于纽约州法定上限;车内两人均未系安全带。司机已被控车辆过失杀人、酒后驾驶和肇事逃逸等罪名。特斯拉 CEO 埃隆·马斯克否认车辆或 Autopilot 与事故有关,并批评 ABC News 的报道。纽约市警察局目前没有将事故归因于 Autopilot 或

苹果发布 SimpleDesign,可联合生成蛋白质序列与三维结构

苹果研究人员发布了蛋白质设计模型 SimpleDesign,相关论文以预印本形式刊登在 arXiv。该模型能够同时生成氨基酸序列和蛋白质三维结构,直接使用序列与连续三维坐标训练,无需先通过自编码器构建中间表示。模型使用超过 200 万组序列与结构配对数据进行训练,在蛋白质联合设计、结构生成和序列生成基准测试中取得了具有竞争力的结果。不过,目前这些结论仅来自计算机评估,尚未通过实验验证生成的蛋白质能

俞敏洪:人工智能可能加剧社会贫富差距

在2026崇礼论坛上,新东方创始人俞敏洪表示,人工智能可能创造大量新工作,但也会替代重复性劳动,尤其影响过去由普通劳动者从事的岗位。他指出,未来的新工作需要人们重新学习并重新定义职业技能。俞敏洪还警告,人工智能创造的财富可能以极快速度集中到少数人手中,而普通民众难以分享相关收益。这番言论是对人工智能社会经济影响的警示,并非已有实证支持的预测。

DLSS 5 混合精度 Mod 测试:RTX 50 系列显卡性能仅提升 1% 至 2%

英伟达 DLSS 5 神经渲染 DLL 流出后,社区开发者开始尝试降低模型推理成本。一款 Mod 在 RTX 50 系列显卡上混合使用 FP8 与英伟达 NVFP4 格式。4K 分辨率下,该方案仅将神经渲染阶段的处理时间缩短约 1% 至 2%,并不代表整款游戏的帧率也有同等幅度提升。在《博德之门 3》的 120 秒测试中,混合精度模式达到 55.16 FPS,FP8 模式为 54.57 FPS,提

华境 S 新增 4 款配置,全系标配华为乾崑智驾 ADS Pro 增强版

华境汽车宣布为六座大型 SUV 华境 S 新增 4 款配置。全系标配华为乾崑智驾 ADS Pro 增强版和鸿蒙座舱,超级置换价为 14.98 万至 19.68 万元。新配置主要升级鸿蒙座舱,搭载 MoLA 2.0 混合大模型架构,支持方言识别,并更新车机界面。同时,车辆支持外接扩展屏,相比原版本加价 3000 元。华境 S 是上汽通用五菱与华为合作推出的首款搭载华为乾崑科技的车型。

微信密集测试 AI 功能,覆盖图片处理、内容摘要与聊天辅助

微信正通过 AI 助手“小微”测试多项新功能。图片发送界面新增“AI 处理”选项,可进行图片美化、背景替换、消除杂物、扩图、提升画质、添加水印、文字提取、内容总结和图片翻译。其他功能还包括整理公众号文章、为朋友圈内容提供评论和文案建议,以及识别扫一扫拍摄的商品和包装。聊天时,用户也可通过语音要求 AI 改写句子、翻译消息或生成回复。目前这些功能仍处于灰度测试阶段,仅部分用户可以体验,微信官方尚未确