AI 新闻中心

AI 新闻中心 过去一年分析了 1378 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

能力问题:大语言模型的技能是否与语言无关?

一项研究考察大语言模型在不同语言中是否具备相同能力,并将语言影响与知识水平及通用基准测试表现区分开来。在多语言自我对弈实验中,同一模型的两个实例分别使用不同语言,在六种文本游戏中对战。模型、规则、状态空间和可用行动均保持不变。研究人员在八种语言上评估了三个开放权重模型,发现模型的对战能力、无效行动数量和策略倾向会因语言不同而显著变化。空间推理、基于卡牌的决策以及最优行动选择中都出现了特定语言的失误

谷歌推出全球首个加密环境下的 AI 模型双盲评估方案

谷歌推出了面向前沿专有 AI 模型的双盲评估方法。外部评估机构可在加密黑箱环境中测试模型,但无法查看模型权重;谷歌也无法获取评估方的测试提示词。该方案旨在防止模型提前接触测试数据,从而避免“基准污染”。谷歌与新加坡人工智能安全研究所、OpenMined、AVERI 及 MLCommons 合作,利用机密计算对 Gemini Flash Lite 进行了测试。这项试点有望提升评估的独立性和可信度,尤

英国完成全球首例 AI 实时辅助脑外科手术

伦敦大学学院医院外科医生利用专门开发的 AI 系统,协助为一名 48 岁患者切除良性垂体肿瘤。手术期间,系统实时分析内镜画面、追踪手术器械位置,并标出重要血管和神经可能所在的区域,帮助医生避开肿瘤附近的关键结构。AI 并未接管手术,所有判断和操作仍由外科医生完成。研究团队使用数百段垂体肿瘤手术视频训练和评估该系统,目前正准备开展更大规模的临床试验。患者表示,手术后周边视野明显改善,术前的疲劳、眩晕

LibriBrain100发布超100小时MEG数据,助力神经语音解码研究

LibriBrain100是一个面向可复现神经语音解码评估的大规模MEG数据集,包含超过100小时的高质量记录。其中约80小时来自单一受试者,规模远超同类数据集。研究人员使用现有解码模型进行词语分类基准测试,取得当前领先表现。为研究单个受试者数据有限时多受试者数据的价值,团队还从32名受试者处各采集了约40分钟数据。数据集、评估基础设施、Python库以及带有公开排行榜的竞赛将以开放方式发布。该项

Transfyr完成2500万美元种子轮融资,利用AI应对科学研究可重复性危机

总部位于马萨诸塞州剑桥的初创公司Transfyr在完成2500万美元种子轮融资后结束隐身运营。该公司使用传感器和软件记录实验室工作的实际过程,再训练AI模型识别其中的模式,并捕捉通常不会被记录的实验室隐性知识。公司希望借此帮助应对科学研究中的可重复性危机。

SWE Refactor Bench:编程智能体能否完成长期的全代码库迁移?

SWE Refactor Bench评估编程智能体是否能真正执行整个软件代码库的技术迁移,而不仅是让现有测试通过。该基准包含20项迁移任务,覆盖四类技术债务,并检查迁移完成度、行为正确性以及隐藏的行为差异。在8个前沿模型的520次运行中,只有28次通过全部三个阶段,13项任务没有获得可接受的解决方案。表现最佳的Claude Opus 5得分为47.0分。结果显示,智能体经常跳过迁移,或在尝试迁移时

10万张国产算力卡支撑“牛来”:智谱开源GLM-5.3-Flash

智谱宣布上线并以MIT协议开源多模态模型GLM-5.3-Flash(320B-A18B)。该模型总参数320B、激活参数18B,支持100万Token上下文,并采用稀疏注意力与线性注意力混合架构及mHC技术。据Artificial Analysis评测,模型得分57分,与Claude Opus 4.8持平,高于文中提到的GLM-5.2和DeepSeek V4 Pro。智谱称其调用价格仅为部分竞品旗

从3.3GB压缩至440MB:腾讯混元极低比特量化基本保持翻译质量

腾讯混元团队将旗下18亿参数的端侧翻译模型Hy-MT2大幅压缩。2-bit版本大小为574MB,1.25-bit版本则将原本3.3GB的模型压缩至440MB。方案结合了弹性量化、量化感知蒸馏,以及腾讯自研的Sherry稀疏三值量化技术。英特尔针对包括最新酷睿Ultra在内的x86处理器,对低比特矩阵运算进行了适配和优化。哔哩哔哩已将该压缩模型用于直播弹幕实时翻译。完整下载资源约600MB,运行时内

Anthropic公布外部研究人员开展Claude使用研究的试点结果

Anthropic公布了一项试点计划的研究结果,允许三名外部研究人员访问有关Claude实际使用情况的汇总数据。其中一项研究发现,用户会将高风险或高重要性的任务交给人工智能处理。这些结果有助于了解Claude的实际使用模式,但并未证明人工智能决策的质量,也未证明将重大任务交给人工智能是安全的。

小鹏首次将 X-Foresight 世界模型搭载上车,可预测未来 6 秒路况

小鹏发布了第二代 VLA 驾驶模型的新版本。X-Foresight 世界模型可提前模拟周边交通参与者未来 6 秒内的可能行为,例如前车突然刹停或行人改变方向。系统结合 Flow Matching 生成多种未来情景,利用 Infini-VLA 保留更长的时间上下文,并通过混合架构将不同驾驶任务动态分配给专门的模型组件。小鹏称,流式自回归推理使端到端响应速度提升 300%,实现边观察、边推理、边行动。

RetrievalRouter:面向文档检索的模态与架构联合选择

RetrievalRouter 是一个轻量级、面向查询的文档检索路由器。它仅根据查询文本,在文本与多模态流程,以及密集检索与晚交互架构之间选择最适合的检索方案。在金融和科学文档基准测试中,没有任何固定流程能在所有查询上保持最佳表现。与最优固定基线相比,RetrievalRouter 的准确率提高 2.5%,速度提升 12.4 倍。通过一个可调参数,用户可以控制完整的准确率与延迟权衡范围。研究团队已

小鹏:第二代 VLA 升级的核心是建立对时间维度的理解

小鹏汽车通用智能中心负责人刘先明表示,第二代视觉—语言—动作(VLA)模型首次将时间维度纳入模型。新推出的 Infini-VLA 长时序架构可记忆此前 30 秒的环境信息,为驾驶判断提供更长的上下文。小鹏还采用流式自回归推理,并宣称端到端响应速度提升 300%,使模型能够在道路状况不断变化时并行完成观察、思考和行动。相关性能数据来自小鹏的企业介绍,报道未提供独立测试或第三方验证。

Next-Chunk 推理强化学习真的优于 SFT 吗?重新审视无 CoT 数据下的训练策略

一项受控研究比较了 Next-Chunk 推理强化学习与 Mixed SFT。后者是一种更简单的监督微调方法,同时使用无 CoT 数据和长 CoT 数据进行训练。Mixed SFT 在 RLVR 后的性能上限明显更高,而所需训练算力减少了 60 倍以上。这一优势在领域内数学推理和领域外推理任务中均得到体现。研究表明,Next-Chunk RL 的收益可能主要来自更有效地利用无 CoT 数据,而不一