AI 新闻中心

AI 新闻中心 过去30天分析了 4607 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

缺乏系统性的思维?评估推理模型在规则归纳任务中的表现

一项研究考察当前推理模型是否具备系统性思维,即能否将对一个概念的理解迁移到结构等价的变体任务中。研究人员扩展了认知科学领域的经典规则归纳任务,并通过重组和替换生成同构变体。结果显示,模型虽然常能正确解决某个具体任务,却经常无法处理结构等价的变体。研究表明,模型表现出的许多推理能力仍高度依赖评测时的具体语境,因此难以据此稳健地证明其具备普遍的认知能力。

E2A-Bench评估金融图表推理中的证据到行动可靠性

E2A-Bench是一个包含969个查询的基准测试,用于评估视觉语言模型能否将金融图表证据可靠地转化为行动建议。该基准覆盖HS300指数的323家成分股,并使用从OHLCV数据中确定性生成的证据锚点。评估指标包括依据性、推理与行动的一致性、置信度校准和方向覆盖率。对20个视觉语言模型的测试发现,单一的幻觉评分会掩盖一些问题:方向覆盖率过低可能导致模型排名靠后;预言机辅助验证虽然能减少无依据的陈述,

比亚迪称辅助驾驶车型保有量已超过372万辆

比亚迪表示,截至2026年8月31日,搭载辅助驾驶系统的车辆保有量已超过372万辆,其中8月新增销售201,533辆。公司称,“天神之眼”辅助驾驶系统每天生成超过2.3亿公里的数据。该数字还包括搭载华为“乾崑智驾”系统的车型。比亚迪表示,数百万辆汽车积累的数据是“天神之眼B”体验大幅提升的部分原因。随着中国汽车行业逐步转向端到端架构,各车企之间的能力差距可能会逐渐缩小。