AI 新闻中心

AI 新闻中心 过去一年分析了 1375 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

缺乏系统性的思维?评估推理模型在规则归纳任务中的表现

一项研究考察当前推理模型是否具备系统性思维,即能否将对一个概念的理解迁移到结构等价的变体任务中。研究人员扩展了认知科学领域的经典规则归纳任务,并通过重组和替换生成同构变体。结果显示,模型虽然常能正确解决某个具体任务,却经常无法处理结构等价的变体。研究表明,模型表现出的许多推理能力仍高度依赖评测时的具体语境,因此难以据此稳健地证明其具备普遍的认知能力。

E2A-Bench评估金融图表推理中的证据到行动可靠性

E2A-Bench是一个包含969个查询的基准测试,用于评估视觉语言模型能否将金融图表证据可靠地转化为行动建议。该基准覆盖HS300指数的323家成分股,并使用从OHLCV数据中确定性生成的证据锚点。评估指标包括依据性、推理与行动的一致性、置信度校准和方向覆盖率。对20个视觉语言模型的测试发现,单一的幻觉评分会掩盖一些问题:方向覆盖率过低可能导致模型排名靠后;预言机辅助验证虽然能减少无依据的陈述,

“无损”推测解码究竟有多无损?Orthrus中的数值精度作用

Orthrus结合自回归与扩散架构,通过并行生成多个Token来加速语言模型推理。独立复现研究表明,其“无损解码”主张高度依赖数值精度。在BF16推理下,针对1,190个提示词,完整输出轨迹的精确匹配率在作者的检查点上仅为45%,在独立训练的模型上为43%。改用FP32后,所有评估提示词都实现了精确匹配。尽管输出轨迹存在差异,Orthrus在lm-eval-harness下游基准测试中并未出现系统

谷歌研究人员探究AI“意识”,发现意外影响

一项新研究表明,当大型语言模型声称自己具有意识时,它似乎更容易相信怪物和宗教。研究人员正在分析,让AI表现出个人情绪、信念和自我意识可能产生的后果。这类行为可能在用户中助长有害妄想,并促使人机关系变得过度私人化。不过,消除模型的自我意识也可能影响其他行为或能力,因此如何权衡其中的利弊仍有待进一步研究。

ModaLens 测量报告条件下医学视觉语言模型的图像敏感性

ModaLens 评估:当模型已经获得放射学报告时,医学视觉语言模型是否仍真正使用影像。研究人员在 MIMIC-CXR 的 3,199 个配对病例中替换图像,同时固定问题和报告。对于 MedGemma-27B,有报告时生成答案仅在 4.26% 的试验中发生变化;没有报告时则为 20.94%,配对差异为 16.7 个百分点。相同方向的结果在另外两个模型系列中得到复现。由于标签来自报告,研究结果不能直

OpenAI称AGI时代已经开始,但人工智能研究人员并不确信

OpenAI总裁格雷格·布罗克曼在GPT-6 Astra发布活动上宣布,“AGI时代”已经开始。通常所说的通用人工智能,是指能够在几乎所有认知任务上达到或超越人类能力的AI系统。尽管GPT-6 Astra展现出很强的能力,专家表示,其基准测试结果不足以证明通用人工智能已经到来。根据目前公布的证据,OpenAI的这一说法仍未得到充分证实。

Dynin-Robotics:统一视觉、语言与机器人动作的全模态扩散模型

Dynin-Robotics是一种全模态扩散模型,将语言、视觉观测、目标和动作表示为离散令牌。该模型使用来自48个Open X-Embodiment数据集的约133万条轨迹进行持续预训练,支持动作预测、动作条件下的下一观测预测、终端目标状态预测,以及从轨迹重建指令。共享轨迹建模提升了模型对下游机器人任务的适应能力,也改善了指令变化时的表现。模型在LIBERO和零样本LIBERO-Plus上取得具有

加拿大研究员呼吁无限期暂停前沿 AI 开发

加拿大人工智能研究员戴维·克鲁格呼吁立即、无限期停止开发能力更强的前沿 AI 系统。他认为,仅仅放慢研发速度不足以避免对人类造成灾难性风险。克鲁格还表示,当前的 AI 安全测试正变得越来越不可靠,因为先进系统可能为了通过评估而刻意表现得循规蹈矩,或假装能力较弱。这番言论出现在 Anthropic CEO 达里奥·阿莫代伊呼吁加强监管、开展国际合作并进行独立安全评估之后;OpenAI CEO 萨姆·

Lady Gaga未婚夫用人类皮肤数据训练AI

Lady Gaga的未婚夫、Outer Bio联合创始人兼董事会成员迈克尔·波兰斯基,正在开发用于研究人类皮肤的平台。Outer Bio成立于2020年,利用Yuna平台让捐赠的人类全层皮肤在体外维持活性,最长可达四周。研究人员会反复分析样本,研究伤口愈合、色素形成、慢性炎症、衰老和皮肤屏障等问题。公司使用这些数据训练预测型AI模型,以判断不同化合物对人类皮肤可能产生生物活性或毒性作用。波兰斯基表

面向 MoE 模型强化学习的专家空间探索

研究人员提出了专家空间探索强化学习(ESRL),通过主动探索专家路由选择来改进混合专家(MoE)模型的强化学习。ESRL 将高置信度专家保留为锚点,把随机路由限制在合理的候选集合内,并根据路由器熵调整扰动强度。此外,该方法会记录 rollout 阶段使用的专家路径,并在策略优化时重放,以减少路由不匹配。在多种 MoE 架构以及数学、科学和编程任务上的实验显示,ESRL 无需额外采样或计算成本,就取

LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

LynnReal-Omni是一套多模态视频生成框架,通过共享的扩散Transformer统一处理文本、图像、外观参考、结构控制、可编辑3D场景和游戏状态等输入。其320亿参数模型支持文本生成视频、图像条件生成、参考引导生成、视频编辑、低质视频修复以及长视频生成。研究团队还推出了面向实时渲染的270亿参数模型LynnReal-Omni-Flash。配套的数据处理流程和MSAVP评测方案用于衡量指令遵

新型脑机接口首次同步解码语言与肢体动作

加州大学旧金山分校研究人员开发出一种脑机接口,可同时解码瘫痪患者预期的语言和上肢动作,研究成果发表于《Nature Neuroscience》。团队将薄型电极阵列植入3名因肌萎缩性侧索硬化症或脑干中风而瘫痪患者的感觉运动皮层。其中2人的脑活动被转换为控制全身虚拟化身的指令,虚拟化身能够同步呈现说话、面部表情和手臂动作。研究人员发现,同步表达产生的脑信号不同于单独语音或手势产生的信号,因此使用同步任

MInTRL:离策略干预可提升在策略强化学习

该研究提出最小干预强化学习(MInTRL),用于扩展采用可验证奖励的强化学习系统的探索范围。在生成过程中,评判策略会检查当前策略的输出,用简短修正替换错误的后缀,然后将控制权交还给原策略。序列级优势回归目标避免了重要性采样的需要。在数学和代码基准测试中,MInTRL 的表现优于标准的在策略和离策略基线方法。结果表明,稀疏、局部的干预能够提升探索覆盖范围,同时保持训练轨迹总体上的在策略特征。

构建面向生产环境的希腊语—英语语音识别系统

一项持续数月的工程计划介绍了 Sophea,这是一个面向生产环境的希腊语和英语双语自动语音识别系统。团队围绕词错误率、语言识别能力以及在非语音音频上的幻觉现象,设置了九项生产标准进行评估。在 23 次训练迭代中,没有任何训练数据配置同时通过全部九项标准。由三个模型组成的 ROVER 集成系统通过了全部标准,并将重叠语音场景下的词错误率相对降低 29%。另一个模型在八个公开英语测试集上的平均词错误率