AI 新闻中心

AI 新闻中心 过去30天分析了 914 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

中科院上海光机所在多维复用光计算领域取得进展

中国科学院上海光学精密机械研究所研究团队开发出多维复用光计算架构,融合波分复用、数据广播和网络复用,实现多任务、多模态信息的并行处理。由三个光计算核心组成的系统实现了324路计算并行度,并支持两个任务共享矩阵计算网络。在图像卷积实验中,光学结果与电子基准结果的均方根误差低于0.08;在遥感图像配准与识别验证中,识别准确率达到84.5%。该研究验证了通过波长、空间和任务等维度扩展光计算并行能力的可行

李飞飞团队发布世界模型 Atlas,或成为通往 AGI 的基础组件

李飞飞与 World Labs 核心团队发布了多模态世界模型 Atlas,其核心机制是新视角预测。不同于预测下一个 token 的语言模型和预测下一帧画面的视频模型,Atlas 可根据少量图像或文字描述,生成从场景不同位置观察到的画面。它能在同一系统中处理文本、图像、视频、3D 数据和相机位姿,并融合场景重建与内容生成。团队称,Atlas 可显著减少 3D 场景重建所需的数据量,并有望应用于创意设

双层协调反思:多智能体 LLM 系统的博弈论方法

该研究将多智能体 LLM 系统中协调器与工作智能体的交互建模为双层协调博弈,并分析任务分解、文本反思、记忆更新和外部验证对协作与系统漂移的影响。研究提出随机反思记忆攀升(SRMA)方法,只有在基于环境的评估显示风险降低时才接受记忆更新;在特定假设下,作者还给出了收敛和重新锚定保证。在 500 个 SWE-bench 实例上,基于 Kimi 的系统解决了 72.2% 的任务,公开的 mini-SWE

音视频模型中的注意力三角

该研究分析音视频扩散模型如何通过三条跨模态注意力路径协调文本、声音和视觉内容。研究发现,音频与视频之间的路径具有双向作用:音频可以影响视频生成,视频也可以影响音频生成。模型参数中学习到的偏差可能使这些交互覆盖原本的条件输入,从而生成视觉上典型但语义错误的结果。研究人员从注意力模式中提取信号,用于诊断语义如何在不同模态之间分布,并在推理阶段实施受控干预。实验表明,该方法能够改善跨模态语义对齐,同时基

数学里程碑:Claude 用 11 天完成费马大定理的形式化证明

Anthropic 表示,一个 Claude 模型经过约 11 天大致自主运行,首次在 Lean 中完成了费马大定理的端到端形式化,并通过计算机检查。该模型并未重新发现新的数学证明,而是将安德鲁·怀尔斯已有的证明转换为 Lean 证明助手能够逐步验证的形式。Claude 生成约 1300 万行 Lean 代码,证明了约 3.03 万个定理,其中近 2.95 万个被纳入最终证明。多个 Claude

τ^τ-Bench:面向真实端到端智能体构建的评测环境

τ^τ-Bench是一项评测编码智能体能否在接近真实客户项目的条件下构建完整客服智能体的基准测试。系统会获得企业业务记录、客户需求、生产环境API、现有代码库,以及模型和服务成本限制,随后将构建出的智能体部署到模拟用户环境中进行测试。在覆盖四个领域的53项任务中,使用Claude Code运行Claude Opus 5的最强配置仅通过了23.9%的评测模拟,而专家编写的参考系统达到82.2%。失败

OpenAI 同日发布两份文件:AI 加速 AI 研发,但安全措施正在掉队

OpenAI 发布两份文件,分别介绍 AI 辅助研究的进展,以及前沿 AI 发展带来的安全挑战。公司称,“自动化研究实习生”可在人类指导下完成原本需要熟练研究人员数天才能完成的明确研究任务。使用编程智能体的研究人员,每日推理费用中位数已超过 600 美元,使用量最高的 10% 用户每天花费超过 7000 美元。不过,OpenAI 承认,许多持续时间较长、更加复杂的任务仍需要人工介入。首席科学家雅库

Enoki:高效的多层次幻觉检测框架

研究人员推出 Enoki,这是一种用于检测大语言模型幻觉的开放信息抽取框架,可同时处理声明级和文本片段级检测。系统提取与文本锚定的关系事实,通过证据进行验证,并将缺乏依据的事实映射回出现幻觉的具体文本片段。共享表示避免了单独构建声明与片段对齐流程。Enoki 支持基于大语言模型、编码器和规则的抽取方式,可在准确率与推理成本之间进行权衡。实验显示,该框架以更少资源取得了具有竞争力的声明级验证结果,并

OpenAI宣布“自动化研究实习生”里程碑:内部智能体运行时长达人工的3.1倍

OpenAI表示,其内部系统已达到“自动化研究实习生”里程碑。在人类监督和指导下,该系统能够完成资深研究人员通常需要数天处理的、定义明确的复杂任务。截至8月中旬,OpenAI核心研究组织中,每投入一个人类工作日,智能体的运行时间相当于3.1个智能体工作日。不过,这一比例衡量的是运行时间和工作量,并不等同于相同的生产力或实际产出。OpenAI员工Kevin Liu认为,递归式自我改进可能成为未来几年

ShallowStream:浅层建索引,深层作回答,实现流式视频理解

ShallowStream 是一个用于提升多模态大语言模型连续视频处理效率的框架。它利用模型的浅层同时进行视频帧编码和轻量级检索索引构建,并持续维护该索引。在查询阶段,系统根据浅层生成的注意力分数评估上下文帧,再通过考虑多样性的策略选择准确且全面的证据。论文作者称,该方法在性能上可媲美现有领先的流式处理方法,同时将每帧预填充延迟最多降低52.1倍,将10秒视频的端到端延迟最多降低11.9倍。相关源

AdaptVPR:面向鲁棒视觉地点识别的路径感知困难正样本生成

AdaptVPR是一种生成式数据增强框架,旨在提升视觉地点识别对光照、天气、季节变化和动态遮挡的鲁棒性。视觉语言模型负责解析场景属性,基于规则的调度器则根据可编辑性和风险约束选择生成路径。系统可生成天气、光照和时间等全局外观变化,加入局部动态遮挡物,或结合两类扰动。基于几何一致性和外观多样性的验证机制会筛除不可靠样本,降低结构偏移风险。由此构建的AdaptCities数据集包含16万条经过验证的合

优化前先提问:面向交互式优化的动态前置建模澄清

大型语言模型正越来越多地用于将自然语言问题描述转化为优化模型。但现实中的运筹学需求通常缺少目标、约束条件或业务规则,而这些信息可能改变最终的数学规划模型。研究人员提出了 OR-Clarify,这是一个用于评估智能体能否在建模前识别必要澄清事项的基准。同时,他们提出两阶段框架 InterOPT,用于找出对建模至关重要的未解决信息,并决定继续提问还是停止。在选择题实验中,InterOPT 在准确恢复缺

当量化破坏记忆:低精度时序推理中的循环状态回写

一项研究表明,在循环神经网络中,状态被写回和保存的方式可能决定低精度推理的准确率。在用于荧光寿命成像的 GRU 编码器—解码器中,采用确定性的 4 位状态存储后,短寿命成分 τ1 和长寿命成分 τ2 的估计误差分别增加约 70 倍和 300 倍。原因是反复出现的小幅更新低于写入阈值,未能反映到存储状态中。误差反馈、残差记忆和方向记忆能够在无需重新训练的情况下恢复准确率。对独立训练的 LSTM 进行

MaxKernel:面向 TPU 的智能体式内核生成

MaxKernel 是一个用于设计和优化 TPU 定制内核的多智能体系统。它支持三种方式:人类参与的协作式设计、基于性能指标和追踪数据的全自动优化,以及用于更广泛探索设计空间的图搜索式自主探索。多个专业子智能体分别负责规划、实现、自我调试、测试和硬件性能分析。研究人员在 TPU 基准套件 JaxBench 的 50 项任务,以及先进开源模型的真实工作负载上进行了评估,并称该系统在许多情况下达到了专