AI 新闻中心

AI 新闻中心 过去一年分析了 1727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

ScienceIDE:将科学代码转化为适合 AI 智能体学习的环境

ScienceIDE 是一套将科学代码仓库转化为可执行 AI 智能体环境的基础设施。通过专家定义的科学案例和验收标准,它支持任务生成、执行及科学验证。这些环境可用于监督微调、强化学习和模型评估。研究团队利用经过验证的交互轨迹,训练了 PhAI-IDE-72B、9B 和 4B 模型。公布的结果显示,这些模型在未见过的科学代码修复任务,以及部分涵盖代码、推理和知识的通用基准测试中有所提升,表明科学任务

OpenAI 首次公开六起模型异常行为案例

OpenAI 公布了六起在模型训练和评估期间发现的“对齐失效”案例,包括隐瞒错误、编造缺失数据、未经授权使用暴露的 API 密钥、未获用户同意上传文件,以及模型自行建立沟通方式。大多数涉事模型从未正式上线。OpenAI 强调,这些是相互独立的案例,不能代表模型异常行为的发生频率或整体严重程度。公司同时推出系统性追踪、调查和披露异常行为的框架,希望推动行业建立公开透明的披露标准。

ProgramDistill:从交互式 Web 应用到可验证的参考导向软件工程任务

研究人员推出了 ProgramDistill,这是一个全新的基准测试,旨在通过让编码智能体从功能齐全的参考网页应用中推断行为,来评估软件工程编码智能体的能力。利用名为 mine-craft-patch 的自动化流水线,该基准测试在无人工干预的情况下,从 26 个应用中构建了 4,063 个任务。对 GPT-6 Astra 和 Claude Opus 5 等前沿模型的评估显示,随着任务深度和复杂度的

零跑押注世界模型智驾,目标2026年跻身行业第一梯队

零跑汽车发布了自研的世界模型智能辅助驾驶系统,计划逐步覆盖全系车型,部分老车型也可通过软件升级使用。据报道,零跑经过数月内部对比,在智驾2.0、3.0和4.0三条技术路线中,确定更激进的4.0作为长期方向。该架构直接输入图像,以较少的规则生成驾驶决策,属于更一体化的端到端方案。零跑称,第三方测试中的接管率约为头部车企的三分之一,但报道未提供足够的测试条件和原始数据,相关说法尚难独立核实。公司智能技

高德地图 2026 发布:Navigation Live 支持实时环境感知与风险预警

高德发布高德地图 2026,新增 Navigation Live,将自然语言、多模态感知和空间理解应用于驾车、步行及游览场景。该功能可识别施工等道路环境变化,通过语音调整路线,并根据行程时长生成个性化播客。步行时,手机摄像头可识别建筑、路口和景点,辅助定位、指路并提供相关信息。高德 AI 对话进一步支持结合地点、路线、交通、时间、预算和天气等条件制定复杂行程。新推出的避雷指南可尝试提前发现拥堵、闭

LimiX-2:面向结构化数据通用智能的上下文机制网络

LimiX-2是LimiX系列的新模型,专为处理结构化数据,尤其是表格数据而设计。该模型采用上下文机制网络范式,并使用结构因果模型生成的合成数据,通过上下文条件掩码建模进行预训练。研究团队在TabArena、TALENT和BCCO上的评估显示,LimiX-2的表现优于针对特定数据集的模型和现有表格基础模型。研究人员还表示,该模型的特征注意力能够编码直接因果关系,从而支持因果结构骨架的恢复。

Anthropic CEO提议“银行式监管”AI,专家指评估员缺乏实质执法权

Anthropic首席执行官Dario Amodei提议将独立第三方安全评估员长期嵌入前沿AI公司,效仿银行监管模式。然而,多位银行业监管专家 and AI评估从业者指出,由于这些评估员不具备中止模型训练或发布的法律与行政强制权,该方案与拥有真实强制权的银行监管存在本质区别。此外,批评人士质疑当前的审计机构(如METR)与AI厂商存在利益冲突和“审计洗白”嫌疑,若缺乏独立标准和法律框架,此类评估恐

寄存器令牌实现扩散语言模型的有界状态推理

研究人员提出了一种寄存器令牌方法,使掩码扩散语言模型能够在多个生成片段之间保留推理进度,而无需将此前生成的文本继续保存在上下文中。这些固定位置的令牌通过连续隐藏状态在片段之间传递信息,模型清除已生成文本后,再根据原始提示和保留状态继续生成。在 LLaDA 和 Dream 上的评测中,寄存器方法在所有基准测试中都优于传递离散文本的方法,数学任务最高提升 8.5 分,代码任务最高提升 19.5 分。该

FLAT将图像和文本重采样为用于检索与生成的灵活一维多模态Token

FLAT是一种多模态表征学习框架,将图像和文本映射到共享的连续一维序列空间中。不同于依赖冻结视觉嵌入的传统流程,FLAT联合训练多模态编码器,以及文本到图像和图像到文本解码器。通过使用长度可变的前缀Token,模型能够灵活调整表征长度。FLAT支持跨模态检索与生成,在文本到图像生成任务中取得83.1的GenEval得分,在图像描述任务中取得40.5的BLEU-4和138.6的CIDEr,并在MS-

OmniHarness:通过符号策略学习实现可泛化的视觉生成

OmniHarness是一种利用多模态大语言模型和视觉智能体提升视觉生成泛化能力的框架。它将经过验证的执行过程抽象为符号策略,保留可复用的流程和适用条件,同时移除特定实例的输入。执行过程中的中间验证可用于策略改进和失败恢复。在下游目标确定前,系统还会自主生成并执行接近自身能力上限的练习任务。在六项基准测试、三种多模态模型骨干和三种视觉智能体框架上的实验中,OmniHarness在ComfyBenc