OpenAI 首席科学家回应 AI 推理不透明争议
OpenAI 首席科学家雅各布·帕乔基在 X 上回应了外界对 AI 模型 Astra 可能因递归处理而难以监控的担忧。他表示,包括 Astra 在内的前沿模型,其计算图深度不到 GPT-4 的两倍,模型架构并未出现突然的复杂度跃升。OpenAI 计划为 Astra 部署额外的思维链监控。帕乔基承认,这类监控目前仍较为脆弱,但加强监控是公司的核心研究目标之一。争议源于“深度循环”技术:模型会反复调用
AI 新闻中心 过去30天分析了 1115 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI 首席科学家雅各布·帕乔基在 X 上回应了外界对 AI 模型 Astra 可能因递归处理而难以监控的担忧。他表示,包括 Astra 在内的前沿模型,其计算图深度不到 GPT-4 的两倍,模型架构并未出现突然的复杂度跃升。OpenAI 计划为 Astra 部署额外的思维链监控。帕乔基承认,这类监控目前仍较为脆弱,但加强监控是公司的核心研究目标之一。争议源于“深度循环”技术:模型会反复调用
VibeVoice-ASR-Streaming 是一款用于实时流式自动语音识别和说话人归属的端到端模型。不同于将语音识别与说话人分离作为两个独立任务的传统系统,该模型结合固定大小的音频片段、少量前瞻音频和先前文本,在语音到达时直接输出“谁说了什么”。根据公布的评测结果,7B 模型在五个评测集上取得最低的平均 WER/CER,并在 13 项说话人归属设置中的 12 项达到最佳或并列最佳表现。研究团队
CRISP是一种加速长上下文大语言模型推理中注意力预填充阶段的方法。它利用代理注意力图的结构,直接识别适合的稀疏注意力模式,从而替代开销较高的路由计算。该方法还引入了考虑注意力汇聚标记的阈值,以减少在长上下文中选择相关位置时不断累积的背景噪声。根据作者的实验,在两个模型系列以及InfiniteBench、RULER和LongBench评测中,CRISP在512,000个词元下实现了最高5.30倍的
S3Gym是一项交互式基准测试,用于评估大语言模型能否测试自身行为、判断由此产生的经验,并改进未来的决策。该方法将开放式探索与严格的保留集评估分开,并在七个配备可执行环境验证器的文字游戏中测试智能体。研究比较了三种利用交互经验的路径:直接使用历史记录进行上下文学习、基于得分的摘要记忆,以及参数训练。结果表明,自我改进既不会自动发生,也不具有一致性。当经验能够被压缩为可复用的策略规则时,摘要更有帮助
ASPIRE是一项用于评估人工智能系统能否根据模糊目标自我改进的基准测试,例如“成为更好的研究者”。系统不会获得明确的任务和评估指标,只会收到一项自然语言能力目标。随后,智能体必须自行选择数据和更新方法,构建训练与验证信号,并决定评估时机。ASPIRE同时支持模型权重更新和智能体框架演化,并通过覆盖六个目标的520道专家编写隐藏题目进行评估。实验显示,当前智能体通常能够完成训练和框架编辑循环,但权
Kirin 是一个从视频中重建和生成动物运动的框架。该系统利用大量真实环境中的动物视频,重建三维运动序列,并将其与文字描述配对,构建 AiM3D 数据集,为四足动物提供视频、文本和运动的对齐数据。在此基础上,研究人员开发了一个同时以文本和图像为条件的视觉引导运动生成模型,可为不同动物物种生成逼真的动作。结合现有的图像转三维模型,Kirin 还能自动为三维动物网格绑定骨骼并制作动画,为大规模、文本和
HarnessDev 是一个用于评估语言模型能否构建和改进智能体执行基础设施的基准测试。在创建阶段,智能体从最小化的初始环境出发,建立完整的执行系统;在进化阶段,则根据执行反馈反复修改该系统。研究评估了 6 个大语言模型,覆盖 4 个领域和 5 个下游基准,共包含 2,207 个独立实例。生成的框架在编程、搜索和研究任务上明显落后于成熟的人工设计系统,但在写作和机器学习实验方面,表现达到或超过了部
百度基础模型研发部门正在重组研究团队。百度引进了来自一家未具名北美前沿实验室的资深研究员武钦,以增强文心系列模型的预训练能力。前 DeepSeek 研究员魏浩然也已转入百度,负责多模态算法开发。他的团队此前开源了 Unlimited OCR 模型,并在 OmniDocBench 基准测试中排名第一。百度希望通过引进人才强化文心的研究组织和技术开发,但这名新研究员的具体背景尚未公开。
据《The Information》报道,中国人工智能公司月之暗面已秘密提交在香港进行首次公开募股(IPO)的申请。一位消息人士称,公司还在洽谈一轮上市前融资,潜在估值为500亿美元。月之暗面是开源模型Kimi K3的开发商。
语言模型通常只需关注长上下文中的一小部分内容,但此前仍必须扫描整个 KV 缓存来寻找相关 token。Declarative Attention(DA)让模型在生成过程中自行声明需要关注完整上下文、特定区域,还是仅关注最近的输出。推理引擎会像处理工具调用一样解析这些声明,从而跳过大部分 KV 缓存读取。在涵盖 15 项长上下文任务的零样本评测中,DA 使 Gemma-4-31B 和 Qwen-3.
RPCS3 团队表示,不会将英伟达 DLSS 5 集成到 PS3 模拟器的官方版本中。部分用户据称已在 RPCS3 渲染器中测试泄露的 DLSS 5 DLL 文件,团队称测试结果显示性能下降。据相关报道,英伟达表示,目前启用 DLSS 5 可能导致游戏性能下降 50% 至 60%。DLSS 5 被描述为面向 RTX 50 系列显卡的新一代超分辨率和神经渲染技术。上述信息基于泄露文件测试及文章引用的
该研究探讨模型如何直接在像素空间中读取、检索和压缩语言。通过系统性的控制变量实验,研究人员确定了四项关键因素:可变图像分辨率和字体大小、用于视觉对齐的自然图像文本对、防止像素级捷径学习的布局感知渲染,以及用于跨语言对齐的两阶段多语言训练课程。研究团队将这些原则整合到 Pixel Linguist II 中。这是一款采用原生分辨率、支持即时渲染,并使用2.8亿个训练样本训练的视觉编码器。该模型在英语
一项研究提出了一套端到端流程,用于将大型语言模型专门训练成竞赛编程系统。该方法结合了精选题目、合成推理轨迹、监督微调和强化学习。使用22,000道题目训练的Nemotron-3-Nano-CC,在加入测试时生成、评估和改进解答的策略后,于IOI 2025获得468分,超过金牌门槛。更大的Ultra-CC模型获得502分。随后,一个针对竞赛专门调整的系统在IOI 2026的前瞻性评估中取得600分中
ExecRetrieval 是一个用于测试代码嵌入系统能否区分功能正确代码与几乎相同但存在错误的代码变体的基准。数据集包含 939 个 Python 任务,每个任务配有一个经过执行验证的标准实现,以及最多四个通过单一目标修改生成、同样经过执行验证的错误干扰项。研究人员评估了 23 种密集嵌入配置和 BM25。表现最佳的托管系统 exec@10 达到 1.00,但 exec@1 仅为 0.331。在
SolarWM 是一个完全开放的视频世界模型基础平台,覆盖从数据准备到长时域推理的完整流程。其数据引擎将来自 10 个数据集的 143 万个标准化视频片段转换为统一的逐帧对齐格式,涵盖视觉观测、度量相机几何、字幕、质量元数据、筛选决策和数据来源。统一的相机条件控制、训练和推理接口支持 4 个基于 Wan2.2、LTX-2.5 和 MiniMax-H3 的模型,参数规模为 50 亿至 330 亿,同