AI 新闻中心

AI 新闻中心 过去一年分析了 1732 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

研究探索语言代理与非语言代理的协作方式

一项研究考察,将非语言代理的连续状态表示压缩为简短文本摘要,是否会限制其与大型语言模型的协作。研究人员推出 LLAMIA-Bench,包含六项协作式国际象棋任务,涵盖行为模仿、状态评估和自然语言解释。作为语言化传递的替代方案,潜在状态内化方法将专用代理的表示直接投射到语言模型的 token 流中,以学习得到的状态 token 进行编码,并随环境状态变化动态重新编码。实验结果显示,基于语言描述的整合

奥尔特曼:OpenAI Astra 模型已接受美国政府自愿审查

OpenAI 首席执行官萨姆·奥尔特曼证实,公司即将推出的 Astra 模型已接受美国政府的自愿审查。Astra 预计将成为 OpenAI 首个被划入“关键”网络安全能力等级的模型,因此在开发期间和正式发布前需要采取更严格的安全措施。根据相关框架,政府官员最长可获得 30 天的模型访问权限,但白宫不打算公开审查规则。这使公众和未参与流程的企业仍难以了解美国政府将如何评估先进 AI 模型。奥尔特曼表

ZipTok3D:利用紧凑Token前缀实现高保真三维标记化

研究人员提出了ZipTok3D,这是一种能够利用极短Token序列高质量重建三维几何结构的标记器。训练期间,嵌套丢弃会随机截断潜在序列,并要求每个保留下来的前缀都重建完整物体,从而使前置Token优先编码关键几何信息。随后,采用参数共享的Transformer解码器逐步恢复更精细的几何细节。在Token维度相同的情况下,ZipTok3D据称达到了使用32个Token的COD-VAE基线相当的重建质

一眼足矣:利用 SimLoss 实现单次推理的细粒度图像描述

SimLoss 是一种无需参考文本的训练目标,旨在通过单次推理生成更细致的图像描述。该方法使用 InfoNCE 对比损失,将视觉语言模型的隐藏状态表示与冻结的图像嵌入对齐,使模型在生成文字前就能学习属性、数量、纹理、材质和空间关系等信息。它不需要人工撰写的细粒度描述,也不依赖多阶段流程生成伪描述。在评测中,可微分的 SimLoss FFT 取得了最高精确率,F1 分数接近多阶段验证系统,同时运行速

OpenAI 首席科学家回应 AI 推理不透明争议

OpenAI 首席科学家雅各布·帕乔基在 X 上回应了外界对 AI 模型 Astra 可能因递归处理而难以监控的担忧。他表示,包括 Astra 在内的前沿模型,其计算图深度不到 GPT-4 的两倍,模型架构并未出现突然的复杂度跃升。OpenAI 计划为 Astra 部署额外的思维链监控。帕乔基承认,这类监控目前仍较为脆弱,但加强监控是公司的核心研究目标之一。争议源于“深度循环”技术:模型会反复调用

VibeVoice-ASR-Streaming:实时说话人归属语音识别技术报告

VibeVoice-ASR-Streaming 是一款用于实时流式自动语音识别和说话人归属的端到端模型。不同于将语音识别与说话人分离作为两个独立任务的传统系统,该模型结合固定大小的音频片段、少量前瞻音频和先前文本,在语音到达时直接输出“谁说了什么”。根据公布的评测结果,7B 模型在五个评测集上取得最低的平均 WER/CER,并在 13 项说话人归属设置中的 12 项达到最佳或并列最佳表现。研究团队

CRISP:面向长上下文大语言模型的输入自适应稀疏预填充

CRISP是一种加速长上下文大语言模型推理中注意力预填充阶段的方法。它利用代理注意力图的结构,直接识别适合的稀疏注意力模式,从而替代开销较高的路由计算。该方法还引入了考虑注意力汇聚标记的阈值,以减少在长上下文中选择相关位置时不断累积的背景噪声。根据作者的实验,在两个模型系列以及InfiniteBench、RULER和LongBench评测中,CRISP在512,000个词元下实现了最高5.30倍的

S3Gym:大语言模型能否将自我测试和自我评判转化为自我改进?

S3Gym是一项交互式基准测试,用于评估大语言模型能否测试自身行为、判断由此产生的经验,并改进未来的决策。该方法将开放式探索与严格的保留集评估分开,并在七个配备可执行环境验证器的文字游戏中测试智能体。研究比较了三种利用交互经验的路径:直接使用历史记录进行上下文学习、基于得分的摘要记忆,以及参数训练。结果表明,自我改进既不会自动发生,也不具有一致性。当经验能够被压缩为可复用的策略规则时,摘要更有帮助

ASPIRE:模型能否从模糊目标中自我进化?

ASPIRE是一项用于评估人工智能系统能否根据模糊目标自我改进的基准测试,例如“成为更好的研究者”。系统不会获得明确的任务和评估指标,只会收到一项自然语言能力目标。随后,智能体必须自行选择数据和更新方法,构建训练与验证信号,并决定评估时机。ASPIRE同时支持模型权重更新和智能体框架演化,并通过覆盖六个目标的520道专家编写隐藏题目进行评估。实验显示,当前智能体通常能够完成训练和框架编辑循环,但权

Kirin:从真实环境视频生成动物运动

Kirin 是一个从视频中重建和生成动物运动的框架。该系统利用大量真实环境中的动物视频,重建三维运动序列,并将其与文字描述配对,构建 AiM3D 数据集,为四足动物提供视频、文本和运动的对齐数据。在此基础上,研究人员开发了一个同时以文本和图像为条件的视觉引导运动生成模型,可为不同动物物种生成逼真的动作。结合现有的图像转三维模型,Kirin 还能自动为三维动物网格绑定骨骼并制作动画,为大规模、文本和

HarnessDev:大语言模型能否创建并进化自己的智能体框架?

HarnessDev 是一个用于评估语言模型能否构建和改进智能体执行基础设施的基准测试。在创建阶段,智能体从最小化的初始环境出发,建立完整的执行系统;在进化阶段,则根据执行反馈反复修改该系统。研究评估了 6 个大语言模型,覆盖 4 个领域和 5 个下游基准,共包含 2,207 个独立实例。生成的框架在编程、搜索和研究任务上明显落后于成熟的人工设计系统,但在写作和机器学习实验方面,表现达到或超过了部

百度引进北美前沿实验室专家,前 DeepSeek 研究员出任多模态负责人

百度基础模型研发部门正在重组研究团队。百度引进了来自一家未具名北美前沿实验室的资深研究员武钦,以增强文心系列模型的预训练能力。前 DeepSeek 研究员魏浩然也已转入百度,负责多模态算法开发。他的团队此前开源了 Unlimited OCR 模型,并在 OmniDocBench 基准测试中排名第一。百度希望通过引进人才强化文心的研究组织和技术开发,但这名新研究员的具体背景尚未公开。

语言模型可以控制自己的注意力

语言模型通常只需关注长上下文中的一小部分内容,但此前仍必须扫描整个 KV 缓存来寻找相关 token。Declarative Attention(DA)让模型在生成过程中自行声明需要关注完整上下文、特定区域,还是仅关注最近的输出。推理引擎会像处理工具调用一样解析这些声明,从而跳过大部分 KV 缓存读取。在涵盖 15 项长上下文任务的零样本评测中,DA 使 Gemma-4-31B 和 Qwen-3.