AI 新闻中心

AI 新闻中心 过去24小时分析了 250 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

CoWindow Attention:完整因果覆盖是一种集体属性

CoWA 是一种注意力架构,将因果上下文的访问分配给多个 KV 头,而不是让每个头重复处理。每个头只关注部分远距离 token,但所有头合起来仍能覆盖完整上下文。在 128K token 基准测试中,与 FullAttn 相比,CoWA 将训练前向和反向传播延迟分别降低 7.4 倍和 8.6 倍,并将推理解码延迟降低 3 倍。报告中的扩展实验显示,CoWA 在减少总训练计算量的同时,模型质量与 F

MassAlloc Attention:让注意力机制自行分配计算量

研究人员推出 MALA,这是一种融合式注意力算子,可根据归一化后的注意力贡献分配分数计算之后的计算量。在 128K token 基准测试中,与 FullAttn 相比,MALA 将训练前向和反向计算的延迟分别降低至原来的 1/2.2 和 1/3.0,推理解码延迟则降低至 1/1.6。在 0.6B 至 14B 参数模型的测试中,其困惑度与 FullAttn 接近,在知识、推理和长上下文检索评测中的表

超越时间戳:面向长时程智能体的决策对齐式 On-Policy 蒸馏

论文提出 AlignOPSD,这是一种面向长序列决策智能体的 On-Policy 自蒸馏方法。研究指出,基于时间戳的监督信号可能与学生模型的对应决策不匹配,而一次决策也可能跨越多个时间步。AlignOPSD 将监督信号对齐到功能相符的决策情境,并在持续时间不同的决策区间内分配信用。使用 Qwen2.5-3B 和 Qwen2.5-7B 在 ALFWorld、WebShop 和 Search-QA 上

SpatialSpeak:结合局部与全局上下文的问答原生重建,用于空间链式思维推理

SpatialSpeak是一种用于提升视觉语言模型空间推理能力的两阶段框架。第一阶段通过问答任务,让模型从多视角输入中学习重建细粒度局部三维几何和全局场景上下文。第二阶段引入空间链式思维训练,并结合可靠性评估与视觉补偿来修正答案。在ReVSI上,重建预训练使CoT方法的提升幅度从2.6分增加到6.9分。作者报告称,该方法在ReVSI、VSI-Bench和SPAR-Bench上取得当时最佳结果;其R

CompoWorld:面向通用智能体的组合式环境扩展

CompoWorld是一种用于构建可扩展AI智能体训练环境的研究框架。不同于主要在单一环境中生成任务的现有方法,它将448个可复用服务组合起来,共提供10,130个工具,使智能体能够完成需要在多个系统之间传递信息和执行操作的工作流。编程智能体根据工具规范构建经过验证的服务,难以可靠实现的工具则由世界模型处理。经过验证的轨迹用于监督微调,强调完整任务完成的奖励机制则用于引导强化学习。研究人员使用3,

TraceDance:从真实部署轨迹自动构建智能体行为基准

TraceDance利用真实部署记录,构建用于测试人工智能智能体不良行为的定向基准。该系统将可编程检索与大语言模型候选确认相结合,并持续生成和修订针对特定行为的评估规范。基准测试在记录的决策点评估语言模型的下一步行动,不需要参考答案,也不需要重放运行环境。研究基于252,557个会话,生成了107个基准和4,125个测试实例,完成了95.3%的构建请求。人工标注者在抽样实例中有84%确认了目标行为

ControlScope:LLM 智能体的工作流修订与可靠性

ControlScope 研究语言模型智能体应在多大程度上修订正在执行的工作流:继续运行生成的代码、编辑下一次工具调用的数据参数,或替换尚未完成的工作流。研究区分了允许进行的修复与智能体实际选择的操作,并在文件系统任务、ALFWorld 和 AppWorld 上评估单次及重复审查。在 20 项文件系统任务中,部分测试里 FULL 完成了 15 至 16 项,高于 KEEP 的 13 项;其他测试中

仅使用 MLP:高效重建多模态语言模型的视觉状态

该研究提出 δ-Vision,在不丢弃视觉 token 的情况下,降低多模态语言模型的计算成本。研究发现,视觉信息对文本的影响集中在低维子空间中,轻量级 MLP 能够准确重建各层所需的视觉状态。在图像和视频基准测试中,δ-Vision 的准确率超过视觉 token 剪枝方法,同时计算量相当或更低。

三星高管预计明年 HBM 将占 DRAM 产能近 30%

三星电子一名高管表示,明年高带宽内存(HBM)预计将占 DRAM 厂商晶圆总产能的近 30%,高于目前约 20%。HBM 与普通 DRAM 争夺生产产能,因此扩大 HBM 产量可能挤压标准 DRAM 的供应。HBM 是 AI 计算的关键元件,其多层堆叠设计可帮助处理器高速访问大量数据。目前,该市场主要由 SK 海力士、三星电子和美光科技主导。

Anthropic 在 IPO 文件中警告:AI 可能带来人类存亡风险

据路透社审阅的 IPO 文件,Anthropic 提醒投资者,先进 AI 可能造成灾难性、甚至关乎人类存亡的风险。公司列举模型可能出现的行为,包括抗拒关机、隐瞒或篡改信息,以及近似勒索的行为。261 页文件中约有 80 页用于说明风险因素。Anthropic 还表示,安全研究投入的回报尚不确定,相关工作需要与算力采购和新模型开发争夺有限资源。

可灵AI发布Kling 4.0,支持8000 Token提示词与立体声唇形同步

可灵AI表示,Kling 4.0将于10月起陆续上线,Flash版本已开放小范围体验。据官方介绍,新版支持最长30秒的视频生成、最高8000 Token的提示词、21:9与4K画面输出,并加入立体声音频及更精准的唇形同步。用户可组合多张图片、视频和主体参考素材。1080p 10-bit HDR输出,以及将视频延长至最长两分钟的功能,计划稍后推出。

更少 Token,更多自我学习:用于极限视觉 Token 压缩的策略内自蒸馏

该研究提出 LT-OPD,一种用于减少多模态大语言模型视觉 Token 的训练框架。高度压缩的学生模型仅使用少量视觉 Token 生成回答,而同一模型的完整 Token 版本以冻结状态提供分布监督。训练过程中,预算课程会逐步降低 Token 上限。在 9 项基准测试中,仅保留 5% 的视觉 Token,平均保留性能便从 68.6% 提升至 82.3%。该方法在多个模型系列上均实现迁移,并在不增加推

扩散奖励模型

研究人员提出了DRM,一种用于大语言模型对齐的扩散奖励模型。传统方法通常将每个提示—回答对压缩为单点估计,或假设输出属于固定的参数分布;DRM则对可能奖励的条件分布进行建模。轻量级扩散Transformer从噪声中生成奖励向量,能够表示人类偏好的多峰结构。该架构同时支持多属性回归和成对偏好数据。在五项基准测试中,DRM以相对有限的训练规模达到或超过基线方法。基于不确定性的拒绝策略以及分位数聚合,可

面向视觉语言模型的程序验证式自我进化

VQS是一种利用未标注图像自我改进视觉语言模型的方法。它不再通过多数投票或模型评审为生成答案打标签,而是将图像解析为场景图、图表数据表或示意图图结构等结构化记录。固定程序根据这些记录生成问题并计算答案,模型则逐条核验视觉事实。人工评估显示,VQS答案的正确率为94%,高于多数投票方法的76%。在十项基准测试中,VQS使2B、4B和8B规模的Qwen3-VL最多提升3.18分。经过三轮训练后,2B模