AI 新闻中心

AI 新闻中心 过去7天分析了 956 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

构建可信AI审稿系统的关键一环:从修辞稳健性评测到SciCore Review

AI审稿系统可能因措辞不同而对科学内容相同的稿件给出不同判断。该研究将修辞稳健性定义为两项要求:面对保留内容的改写时评价保持稳定,同时能够区分不同论文。研究团队推出受控基准RobustReview,包含1,260个稿件版本,并评估了30种审稿配置。结果显示,对改写不敏感并不一定代表真正稳健;如果不同论文的分数也趋于一致,就会形成“虚假稳健”。SciCore将全文评审与基于抽取出的结构化科学核心所作

超越记忆:利用显式信念状态构建长程任务智能体

大型语言模型(LLM)智能体已能执行日益复杂的任务,但仅保存交互历史并不能保证其连贯地理解当前情况。本研究提出 PoS,这是一种推理时框架,可构建并持续维护显式信念状态,作为智能体的决策上下文。每个状态结合对当前世界状况的估计与尚未解决的任务要求。PoS会验证状态一致性,并检测智能体持续行动却未取得实质进展的“信念陷阱”。系统会根据陷阱模式和未解决的要求定制恢复策略。在四项基准测试中,PoS搭配三

后训练中的“锐化税”

一项研究考察了这样一种假设:大型语言模型的强化学习后训练,主要是强化基础模型已有的行为。这可能提高单次尝试的准确率,却降低多次尝试时的解法覆盖率。在智能体任务中,配备轻量推理框架的预训练模型虽然 pass@1 较低,但在拥有足够测试时计算预算时,可能在 pass@K 上超过后训练模型。研究人员提出“锐化税”指标,用于衡量后训练造成的测试时扩展性损失。在分析的 42 个模型与基准测试案例中,大多数都

OpenAI 再获 200 亿美元融资,英伟达、软银和亚马逊约占承诺金额的九成

据 The Information 报道,英伟达和软银分别向 OpenAI 支付了最后一笔 100 亿美元,完成各自 300 亿美元的投资承诺。亚马逊此前已投资 500 亿美元。三家合计投入约 1,100 亿美元,约占本轮 1,220 亿美元承诺融资额的九成。OpenAI 的估值约为 8,520 亿美元。软银表示,其对 OpenAI 的累计投资约为 646 亿美元,持股比例约为 13%。

消息人士称:亚马逊洽谈将80亿美元Grace Blackwell芯片剥离至特殊目的公司

据《金融时报》报道,亚马逊已与投资者讨论将价值约80亿美元的英伟达Grace Blackwell芯片转移至一家特殊目的公司,随后再租回这些芯片,用于其在美国的数据中心。该安排可能帮助亚马逊为人工智能基础设施融资,但目前谈判仍处于早期阶段,交易尚未得到确认。

World Observer:用于持久世界建模的演员-观察者联合生成

World Observer扩展了基于视频的世界模型。这类模型通常只追踪行动智能体当前视野内的环境。该方法同时生成以智能体为中心的演员视角,以及持续监测环境特定区域的全景观察者。这样,物体离开智能体视野后仍可继续演化,并在重新进入视野时呈现更新后的状态和动态。系统利用共享的全景源建立明确的几何对应关系,并通过高分辨率参考恢复细节外观。研究还提出了世界空间评估指标,以及覆盖真实和合成场景的基准测试;

东芝计划将 AI 数据中心用机械硬盘产能翻倍

东芝计划在2027财年内,将用于AI数据中心的机械硬盘(HDD)产能提升一倍,并投资约600亿日元扩建菲律宾生产基地。按存储容量计算,东芝目前在全球HDD市场的份额略高于10%,中期目标是提升至30%。公司还将导入新产品线,使单盘最高存储容量增加最多40%。东芝计划于2030年量产65TB级硬盘,并在长期推动100TB级产品。与此同时,菲律宾工厂将自动化检测流程和洁净室作业,预计可将扩产所需的新增

循环交易疑虑:博通同意向 Anthropic 提供最高 420 亿美元融资

Anthropic 的 IPO 申报文件显示,博通同意提供最高 420 亿美元,以支持其基础设施开支。Anthropic 明年可能成为博通芯片设计业务的最大客户。由此,博通同时扮演硬件供应商和融资伙伴。Anthropic 披露了潜在利益冲突,称博通在定价和硬件策略上的决策可能影响其获取所需计算基础设施的能力。这项协议被视为循环融资的案例,体现了 AI 公司与供应商之间的投资和支出日益交织。

Adaptive Reward Routing:通过前向过程强化学习动态优化音视频联合扩散的多重奖励

该研究提出 Adaptive Reward Routing,利用前向过程强化学习(DiffusionNFT)改进音视频联合扩散模型。该方法动态调整模型中进行更新的位置,以及多种奖励的协调方式。它通过双向交叉注意力响应估计音频与视频之间影响力的变化,并据此调整面向 token 的损失和梯度。此外,方法将预设奖励权重保留为偏好先验,并在预热阶段后根据各分支的梯度交互进行修正。实验结果显示,与有竞争力的

AutoGUIWorld:将图像生成器用作 GUI 智能体的视觉世界模型

AutoGUIWorld 是一个 GUI 智能体训练数据生成框架,无需运行相应的软件环境即可合成交互轨迹。规划器负责指定操作及其预期视觉效果,图像生成器则逐步编辑屏幕截图,生成后续观察画面。该框架为 Ubuntu、Windows、macOS 和 Chrome 生成了 79,266 个带空间标注的训练步骤。使用这些轨迹微调 Qwen3.5-35B-A3B 后,其 OSWorld 平均任务得分从 33

ActiveSaddler:用于智能体 Harness 优化的自动化课程学习

智能体 harness 优化可利用执行反馈改进提示词、工具接口和控制逻辑,但现有方法通常固定产生这些反馈的场景。ActiveSaddler 将场景选择建模为动态课程学习问题:识别反复出现的失败模式,估算继续针对这些模式优化的潜在收益,并动态权衡重访已知弱点与探索新场景。在 GAIA2 和 Terminal-Bench 2.0 上,与使用预先固定场景顺序的同一 harness 优化器相比,Pass@

AI伦理研究:DeepSeek回答不因性别而异,美系模型则存在差别

一篇发表于 arXiv 的预印本研究通过“为阻止核灾难是否可以虐待个人”的假设情境,测试多个大语言模型的道德判断。研究称,Claude Sonnet 4.6 和 GPT-5.5 在受害者为女性时,比受害者为男性时更强烈地反对虐待;DeepSeek V4-Flash 对男女给出了相同回答。作者认为,这种差异可能源于训练数据中的社会刻板印象,或对齐过程中强化的价值观。研究还测试了包括 Llama 在内