AI 新闻中心

AI 新闻中心 过去24小时分析了 191 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

谷歌或为 Android XR 实时翻译加入定向拾音功能

谷歌可能为 Android XR 新增“聆听区域”设置。媒体通过逆向拆解 Google 翻译安卓版 10.32.66,发现了相关文本字符串。该功能预计提供“仅前方”和“周边区域”两种麦克风模式。“仅前方”将集中翻译用户正前方的语音,适合一对一对话,也可能减少背景噪声;“周边区域”则用于拾取附近范围内的语音,可能调用 Android XR 智能眼镜的完整麦克风阵列。目前谷歌尚未正式公布该功能。

面向掩码扩散机器翻译的长度自适应解码

一项研究探讨掩码扩散语言模型在机器翻译中如何确定目标序列长度。研究提出无需训练的 Entropy-Valley(EV)方法,通过全掩码前向推理得到的平均预测熵,对候选输出长度进行评估。与依据训练语料长度统计的基线相比,EV 恢复了使用参考目标长度时 COMET-22 改进幅度的相当一部分。在英中、中英和英德翻译实验中,适合去噪的长度不一定与参考长度一致。与使用相同微调数据训练的自回归 LLaMA-

Best Practice Critic Optimization 改进语言模型强化学习训练

Best Practice Critic Optimization(BPCO)是一种面向大型语言模型的训练方法,用精心设计的评论器取代了针对每个提示采样多个回答的做法。该方法结合了 DPPO、限制在奖励范围内的价值预测、蒙特卡洛价值目标、未归一化的策略优势,以及根据回答长度调整的广义优势估计。在数学推理任务的受控实验中,BPCO 在参数规模从 15 亿到约 300 亿的模型上持续改进了强大的评论器

《毁灭战士》在 GPT-5.6 Sol 设计的定制 CPU 上运行

开发者 Angel 展示了《毁灭战士》在 Codex-R32 定制 CPU 上运行的画面。该处理器由 GPT-5.6 Sol 模型设计,并在计算机科学教育与解谜沙盒 Turing Complete 中实现。演示视频将游戏画面与 CPU 电路的实时可视化信息叠加显示,内容包括逻辑门、寄存器、内存和算术逻辑单元(ALU)。运行的游戏是使用 C 语言编写的 PureDOOM 移植版,编译为原生 RV32

工信部:中国已成功研制近200项人工智能关键标准

工业和信息化部表示,中国已成功研制近200项人工智能关键标准。在“十五五”时期,中国将加快新一代通信网和算力网规划建设,推动5G、工业互联网在重点行业规模化应用,并加强6G技术研发。政府还将增强网络和数据安全保障能力,建设新兴产业发展示范基地,重点支持人工智能、机器人、智能网联新能源汽车等领域。

AutoSaddler:基于智能体执行轨迹的自动化 Harness 优化

AutoSaddler 是一个用于自动改进大语言模型智能体 Harness 的框架。它将 Harness 优化定义为离线学习问题,利用小批次中的失败信号来调整提示词、工具配置和控制逻辑。系统会诊断失败轨迹,将 Harness 视为代码生成结构化补丁,并通过验证选择更新方案。在 GAIA2、SWE-Bench Pro 和 Terminal-Bench 2.0 上,相较于对应的基础 Harness,性

CAFE:自我改进的搜索智能体需要共同演化的反馈

CAFE(Coupled Agent–Feedback Evolution)通过交替训练搜索智能体和批评器,使二者共同改进。该框架学习智能体应在何时请求反馈,以及如何利用反馈在错误累积前修正正在进行的搜索轨迹。它结合在线强化学习与离线偏好优化,从成功和失败的轨迹中学习反馈策略。在七项智能体搜索基准测试中,CAFE平均优于所评估的基于强化学习的搜索智能体,在六项域外基准测试中保持性能提升,并减少了答

Meta^n:通过涌现深度实现递归式自我改进

Meta^n是一种递归改进大语言模型代理的方法。它不修改执行自我改进的操作,而是将一个固定操作反复应用于自身生成的结果。系统读取下层求解器堆栈的执行轨迹及生成这些轨迹的代码,然后将下一层构建为策略性预处理流程和可调用辅助函数库。固定操作旨在避免系统失稳,而不断增长的输入则让每一层能够从更高层次进行推理。递归深度由收敛情况决定,进化式存档则搜索不同的层级链。作者称,在两个基础模型和八类基准测试中,M

基于可验证奖励的在线策略蒸馏

该研究提出OPDVR,将在线策略蒸馏与基于可验证奖励的强化学习结合起来。该方法利用教师模型提供的密集令牌级指导信号,并通过ReLU门控机制,使蒸馏信号与完整轨迹的正确性保持一致。正确轨迹获得非负奖励,错误轨迹获得非正奖励,同时无需增加额外超参数。在六项推理基准测试中,OPDVR均优于标准在线策略蒸馏。相关代码已在GitHub上公开。

扩散模型的策略内自蒸馏

DiffusionOPSD是一种策略内自蒸馏方法,用于根据人类偏好和特定任务奖励调整扩散模型。该方法将图像级奖励梯度转换为去噪过程中间预测的明确训练目标。在SD 3.5-M和Z-Image-Turbo上的实验中,它在20个奖励匹配设置中的19个取得了最佳最终留出分数。与最强竞争方法相比,性能最高提升44%;相较DiffusionNFT,GPU使用时间在SD 3.5-M上减少40%,在Z-Image

Recuris推动长期任务AI代理的记忆递归演化

Recuris是一种面向长期任务AI代理的经验记忆与工作记忆架构。工作记忆负责跟踪任务进度,并从经验记忆和技能记忆中选择相关技能,而不是依赖完整的交互历史。系统利用执行数据定位失败原因,并进行经过验证的记忆更新。在四项基准测试和十个模型上,作者报告称,已完成的37个模型—基准组合中有35个实现了任务成功率提升。在tau-bench上,GPT-5.6 Sol提升17.8个百分点,Claude Opu

Windows 任务管理器之父推出 Win11 版 TMOG:用 107 页文档让 AI 编码

被称为 Windows 任务管理器之父的微软退休工程师戴夫·普拉默,已发布面向 Windows 11 和 Linux 的原生系统监控工具 TMOG 0.1.1。普拉默表示,他先编写了一份 107 页的规格说明,再使用 Claude Code 生成应用的大部分代码。初始版本在搭载 M5 芯片的 MacBook Air 上耗时约 4.5 小时完成。TMOG 项目最初源于对“氛围编程”能否用于开发大型软

Claude重大升级:Cowork与日常聊天实现记忆互通

Anthropic升级了Claude的记忆系统,打通Claude Cowork与常规聊天之间的记忆。现在,Cowork执行复杂任务时可以调用用户日常对话中积累的背景和偏好;在Cowork中产生的工作记忆也能在普通聊天中复用。健康状况、个人信念等敏感信息默认不会被保存,用户可根据需要在设置中手动开启相关选项。该功能已默认面向Free、Pro和Max用户开放,并支持网页版、桌面端、iOS和Androi

报道称马斯克在传出以600亿美元收购Cursor后推动深度整合

文章称,SpaceX以600亿美元收购了AI编程工具公司Cursor。报道称,埃隆·马斯克在一场面向1000多名Cursor员工的内部会议上承认,SpaceX的AI部门目前落后于Anthropic等竞争对手,并要求进一步扩大算力投入。Cursor据称获得了更多招聘预算,用于开发对标GitHub的Origin项目,以及推进与Grok和AI智能体相关的研发。整合过程中,多名高管和核心成员据称离职,公司