AI 新闻中心

AI 新闻中心 过去30天分析了 911 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Gricea:面向对话式 AI 研究的开放科学平台

Gricea 是一个开放科学平台,将对话式 AI 研究表示为可配置、可部署的研究成果。研究人员可以运行、检查、分享和复用这些成果。平台将研究流程、面向参与者的系统以及对话任务行为结合起来。在一项复现研究中,Gricea 复现了符合条件的 CUI 2026 论文中 93% 的配置,同时发现 96% 的论文缺少会妨碍忠实复现的信息。用户研究表明,来自不同背景的研究人员和从业者能够构建可运行的研究,以探

GAVEL:利用图世界模型验证并提升大语言模型长期任务规划效率

GAVEL是一种用于验证和修复大语言模型生成的长期机器人规划的框架。其显式图世界模型表示物体关系、动作的前置条件与效果,以及对未观测物体位置的概率信念。系统因此能够在执行前预测动作后果、检测约束违规,并直接修复可根据世界模型确定解决方案的错误。只有需要语义推理的错误才交由大语言模型重新规划。在BEHAVIOR-1K评测中,使用Qwen3-8B时,GAVEL将100个单一长期任务的成功率从41.2%

APort Vault借助Open Agent Passport评测AI代理支付授权能力

APort Vault是一项用于评测工具型AI代理支付授权能力的基准测试。研究重放了针对一个在线支付代理的4,371次人工编写攻击,覆盖8家实验室的14个模型、5种策略配置和225,964次评估。加入基于Open Agent Passport规范的确定性执行前检查后,69,297笔向未获授权收款人的转账中没有一笔被放行;未加入该检查时,76,842笔中有140笔被放行。该机制并非简单拒绝所有支付,

RefineEdit:基于生成式细化网络的免训练 Prompt-to-Prompt 图像编辑

RefineEdit 是一种无需额外训练的文本引导图像编辑框架。它通过对二进制图像编码进行全局细化,将编辑区域定位与内容生成结合起来,使系统能够随着图像生成过程重新评估需要修改的区域。编辑分支从源图像的中间状态初始化,并与源分支比较,以选择可编辑的位置和比特。自适应空间冻结和临时比特锁定用于限制掩码不必要的扩张。该方法不需要额外训练、外部掩码或注意力控制。在 PIE-Bench 的九类编辑任务中,

IntBMoE通过块条件专家组合实现全参与式混合专家模型

IntBMoE是一种混合专家模型架构,旨在将专家参与度、计算成本和内存需求相互解耦。轻量级超网络动态组合专家基底,而路由器只将每个令牌发送到少量区块。这样,每个组合专家都能利用完整专家池的信息,同时避免密集型MoE的执行成本。研究在图像分类、语言建模和序列推荐任务上进行了实验,结果显示其优于多种稀疏和密集基线模型。作者表示,IntBMoE已部署于高德地图的生成式推荐系统,在60毫秒延迟预算下服务数

面向干细胞显微成像的 Cellpose-SAM 保持性能约束后训练量化

该研究评估了分割基础模型 Cellpose-SAM 的压缩方法,目标是在实验室 CPU 和边缘硬件上部署。在覆盖三种成像模态的 176 个显微视野分层数据集上,仅量化权重的 W8A16 在所有模态中均满足预先设定的性能保持标准。采用四个 INT8 例外的敏感度引导混合 W4/W8 方法,将权重存储需求减少了 6.76 倍,且在评估视野中未出现灾难性失败。三值权重量化虽然实现了 12.08 倍压缩,

OmniVChat:原生音视频对话的合成、基准测试与训练

OmniVChat是一种对话形式:全模态模型直接同时接收用户的音频和视频,并以文本回复,不需要单独的文本问题、外部字幕生成或语音识别。由于真实用户录制数据稀缺,且开放式回答难以通过关键词匹配评估,研究团队提出多智能体数据引擎OmniVChat-Studio,用于合成单轮和多轮音视频对话。研究人员据此构建OmniVChat-Bench,评估五项基本对话能力,并提出OmniVChat-RL,在强化学习

价值几何:通过任务向量组合对齐语言模型的伦理偏好

一项研究提出了一个包含12,000个二选一困境的数据集,涵盖诚实、公正与自主性之间的两两价值冲突,并提供印地语、阿拉伯语、西班牙语和中文译本。在未指定政策时,GPT-5-mini在测试的五种语言中都稳定地偏好诚实而非自主性。小型Llama-3.2模型则明显偏向第一个选项;但普通微调和直接偏好优化能够有效消除这一偏差,使准确率提升至98%以上。研究人员还将任务向量与通用指令遵循向量进行正交化,以分离

OceanBase 登顶国际 Data Agent 榜单,超过多项 GPT 和 Claude 方案

OceanBase 表示,其 Data Agent 方案 Scout 在国际数据智能体基准 DAB 中以 90.62% 的准确率排名第一,成为首个准确率超过 90% 的参评方案。该系统基于国产数据库 OceanBase 和大模型 GLM-5.2 构建,超过了多项基于 GPT、Claude 等模型的 Data Agent 方案。DAB 不仅考察自然语言转 SQL,还评估系统理解复杂数据、选择数据、规

FRAUDSkill:面向音频反欺诈检测的结构化冻结权重技能优化

FRAUDSkill是一种无需修改大型音频语言模型内部权重的适配框架。该方法转而优化外部技能程序、路由专属策略和决策规则,以执行三阶段流程:识别服务场景、检测欺诈,并在必要时分类欺诈类型。研究还结合验证引导的多路径推理,以提高输出对既定流程的遵循程度。在TeleAntiFraud基准测试中,FRAUDSkill取得73.50%的Macro-F1,相比共享冻结模型基线提升31.96个百分点,同时将无

TeleAntiFraud 2.0:可更新、基于画像的语音电信诈骗检测基准

电信诈骗话术变化迅速,而且常常伪装成普通客服通话。TeleAntiFraud 2.0提出按月冻结的评测集,在加入新诈骗模式的同时不覆盖既有测试集,并要求模型区分诈骗通话与合法、但处于相近领域的通话。每个评测集包含900段中文通话,其中600段为诈骗,300段为非诈骗。受控文本实验显示,分类器面对无关或普通负例时可达到完美的Macro-F1,但面对相近领域的负例时,得分降至0.65至0.68。完整音

基于信息瓶颈的训练自适应卷积稀疏编码,用于鲁棒视觉表征

该研究提出了一种用于鲁棒视觉表征的训练自适应卷积稀疏编码框架。方法将 FISTA 优化过程展开为可训练网络,并让稀疏系数与网络参数联合学习,而不是手动设定。从信息瓶颈角度看,该系数控制冗余信息压缩与任务相关信息保留之间的权衡。研究还提出了一种无标签的训练后策略,在固定主网络参数的情况下,针对受损输入调整压缩强度。CIFAR 和 ImageNet 实验表明,该方法在干净数据上的识别性能具有竞争力,并