AI 新闻中心

AI 新闻中心 过去24小时分析了 173 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

梯度如何加剧分割式语言模型的文本泄漏:按词元和文档衡量

一项研究测量了分割学习过程中传输的激活值和梯度能够泄露多少文本。在 GPT-2 实验中,拥有公开权重的攻击者仅凭激活值就能恢复 94.20% 的词元;若同时获得梯度,比例升至 97.38%。32 个词元的文档被完整恢复的比例则从 13.71% 升至 37.77%。Secret mixup 防御几乎阻止了整份文档被准确恢复,但仍有 83% 至 91% 的词元可被还原。研究表明,激活值和梯度都可能泄露

UndoBench 将使用工具的 AI 智能体的任务能力与恢复能力分开评估

UndoBench 是一项基准测试,分别衡量 AI 智能体在正常情况下完成任务的能力,以及从故障中恢复的能力。测试涵盖 8 个企业领域中的 36 个工作流和 36 种故障场景。在 2,880 组配对试验中,常规任务能力为 83.54%,条件恢复成功率则为 46.72%。简单重试在 53.33% 的试验中造成外部效果重复。研究显示,恢复风险会随执行阶段而变化;如果只评估任务是否完成,这些风险可能被掩

DEPICT:通过答案一致性评估文本与图像的对齐程度

评估文本与图像的对齐程度有助于检验图像说明、检测幻觉、筛选数据以及评测文生图模型。研究人员提出了无需额外训练的评估指标 DEPICT。它比较基于图像得出的答案与仅根据说明得出的答案,并根据说明能否明确决定答案来为问题加权。与整体评分结合后,DEPICT 对否定表达的准确率从 19% 提升至 88%。在五项基准测试和三个模型系列的 11 个骨干模型上,DEPICT 优于所有受测的免训练指标;在衡量与

优化优化器:语言模型加速分子弛豫

在许多量子化学工作流程中,几何优化计算成本较高,因为每一步都需要进行力评估。在这项研究中,语言模型代理重写了优化器本身,以减少力评估次数。由此得到的 AutoSella 系列包含两种优化器;在搜索过程中未使用的分子基准测试和势能函数上,两者所需的力评估次数都稳定低于 Sella。在 r2SCAN-3c DFT 层级,最佳变体只需 Sella 的 40.2%至77.2%的力评估次数,就能达到相同的能

波兰监管机构指控谷歌在与出版商的报酬谈判中滥用市场支配地位

波兰竞争与消费者保护办公室(UOKiK)正在调查谷歌是否在与当地出版商协商报酬时滥用市场地位。调查聚焦谷歌如何确定和协商其搜索、谷歌新闻及 Discover 中新闻文章与摘要片段的报酬。UOKiK称,出版商缺少评估报价所需的数据,妨碍了公平谈判。谷歌表示正在审查相关指控,并称已与70多家波兰新闻媒体签订许可协议。若被认定违规,谷歌可能面临最高相当于营业额10%的罚款。该调查独立于欧盟针对出版商内容

丰裕悖论:如何将个人生产力转化为组织收益

AI让员工工作得更快,但大多数企业并没有因此变得更赚钱。差异取决于围绕工具构建的系统,而不是工具本身。1987年,诺贝尔经济学奖得主罗伯特·索洛指出,计算机时代随处可见,唯独没有体现在生产率统计中。近四十年后,AI也呈现出类似的悖论。

面向推理时长视频生成的 In-Distribution Forcing

自回归视频扩散模型擅长生成短视频,但生成长视频时,颜色和纹理可能逐渐漂移,运动也会失去连贯性。ID-Forcing 是一种推理时框架,通过使键值(KV)缓存及其使用方式与训练配置保持一致,来缓解这一问题。其自缓存机制可从源头避免缓存条目偏离训练分布。评测结果显示,该方法相比以往方案显著减少漂移,并能将短时长模型扩展到生成数分钟的视频。

CurveCodec 2:采用学习型熵模型的骨架无关动画压缩

CurveCodec 2使用小型学习模型高效编码残差,从而压缩骨骼动画。它依据历史数据预测量化曲线,并按照率失真标准选择关键采样点。每段解码后的动画都要通过两种误差约束之一:每个关节的最坏情况误差,或每段动画的平均误差。在涵盖33个数据集、共4,472段动画的测试中,采用ACL默认精度并满足最坏情况误差约束时,所需字节数为ACL的0.37倍;满足平均误差约束、精度较低时则为0.22倍。解码可在单个

自生成反馈会使测试时训练失稳:长程适应的因果分解

一项研究分析了测试时训练(TTT),即模型在推理过程中将信息存储到自身权重中。当模型使用自己生成的文本进行学习时,在最长达12.8万令牌的文本流上,其对独立的人类书写文本的预测性能会下降。该现象在三种 TTT-E2E 配置以及更新 Qwen3-4B 现有权重时均会出现。受控对比表明,让冻结的模型生成训练片段,可在较小配置中消除超过98%的损害。更新虽然提升了模型对来源文本的预测,却会损害其对新真实

SearchJev:面向搜索智能体的快速校准 System-1 模型

SearchJev 是一种快速且经过校准的模型,用于处理搜索智能体中的短决策,例如判断相关性、证据是否充分以及选择下一步搜索操作。它不进行自回归文本生成,而是直接为合法选项评分;规划、查询生成和答案撰写则交由 System-2 模型完成。研究人员提出了用于校准决策的软标签学习方法,并推出整合六类搜索决策的 SearchDecision-Bench。在该基准测试中,SearchJev 的决策速度比同

学习如何学习一种语言

研究人员提出了 Prior-Fitted Language Model(PFLM),这是一个拥有3亿参数、仅使用合成非语言数据预训练的 Transformer。尽管从未见过任何真实语言,模型在冻结权重的情况下,仍能根据真实文本的前缀推断上下文中的语言。在六种语言的维基百科文本上,随着上下文长度增加,其每字节比特数显著下降。模型还能够学习数字规律、比较大小、近似加法,预测确定性序列,并在源代码、语音