AI 新闻中心

AI 新闻中心 过去一年分析了 8787 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

用于 CVaR 策略评估的尾部影响采样

使用条件风险价值(CVaR)准确估计策略的下尾风险,可能需要大量且成本高昂的样本。新方法将固定查询预算分配给工作流中对 CVaR 影响最大的条件组件。在特定假设下,尾部影响采样(TIS)可达到 oracle 分配的渐近方差;带保护机制的变体则控制在 oracle 的两倍以内。在 CliffWalking 中,TIS 相较两种基线方法分别将均方误差降低 41% 和 76%。在使用冻结语言模型的审查流

RealCompanion:通过推理长期真实对话评测人类理解能力的基准

RealCompanion收录了10段与AI伴侣建立的真实关系,共27,218条消息,时间跨度最长达120天。基准数据包括对话,以及据此整理的个人档案、人物设定、对话标准答案和问题;每项内容都标明了所依据的消息。研究发现,相关记忆很少是必需的,所需信息也很少来自久远以前。简单地检索近期消息,就能为95.9%的问题找到所需内容,但实际需要记忆的问题仅占2.2%。受测方法也无法可靠判断何时需要调用记忆

从梯度到能力:理解多教师在线策略蒸馏

这项研究考察多个经强化学习训练的教师模型信号,如何影响共享学生模型的参数更新和学习结果。基于 Qwen3-1.7B 的实验显示,按 token 求平均会使较长回答获得更高权重,而 Adam 会缩小教师梯度差异在最终更新中的体现。BF16 舍入也会掩盖许多细微变化。基于概率最高的 64 个 token 计算的 KL 梯度与全词表梯度接近,但其对数学准确率的影响取决于平均方式。

OpenAI 将在欧盟为 ChatGPT 和 Codex 文本输出添加隐形水印

OpenAI 计划在未来几周内,为欧盟符合条件的 ChatGPT 和 Codex 用户提供带有机器可识别隐形水印的部分文本输出。名为 textGrain 的技术会在选词过程中嵌入统计信号,供检测器识别。该功能上线时不会在全球默认启用;API 客户可选择为部分模型开启水印。OpenAI 还计划向获批的研究人员和专业组织开放检测器。工具只会报告是否检测到 OpenAI 水印,不会透露用户身份、提示内容