AI 新闻中心

AI 新闻中心 过去一年分析了 8830 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

让稀疏奖励发挥作用:面向多奖励强化学习的密度感知奖励聚合

多奖励强化学习旨在训练大型语言模型同时满足多个行为目标。研究发现,即使采用针对各项奖励分别归一化的方法,不同目标之间的学习信号仍可能不均衡。论文指出,某项奖励的优势能量与其在多少比例的 rollout 组中产生非零相对信号有关。作者提出 DARA,根据每个批次中各奖励的活跃程度调整权重,让较少出现的奖励获得更大权重,同时不改变策略优化目标。在工具调用和数学推理实验中,与 GDPO 相比,DARA

通过跨执行框架适配实现检索增强型技能优化

这项研究提出检索增强型技能优化(RASO),用于改进可复用的 AI 智能体自然语言指令。RASO 从外部现有技能库中检索相关知识,并根据目标任务和智能体执行框架进行适配。初始化阶段无需运行智能体,即可构建以知识为基础的技能;随后利用执行反馈和额外检索到的知识对技能进行迭代优化。在四项智能体基准测试和两个模型上的实验中,RASO 均优于未采用检索增强初始化与更新的基线方法。

AI不再叫AI,而是“超级智能”——白宫的说法

白宫召集多位大型科技公司首席执行官,包括马克·扎克伯格、杰夫·贝索斯、埃隆·马斯克和Anthropic的达里奥·阿莫迪,签署一项AI安全承诺。美国总统唐纳德·特朗普称其具有“道德约束力”。特朗普还签署行政命令,正式将AI改称为“超级智能”。与此同时,Meta和OpenAI正为其AI产品塑造更亲切的形象。

不管叫人工智能还是超级智能,只有 2% 的消费者会购买

文章指出消费者购买人工智能产品的意愿较低,称只有 2% 的消费者会购买。本周,白宫召集了多位科技行业领袖,包括扎克伯格、贝索斯、马斯克和 Anthropic 的达里奥·阿莫代,共同签署人工智能安全承诺。美国总统唐纳德·特朗普称该承诺“具有道德约束力”。特朗普还签署行政命令,正式将人工智能改称为“超级智能”。与此同时,Meta 和 OpenAI 正在让旗下人工智能产品显得更加亲和。