直接问 Jev:通过校准决策强化学习零样本检测 AI 对齐失效
一项研究评估了经过校准决策强化学习训练的模型 Jev,能否检测语言模型的对齐失效。研究团队推出 RLCDAlignBench,涵盖 10 类失效、44 项基准测试和 5 个目标模型。仅使用一个通用问题,零样本中位数 AUROC 即达到 0.886,并在多数基准测试中超过监督式基线。Jev 与参考评分器在人工标注上的一致程度相当,也揭示了部分现有基准的缺陷。研究称,其成本比基于 LLM 评审的评分低
AI 新闻中心 过去24小时分析了 169 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究评估了经过校准决策强化学习训练的模型 Jev,能否检测语言模型的对齐失效。研究团队推出 RLCDAlignBench,涵盖 10 类失效、44 项基准测试和 5 个目标模型。仅使用一个通用问题,零样本中位数 AUROC 即达到 0.886,并在多数基准测试中超过监督式基线。Jev 与参考评分器在人工标注上的一致程度相当,也揭示了部分现有基准的缺陷。研究称,其成本比基于 LLM 评审的评分低
音乐初创公司 Thoughtful Things 已在 Kickstarter 上为其首款乐器 Engram 发起众筹。这款采样器与 Groovebox 结合了 AI,可对输入音频进行重塑,甚至生成全新的声音。不过,Engram 并不是装进盒子里的 Suno:它并非通过按键即可制作适合主流排行榜的成品歌曲,而是定位为实验性音乐创作工具。
Instagram的Pixel特效可以通过文字提示模糊Story中的人物。这项功能可能被用来低调暗示恋情,因此引发了讨论。
在Equity节目中,讨论了Meta的AI公告如何抢走了OpenAI和Anthropic的风头。