原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.35279
立即前往原文

衡量同质 LLM 辩论中的崩溃与纠正

这项研究提出了一套可审计的方法,用于记录同质 LLM 群体辩论中的有害崩溃和有效纠正。在 6,925 场使用 MMLU-Pro 题目的辩论中,研究发现了 253 次崩溃。一种先排除一个模型、再依据探测结果冻结辩论的方法避免了 29 次崩溃,但在等权重条件下也损失了 108 次纠正。研究结果表明,仅以防止崩溃为标准评估干预措施,可能得出错误结论。研究团队还发布了可重放的方案、审计工具和用于重建实验的脚本。
行业资讯 AI模型 研究 2026-09-29 14:01:31 711 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。