原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.34754
立即前往原文

Draft-KV:学习语言模型之间有用的潜在通信

潜在通信在语言模型之间传递内部状态,而非解码后的文本。但接收模型准确率提高,并不能单独证明它利用了消息内容。在五组方法与数据集的实验中,将消息替换为来自无关问题的消息,准确率变化最多为0.60个百分点。Draft-KV改为传递发送模型针对当前问题起草答案时形成的键值状态。两个模型均保持冻结,只训练包含105万个参数的接口。以Qwen3-8B为发送模型时,冻结的Qwen2.5-0.5B-Instruct接收模型在MMLU-Redux上达到78.04%;不进行通信时为37.45%,使用重新分配的消息时为36.40%。
行业资讯 AI模型 研究 2026-09-29 14:01:31 830 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。