原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.15991
立即前往原文

Functionalizer:面向子词标记化的无损功能分解

研究人员提出了一种预标记化框架,将大小写、变音符号和字符重复等正字法变化表示为作用于规范基础词元的可逆运算符。该方法以更小的词汇完整覆盖自然语言和代码语料库;在无约束测试中,所需词汇槽位最多减少19.7%。在拥有9800万参数的GPT-2模型上,Python代码的语法有效率从7.70%提高到9.12%,自然语言文本中的重复n-gram也有所减少。不过,该方法仍需在生产规模上进一步验证。
行业资讯 AI模型 研究 2026-09-23 00:31:03 900 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。