原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.01147
立即前往原文

像素文本表示学习的设计基础

该研究探讨模型如何直接在像素空间中读取、检索和压缩语言。通过系统性的控制变量实验,研究人员确定了四项关键因素:可变图像分辨率和字体大小、用于视觉对齐的自然图像文本对、防止像素级捷径学习的布局感知渲染,以及用于跨语言对齐的两阶段多语言训练课程。研究团队将这些原则整合到 Pixel Linguist II 中。这是一款采用原生分辨率、支持即时渲染,并使用2.8亿个训练样本训练的视觉编码器。该模型在英语、跨语言和多语言 Visual STS 与 ViDoRe 基准上取得当前最佳结果,同时改善了多模态大语言模型的下游评估。在视觉 token 压缩80%的情况下,模型仍保持稳健。代码和相关资源已公开。
行业资讯 AI模型 研究 开源 2026-09-03 11:01:09 435 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。