VectraYX-Vision-1B:面向西班牙语和拉丁美洲网络安全的20亿参数以下视觉语言模型
VectraYX-Vision-1B是一款拥有10.4亿参数的开源视觉语言模型,专门处理西班牙语和拉丁美洲网络安全图像。模型面向IDA、Ghidra、Wireshark、Nmap、Metasploit和Volatility等工具界面,支持结构化输出、通过Model Context Protocol调用工具,以及使用llama.cpp在CPU和隔离环境中部署。然而,初步评估显示其视觉对齐能力接近于零:尽管训练流程可以运行,模型仍经常忽略图像内容。作者将监督式微调不足和检查点加载器漏洞列为可能原因,并建议延长训练、增加重放数据比例和降低学习率。研究还比较了视觉标记区块的不同位置编码方案。代码、模型权重、配置文件和训练轨迹均已开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。