LMSM:受 Linux Security Modules 启发的 LLM 安全框架
LMSM 将 Linux Security Modules 的设计应用于大语言模型服务。该框架将经过校准的安全证据、版本化策略评估,以及缓冲输出的发布授权彼此分离。原型系统可在 Hugging Face Transformers 和 vLLM 中支持稀疏自编码器、转换器和密集探针。在 Qwen3-4B 上,LMSM-Checkpoint 将 HarmBench 攻击成功率从 39.20% 降至 3.32%,但 XSTest 的错误拒答率从 2.40% 升至 4.40%。在 32 个活跃序列下,其吞吐量达到不执行监控工作的匹配服务路径的 98.14%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。