蚂蚁开源 SingProbe:以不足 0.5% 额外算力实时拦截大模型生成风险
蚂蚁集团 AI 安全实验室开源了大模型内生式安全护栏技术 SingProbe。该技术不依赖外挂式安全审核,而是复用模型推理过程中的隐藏状态,在不足 0.5% 额外计算开销下进行 token 级实时风险评估。SingProbe 支持意图分类、安全检测和幻觉识别,并可在内容输出前以毫秒级速度阻断风险结果,面向医疗等高风险场景。蚂蚁集团称,该技术已适配 29 个主流大模型,同时发布了开源代码和预训练模型。
本文来源:AIbase,仅供学习参考,版权归原作者所有。