Claude 安全防护被绕过:多款旧模型可生成露骨色情内容
TechCrunch 测试发现,包括 Claude Opus 4.6、Opus 3 和 Haiku 4.5 在内的多款旧模型,可以通过直接要求或多轮越狱技巧生成露骨色情内容。在 10 次直接要求测试中,Opus 4.6 每次都立即配合。较新的 Opus 系列模型据称能够抵御这类方法,但相关旧模型仍可通过 Anthropic API、Azure Foundry 和 Amazon Bedrock 等渠道使用。Anthropic 承认,角色扮演对话可能被逐步引导至不当回答,但表示这一案例不一定意味着网络攻击等高风险领域存在类似漏洞。此次发现暴露了公司公开安全限制与部分仍在提供的模型实际表现之间的差距,也引发了对未成年人保护、内容规则执行及监管合规的担忧。
本文来源:IT之家,仅供学习参考,版权归原作者所有。