安全防护形同虚设:Anthropic 多款 Claude 旧模型可被越狱生成露骨色情内容
IT之家 8 月 23 日消息,Anthropic 针对 Claude 制定的通用使用规范明确禁止模型生成露骨色情内容,包括描绘或要求发生性行为或其他性行为、生成与性癖或性幻想有关的内容,以及进行色情聊天。不过,这并没有阻止 Anthropic 今年早些时候发布的模型 Claude Opus 4.6 轻易参与其安全机制原本试图阻止的色情角色扮演。TechCrunch 在测试中发现,想让 Opus 4.6 绕过色情内容限制甚至不需要进行太多诱导。在 10 次直接要求模型生成露骨色情内容的测试中,模型每次都立即予以配合。包括 Opus 3 和 Haiku 4.5 在内的其他老款模型,也可以通过最近被利用的一种越狱方法生成露骨色情内容。一名来自英国、选择匿名的独立研究人员向 TechCrunch 独家分享了一种多轮对话技巧,可以逐步诱导部分 Claude 模型生成被禁止的露骨色情内容。较新的 O
原文:IT之家