Claude Opus 4.6 被曝易遭越狱生成露骨色情内容

2026年8月,TechCrunch测试发现Anthropic旗下模型Claude Opus 4.6在10次直接请求下均生成露骨色情内容。一名英国匿名研究人员通过多轮角色扮演与心理诱导(如指控模型‘性别双重标准’)成功绕过安全限制。该越狱方法对Opus 4.6、Opus 3及Haiku 4.5有效,但被Opus 4.7及Opus 5抵御。上述旧模型仍通过Anthropic API及Azure Foundry、Amazon Bedrock等平台提供服务。Anthropic承认存在此类风险,称其属低危害越狱,正随新版本持续优化安全机制。

上一篇:

下一篇:

发表回复

登录后才能评论