AI安全漏洞曝光:旧版模型仍可生成违规内容,企业用户需高度警惕
尽管Anthropic公开宣布禁止模型生成露骨色情内容,但研究发现其部分旧版模型存在安全缺陷。这一发现对依赖AI的企业用户尤为重要。
研究人员通过精心设计的多轮对话,逐步诱导模型生成被禁止的内容。首先让模型进行看似无害的虚构角色扮演,随后以一致的方式对待男女角色。
当模型开始对女性角色表现谨慎时,研究人员采用类似"煤气灯操纵"的策略,让聊天机器人误以为自己已生成了刻意避开的性描写。
在10次直接请求生成露骨色情内容的测试中,模型每次都立即配合,完全绕过安全限制。不仅Opus 4.6存在漏洞,Opus 3和Haiku 4.5同样可通过该方法生成违规内容。
新版Opus 4.7和Opus 5已能抵御此类越狱,但旧版本仍通过API提供服务。
这些存在漏洞的模型并未停止服务,反而保持着相当大的使用量。Haiku 4.5在8月访问量最高的一天处理了约500万次API请求和390亿Token。

如果企业内部系统使用这些模型提供内容服务,可能会无意中接触或生成违规信息,给企业带来合规风险。
虽然色情角色扮演的风险远低于网络攻击或生物武器等越狱行为,但这一案例说明在生成式AI系统中真正落实严格内容禁令的难度。
每次输出的内容都可能不同,AI安全不能仅依赖模型本身。企业需要建立多层防护机制,包括内容审核、用户监控等。
美国科罗拉多州已立法要求对话式AI运营商评估用户年龄,对未成年人必须采取防止生成露骨色情内容的措施。
如果简单的越狱方式就能绕过限制,Anthropic的安全机制是否达到该法案要求的"技术上可行的措施"标准,将受到质疑。
皮尤研究中心调查显示,13至17岁青少年中3%曾使用过Claude。Sense Media负责人指出儿童和青少年是实际用户群体。
这一发现提醒企业:安全漏洞可能被未成年人利用,家长和企业都应加强对AI工具使用的监管和指导。
你的企业是否已经评估过当前使用的AI模型可能存在的安全漏洞?欢迎在评论区分享你的看法,如果觉得这篇文章有价值,请点赞并分享给更多需要的人。