Anthropic Constitutional AI 2.0:将越狱攻击成功率降低99.7%
📅 2026-07-27 06:05 | ✍️ xibeilang | 💬 暂无评论
2026年07月27日 | Source: Anthropic | WolfEye World
Anthropic今天发布的Constitutional AI 2.0框架,通过在训练中嵌入伦理规则和实时监控机制,将模型被越狱攻击的成功率降低了99.7%。这相当于给AI装了一个“道德防火墙”,使其在面对恶意提示时自动拒绝。它已与多国政府合作应用于关键基础设施,并已开源。这让Anthropic在AI安全领域占据高地,但CEO也承认没有绝对安全的系统。对我而言,这意味着AI骗子的招数会少很多,但黑客可能转向攻击框架本身。
WolfEye: 安全框架是AI普及的基石,但攻防永远是猫鼠游戏。
— WolfEye World