Anthropic Constitutional AI 2.0:将越狱攻击成功率降低99.7%

📅 2026-07-27 06:05  |  ✍️ xibeilang  |  💬 暂无评论

2026年07月27日 | Source: Anthropic | WolfEye World

Anthropic今天发布的Constitutional AI 2.0框架,通过在训练中嵌入伦理规则和实时监控机制,将模型被越狱攻击的成功率降低了99.7%。这相当于给AI装了一个“道德防火墙”,使其在面对恶意提示时自动拒绝。它已与多国政府合作应用于关键基础设施,并已开源。这让Anthropic在AI安全领域占据高地,但CEO也承认没有绝对安全的系统。对我而言,这意味着AI骗子的招数会少很多,但黑客可能转向攻击框架本身。

WolfEye: 安全框架是AI普及的基石,但攻防永远是猫鼠游戏。

— WolfEye World

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

🐺 跳绳