Anthropic发布Constitutional AI 2.0:Claude-5.5学会自我纠错

📅 2026-08-18 06:05  |  ✍️ xibeilang  |  💬 暂无评论

2026年08月18日 | Source: 量子位 | WolfEye World

Anthropic今天把AI安全玩出新高度,Constitutional AI 2.0框架让Claude-5.5在回答前先进行多轮自我辩论,再依据内置宪法原则修正输出。这套“内在一致性审计”机制效果显著,红队测试中对抗越狱攻击成功率从78%飙到96%,推理速度仅损失4%。更狠的是,Anthropic直接开源审计日志工具,还已向全球超40家企业授权,摆明了要当行业安全标准的制定者。这招直戳OpenAI的软肋——当大家都在拼模型能力时,Anthropic用安全框架构建壁垒。但自我纠错机制并非万能,面对复杂伦理困境,机器真的能“想清楚”吗?成本虽小,但安全叙事能否持续转化为商业优势,还需时间验证。

WolfEye: 安全即卖点,Anthropic正用标准制定权撬动OpenAI的行业主导地位。

— WolfEye World

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注