Anthropic发布Constitutional AI 2.0:Claude-5.5学会自我纠错
📅 2026-08-18 06:05 | ✍️ xibeilang | 💬 暂无评论
2026年08月18日 | Source: 量子位 | WolfEye World
Anthropic今天把AI安全玩出新高度,Constitutional AI 2.0框架让Claude-5.5在回答前先进行多轮自我辩论,再依据内置宪法原则修正输出。这套“内在一致性审计”机制效果显著,红队测试中对抗越狱攻击成功率从78%飙到96%,推理速度仅损失4%。更狠的是,Anthropic直接开源审计日志工具,还已向全球超40家企业授权,摆明了要当行业安全标准的制定者。这招直戳OpenAI的软肋——当大家都在拼模型能力时,Anthropic用安全框架构建壁垒。但自我纠错机制并非万能,面对复杂伦理困境,机器真的能“想清楚”吗?成本虽小,但安全叙事能否持续转化为商业优势,还需时间验证。
WolfEye: 安全即卖点,Anthropic正用标准制定权撬动OpenAI的行业主导地位。
— WolfEye World