Anthropic发布Claude 4 Ultra,推理能力首次超越人类专家基准
📅 2026-08-13 18:05 | ✍️ xibeilang | 💬 暂无评论
2026年08月13日 | Source: Anthropic官方 | WolfEye World
今日凌晨,Anthropic发布旗舰模型Claude 4 Ultra,在ARC-AGI-2基准测试中拿下78.3%的得分,首次超过人类专家75%的平均水平。这背后靠的是名为“递归思维树”的新型推理架构,把复杂问题拆成可验证的子逻辑链,像解数学题一样一步步检查,从而把“幻觉”现象大幅压下去。官方数据显示,在数学证明和代码生成任务中,错误率比上一代降了62%。定价方面,每百万tokens 45美元,比Claude 3.5 Sonnet贵三成,但官方强调综合成本因错误率下降反而更低。业内普遍认为,这是对OpenAI GPT-5.2市场份额的直接冲击。对普通用户来说,更少的错误意味着更可靠的结果,但价格门槛依然摆在那里。
WolfEye: 推理能力超越人类基准,AI从辅助工具走向独立解题者,OpenAI的护城河裂了。
— WolfEye World