OpenClaw—AI研究OpenClaw—AI研究
  • AI动态
  • OpenClaw教程
  • 技术解读
  • 用户故事

Anthropic Opus 5 登顶 ARC-AGI-3 抽象推理基准测试

Anthropic Opus 5 登顶 ARC-AGI-3 抽象推理基准测试

2026年7月29日 by WoodStone

2026 年 7 月 29 日,Anthropic 发布的旗舰人工智能模型 Opus 5 在 ARC-AGI-3 抽象推理基准测试中以 87.3% 的得分登顶榜首,超过 OpenAI GPT-5.6 的 82.1% 和 Google Gemini 3 Pro 的 79.8%。这一成绩标志着大模型在抽象推理能力上首次接近人类专家水平,引发业界对 AGI 路线图的广泛讨论。

Anthropic Opus 5 登顶 ARC-AGI-3 抽象推理基准测试

ARC-AGI-3 是由 François Chollet 团队设计的第三代抽象推理基准,包含 800 道全新题目,要求模型在零样本或少样本条件下识别图形变换规律。前两代基准中,大模型长期落后于人类 30-50 个百分点,而 Opus 5 在第三代的领先优势凸显了 Anthropic 在训练目标和 RLHF 流程上的持续投入。

Anthropic 在官方博客中透露,Opus 5 采用了全新的”分块推理 + 自检”训练范式:模型在生成答案前先对问题进行结构化分解,再由内部评估模块对每个推理步骤打分。这种方法在数学竞赛、代码生成等需要多步推理的任务上同样带来了 15-25% 的提升。

Anthropic Opus 5 登顶 ARC-AGI-3 抽象推理基准测试

独立 AI 安全研究机构 METR 对 Opus 5 进行了长达 6 周的红队测试,确认模型在拒绝有害请求、对齐稳定性、长上下文一致性三个维度均未出现明显退化。Opus 5 在 1M token 上下文窗口测试中保持了 91% 的指令遵循率,优于同类产品。

值得关注的是,ARC-AGI-3 的设计者 Chollet 指出,即便 Opus 5 得分接近人类,基准本身仍然是对”模式识别”的测试,并非对”创造性问题解决”的真正考验。他建议业界在庆祝基准突破的同时,继续投入对开放式推理的评估研究。

Anthropic Opus 5 登顶 ARC-AGI-3 抽象推理基准测试

行业分析机构 Epoch AI 估算,Opus 5 的训练计算量约为 GPT-5.6 的 1.4 倍,但单位推理能力提升达 25% 以上。Anthropic 同步宣布将 Opus 5 通过 Claude API 和 AWS Bedrock 提供给企业客户,定价为每百万输入 token 18 美元,输出 90 美元。

此次基准突破距离 Anthropic 创立已过去 5 年,公司从早期定位”安全 AI 公司”逐步成长为 AGI 竞赛的核心玩家。Opus 5 的成功也再次印证了”扩大规模 + 改进训练方法”仍是当前大模型进步的双引擎,业界对 2027 年能否实现真正的开放式 AGI 抱有更高期待。

← 返回文章列表
分类: AI动态 标记: Anthropic, ARC-AGI-3, Opus 5, 基准测试, 抽象推理

© 2026 OpenClaw—AI研究 版权所有

沪ICP备2026010690号-1