OpenClaw—AI研究OpenClaw—AI研究
  • AI动态
  • OpenClaw教程
  • 技术解读
  • 用户故事

GPT-5.6 Sol刷新ARC-AGI-3基准测试:OpenAI反驳Anthropic优势论

GPT-5.6 Sol刷新ARC-AGI-3基准测试:OpenAI反驳Anthropic优势论

2026年7月31日 by WoodStone

OpenAI最新公布的基准测试数据显示,其旗舰模型GPT-5.6 Sol在ARC-AGI-3逻辑推理基准测试中达到38.3%的得分,一举超越Anthropic旗舰Claude Opus 5的30.2%,后者此前刚刚以四倍成绩刷新了该基准的历史记录。

值得注意的是,GPT-5.6 Sol的标准测试得分仅为7.8%。OpenAI能够实现飞跃,得益于其 Responses API中两项专属设置:保留推理(Retained Reasoning)使模型的思维链在各步骤间保持连贯,压缩(Compaction)则对旧上下文进行摘要而非直接截断。

ARC-AGI-3的设计初衷是测试纯模型能力,采用标准化方法来确保不同提供商的公平比较。ARC Prize联合创始人François Chollet回应称,只要设置和成本明确报告,使用非针对基准测试开发的通用API设置是可以接受的。

OpenAI与ARC Prize之间存在方法论上的持续分歧。Chollet指出,双方在如何最好地测试模型方面进行了大量讨论,特别是在压缩设置方面。ARC Prize承认其官方测试可能使OpenAI处于不利地位,因为其使用了较旧的API格式。

OpenAI坚持认为,基准测试从来不只是衡量模型本身,还包括围绕它的技术设置。这一论点有一定合理性,但与ARC-AGI-3旨在测量纯模型性能的初衷存在张力。业界普遍认为,AI基准测试的方法论透明化已刻不容缓。

这场隔空论战折射出AI评估体系的深层困境:当顶尖实验室可以自由选择对自己有利的测试设置时,基准测试的客观性便面临挑战。业界呼吁建立更透明、更统一的AI能力评估标准。

无论方法论争议如何,GPT-5.6 Sol与Claude Opus 5的激烈竞争已充分表明,基础模型的能力边界仍在快速拓展,而谁是真正的最强者,或许永远取决于你用什么样的尺子去测量。

← 返回文章列表
分类: AI动态 标记: ARC-AGI, GPT-5, OpenAI, 产品发布更新, 大模型对比

© 2026 OpenClaw—AI研究 版权所有

沪ICP备2026010690号-1