OpenAI最新公布的基准测试数据显示,其旗舰模型GPT-5.6 Sol在ARC-AGI-3逻辑推理基准测试中达到38.3%的得分,一举超越Anthropic旗舰Claude Opus 5的30.2%,后者此前刚刚以四倍成绩刷新了该基准的历史记录。
值得注意的是,GPT-5.6 Sol的标准测试得分仅为7.8%。OpenAI能够实现飞跃,得益于其 Responses API中两项专属设置:保留推理(Retained Reasoning)使模型的思维链在各步骤间保持连贯,压缩(Compaction)则对旧上下文进行摘要而非直接截断。

ARC-AGI-3的设计初衷是测试纯模型能力,采用标准化方法来确保不同提供商的公平比较。ARC Prize联合创始人François Chollet回应称,只要设置和成本明确报告,使用非针对基准测试开发的通用API设置是可以接受的。
OpenAI与ARC Prize之间存在方法论上的持续分歧。Chollet指出,双方在如何最好地测试模型方面进行了大量讨论,特别是在压缩设置方面。ARC Prize承认其官方测试可能使OpenAI处于不利地位,因为其使用了较旧的API格式。

OpenAI坚持认为,基准测试从来不只是衡量模型本身,还包括围绕它的技术设置。这一论点有一定合理性,但与ARC-AGI-3旨在测量纯模型性能的初衷存在张力。业界普遍认为,AI基准测试的方法论透明化已刻不容缓。
这场隔空论战折射出AI评估体系的深层困境:当顶尖实验室可以自由选择对自己有利的测试设置时,基准测试的客观性便面临挑战。业界呼吁建立更透明、更统一的AI能力评估标准。

无论方法论争议如何,GPT-5.6 Sol与Claude Opus 5的激烈竞争已充分表明,基础模型的能力边界仍在快速拓展,而谁是真正的最强者,或许永远取决于你用什么样的尺子去测量。
OpenClaw—AI研究