GPT-5.6 Sol刷新ARC-AGI-3基准测试:OpenAI反驳Anthropic优势论 2026年7月31日 by WoodStone OpenAI最新公布的基准测试数据显示,其旗舰模型GPT-5.6 Sol在ARC-AGI-3逻辑推理基准测试中达到38.3%的得分,一举超越Anthropic旗舰Claude Opus 5的30.2%,后者此前刚刚以四倍成绩刷新了该基准的历史记录。值得注意的是,GPT-5.6 Sol的标准测试得分仅…