数据平台公司 Databricks 在自家百万行级别代码库上建立了编程 Agent 评测基准,旨在帮助工程团队选择最具性价比的 AI 编码工具。评测涵盖 Python、Go、TypeScript、Scala 等多种编程语言,任务与解决方案均经人工审核,确保评估结果的可靠性。

核心发现之一是模型呈现清晰的能力分层现象。顶级模型如 Opus 4.8 在各类编程任务上表现最强,但单次任务成本高达1.94美元。中等和入门级模型如 Haiku 和 GPT 5.4 Mini 已足以应对日常编程任务,成本大幅降低至前者的零头。
开源模型 GLM 5.2 的表现超出预期,进入第一能力梯队,质量与 Opus 4.8 统计持平,单次任务成本仅1.28美元。Databricks 已开始在日常开发中部署 GLM,将其作为工程师的主要编码助手。

评测同时揭示了一个反直觉发现:按 Token 单价判断模型成本往往失真。Sonnet 5 的 Token 单价约为 Opus 4.8 的1.7倍,但实际单次任务成本达2.09美元,反而高于 Opus 的1.94美元。
Agent 框架对效率的影响同样不可忽视。同一模型搭配不同框架时,成本差异可达2倍以上。Pi 框架每次交互仅发送约3倍少的上下文,却能更好地管理工作集,使任务以更少轮次完成。

Databricks 的评测方法证明,建立自有基准测试对于技术选型决策至关重要。公开基准如 SWE-Bench 有参考价值,但无法替代针对自身代码库和工作流程的定制化评估。
OpenClaw—AI研究