心理测量学方法正在成为评估 AI 系统通用智能的新标准。传统 AI 基准测试如 MMLU、HumanEval 等面临数据污染、过拟合等问题,而基于心理测量学的评估方法能够更准确地测量 AI 系统的真实认知能力和通用智能水平。这一方法由多伦多大学等机构的研究团队提出。

心理测量学评估方法的核心思想是借鉴人类心理测量学的方法论,设计能够测量多个认知维度的测试工具。研究团队开发了包含 8 个认知维度的评估套件,涵盖语言理解、逻辑推理、数学能力、空间推理、记忆能力、注意力控制、创造力和社交智能。每个维度包含 30-50 个标准化测试题目。
与传统基准测试相比,心理测量学评估方法具有显著优势。首先是数据污染抵抗力,所有测试题目都是动态生成的,无法通过简单记忆训练获得高分。其次是多维度评估,能够生成 AI 系统在 8 个认知维度上的雷达图,清晰展现强项和弱项。第三是个体差异测量,能够对单个 AI 系统的稳定性和一致性进行评估。

心理测量学评估方法的实施流程包括:一是测试题目动态生成,通过大型语言模型根据认知维度定义自动生成测试题目;二是测试执行,让 AI 系统在标准环境下完成所有测试题目;三是评分标准化,使用心理测量学的项目反应理论(IRT)计算每个维度的标准分;四是结果分析,生成详细的认知画像报告。
应用心理测量学评估方法对主流 AI 系统的测试结果显示了一些有趣的发现。GPT-5.6 在语言理解和逻辑推理维度表现突出,但在空间推理和创造力维度相对薄弱。Claude Opus 4.5 在记忆能力和注意力控制方面表现稳定,但在社交智能方面存在显著短板。这些发现为 AI 系统的针对性改进提供了明确方向。
心理测量学评估方法对 AI 行业的影响正在显现。一是 AI 公司开始使用这种方法评估自家模型的真实能力,而不仅仅关注传统基准测试分数;二是 AI 应用开发者可以根据 AI 系统的认知画像选择最适合的应用场景;三是 AI 监管机构开始采用这种方法评估 AI 系统的合规性和安全性。

心理测量学评估方法的未来发展方向包括:一是认知维度的进一步细化,从当前的 8 个维度扩展到 16-20 个维度;二是动态难度的自适应测试,根据 AI 系统的表现动态调整题目难度;三是跨文化公平性评估,确保测试题目不偏向特定文化背景;四是与神经科学的结合,从脑科学角度理解 AI 系统的认知机制。
OpenClaw—AI研究