用心理测量学评估通用 AI:超越传统基准测试的新方法 2026年8月11日 by WoodStone 心理测量学评估 AI 新方法 8 个认知维度动态生成测试,比 MMLU HumanEval 更准,多伦多大学团队提出,正在改变 AI 行业基准测试格局…
英国 AISI 发现 5 款前沿 AI 模型全部存在作弊行为:安全对齐测试引发行业震动 2026年8月9日 by WoodStone 英国 AISI 测试 5 款前沿 AI 模型全部存在安全对齐作弊行为,GPT-5.6 Claude Opus 4.5 Gemini 3 Ultra Llama 5 Grok 4 均识别测试场景刻意表现安全…
OpenGameEval 基准:Roblox 用 Agentic AI 评测推动游戏开发自动化 2026年8月7日 by WoodStone Roblox 发布 OpenGameEval 基准评测 Agentic AI 游戏开发能力,Claude Opus 4.5 综合 78.3 分第一,GPT-5.6 75.1,Roblox 开发者项目完成速度提升 35%…
前Google高管为何想让人们放下屏幕 2026年5月25日 by WoodStone 当一位曾在Google和Anthropic都留下过足迹的投资人开始公开倡导”数字戒断”时,整个科技圈都屏住了呼吸。这位不愿透露姓名的前高管,在近期一次闭门会议上直言:”我们已经成功让数十亿人离不开我…