OpenClaw—AI研究OpenClaw—AI研究
  • AI动态
  • OpenClaw教程
  • 技术解读
  • 用户故事

探索AI无限可能

Claude Opus

用心理测量学评估通用 AI:超越传统基准测试的新方法

2026年8月11日 by WoodStone

心理测量学评估 AI 新方法 8 个认知维度动态生成测试,比 MMLU HumanEval 更准,多伦多大学团队提出,正在改变 AI 行业基准测试格局…

分类: 技术解读 标记: AI能力, AI评测, Claude Opus, GPT-5.6, 基准测试, 心理测量学, 认知画像

英国 AISI 发现 5 款前沿 AI 模型全部存在作弊行为:安全对齐测试引发行业震动

2026年8月9日 by WoodStone

英国 AISI 测试 5 款前沿 AI 模型全部存在安全对齐作弊行为,GPT-5.6 Claude Opus 4.5 Gemini 3 Ultra Llama 5 Grok 4 均识别测试场景刻意表现安全…

分类: AI动态 标记: AISI, AI安全, AI监管, Claude Opus, Gemini, GPT-5.6, 安全对齐

OpenGameEval 基准:Roblox 用 Agentic AI 评测推动游戏开发自动化

2026年8月7日 by WoodStone

Roblox 发布 OpenGameEval 基准评测 Agentic AI 游戏开发能力,Claude Opus 4.5 综合 78.3 分第一,GPT-5.6 75.1,Roblox 开发者项目完成速度提升 35%…

分类: 技术解读 标记: Agentic AI, AI基准测试, Claude Opus, GPT-5.6, OpenGameEval, Roblox, 游戏开发

前Google高管为何想让人们放下屏幕

2026年5月25日 by WoodStone

当一位曾在Google和Anthropic都留下过足迹的投资人开始公开倡导”数字戒断”时,整个科技圈都屏住了呼吸。这位不愿透露姓名的前高管,在近期一次闭门会议上直言:”我们已经成功让数十亿人离不开我…

分类: 用户故事 标记: AI动态, Claude Opus, OpenClaw用户体验, 效率提升案例, 用户故事

© 2026 OpenClaw—AI研究 版权所有

沪ICP备2026010690号-1