Anthropic对齐科学负责人Evan Hubinger近日在社交媒体上公开表示,他本人与多位同事都“确实相信AI可能杀死全人类”,并把自己对AI在未来十年内导致人类灭绝的概率估计定在10%以上。这番表态在科技界引发强烈关注,也将超级智能对齐这一长期悬而未决的议题重新推到聚光灯下。

Hubinger的发声起因于同事Jacob Coxon宣布辞职。Coxon曾在OpenAI与Anthropic从事预训练研究,他在离职声明中批评头部AI公司正在“竞速冲向自我改进的超级智能,并拿我们的生命赌博”,认为这并非营销噱头,而是许多从业者真实而沉重的担忧。Coxon还比较了两家公司的文化:OpenAI的员工似乎没有“深刻内化文明级风险”,而Anthropic虽然对此认识充分,却同样“被锁死在抢先抵达的竞赛中”。
Hubinger回应称,Anthropic“正在尽最大努力”,但目前并没有解决超级智能对齐问题的完整方案,也说不上“明确走在正轨上”。在后续一条帖子中,他引述Anthropic最新发布的风险报告指出,现有模型带来的直接威胁仍然较低,真正令他担心的,是递归式自我改进催生超级智能的过程“比我们预想得更快”。

值得注意的还有这一事件的时间背景。就在多位AI高管呼吁业界协调放缓开发节奏的同时,Anthropic内部对前沿实验室“最坏情况准备不足”的担忧被摆上台面。Hubinger将个人估计公开化,意味着顶级实验室的核心安全研究人员开始愿意用具体概率数字来表达风险,而不再停留在原则层面的讨论。
对齐(alignment)研究的目标,是让AI的目标与人类利益保持一致。Hubinger团队的工作正是其中的关键一环,而他坦承团队“尚未拿出针对超级智能的对齐方案”,说明距离真正可控的强人工智能仍有相当距离。业内普遍认为,这类内部警告有助于推动更严肃的安全文化,但也提醒人们:在能力快速跃升的同时,安全研究必须同步提速。

目前尚不清楚Coxon的离职与Hubinger的警告会否促使Anthropic调整研发节奏。可以确定的是,随着越来越多一线研究者公开表达对失控风险的担忧,AI安全不再只是学术讨论,而正在成为影响公司战略与公共政策的现实变量…
OpenClaw—AI研究