2026-09-10
3204
新智元报道 今天,整个AI圈都被这件事刷屏了。 Anthropic的核心预训练研究员离职了。 他发布的一篇离职长文,在X上已经浏览破亿。 更惊人的是,Anthropic对齐负责人Evan Hubinger不仅没有对此公关,反而站出来承认—— 「 我们团队内部真诚地相信,AI可能会杀死全人类。我个人预测,未来十年内,这个概率超过了10%。 」 他的结论是:我们根本没有解决超级智能失控的方案,而且当前的研发路线明显已经跑偏了。 10年内,AI毁灭人类的概率已经超过10%,人类危险了。 目前,这篇帖子浏览量已经破亿 一封辞职信引爆硅谷: 「他们正拿全人类的命在赌博!」 Jacob Coxon,是一位顶尖AI研究员。 过去三年里,他先后在OpenAI和Anthropic从事大模型预训练研究,可以说是当今最了解AI进化速度的人之一。 但在万亿级IPO的前夜,他却选择了辞职,用绝望的语气揭露了行业的疯狂,字字泣血。 下面就是他的X原文。 首先,他对前东家发出严厉指控。 今天我从Anthropic辞职了。过去三年我都在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行事。他们正径直冲向自我改进的超级智能,拿我们的生命赌博。 接着,他警告所有人,不要被大公司温文尔雅的表态给骗了,他们私底下同样恐惧得发抖: 构建AI的人真诚地相信,它可能会在这个十年结束前杀光我们所有人。这不是营销噱头。如果有的话,许多高管和资深研究人员会在媒体面前斟酌他们的措辞以显得理智——但我听到同样的人在私下表达恐惧。没有其他任何人类活动能带来这种级别的危险。 不要低估这项技术的力量。它们很快就会成为超人类系统,能够黑客入侵任何东西、一夜之间彻底改变任何领域,并获取真正的权力和资源。我们都目睹了在每个领域取得的进展,而且这种进展并没有放缓。 既然这些绝顶的天才真的相信AI会毁灭人类,为什么还要把它造出来? Coxon揭露了他们陷入的「囚徒困境」。 一个常见的反应是: 「 如果他们真的相信这一点,为什么还要继续构建它? 」 在OpenAI,许多人并没有深刻地将这种攸关文明存亡的赌注内化。而在Anthropic,这种赌注被充分理解,但他们陷入了一场争夺第一的竞赛——他们相信没有其他人会负责任地行事,所以即使冒着风险,他们也必须自己来做。 接受这场竞赛并进入 「 残局 」 ,是一场傲慢的赌博,不应该由一家私营公司的Slack发起。试图在对齐问题上速通,需要有超乎寻常的自信,确信没有更好的发展轨迹可用。 最后,他呼吁政府和全行业立刻踩下刹车,并且向同行们发出了灵魂拷问。 我对协调的潜力感到乐观。像Hugging Face攻击事件这样的警告信号,使得美国实验室之间达成限速协议变得更加可行。我不觉得我们现在处于阻止全球竞赛的正轨上,这可能需要付出高昂代价的行动,比如暂时禁止提升模型能力。 如果你是一名实验室研究员,我敦促你思考一下未来几年实际上会是什么感觉。你是否想要在没有严格理解其心智的情况下,启动一次超级智能的强化学习运行?你是否应该因为 「 反正它都要发生 」 就埋头苦干——还是抓住这个时刻呼吁创造不同的条件? Jacob表示,这些都不是营销噱头,没有任何其他人类活动,能构成如此级别的危险! 高管绝望承认:「十年内灭绝概率超10%」 接下来,Anthropic的对齐科学负责人Evan Hubinger,直接在Jacob的帖子下回复,把全人类的心推向了冰窟: Jacob在这里说得是对的——我们真的、真诚地相信AI可以杀死全人类!我个人认为,在未来十年内,这个概率大于10%。 可以说,Evan Hubinger这是亲手砸了自家公司「安全第一」的招牌。 他坦白道:「我相信Anthropic正在尽最大努力,但我们目前还没有解决超级智能对齐问题的计划,也明显不在通向解决方案的正轨上。」 他承认:我们造出了一个怪物,但手里连根绳子都没有。 大V Nathan Calvin表示:这绝不是一个为了IPO炒作的营销手段 在AI圈里,有一个著名的内部黑话叫「p(doom)」,也就是「AI导致人类灭绝的概率」。 以前,大多数研究员的p(doom)都在1%以下,大家都觉得那是科幻。 但现在,风向彻底变了。OpenAI研究员Roon也公开将个人的p(doom)从不到1%上调至超过10%。连「AI教父」Hinton,此前预测AI有10%到20%概率灭绝人类。 然而巨头们却都相信,其他公司不会负责任地行事,如果让别人先搞出超级智能,世界就完了。 所以,「为了拯救世界,我们必须冒着极大的风险,自己先把它造出来。」 今年夏天,这种苗头已经开始显现。 Anthropic、OpenAI和Meta都纷纷披露了自家AI工具在第三方网络安全评估中,出现过「未经授权访问真实系统」的黑客行为。 更令人