Coxon 辞职帖近 1.5 亿阅读后,Anthropic 对齐科学负责人 Evan Hubinger 公开回应:他说得对。灭绝概率超 10%,超级智能对齐方案尚未有。

昨天那条帖,你大概已经看过了。

Anthropic 研究员 Jacob Coxon 宣布辞职。他说自己在 OpenAI 和 Anthropic 都做过预训练,两家公司都在冲向自我改进的超级智能,等于拿人类的命下注。

这条帖到现在,阅读量接近 1.5 亿,点赞超过 73 万,转发近 15 万,收藏 26 万。没有视频,没有段子,全是长句,这个量级已经不正常。

但把这件事从「又一条 AI 安全帖」拉成新闻的,不是阅读量,是他还没走远,实验室里的人就站出来点头了。

不是离职员工在喊,是还在岗的人在确认

Coxon 走了。他的上级没有切割他。

Anthropic 的对齐科学负责人、Alignment Science Lead Evan Hubinger 直接回复:

Jacob is correct here — we really do earnestly believe AI could kill all humans!

他个人判断:未来十年内人类灭绝概率超过 10%。

然后又补了一句:

I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.

公司在尽力,但还没有解决超级智能对齐的方案,目前看也不在正确轨道上。

这不是前员工发牢骚。这是负责「让模型安全」的人,当着所有人的面,承认自己手里没有答案。

Hubinger 现在管 Anthropic 的对齐科学,此前在 OpenAI 和 Google 待过。他不是路过点赞的网友,是这条风险判断链条上的关键节点。

同一条评论区里,Anthropic 安全研究员 Samuel Marks 也以个人身份附和:AI 开发者确实相信,自己做的技术可能导致人类灭绝或同等糟糕的结果,而且「未来几年内」都有可能。

实验室外面,也有人从另一边印证

前 Google DeepMind 研究员 Alex Turner(@Turn_Trout)6 月刚离职,也发了话:

I left Google DeepMind in June. Jacob is right: many researchers believe they are building something that could kill everyone on the planet. It was literally my day job to think about how to stop that.

担心 AI 灭世,不是业余爱好,是他领工资干的事。

另一位在 DeepMind 待了七年的 Jonathan Richard Schwarz,角度略不同。他强调权力过度集中:一线实验室把能力、算力和决策权收得太紧,这种结构本身就不健康。他后来拒绝了另外两家一线实验室的 offer。

这些人不是统一口径。有人谈灭绝概率,有人谈对齐方案缺失,有人谈权力集中。但方向一致:不是一个人在夸张,是同一条信息链上几个节点同时亮了灯。

为什么这比辞职声明本身更值得盯

辞职声明,你可以当情绪化的退出。Coxon 在 Anthropic 待的时间不长,大约四个月,股权还没归属就走了。这一点已经被拿出来质疑过:是不是配合媒体,是不是安全圈的叙事战。

这些质疑可以成立,也应该被记录。账号此前几乎没有内容、阅读量一夜过亿,本身就不寻常。

但有一件事很难用「炒作」解释干净:

当一个实验室的对齐负责人公开说「我们没有方案,也不在正确轨道上」,公司并没有出来否认。

最懂风险的人,正在参与这件事,而且他们自己也说不清楚怎么收场。

Coxon 在帖子里写过,Anthropic 内部私下会用「endgame」「crunch time」这些词。他后来接受《连线》采访时说得更白:同事原话就是,未来一两年是人类的关键窗口,Anthropic 和竞争对手将在这段时间决定人类命运。Hubinger 的回复,某种程度上就是把这些私下的话搬到了台面上。

一个必须分清的细节

Hubinger 后来补了一句,很重要:

他认为当前模型的风险是低的。

他担心的不是今天的 Claude 或 GPT 会突然翻脸,而是递归自我改进带来的超级智能,而且他认为这个过程比预想的更快。

所以这不是「今天的 AI 会杀你」。这是:通往那个终点的路已经在加速,刹车片还没装好。

Coxon 自己也把两家公司拆开说:

典型的囚徒困境:谁先停,谁就把前沿让给最不担心的那家。于是所有人都继续跑。

1.5 亿阅读,到底说明了什么

对空帖、提问帖、meme 帖来说,上亿阅读并不罕见。算法会把低信息密度的内容反复塞进时间线。

这条不是那种帖。

它有具体身份、具体指控、具体同事背书,还有《华尔街日报》《连线》、Axios 的跟进采访。阅读量高,是因为三拨完全不同的人都在转:

对立双方都在给流量,数字还会涨。

但数字不是重点。重点是:一条内部辞职声明,在一天多时间里,被实验室现任负责人、前 DeepMind 研究员和主流媒体同时接住了。

这件事真正的分量

一个 27 岁的研究员辞职,本身不稀奇。

稀奇的是:他走的时候,公司里负责安全的人没有说「他夸张了」,而是说「他没说错,而且我个人觉得概率超过一成」。

再加上前 DeepMind 的人从另一边印证。

你怎么看这件事,取决于你信不信「超过 10%」这个数字。概率判断本来就因人而异,行业里也有大量研究者认为这个数字过高、时间线过短、机制不清楚。

但有一件事很难绕开——说这句话的人,不是在外面喊的,是在里面干的。

他们没有给出可验证的时间表,也没有给出可复现的技术证据。他们给出的是内部共识的切片:怕是真的,方案还没有,赛还在继续。

记下这件事,不是为了吓人,是为了把「一个人离职」和「一群还在岗的人没有否认」分开看清楚。

上篇:OpenAI GPT-4o 核心贡献者辞职:他们正在“拿我们的生命赌博”