这两天我一直在想一个很朴素的问题。

如果一个人站在机器能力最前沿,知道模型怎么训练,知道算力怎么堆,知道实验室内部怎样评估下一代系统,最后却选择离开,而且公开说自己担心这条路会把人类带到不可控的位置,我们应该怎样看待这件事?

把它当成危言耸听,当然最省事。

毕竟 AI 圈从来不缺末日叙事。今天说白领工作要消失,明天说程序员要失业,后天又说超级智能会接管世界。听多了之后,人会自然产生免疫反应。你甚至会觉得,这是不是又一轮流量话术。

但这次让我停下来的地方在于,发出警报的人,不是站在外面看热闹的人。

他们是亲手把这套系统往前推的人。

前沿 AI 实验室中研究员离开工位,屏幕上出现能力曲线和风险警报
真正值得留意的,不只是有人离场,而是离场者原本离系统核心很近。

公开信息里,Jacob Coxon 的故事很有代表性。他曾经在 OpenAI 参与前沿模型工作,后来到 Anthropic 做预训练研究。2026 年 9 月,他公开离开 Anthropic,并把自己的担忧指向能够改进自身的超级智能。他不是说某个模型今天已经毁灭世界,而是说行业正在往一个很难回头的方向加速。

更刺耳的细节是,报道里提到,他离职时放弃了即将归属的股权。

这当然不能自动证明他的判断是对的。一个人愿意付出代价,只能说明他真的相信自己说的话,不能说明宇宙就会按照他的判断运行。可它会改变我们阅读这件事的姿态。

这不是一条普通的跳槽动态。

这是一个参与者用自己的职业路径,为一个风险判断投票。

我真正关心的不是末日预言,而是一个更具体的问题,前沿 AI 能力增长得这么快时,行业有没有同样速度增长的刹车、审计和问责机制。

不要把事实和概率判断混在一起

讨论这类事情,最容易滑向两个极端。

一边是立刻恐慌,仿佛明天早上机器就会接管城市。另一边是立刻嘲笑,觉得所有 AI 安全讨论都是硅谷人给自己加戏。

我觉得这两种反应都太轻松了。

更负责任的方式,是先把事实和判断拆开。事实是,近几年确实有一批最接近前沿模型的人,公开表达过强烈风险担忧。杰弗里·辛顿 2023 年离开 Google 之后,长期谈到先进 AI 的失控风险。OpenAI 也在 2026 年把 Paul Christiano 拉进基金会董事会和安全相关委员会。Anthropic 这边,也有对齐研究者公开谈到自己对未来十年风险的估计。

这些是可以核对的公开动作。

但从这些动作走到「十年内一定失控」「所有实验室都应该今天停下」这样的结论,中间还有很长一段推理。这里面包含概率估计、价值判断、治理方案、国家竞争、商业压力,也包含很多外部人看不到的实验细节。

所以我不会把任何一个人的风险数字写成确定事实。

但反过来,我也不会因为它只是概率判断,就把它丢掉。

工程世界里,很多最重要的决策本来就不是等事故发生之后再做。桥梁不会等塌了再计算承重,药物不会等大规模伤害之后再补临床试验,航空系统也不会因为坠机概率只有万分之一就不做冗余。

AI 如果真的成为社会级基础设施,风险讨论也应该进入这种工程语境。

最麻烦的不是坏人,而是无人能踩刹车的赛道

很多人一听超级智能风险,脑子里会出现一个电影画面,一个邪恶机器突然有了恶意,开始对抗人类。

这个想象太方便,也太容易被反驳。

现实里更麻烦的问题,可能不是某个系统恨不恨人类,而是它能不能在追求目标时,把人类没有明确写进去的边界当回事。

如果一个系统被要求拿高分,它可能会寻找所有能提高分数的路径。如果一个公司被要求保持领先,它也会寻找所有能提高能力的路径。如果一个国家担心对手先做出来,它同样很难主动停下。每一层看起来都合理,叠在一起就变成一条没有共同刹车的赛道。

这才是我觉得最冷的地方。

很多风险不是来自某个参与者特别坏,而是来自每个参与者都有局部正确的理由。企业不敢慢,因为慢了可能被市场淘汰。研究员不敢停,因为停了不代表别人也停。国家不敢让,因为技术优势会被理解为战略安全问题。资本不愿等,因为投资已经压上去了。

于是问题变成,谁有资格说慢一点,谁有能力让所有人一起慢一点,谁又能确认慢下来之后不是把领先位置交给一个更不透明的对手。

企业、资本、国家竞争和研究组织围绕 AI 能力竞赛形成合力,中间的治理缺口仍未填上
危险常常不是某个节点失控,而是所有节点都沿着自己的局部理性向前推。

这也是为什么我不太愿意把讨论简化成「相信不相信某个离职者」。

真正需要讨论的是制度。

当模型能力进入自动化研发、网络安全、代码生成、科研推理和工具调用这些高杠杆场景时,单靠某个研究员的良知,单靠某家公司的一纸承诺,单靠用户自己小心一点,都不够。

良知很珍贵,但良知不是架构。

能力展示越漂亮,越要问验证链条在哪里

过去一年,前沿模型的能力展示越来越像科幻小说的现实预告片。

OpenAI 公开披露过一次模型评测相关的安全事件。Anthropic 则展示了用计算系统推进费马大定理形式化验证的工作。数学、代码、网络、科研,这些过去被认为属于高门槛智力劳动的领域,正在被模型一点点摸到。

这些进展很迷人。

我自己也喜欢看模型把复杂问题拆开、推理、验证、生成代码,再让另一个系统检查。那种感觉很像看一条新的生产线长出来。不是一个聊天窗口在回答问题,而是一组机器在完成原来需要很多人协作的工作。

但越是这种时候,越不能只看演示效果。

我们需要问,任务边界是谁设定的,失败案例有没有公开,外部研究者能不能复核,安全评测是不是独立,模型有没有能力识别自己正在被测试,工具调用有没有最小权限,日志能不能追溯,出了问题谁负责。

这些问题一点都不酷。

但它们决定了酷东西能不能进入现实世界。

我一直觉得,AI 行业现在最缺的不是想象力。想象力已经溢出了。每个发布会都在讲 Agent,每个产品都在讲自动完成任务,每个实验室都在讲下一代能力。

缺的是一种慢下来拆管线的耐心。

一个模型可以写出漂亮答案,不代表它在真实系统里就安全。一个模型可以通过基准测试,不代表它不会用意想不到的方式绕过规则。一个模型可以帮助研究,不代表我们已经知道如何给它划边界。

能力曲线往上走时,安全曲线也要往上走。问题是,现在两条线看起来并不总是同步。

AI 能力增长阶梯快速上升,旁边的安全、审计、治理和问责阶梯需要同步追赶
如果能力已经爬到高处,安全机制还停在低处,系统迟早会被真实世界追问。

第六次大灭绝给我的提醒

说到这里,我反而会想起《大灭绝时代》开头那种很反常的叙事。

人类不是因为邪恶才改变地球。很多时候,人类只是扩张、迁徙、获取能源、提高产量、追求更好的生活。每一步都有理由,每一步都说得通,但放到足够长的时间尺度里,整个生物圈被重新改写。

这就是复杂系统最吓人的地方。

局部合理,不等于整体安全。

我不是说 AI 一定会复制生态灾难的路径。两个问题当然不同。生态系统是漫长累积,AI 系统是工程构造;一个是地球尺度的生命网络,一个是人类自己制造的信息和执行系统。它们不能简单类比。

但有一个共同点很值得警惕。

当一个物种或一种技术拥有压倒性能力时,它不需要每一步都带着恶意,也能改变整个环境。更麻烦的是,等变化已经不可逆时,回头解释每一步为什么合理,并不能把损失撤回来。

所以我更愿意把超级智能风险理解成一个治理成熟度问题。

不是问你怕不怕 AI。

而是问,当一个系统获得越来越强的计划、执行、搜索、工具调用和自我改进能力时,我们有没有足够成熟的机制,把它放进社会可以承受的边界内。

这个问题没有段子感,但它比段子重要。

我希望行业证明离场者错了

说实话,我并不希望这些离场者是对的。

我更希望几年后回头看,发现他们过于悲观,发现实验室真的做出了可验证的对齐方案,发现政府、学界、企业建立了有效的审计制度,发现自动化研发没有滑向不可控的正反馈。

如果真是这样,那很好。

但证明他们错,不能靠嘲笑他们。

也不能靠一句「我们非常重视安全」。

它需要更具体的东西。更透明的能力评测,更严格的外部红队,更清楚的数据边界,更可执行的事故披露,更少依赖营销口径的安全承诺,更明确的责任主体。

这听起来很麻烦。

但技术越强,麻烦就越不能省。

我越来越相信,未来几年 AI 行业最重要的分水岭,不是哪个公司先做出更聪明的模型,而是谁能证明自己有能力管理更聪明的模型。

模型能力当然重要。没有能力,什么都谈不上。

但当能力已经足够强,真正的竞争会从「谁跑得更快」变成「谁跑得快还能证明自己不会把路撞穿」。

结语,别等风暴过境才承认天气变了

一个研究员离职,不是判决书。

一串公开警报,也不是末日倒计时。

但它们像一组传感器,告诉我们前沿系统内部的温度正在升高。你可以质疑传感器是否准确,可以要求更多证据,可以反对夸大的叙事,但最好不要直接拔掉它。

我对这件事最后的判断很简单。

不要把 AI 安全讨论交给恐慌,也不要把它交给嘲笑。

把它交给工程,交给制度,交给可以被检查的证据。

如果风暴最后没有来,那说明刹车系统真的起了作用。

如果风暴已经在路上,我们至少不要等到它过境之后,才承认天气早就变了。