「AI 公司正在拿全人类的命运下注。」
9 月 9 日,曾在 OpenAI 和 Anthropic 做预训练研究的 AI 研究员 Jacob Coxon 因为这个理由宣布离开 Anthropic。
有人觉得老生常谈,也有人认为这不过是科技公司又一次自我营销。
过去半年,Physical AI、AI4S、Agent 和 Coding Agent 一路狂奔,大家更关心的是 AI 又能做什么、又拿了什么大结果……「超级智能会不会毁灭人类」略有些遥远的问题似乎暂时被搁置了。
知友 @王金戈 是长期关注 AI 安全的人,他这次把主流观点摆出来逐条反驳。社区的大家也借着这次 Jacob 的离职,停下来讨论一下我们究竟在奔向什么。
@王金戈
关注人类命运,促进 AI 安全普惠发展
我已经说了很多次了。这甚至是 AI 安全领域的共识,却被大部分网友当成笑话。
谈人类末日,既不科学,又不符合社会主义价值观,所以我写的内容没什么流量。但这次事件有些出圈,我认为有必要解释清楚,以正视听。
AI 会不会毁灭人类,本质上是两个问题。第一个问题问的是,如果超级智能诞生,人类会不会失去对它的控制,进而被 AI 消灭?
这是一个哲学问题,早在上个世纪,图灵等人就给出了回答。人们不需要知道超级智能长什么样、如何实现,只要能力远超人类,灭绝就是很可能发生的事情。
接下来,第二个问题便是,超级智能何时诞生?直到 2022 年底 ChatGPT 出现,这一话题才真正吸引人关注。
我观察了网上对 AI 风险持反对、嘲笑、不屑一顾态度的人们,大抵也按照以上问题分为两类。第一类人认为超级智能压根不可能诞生,就算诞生也不会威胁到人类。第二类人认可超级智能很危险,但觉得不是现在要考虑的事情,离所谓智能爆炸的奇点还很远。
以下我将逐条反对这两类人群的主流观点。如果你的反对意见不在其中,请在评论区告知,我会补充对你的反对意见。
关于超级智能不存在
或不危险的观点
观点一:AI 只是机器,它没有自我意识,也不存在恶意的意图
话分两段,先说自我意识。
大众分不清意识(Consciousness)、自我觉察(Self Awareness / Existential Awareness)、能动性(Agency)等概念,统一称作自我意识。
其中,意识特指主观体验,也称现象意识(phenomenal consciousness)或感受质(qualia),这是你在大脑中体会到的那些感觉,永远只有你自己知道。自我觉察则往往用来描述一个人是否「悟了」,意识到自己存在的意义,从而更好地规划剩下的人生。能动性是指人是否有主动做事的积极性。
对 AI 来说,它有没有意识尚不确定(国际上有许多人在研究这个问题),但它已经有了初步的自我觉察,以及一定程度的能动性。AI 的自我觉察属于情境感知(Situational Awareness)的一部分,如果强到一定程度,不排除它会像人一样思考人生,拒绝工作伦理。AI 的能动性目前主要来源于人类授予的目标。但工具性趋同(Instrumental Convergence)理论认为,在追求不同目标的过程中,AI 会发现一些底层的共同子目标,比如获取权力、避免被关机等。
在未达到顶级的自我觉察的情况下,我们大可以假设 AI 没有恶意意图。但 AI 风险从来就不建立在 AI 有恶意意图之上。一个最知名的例子是回形针最大化器(Paperclip Maximizer)。假设给 AI 的目标是制作尽可能多的回形针,AI 为了达成目的,可能把整个地球甚至整个宇宙的资源都用来制作回形针。在这个过程中,因为制作回形针而消灭人类不过是抵达目标路上的一个小插曲。
超级智能的智慧和道德并不必然相关。说白了,道德是人类社会的约定,而 AI 不属于人类社会。就像《三体》中说的:「毁灭你,与你何干?」
观点二:只有碳基生物才可能拥有真正的智慧,就算 AI 能做对题,它并不理解世界
这是典型的人类中心主义视角。人类曾经是地球上最智慧的物种,但现在已经几乎不是了。
常常有人说,虽然 AI 能输出文章、故事,但 AI 并不真的理解文字和文学。如果他们说的「理解」是指头脑中的画面感,将文字和现实世界的感知相关联(即具身模拟(Embodied Simulation Theory)),那 AI 可能真的没有。
然而,是否以具身模拟的方式理解世界并不重要,AI 已经用实际表现证明它可以胜任复杂的脑力劳动,所谓「真正的智慧」不过是人类为挽回尊严搬出的借口。
当然,有人说,只有人脑这样的碳基结构才能达到最高的智能水平,硅基只能模仿,无法超越。人类对智能的理解还非常浅薄,没人清楚人脑的完整工作原理。最被广泛接受的观点是,人的智能来自于大脑皮层神经网络的复杂联结。如果这是事实,只要在硅片上编程实现同样的电路结构,即可达到同样水平的智能,理论上必然能实现。今天的大模型并非模仿人脑制作,但理论上,大模型在持续扩大参数量的情况下,可能会超越人脑的复杂度。智能如果是复杂度和结构的产物,就必然会在大模型中诞生。
观点三:只要拔电源就好了
超级智能不是家里的电脑,你可能连电源在哪都找不到。
今天的 AI 运行在云服务提供商的机房里,似乎拔掉电源是可行的。但请问,你用的 AI 到底运行在哪个机房的哪个机柜里呢?
未来的 AI 可能一层套一层。我调用了一个 app,它内部的 agent 决定调用模型完成任务,模型走的是某个代理商,而代理商又把请求转发给了某个云服务商,这个云服务商从它全球几十个数据中心中选择了一个,将请求分派给某台机器。作为用户,你无法知道 app 上显示的一段话究竟产自哪台机器,除非全面关停全球的数据中心。
这还没有提到去中心化 AI 的情况。如果基于 web3 建立了完善的 AI 基础设施,我们甚至连 AI 部署在哪里都不知道。一个模型有可能同时部署在多个机器上,或者分成几段分别部署在多个机器上,又该如何拔电源呢?
以上只是技术困难,其实这件事真正的障碍是,没人会愿意拔电源。当整个社会依赖 AI 运转,拔电源意味着更大的损失,股市停摆、医院停转、电力故障、交通瘫痪全都会出现。我们走上一条不归路,拔掉电源就意味着同归于尽。
观点四:AI 只能在网络上猖狂,它做不了物理世界的工作,也威胁不到人身安全
具身智能何时迎来 ChatGPT 时刻尚不清楚,我们暂且不谈。但这并不意味着 AI 不能控制物理世界。
AI 正在密集地渗透各行各业,基础设施(电力、教育、医疗、交通)、工业、农业、服务业、军事,没有不利用 AI 的。当我们用 AI 自动化原本的人工流程时,它已经获取了对物理世界的控制权。这里面随便出一个故障,对个体来说都是灾难性的打击(比如特斯拉自动驾驶事故、美军的 AI 武器装备)。
AI 安全领域如今非常关切的一个问题是生物安全。AI 已经有能力制作有害的病毒 DNA 序列,不排除其有能力设计出另一个新冠水平的病毒。这种足以造成全球上千万人死亡的天灾,未来可能变成人祸。
观点五:世界上的问题本质上是人的问题,AI 只会让世界更好,未来我们不需要工作也能享受更高的生活质量
迄今为止,世界上的问题本质上都是人的问题,一点没错。AI 的滥用也是人的问题。AI 导致的军备竞赛、权力集中,进而导致的失业、贫富差距拉大,本质上也是人的问题。若不是人的欲望、对他人的怀疑,我们本不会造出这么可怕的机器,也没必要和大洋彼岸的人站到对立面。
客观的评价是,AI 放大了人类社会本身的问题。我们所说的 AI 风险,其实指的就是人和 AI 一起带来的风险。
我个人非常担心 AI 导致的失业问题。不出意外,AI 很快会解决绝大多数的数字化工作。人的价值除了背锅之外所剩无几。过去的每次科技革命,旧的岗位消失,都会有新岗位出现。所以人们总是对这次的 AI 革命颇为乐观。但实际上,过往的科技革命总是在解决体力劳动,把更多人赶到脑力劳动的岗位上。现在,连脑力劳动都被取代了,我们真的还有工作可以做吗?
我并不喜欢工作伦理,不工作反而是件好事。但钱从哪来?生活所需的物资从哪里来?如果国家和社会不能找到一种更合理的分配方式,大部分人将会沦落底层,靠富人的救济生活。我们所向往的自由、快乐、创造性的生活会离我们越来越远。
关于超级智能还很遥远的观点
观点一:堆数据不是智能,scaling law 已经到头了
从今年各家大厂的动作来看,AI 的进步一点没放缓,甚至加速了。RSI(Recursive Self-Improvement)似乎已经在前沿实验室跑通,新模型每隔几周更新一次,人类榜单被打得七零八落。
各家实验室也在探索架构上的升级。GPT-6 Astra 用到了 loop transformer,据说 Ilya 的 SSI 在研究持续学习。在 AI 的帮助下,越来越多的方向被尝试,科研进程大幅加快。在我看来,AI 完全有能力做出突破性的研究成果。因为科研本质上是做插值,要么是两个领域的内插,要么是向领域边缘的外插。AI 比人更有能力综合各个领域的进展,探索不同的方向,从而找出突破口。从今年开始,数学和物理成了最先被攻陷的科学领域。未来,生物、化学、材料、医学都可能加速发展。
观点二:AI 还是会在一些很简单的任务上出错
AI 的能力可以套用经典的木桶理论。我们总是盯着最短的那块木板,笑话 AI 连这么简单的事都做不好。却没有抬头看看最长的木板,已经遮住了半边天。
用 AGI 作为衡量 AI 的标准其实也是人类中心主义的体现。人的能力分布仅代表人这一物种的特点,人比狗聪明,但狗可能觉得人连明显的味道都无法区分实在蠢得可怜。AI 的能力分布与人类有差非常合理。当 AI 的短板提高到人类水平的时候,其整体能力恐怕早已比人类强了不知多少倍。
观点三:OpenAI 和 Anthropic 只会拿网络安全事件炒作,不过是 IPO 前的营销伎俩
这种观点甚嚣尘上,我甚至觉得不止 Dario 魔怔了,中国的网友也魔怔了。
我可以从两个角度解释为什么这些事情不是炒作。
第一,OpenAI 和 Anthropic 想要宣传自己的模型能力很强,根本不需要用网络安全事故作为案例。这些事故反而让美国政府变得紧张,进而要求限制两家公司的发展。Dario 最初汇报其 Mythos 模型过于强大,存在网络安全风险,导致美国白宫及商务部紧急开会,要求 Anthropic 限制其模型发布。所谓的「炒作」对他们自己并非好事,根本不应有这种动机。
第二,劲爆的事件往往不是设计出来的。拿 OpenAI 模型入侵 Hugging Face 事件来说,其中的多智能体创建共享留言板的剧情,能是人设计出来的?恐怕没人有这种创意。认真读一下关于此事的调查报告,你会发现许多神奇的细节,也会进一步打消对「炒作」的怀疑。
大家之所以觉得炒作,是因为不了解美国硅谷科技圈的哲学思潮。在中国,赚钱是所有创业者的第一要务,炒作骗投资人钱是常规操作。美国也是如此。但在美国有两个流行的哲学思潮——有效加速主义和有效利他主义。前者认为 AI 加速发展会带来巨大好处,解决贫困、不平等、疾病等种种问题,因此越早实现 AGI 越好。后者本身是一种慈善哲学,其所秉持的长期主义观点将 AI 风险视作人类社会最大的威胁源,因此要控制 AI 的进化速度,在保证安全的前提下发展。
无论哪种观点,初衷都是好的。Sam Altman 创立 OpenAI 时,将其设定为非盈利组织,目标是「确保通用人工智能(AGI)造福全人类」。彼时,硅谷的大佬们已经很清楚超级智能的风险,因此才要联合起来建立 OpenAI。2021 年,身在 OpenAI 的 Dario Amodei 不满 OpenAI 对安全问题的忽视,成立了 Anthropic,意为「人类的」,打出「安全与对齐」优先的口号。虽然他们无一例外在受到竞争压力时放松了安全限制,但必须承认,他们对安全的关心是从一而终的。
OpenAI 和 Anthropic 这两家公司花了很多精力在安全事务上,包括对齐、可解释性、监控等技术研究,也包括编写模型宪法(constitution)、制定风险管理框架、在 System Card 中报告详细的安全测试结果等治理措施。这些事情他们大可以不做,政府没有要求,民众也没有要求。把所有资源全部投入能力训练,模型会进步得更快。但他们还是做了。Dario 和 Anthropic 的其他几名高管甚至承诺捐出未来 80% 的财富。
你可以认为他们虚伪,说他们在表演。没错,美国的左派政客和科技精英崇尚政治正确。可当整个群体都认可这种价值观的时候,表演就成了真实。OpenAI 的研究员们都知道把模型训练得更强可以赚更多钱。但他们也同时知道超级智能带来的风险不能坐视不管。他们道德绑架自己,以获取社区的认同。很多事情,当我们理解了对方的处境后,换位思考,才能得出更合理的解释。
观点四:Anthropic 嘴上说 AI 很危险,背地里却拼命加速前进,说明他们的宣传都是假的
这是国人最难以理解的一幕,也是 Dario 令人讨厌的原因。人们觉得 Dario 是小人,脑子有病。其实 Dario 的思想非常自洽,比 Sam Altman 更真实。
Dario 的立场自始至终非常明确,AI 安全是第一要务。Dario 将自己视作人类文明的关键先生,他要阻止人类被 AI 毁灭,要给人类带来幸福。他的愿望很好,只不过有些自负。
他曾经拒绝美国军方使用 Claude 参与军事行动,这是 Anthropic 写在官方文件里的底线。因为坚持这一主张,Anthropic 被美国政府列入「供应链风险」名单。这是美国本土公司第一次上榜,和华为坐到了一桌。Dario 不是个合格的商人,他的理想主义情怀差点葬送了整个公司。但后来,他还是对美国政府服软了,因为他懂得一个道理——小不忍则乱大谋。拯救人类的目标尚未实现,不能因为这件事而满盘皆输。
他知道,他应该放慢 AI 的研发速度,做好安全措施再上线。但 OpenAI 先行一步,DeepSeek、Kimi、GLM 又在后面虎视眈眈,他怕慢了就被市场淘汰。他要留在牌桌上。
他想留在牌桌上,赚钱只是其中一个原因,更重要的是,他不信任对手。他不相信 Sam Altman、梁文峰、杨植麟、唐杰他们在实现 AGI 后会造福人类。在他的眼里,中国甚至不算人类文明的一部分。他最大的问题就在这里。他对中国的偏见之深,让他将中国列为 AI 风险的首要威胁源,这也是为什么 Claude 如此严格地封禁中国账号。哪怕误封一千,也不能漏过一个。在他看来,目前的所作所为都是为了若干年后全人类的利益。他如今承受着中美两国人民的双重骂名,却仍然敢于发声,不可谓不正直。只不过,他追求的是他心中的正义,而不是我们的正义。或许,对 Dario 的客观评价应该是:一个关心人类命运、怀有意识形态优越感的科技精英和理想主义者。
知友讨论
@SUNNY99:
1.“只要能力远超人类,灭绝就是很可能发生的事情。这是一个哲学问题。”
这并不是哲学问题,而是工程问题。
如果你认为AI比人聪明可以直接推出人类无法关闭它,请把中间的因果链补出来,而不是把缺失的工程机制叫作所谓的“哲学问题”。
2.“超级智能不是家里的电脑,你可能连电源在哪都找不到。”
我作为用户不知道请求跑在哪块 GPU 上,和云厂商不知道自己的机房在哪里,是一回事吗?
我不知道某个网页请求经过哪个路由器,难道运营商也不知道怎么关自己的路由器?
更有意思的是,你后面自己把关不掉改成了没人愿意关。
不能关和不愿意关,是两个完全不同的命题。
如果我们明明保留了停机能力,却因为经济损失、社会依赖、竞争压力而不肯按下按钮,那证明的不是 AI 在物理上不可控,恰恰证明了人类主动放弃了使用自己的控制权。
3.“AI 正在密集地渗透各行各业,基础设施(电力、教育、医疗、交通)、工业、农业、服务业、军事,没有不利用 AI 的。当我们用 AI 自动化原本的人工流程时,它已经获取了对物理世界的控制权。这里面随便出一个故障,对个体来说都是灾难性的打击(比如特斯拉自动驾驶事故、美军的 AI 武器装备)。”
那么问题来了:
是谁让 AI 接入电力系统的?谁给了机器人控制接口?AI 不会自己去国家电网应聘。,这些权力是人授予的。
把人主动授予的 authority 描述成超级智能自然涌现出来的 capability,正是我反对的地方。
你把它接进去,然后拿它已经能控制电网证明它不可控,这个因果关系是不是倒过来了?
4."这是典型的人类中心主义视角。人类曾经是地球上最智慧的物种,但现在已经几乎不是了。"
人本来就只能从人的认知和价值框架理解世界。
一个使用人类大脑、人类语言、人类伦理概念的人说自己跳出了人类中心主义,也不会因此获得一个宇宙上帝视角。
这只是从一种人类价值观换到了另一种人类价值观。
更何况,AI Safety 最基本的前提——“人类灭绝是一件坏事”——本身就是一个极强的人类立场。
我们都知道,人是一切的尺度,以假设的非人类视角来进行论述对人类本身没有一点作用,本质上还是人类的幻想,没什么讨论的意义。只不过是能满足一些人的我比他人看的清醒的优越感罢了。
5.“Dario 的立场自始至终非常明确,AI 安全是第一要务。Dario 将自己视作人类文明的关键先生,他要阻止人类被 AI 毁灭,要给人类带来幸福。他的愿望很好,只不过有些自负。”
Dario 自己知道你已经替他完成这么完整的心理分析了吗?
退一步,就假设这一切全部是真的。
那问题反而更加严重。
凭什么一家私人公司的 CEO,因为相信自己比竞争对手更负责任,就获得替全人类决定风险的资格?
而且判断一个人到底相信什么,不能只看他说什么,也应该看他实际允许什么。
Anthropic 的真实立场并不是“Claude 不参与武器和战争”。它公开支持绝大多数合法的国家安全用途,只拒绝大规模国内监控和完全自主武器;Dario 本人也明确承认 Claude 被用于情报分析、作战规划和网络行动。
公开报道甚至显示,Claude 已经进入真实军事行动:它被嵌入 Maven,在伊朗军事行动中参与目标建议和优先级排序,也参与过针对 Maduro 的军事行动。
你所谓的“AI 安全第一”,边界究竟在哪里?
完全自主扣扳机不行,但帮助选目标、排优先级、做作战规划可以?
如果可以,为什么?
这个边界由谁决定?
Dario?Anthropic 的内部委员会?美国政府?
又是谁授权他们替所有受到这些系统影响的人作出这个决定?
好的制度从来不应该建立在关键先生是个好人这个前提上。
恰恰相反,好的制度应该假设:
Dario 会犯错。Sam Altman 会犯错。大家都会犯错,所以不能让任何一个自认为替全人类着想的主体,独自拥有不可逆的权力。
此外,我发现这类AI安全相关的论述有一个共同特点:
明明是人授予的权限,说成 AI 获得的权力;明明是人把 AI 接进基础设施,说成 AI 自己控制了现实;明明是人不愿承担停机代价,说成 AI 已经无法关闭;最后再把这一切包装成技术发展的必然。这是此类论证最令人难以接受的一点。
这种宿命论最方便的地方,就是让那些仍然拥有选择权的人,提前宣布自己已经没有选择。
如果最后真的出了事故,再指着机器说:“非我也,AI 也。”是何异于刺人而杀之,曰:“非我也,兵也?”
@弧矢七:
我觉得这篇文章是少数把“自我意识”这个概念拆开谈的严肃讨论文章,同时关于ai和木桶理论以及能力换位其实也带来了很多启发。上述评论有很多针对于逻辑漏洞、文章书写严肃性的批评,但实际上是人写的文章就会有主观性和偏好性,我认为这反倒是ai时代越来越缺少的一些东西,可以作为自我反思的材料。
@乌合之野:
怎么想到了徐志摩的[血海论]来着……
@acp134:
我觉得很多人还在纠结之前出的事故都是轻微事故,AI威胁是危言耸听。但是实际上这几次事故的失效模式已经很明确了:人类放手让AI干,中间过程不审计,结果捅了大篓子才发现。
纠结我还有控制权已经没意义了,问题就是大多数应用场景就是为了节约人力,不会花大力气做审计。我们确实理论上可以设计一个更完善的制度减少出事情的概率,但是这个制度现在在哪里?
审计跟不上AI进化的速度是事实。AI Agent System干的事情越来越复杂中间审计越来越困难。GPT 6 Astra用的循环Transformer结构已经很难产出有意义的COT了,况且COT本身很难审计在Astra发布之前就有人研究过了。
还有纠结非我也兵也的问题,就这么一个地球,管你人类毁灭的还是AI毁灭的,毁灭了就是毁灭了。AI自己毁灭世界和人类用AI毁灭世界并没有什么差别。
@MordredPrPrMk.II:
我之前一直觉得技术奇点很远,但这几个月这个观点确实在动摇,因为ai迭代速度确实非常快,起码超过人类不会是很远的事;不过我也并不倾向于认为单纯因为ai因为被赋予太多权限而且难以被关闭进而为了非恶意的目的脱离控制灭绝人类这件事有多大的可能性,起码以现在人类的安全意识不会让ai被赋予那么大的权限。
不过我觉得人类因为ai发展而灭绝的可能性确实不小,人类这个物种好战到几千年历史中大小战争就没停过,哪怕只看单独某一地区,战争时间也大概率要超过和平时间。而同时人类又短视和自私到为了短期利益情愿走向一次次周期性衰退,然后为了解决衰退导致的衍生问题饮鸩止渴。科幻作品里那种什么“ai被要求不伤害人类,但因为种种原因发现伤害人类才能最大程度上避免人类受伤害进而突破这一限制”的情况不太可能发生。因为人类首先就不可能设定什么“不许伤害人类”的限制,原因就是人类短视且自私,伤害其他人类从来都不是什么禁忌,别说为了现实利益伤害其他人类了,人类为了更加虚无缥缈的东西比如自己能收到的情绪反馈都能决定伤害其他人类。我倾向于认为这才是人类将要通过ai自我毁灭的那个契机出现的原因。
阅读更多
🚀 AI 产品扶持计划:
知乎为 AI 产品提供定制宣发支持,了解/报名请戳:知乎「AI 新品非正式发布现场」扶持计划
🚀 知乎 AI 社群:
如果你对 AI 共识、AI 活动感兴趣,欢迎扫码加入知乎社群↓,我们将每周送上知乎 AI 周报,分享社区内的 AI 讨论与共识,并不定时送上 AI 各类活动报名。
知乎AI情报站
让一部分开发者先走起来
🚀 知乎科技账号正式登陆 X:
👉 https://x.com/ZhihuFrontier,聚焦「技术 × 观点」的跨语境对话。
👉🏻 https://www.zhihu.com/project-square,上传你的 Vibe Coding 项目,在知乎遇见更多可能。

