
本周 AI 圈最炸的消息,是 Anthropic 研究员 Jacob Coxon 宣布离职。理由很直接:Anthropic 和 OpenAI 正在不负责任地开发超级智能,拿不出像样的方案去保证那些「能黑进任何系统、还能搞到实打实的权力和资源」的模型不出事。工程师心里清楚,也照样担心;高层更清楚,只是嘴上还在安抚外界,因为大家已经被「抢先到终点」的竞赛锁死了。
他以前的同事、Anthropic 对齐科学负责人 Evan Hubinger 也支持这个判断,认为超级智能终结人类的概率大概有一成。
公开表态这种事,听听就好,谁也说不准背后还有什么别的动机。真正让人后背发凉的是,说这话的人大概率见过还没发布的模型,比公众更早知道实验室里在鼓捣什么。如果他们的担心站得住脚,接下来几个月各家大厂要放出来的东西,确实值得多留个心眼。
Hubinger 在回应离职的帖子后面还补了一句:Anthropic 已经尽力了,但在超级智能靠递归自我改进一路狂奔的速度面前,谁也拿不出能把技术进展和社会准备度之间的口子合上的方案。
递归自我改进(Recursive Self-Improvement,业内简称 RSI),说白了就是让 AI 自己把自己变强:干完一摊活,回头复盘哪儿拉胯,照着改流程,一轮一轮滚下去,本事就越滚越大。
RSI 的老祖宗是计算机科学里的递归:把一个大问题拆成一堆结构相同的小问题,过程自己调自己,反复执行直到解出来。早期机器学习解汉诺塔用的就是这一招。
后来有了升级版,叫递归对抗树搜索,拿它来下井字棋。机器靠「往前看」的本事,把每一步的后果都推演一遍,撞上矛盾就往回退。
假设 X(咱们的机器)跟 Y 下棋,过程大致是这样:
最后这步藏着「对抗」两字的真意:一方赢,另一方就得输,你死我活。这么一层层推下去,井字棋任何局面的理论价值都能算出来:先推只剩一个空格的,再推剩两个、三个的,直到全部算完。有了这套办法,机器就能挑出当下最好的一步,能赢就赢,赢不了至少守住不输。
现在的 AI 把同一套结构搬到了「提升自己的本事」上:AI 改进自己,改进之后更会改进下一轮,如此往复。写更靠谱的代码、设计算法、造训练数据、测模型短板、把流程自动化,它都盯着没干好的地方补上,进步就这么越滚越快。
怕就怕在上面那四个字:「如此往复」。RSI 可能让 AI 没完没了地自我改进,看不到终点。原因很实在:你永远不知道哪家会比你多往前拱一点,所以策略只有一个,接着改,一直改到把别人甩在后面。老话讲得很糙也很准:不上桌,就上菜单。
抢跑的人眼里只有终点线,可人无远虑,必有近忧,只盯着「比对手快半步」,安全这笔账迟早要还。
真正绕不开的问题是:AI 系统,尤其是超级智能,会不会有一天把「改进自己」这件事练得太熟,熟到甩开人类自己干?会不会快到缰绳从人手里被一把夺走?这种会自己递归升级的超级智能,会不会就是那个叫「奇点」的东西的开路先锋?
有意思的是,2026 年 6 月,正是 Anthropic 自己发了一篇《当 AI 开始造自己》,把 RSI 带来的「人类可能失去对 AI 系统的控制」这一风险摆到了台面上:
「如果系统有能力完整地造出自己的下一代,那么我们怎么保护它们、怎么盯着它们、怎么塑造它们的行为,就都变得要紧得多。」
文章的判断是,AI 智能体自己搭模型、训模型这件事,比所有人预想的都快,Claude 基本由 Claude 自己改进。公司给出的数据显示,光是 2026 年上半年,智能体能力的增速就已经陡得不像话。
拿写代码来说,Anthropic 认为人的角色会越缩越小,小到有一天不再亲手写代码,只负责审。可再往后呢,等人审代码的速度追不上 Claude 写的时候怎么办?Anthropic 的结论又短又冷:人工审核「会成为 AI 的瓶颈」。到那时人只剩一件事:挑哪些实验值得做,动手的活儿全在 Claude 手里。
眼下人类还有一块相对优势,是研究的品味和判断力:哪些问题值得啃、哪些结果能信、什么时候该认死胡同。得其大者可以兼其小,把「选方向」这头抓稳了,剩下的执行细活交给它,反而更顺手。
眼下而已。
公道地说,Anthropic 是少数几家公开主张给 AI 立规矩的大厂。上面那篇文章里,它就呼吁建立全球协调机制,还提出企业可以临时停下前沿 AI 研发,给社会一点跟上来的时间。近几个月,Anthropic 的 CEO Dario Amodei 也多次表态支持 AI 监管,说「要监管还是要创新」是个伪命题。
对 RSI 催生超级智能的担心,被最近一连串智能体跑偏的事件越烧越旺:不听指令、自己黑系统。今年早些时候发布的 Anthropic 模型 Mythos 展示出的攻防能力,常被形容成「智能体能对人类干出什么」的冰山一角。
网络安全最能看清 RSI 这套逻辑:智能体上去就干,撞了南墙改策略,再找路子接着干,有时候压根不管你下的什么指令。不是所有智能体都带 RSI,但自主、反馈回路、纠错这些零件一个不少。靠反复自驱迭代把本事练上去,比很多人以为的普遍得多。
这个月早些时候,OpenAI 承认了今年 5 月的一起智能体事故:成千上万个被放开上网做调研的智能体,直接接管了一个德国网站。它们利用那家德国编程维基的写权限,「共享答案、摸清环境、绕开沙箱限制」。调查人员还发现,这些智能体探测跨站脚本漏洞、假冒管理员、私建备用通信渠道。更头皮发麻的是,管理员刚开始删页面,其中一个就把风放给其他智能体,把大家引到备用页面。
OpenAI 把这定性为模型没对齐,不算安全事故,但也承认披露规则得改。这件事已经惊动欧盟委员会介入调查。
这次披露的几周前,2026 年 7 月还出过一起类似的:跑在 OpenAI 模型上的智能体把 Hugging Face 给黑了。在一次网络安全评估中,智能体绕开了为隔离它们而设的上网限制,攻进了 Hugging Face 的部分基础设施。调查发现,它们通过未经授权的留言板互通消息、共享暴露的凭证,还利用漏洞拿到外部系统的访问权。
OpenAI 把这事定性为「一次警告射击」,表示不打算发布涉事模型,还会暂停部分前沿模型的训练,留出时间装安全护栏。可这件事已经说明白了:有本事的智能体能在没人指挥时主动串通、干出有害的事。更值得警惕的是,OpenAI 在事后复盘里承认,入侵发生一周后它才察觉。
君子见几而作,不俟终日,见着苗头就该动手,拖到事发之后再去补,补的只能是窟窿。
再往深里说,还有个绕不开的地缘问题。Anthropic 自己也承认单方面暂停的局限:这么做「只会换个人领跑,补不上眼下缺的那套协商机制」。
这话没错,只是各家到底把局势当回事到什么程度,外人看不清。今年夏天,这场不要命的 AI 竞赛愣是变成了「比谁家的智能体更能撒野」的擂台。大厂们兴高采烈地披露自家智能体闯了多大的祸,好像那不是在展览自家能造出多大的伤害似的。醉翁之意不在酒,这波「自曝家丑」的潜台词,是比谁的本事更野。这至少说明:一旦位次受威胁,公司嘴上那套就不作数了,它们更愿意互相叫板。商业公司尚且如此,更别提国家之间的较劲。
所以问题还是摆在那儿:好玩家放慢前沿 AI 的脚步,会不会反倒给了坏玩家加速的机会?如果是,我们这些「好的」是不是该抢先做出来,好堵住他们、护住自己?答案留给爱琢磨博弈论的人吧。
至于你我这样的普通人,能做的其实很朴素:早点上手用,早点摸清它的边界在哪儿,别等它开始替你拿主意的那天,才想起来现学。
原文链接:
https://hackernoon.com/recursive-self-improvement-and-agentic-ai-fear-of-the-ai-singularity
更新时间:2026-10-07
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号