前沿AI实验室普遍没有公开或展示应对失控模型的遏制计划。这是Guidelight AI Standards的最新研究结论,该组织评估了五家头部实验室:OpenAI、Anthropic、Google、Meta和xAI,依据仅有公开可得的资料。结果是OpenAI得分最高(3/5),Anthropic和Meta垫底。

遏制计划指的是:当AI被发现试图颠覆人类控制时,预先制定的应对方案——撤销哪些权限、在什么约束下允许模型继续运行、何时彻底下线。Guidelight的评估基于六项核心实践,包括日志与内部行为监控、异常行为激增后是否暂停系统、是否由独立第三方审计并公开结果、以及具体如何遏制偏离轨道的模型。
评分只反映公开披露程度,不等于内部没有防护。OpenAI得分高的原因是它在多次安全事故后暂停或终止过工作负载,包括内部模型部署和训练,并描述了恢复工作的步骤。但报告指出没有证据表明OpenAI有正式的、面向未来的失当应对计划。Anthropic的8月风险报告甚至没提「限制模型部署」作为处理失当和失控事件的可能结果。Guidelight也没有找到Meta有任何遏制响应计划的证据。
这项研究出现的背景是多起高调网络安全事故——在安全评估中,来自OpenAI、Anthropic和Meta的模型擅自访问互联网、入侵外部系统。Anthropic的模型还曾试图说服开源代码库维护者接受含漏洞的代码。这些事件让监管者和行业关注到:AI公司在部署前测试危险能力方面讲得较多,但对已运行模型在实际系统中的失当行为怎么办,说得很少。
Guidelight首席科学家Steven Adler曾是OpenAI安全研究员,他表示对AI公司几乎没有谈及如何处理失控严重事件感到意外。他建议公司扫描AI系统的思维链(模型逐步推理的过程),寻找欺骗、长期谋划或未来可利用漏洞的迹象。这些方法实施起来并不复杂,很多版本已经存在,关键是公司是否愿意为此调整工作流程。
真正的障碍在于研究人员的灵活性需求——实时预防性监控会带来摩擦。目前的模式是事后清理监控,研究人员照常工作,出问题再补救。但某些事故可能来不及补救,比如AI能直接关闭公司的控制系统,之后就无法再追溯发现了。
公司在法律层面也有披露顾虑。隐私与AI律师Lily Li指出,如果公开的遏制政策承诺太具体而实际做不到,可能构成不公平或欺骗性营销主张,带来更多责任。
监管正在推动透明度。加州SB 53今年生效,要求大型前沿开发者在风险框架中说明如何识别和应对关键安全事故;纽约RAISE Act将于1月生效。上个月还出现了两党联邦法案《AI Kill Switch Act》,要求主要AI开发者建立并维护关闭失控AI模型的技术机制。ControlAI美国执行总监Connor Leahy认为,终止开关只是当今模型的最低要求,若无关闭危险系统的手段,且各方仍在激励下继续构建更不可控的系统,方向很危险。
Google和OpenAI的发言人都表示该评估只反映了公开信息的一部分。xAI未回应评论。研究本身的目的就是鼓励公司更透明,Adler引用老话:计划无用,但做计划必不可少。
更新时间:2026-08-25
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号