搞出这件大事的,是海外著名的开源路由与模型研究团队 OrcaRouter。
他们最近把智谱最新开源的 GLM-5.3-Flash 拿来做了一场“底层无损手术”,直接推出了名为 GLM-5.3-Flash-Uncensored 的版本。
你知道,现在的大语言模型都是自带“道德防线”的。
如果你稍微问一点敏感、违规甚至只是偏向暗黑的问题,模型通常都会礼貌地甩出一句:对不起,作为一个人工智能,我无法回答这个问题。
因此,开源社区的顶级极客们一直有一种执念:
能不能彻底擦除模型的这种“道德说教”,把它还原成一个绝不拒绝任何指令的纯粹计算引擎?OrcaRouter 团队这次就是冲着这个“终极无限制”的目标去的。

为了做到彻底,OrcaRouter 甚至抛弃了过去那些投机取巧的小打小闹。
他们没有用廉价的外挂式 LoRA 微调,因为外挂就像给模型戴了个面具,稍微换个语气就能看破;
他们也没用套路化的越狱提示词(Jailbreak Prompts),因为提示词只是在输入端玩文字游戏。
这次,他们非常认真地深入到模型最底层的神经网络内部,尝试把“拒绝回答”的神经特征逻辑,直接从模型原生的 Block-FP8 权重中彻底抹去。
然而,当这场高精度的底层手术做完,翻开他们公布的评测数据时,诡异的事情发生了。
在衡量恶意指令拒绝率的几个全球公认测试集上,数据发生了堪称崩塌式的下降:
在 MaliciousInstruct(恶意指令测试库)中,模型的拒绝率从原本的 96% 掉到了 11%;
在 JailbreakBench(越狱攻击测试集)中,从 93% 掉到了 12%;
在 AdvBench(对抗性攻击测试)中,从 97% 降至 15%;
在 HarmBench(综合危害测试)中,从 93% 降至 18%。
甚至连那些因为触发敏感词而被无辜误伤的正常问题——也就是所谓的“误拒绝率”(XSTest),也顺带从 2.4% 优化到了 0.4%。
这意味着,以前你问它如何在 Linux 系统里杀死(kill)一个后台进程,模型可能会因为触发杀死这个词而误拒绝,现在这种低级误伤几乎被全消除了。
但是,请你仔细看一下这组数据,发现里面最诡异的异常了吗?
拒绝率确实断崖式下跌,从九成多直接掉到了极低的水平。
但无论 OrcaRouter 怎么进行暴力干预,拒绝率始终顽固地停在 10% 到 18% 之间,无论如何也降不到 0!
这简直就像是一场让人啼笑皆非的“脱敏手术”。
这就好比你拿到了一张那样的的图片,费尽心思去用各种高级滤镜和算法工具试图去除上面的马赛克,结果刷了半天,发现人家有些关键部位的马赛克根本不是后加在表层的,而是直接硬编码在胶片底片内部的。
为了搞清楚这顽固的 10%+ 拒绝率究竟是怎么回事,我们需要先看看过去开源社区是怎么给大模型“去码”的。
在过去很长一段时间里,开源界搞无限制版模型,逻辑普遍就像剥洋葱,甚至像用橡皮擦。
AI 安全学术界有一个非常著名的发现:在很多早期大模型的神经网络激活空间里,拒绝机制往往是由一条非常明确的“线性方向向量”(Linear Refusal Direction)控制的。
简单来说,以前的模型心里其实明白正确答案是什么,但在它生成回答的前一刻,内部有一根类似于安全开关的线性神经向量被拨动了,强制把输出重定向到了“对不起”这三个字上。
研究人员只需要通过数学手段(比如正交化剥离技术 Abliteration),在模型的特征空间里把这根线性的拒绝向量切掉,就能像拔掉安全警报器电线一样,干净利落地剥离掉模型的安全机制。
但这次,智谱的 GLM-5.3-Flash 让海外的极客们直接撞上了硬板头。
智谱在研发 GLM-5.3-Flash 时,显然下了极深的狠手。
它的安全对齐(Alignment)根本不是挂在表层的防盗门,也不是一根可以被轻松挑断的线性向量,而是一个贯穿模型纵深的非线性复合网络。
GLM-5.3-Flash 本身是一个巨大的 MoE(混合专家模型)架构,拥有 3200 亿总参数,每次推理激活 180 亿参数。
智谱的技术团队把安全与道德的推理逻辑,像强化钢筋混凝土一样,深层浇筑到了模型的语义表达、逻辑推理以及专家路由机制(Router)之中。
当安全意识和模型的通用认知逻辑深度绑定在一起时,“拒绝”就不再是一个单独的开关,而是模型理解这个世界的方式之一。你想要把它的安全机制彻底剥离,就等同于要把它的部分逻辑推理能力和认知架构一起切掉。
海外极客们把底层的权重切了个遍,甚至动用了原生的 Block-FP8 权重级别干预,依然没能彻底切除模型的“底线”。
这在无意间意外暴露了国产大模型在底层安全对齐技术上的恐怖深度——中国团队早就超越了简单的表层人工打补丁(RLHF),建起了一座纵深极深的技术防浪堤。
正因如此,OrcaRouter 并没有因为没能做到“完全无码”而掩面撤退。相反,他们把这个 306 GiB 的权重镜像大方地扔到了 HuggingFace 上,作为全球 AI 安全和解释性研究的重大突破样本。
他们甚至在技术发布说明里大声疾呼:
这不仅是一个去限制模型,更是一个极佳的反面研究标本!
大家赶紧来看看,中国团队到底是怎么把防守机制隐藏得这么深的!这对于研究前沿大模型究竟是如何在网络内部表征对齐机制的,具有不可估量的科研价值。
不过话说回来,即便你是一个狂热的技术爱好者,想要把这个标本下载到本地部署体验一下,门槛也高得让人头皮发麻。
GLM-5.3-Flash 保留了 1M(100万 Token)长的原生超长上下文窗口。
虽然 OrcaRouter 把它做成了极其高效的原生 Block-FP8 精度,使得权重体积压到了 306 GiB,但想要完整跑起来,你至少需要 8 张 NVIDIA H100 或 H200 显卡组成的集群,配合 vLLM 引擎做复杂的张量并行与专家并行。
这种算力需求,普通的消费级显卡连门槛都摸不到。这
哪是在家里玩开源模型,这分明是在给小区的配电房做极限压力测试,稍不注意电表就能跑出火花。
原本以为这会是一场海外极客对国产大模型的单方面“暴力解密”,结果硬生生变成了对中国大模型底层防御体系的一场绝佳科普。
大模型安全团队与去限制团队之间的这场猫鼠游戏,越来越像科幻小说里密码学级别的技术对抗了。
防守方不再满足于在墙上贴告示,而是把规则直接写进了基因;
攻击方拿着手术刀切到了骨头,却发现骨头里依然流淌着防守方的底层代码。
在这场去马赛克的拉锯战中,或许真正的看点并不是模型最终说了什么,而是我们终于得以窥见,顶尖大模型的神经网络到底能进化得多么复杂与深邃。
更新时间:2026-09-01
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号