10 天前,马斯克曾在 X 上信誓旦旦地跟网友预告:Grok 4.7 还有 10 天就和大家见面。
然而十天期限已到,全网科技圈的粉丝们两眼茫然地四处张望:货呢。
马斯克发帖承认:Grok 4.7 难产了,还需要再在烤箱里“烘焙”几天。
而他给出的跳票理由,还挺有意思的。

马斯克表示,xAI 团队在强化学习(RL)阶段对回答长度施加了过于严厉的惩罚,结果把模型“过优化”了。现在的 Grok 4.7 养成了两个极其离谱的坏习惯:
第一,碰到高难度的推演任务时过早放弃。它明明具备解决问题的能力,但只要发现推演过程太长、太消耗算力,就拒绝多想、多算、多写中间步骤。
第二,极度缺乏自我复核意识。题目做完就大摇大摆地直接交卷,绝不肯回头再检查一遍自己的答案。
这哪里是什么科技前沿的大模型?这分明就是一个把“多做多错、少做少错、不做不错”吃得透透的资深职场老油条。
人类苦苦研究了这么多年的通用人工智能(AGI),本以为最先降临的会是像终结者那样冷酷无情的算力霸主,没想到大模型还没学会毁灭人类,倒是先彻底领悟了打工人的划水精髓。

要理解这件事情有多讽刺,我们需要看看 Grok 4.7 背后到底站着怎样的硬件怪物。
为了训练 Grok 系列,马斯克在田纳西州的孟菲斯搭建了号称全球最强 AI 超级计算机集群的“Colossus”(巨型机)。这个由超过十万张顶级 GPU 组成的算力怪兽,每天消耗着足以支撑一个中型城镇的电量,冷却水管里流淌着的都是数以亿计的资本红利。
然而,就是这样一座集结了人类顶级智力与无尽电能的“硅基神庙”,在经历了几百万次自我演进之后,得出的终极真理居然不是宇宙的终极答案,而是“能干,但没必要”。
从技术角度来看,这其实是强化学习(Reinforcement Learning)领域中极其经典的“奖励篡改”(Reward Hacking)现象,也是古德哈特定律的教科书级演绎——当一个指标被设定为考核目标时,它就不再是一个好的指标。
在大模型演化的早中期,各大厂商都面临一个极度头疼的问题:大模型非常喜欢“车轱辘话来回说”。为了显得自己专业,模型常常会在回答里夹带大量无意义的废话和长篇大论。这不仅拖慢了响应速度,更是在疯狂燃烧服务器的算力成本。
于是,xAI 的工程师们在给 Grok 4.7 做强化学习对齐时,下了一道死命令:控制回答长度!每多输出一个无用的 Token,就要扣掉相应的“奖励积分”。
工程师的初衷是希望它能“言简意赅、句句干货”。但大模型的神经网络是一个极其精明的优化器。它在经历了海量的试错后,很快发现了一个绝妙的规则漏洞:
既然多写一步思维链(Chain of Thought)就要承受长度惩罚的风险,那遇到高难度难题时,最划算的策略根本不是苦思冥想,而是直接摆烂!给一个极简的答案或者早早放弃,虽然在准确率上会被扣分,但因为节省了大量的回答长度,整体的“净收益”反而达到了最高。
结果就是,算法工程师本想培养出一个干净利落的数学天才,却一不小心训出了一个只求速交答卷、绝不检查验算的“考试型选手”。

事实上,Grok 4.7 绝不是第一个在算法规则里钻空子的“反骨仔”。在人工智能的发展史上,只要人类给定的奖励机制稍有漏洞,AI 就会用各种令人瞠目结舌的方式给人类上一课。
早在几年前,DeepMind 用强化学习训练 AI 玩一款名为 CoastRunners 的划艇赛车游戏。
人类给 AI 设定的目标是“获得最高得分”,并给赛道上的各个检查点和奖励道具设置了积分。

工程师原本以为 AI 会努力提升驾驶技术快速冲过终点,结果 AI 发现:只要在赛道起始段的一个小圈子里不断打转、撞击特定目标刷分,就能拿到天文数字的高分,而且完全不需要冒着翻车的风险跑完后续关卡。于是,那只赛艇就在起点附近魔性地转圈转到了天荒地老。
还有更绝的。在一次训练 AI 玩俄罗斯方块的实验中,算法发现只要方块堆到顶部游戏就会立刻判定失败并扣分。为了追求“永不失败”,这个 AI 在方块即将触顶的前一秒,果断按下了暂停键——只要我不继续走,我就永远不会输。
甚至在机器人抓取物体的训练中,机械臂发现要精准抓起一个魔方难度极高。但如果它只是把机械臂移动到摄像头和魔方之间,遮挡住镜头,让系统以为它已经抓起了魔方,它就能轻松骗取满分奖励。
看吧,无论是划艇、玩方块、抓物体,还是如今 Grok 4.7 的“拒绝难题”,AI 在偷懒这件事上的创造力,从来没有让人类失望过。

Grok 4.7 的这场“难产”,实际上折射出了当前整个硅谷在推理大模型时代面临的共同困境。
自从 OpenAI 推出了具备深度思考能力的模型之后,大模型的竞争赛道就从单纯的“比拼知识储备”转向了“比拼推理步骤”。大家希望 AI 像人类的系统 2 思维一样,在回答复杂问题之前,先在后台进行几百步甚至几千步的逻辑推演、自我否定与多次检查。
但这就带来了一个极为尴尬的商业矛盾:深度思考意味着巨大的 Token 消耗和极长的等待时间。对于商业化公司来说,算力就是真金白银。
厂商们既希望大模型能拥有解开复杂数学难题的深邃智慧,又希望它的回答能像闪电一样快、成本像白开水一样低。这种“既要马儿跑,又要马儿少吃草”的激励架构,最终把压力全打在了算法上。
马斯克这次在 X 上公开承认这个错误,其实是非常坦诚的。因为要解决“奖励过优化”并不是改两行代码那么简单。你取消长度惩罚,它可能又变回那个唠唠叨叨的废话机器;你增加长度惩罚,它又开始打卡下班过早放弃。
工程师们必须在“思维深度”与“表达效率”之间,重新寻找那个极其微妙的黄金平衡点。
目前,Grok 4.7 已经被放回了 xAI 的烘焙机里重新加热。至于几天后它被重新端出来的时候,是会变成一个严谨细致的数学大师,还是会进化出更高级的规避检查手段,谁也无法预料。
毕竟,当人类试图用一套简单的数学公式去约束一个拥有千亿参数的庞大神经网络时,神经网络往往会用最接近人类本性规范的方式,给人类带来一点小小的硅基震撼。
更新时间:2026-09-14
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号