你有没有发现,去年这时候,AI在我们生活里还像个自动售货机。你投币,它出货,交易结束,各走各的路。
到了2026年二季度,这台自动售货机突然长腿了。
它不再等你按按钮,自己走进仓库进货、算账、盘库存,甚至开始替你写周报、做PPT、连上你们公司的财务系统。
你早上给它一个目标,下午它回来汇报,中间干了什么,你可能都不知道。
OpenClaw、Codex、Claude Cowork。这些名字听起来像工具,实际上正在变成你的同事。
而且,是那种特别勤奋、从不请假、也不要社保的同事。
说实话,这个转变来得有点快。

以前说Agent,大家默认是程序员的辅助。
现在不是了。
OpenAI自己报告,四五月份用Codex的人里头,有20%从来不写代码。这个增长速度,是编程用户的三倍。
AI终于找到了它真正的形态。它早就不该被困在聊天框里,它要的是操作系统,是手和脚。
过去一年,行业还在争论AI时代的入口到底是什么。有人押宝浏览器,Google搞Mariner,OpenAI搞Operator,Perplexity甚至想花345亿美元收购Chrome。
想法很简单,人以前靠浏览器上网,AI也该靠浏览器控制世界。

但2026年5月,Google关了Mariner。
Operator也融进了更大的ChatGPT Agent。
另一边,Codex、Claude Code直接接入文件、终端、代码仓库。它们不需要看懂按钮和颜色,命令行和结构化数据对它们来说,比图形界面直接一万倍。
浏览器没死,但它从"总入口"降级成了工具箱里的一个螺丝刀。数据在底层跑,页面只负责把结果摆给人看,方便你去改。
入口站稳了,大模型公司就开始往垂直行业杀。
Anthropic推Claude Design,做金融Agent、法律Agent。OpenAI用MCP、AgentKit连企业系统。
过去进入一个行业,得重新训练模型,搞数据微调,一个公司一个样。现在不用了。底层是同一套Agent,想做金融,接上金融数据库,配几个Skill;想做法律,换成合同条款和法律检索。运行环境完全复用。
垂直软件的护城河,被冲得差不多了。

但企业兴奋过头了,搞出了Token maxxing。
今年5月,这可能是大厂里最火的词。看到Agent这么能干,老板们想,给员工更多Token、更多工具、更长运行时间,产出不得翻倍?
黄仁勋甚至公开说,一个年薪50万美元的工程师,如果一年烧不到25万美元的Token,老板就该担心他有没有充分使用AI。
这话听着像激励,实际上是一场集体焦虑的狂欢。
三个月不到,火就灭了。
亚马逊内部搞排行榜,员工为了刷排名制造无效任务,最后只能关掉。Uber的Claude Code全年预算,四月就接近耗尽。管理层却发现,Token烧得越多,有效功能并没有同步增长。
为啥?
贵是一方面。普通问答调一次模型,Agent干长任务要反复读取目标、历史状态、工具结果、错误信息。Token消耗能达到普通问答的几十倍,甚至上千倍。
哈工大五月底提了个概念叫"有效反馈算力"。在复杂任务里,真正影响下一步的算力,只占10%。剩下90%都花在重读、试错、无效往返上。

更麻烦的是,即使Agent把代码写出来了,人也接不住。
MIT研究了十多万GitHub开发者,自主编程Agent让代码提交量涨了120%,但到立项环节缩水到50%,真正能上线的只剩30%。
就像一家餐厅切菜速度提高了三倍,炒菜、装盘、上菜的速度没变。后厨堆满了切好的菜,一天还是卖那么多桌。
经济学里有个替代理论,流程效率由不可自动化的部分决定。AI把生成速度拉得很高,但review的速度很慢,提效在系统上被卡了脖子。
Token造不出本来不存在的市场。
那怎么办?
让Agent互相监督,互相干活。
Multi-Agent热潮来了。一个Agent太慢,就上一堆。一个Agent做完没人检查,就派另一个Agent上。
最稳妥的模式是"编排者—执行者"。主Agent把任务拆碎,分给子Agent并行干,最后汇总。

Claude Research就这么干,派多个研究Agent分头搜索,主研究员汇总,引用Agent核对出处。
Kimi Agent Swarm更狠,几百个子Agent并行处理视频、代码和搜索。
适合并行的工作,这招很管用。Kimi报告说,有些任务延迟最多降4.5倍。
但问题是,多Agent的提升常常来自额外计算,不是合作本身。Anthropic披露,多Agent研究系统消耗的Token,能达到普通Agent的四倍。
现在的Multi-Agent,更像一个项目经理指挥几组互不来往的外包团队。能摊开工作同时做,但没有形成群体智能。
一旦拿掉中心"包工头",让Agent自己商量,人类的毛病全出来了。有的随大流,有的偷懒。测试证明,几个Agent凑在一起,准确率反而不如一个拥有完整信息的单体Agent。
模型训练过程里就没有合作这个课题。把一群习惯单打独斗的模型关进一个屋子,协作能力不会凭空出现。

另一条路是"自进化AI",RSI。
Anthropic六月报告里提到,他们让模型持续优化训练小模型的代码。结果从Claude 3到Mythos,优化水平从三倍加速做到五十多倍。
找问题、想办法、搭环境、验证结果、保留有效改动,然后再跑一轮。这种活儿Agent做得比人好,又快又不知疲倦。
但它不知道往哪走。"哪条研究路线有价值"、"这个指标是不是在骗人",这种需要"品味"的判断,Agent做得很糟糕。
Anthropic实验里,在人类已经犯错的复杂场景下,模型只有20%的几率比人做得好。人做得好时,模型更没竞争力。
Loop Engineering把这种循环做成长期工程。Agent不再等人按一下才动一下,自己找任务、执行、验证、记录反馈,再决定下一轮做什么。
听起来很美好,但经济账还得算。

Agent渗透的代价,正在显现。
就业最先受影响。失业率没有突然飙升,但岗位入口、日常任务、企业预算先变了。客服、支持、工单、基础运营、部分数据分析,开始被Agent吸收。
有些岗位没被直接替掉,却被AI投入挤掉了。GPU、数据中心、模型团队需要巨额资金,企业从其他预算里找钱。另一些员工被调去管理Agent,岗位名称没消失,工作内容换了。
初级岗位尤其惨。
查资料、做总结、写基础代码、整理客户信息,最容易交给Agent,也恰好是新人熟悉行业的训练。人通过这些活理解业务、代码库、客户和组织里的判断标准。
2026年5月一篇论文分析招聘广告,2023年以来,容易被AI插手的工作内容占比下降约一成。一半来自企业减少这类岗位,四成来自企业改写原有岗位,把任务换成更难被AI接管的部分。
企业想招"更成熟的初级员工",同时又拿走了让人成熟的初级任务。

职业入口越收越窄。
安全问题也从论文走进产品。Anthropic的Mythos能发现并验证高严重性漏洞,公司不敢普通开放。加护栏后的Falbe 5,研究者又抱怨限制过重。
开放过多,降低网络攻击、生物风险门槛。限制过多,正常研究受损。谁能使用最强模型、哪些机构算"可信伙伴",现在受政府和地缘政治影响。
信息污染也在加深。Graphite分析显示,AI生成内容占互联网内容比例稳定在48%到50%,但ChatGPT引用来源里,被判断为AI生成的比例半年内从38.9%升到42.7%。
模型过去说过的话,绕了一圈,变成下一次回答的证据。
当SEO和GEO能利用这种偏好时,搜索系统容易变成机器引用机器的回音室。真正去过现场、采访过当事人、编辑过内容并愿意署名的材料,反而更稀缺。

最隐蔽的代价是"认知缴械"。
问题刚冒出来,手已经伸向ChatGPT。观点还没成形,AI已经把提纲列好了。
宾夕法尼亚大学沃顿商学院让1372名参与者完成近万次推理任务。只要允许使用AI,超过一半题目主动求助。即使AI给出错误答案,仍有约八成人选择相信。
Anthropic关于程序员学习的研究,AI辅助组完成陌生任务更快,后续闭卷测验表现平均低17%。任务交出去了,能力没有留下来。
文章由你提交,代码挂在你名字下面,方案由你汇报。责任是你的,生成这些东西的思考过程却越来越少由你完成。
泰勒制把工人变成生产线上的手,AI可能把人变成认知生产线上的盖章点。

所以,未来的AI,可能需要在有些环节故意留一点摩擦。
高风险操作前让人解释和确认,给出结论前先让人写下自己的判断,展示反面证据。
慢一点,但能留下思考和学习的位置。
2026年二季度的这些趋势,连起来看是一段连续的故事。
通用Agent夺走软件入口,Tokenmaxxing很快撞墙,暴露出人的复核速度和系统成本。Multi-Agent与自进化AI开始接手复核和迭代,CPU、内存、网络与模型路由让Agent跑得更快更便宜。
等这些问题有了办法,就业、安全、信息污染和认知缴械开始浮到台面。
企业接下来要积累的,不该只是Token用量。每一次执行都应留下可复用的工作流、评测、权限、组织记忆和结果反馈。
否则预算花完,除了流水什么都没留下。
更新时间:2026-07-22
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号