国产大模型的期中考试已经全部出分了

随着智谱的GLM-5.3终于也在AA竞技场开榜,年中这一轮国产模型的上新,基本算是告一段落了,目前各家厂牌的成绩如下:

Kimi K3和GLM-5.3并列60分,是中国唯二能够挤进T1阵营里的模型,死死咬住了GPT-5.6和Claude Opus 5。

当然Kimi K3是已经发布超过1个月的「老」模型了,可见含金量之足,月之暗面应该是今年惊喜最大的AI公司了,路线修正得太及时了。

按照智谱创始人唐杰的说法,GLM-5.3是故意在控制变量,只通过后训练来做迭代,不动基座、架构和参数,看看能有多少提升,结果相当不错。

T2档位排下来依次是58分的Qwen3.8 Max、53分的DeepSeek-V4-Pro、52分的Qwen3.8 27B,也是兼顾性能与经济性的高竞争区间,凡尔登绞肉机的市场。

阿里的Qwen3.8这一代其实口碑不错,非但Max版本重回开源,27B版本更是极其亲民,在Hugging Face,Qwen全系列模型今年被下载了20亿次以上,比第2名到第5名加起来还多。

DeepSeek-V4-Pro到底出了什么问题,现在没人知道,虽说有搭配专武(Harness极简模式)的找补,但我觉得葬AI说得没毛病,一言不合就堆定语,是车圈陋习,咱大模型行业不要学。

再说T3分段,这里已经接近上桌吃饭的底线了,能看到45分的MiniMax-M3、43分的MiMo-V2.5-Pro、42分的Hy3,主打一个量大管饱的供应,够用就行,要啥自行车呢。

MiniMax今年算是垫给了智谱,M3押注的原生多模路线,在商业价值上还是比不过纯Coding,最后还是靠视频模型找回了场子,字节比智谱好打你们敢信?

在DeepSeek-V4-Flash发布之前,小米的MiMo系列模型其实在OpenRouter上当了小半年的性价比之王,很适合用来跑自动化工具链之类的低价值高频次任务,也已经在财报里帮雷总做市值管理了。

腾讯的Hy3是姚顺雨的第一个作品,打响了翻盘的第一步,而且真做到了中美两开花,内有扶WokrBuddy上位的功劳,外有开打OpenRouter价格战的成绩,均衡双修。

再往下数,T4的分段就很接近不可言说的深海了,蚂蚁的Ling 3.0 Flash是38分,美团的LongCat 2.0是34分,阶跃的Step 3.7 Flash是31分,已经不太适用通用场景了,只能用在特定的细分领域。

比如它们都突出一个「快」字,主攻高速模型的品类,聪不聪明你别管,就问有没有秒回吧,在不追求解题效果的工业化任务里是有价值的。

什么,你问22分的百度文心ERNIE 5.0是不是位于马里亚纳海沟?自从拉了这坨大的之后,百度就没有再把新发布的ERNIR5.1上传AA竞技场了,不参战就是没胜负,精髓。



展开阅读全文

更新时间:2026-08-21

标签:游戏   模型   竞技场   车圈   马里亚纳   凡尔   路线   中美   成绩   版本   价值

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top