ClaudeFable5.1突袭上线!全榜霸榜,奥尔特曼火速预告新品

9月2日,Anthropic一次性对外放出两款重磅大模型,ClaudeFable5.1与ClaudeMythos5.1正式亮相。两款产品共享一套底层模型底座,唯一区别就是安全护栏的松紧程度。

这一次Fable5.1直接横扫多项行业基准测试,把GPT‑5.6Sol、前代Fable5等一众热门模型压在身后。有意思的是,发布消息传出没多久,OpenAI的CEO奥尔特曼就在社交平台发文,预告自家新品很快到来,字里行间透着一场新一轮大模型竞速已经打响。

不同于以往单纯堆性能的迭代,这次更新把成本这件事摆到台面上。表面看官方输入输出标价没有改动,但缓存读取费用大幅下调,还新增推理档位调节。高性能不等于一味烧钱,开发者可以根据业务,自己权衡能力和开销。社交平台上大量开发者已经上手实测,游戏开发、建筑渲染、疑难Bug排查,不少真实案例流出,也让外界看清这一代模型真实的实力与代价。

一、实测见真章:效果亮眼,但账单并不便宜

新版本上线之后,海外社交平台很快就被各路开发者的实测案例填满,不少人拿Fable5.1,和GPT‑5.6Sol、KimiK3做实打实的横向对比。

有开发者做3D场景生成测试,让模型搭建私人岛屿未来豪宅、镶嵌钻石吊灯的宏大厅堂。对比结果很直观,Fable5.1生成出来的画面细节层次更加丰富,光影、物体纹理处理更加细腻,但代价同样突出,完成同一套任务,开销达到GPT‑5.6Sol的六倍。

还有人专门测试游戏开发能力,对比Fable5.1和KimiK3。从交互逻辑、界面完整度到游戏运行流畅度,Fable5.1整体表现占优,整套项目跑下来,KimiK3花费11美元,Fable5.1则要18美元。不少开发者晒出成果,用Fable5.1完成房屋设计、渲染动画,镜子反射桌椅的光影细节都还原到位;也有人直接做出可运行的马里奥卡丁车衍生小游戏,对成品完成度相当满意。不少设计师看完演示,忍不住感慨AI正在快速蚕食传统设计岗位的工作边界。

高分榜单背后,也藏着容易被忽略的现实。第三方平台ArtificialAnalysis的数据显示,即便缓存读取资费砍了七成五,完整任务下Fable5.1的实际单任务成本依旧比Fable5高出两成,根源在于新版本输出Token消耗量是老版本的1.7倍。模型思考更深、输出内容更长,自然会带来额外消耗。

当然它也有省钱的打开方式。Anthropic内部人员分享实测结果,在CursorBench测试当中,把推理档位调到低功耗模式,Fable5.1低档位性能,能够追平Fable5高推理档位,成本却只有后者的三分之一。这就意味着,不是所有场景都必须拉满最高性能,普通业务完全可以降档位,省下一大笔开销。甚至不少开发者反馈,自己的Anthropic调用额度被官方悄悄重置,方便大家上手体验新模型。

二、多项基准霸榜,长周期智能体能力实现跨越式提升

官方公布的八项基准测试里,ClaudeFable5.1全部拿下第一名,AI分析指数拿到66分,高于Opus5的63分、Fable5的62分,也超过GPT‑5.6Sol、Grok4.6的61分。提升最明显的,集中在科学研究、长周期业务工作流这类智能体任务。

在Terminal‑Bench‑Science科研智能体测试当中,Fable5.1拿到52.6%的得分,其余主流模型全部落在22%‑29%区间,差距直接拉开一倍左右36氪。过去很多大模型做科研任务,习惯走捷径,拼凑答案快速输出,Fable5.1不会简单投机取巧,擅长顺着线索定位深层问题根源。

一家投资机构Millennium遇到过一个棘手故障,内部工程师折腾数年,其他大模型也排查无果,系统会不定期出现罕见崩溃。把问题交给Fable5.1之后,模型成功定位到故障诱因,展现出复杂系统排错的硬实力。中等、低难度任务场景,它同样可以做到不输甚至超越上一代Fable5,配合缓存降价,日常业务能够做到效果不掉,成本下降。

不管是自主写代码、跨学科思考,还是终端操作,长链条的多步骤任务,是这一代模型重点突破的方向。而这类任务恰恰是智能体、自动化工作流最核心的场景,也是现在企业落地AI项目最看重的能力。

三、Mythos5.1放开科研护栏,硬核科研任务再进一步

同底座的Mythos5.1,定位更偏向前沿科学研究,安全约束做了调整,面向经过审核的科研人员开放,普通开发者不能直接调用全部能力。官方放出几组相当震撼的科研案例。

在分子设计领域,接入开源蛋白质工具之后,Mythos5.1设计出来的结合剂亲和力表现突出。针对3个测试靶点,亲和力比行业顶尖团队AdaptyvBio高出十倍,12个靶点整体命中率接近50%,行业常规水平大多只有10‑15%。

借助NASA麦哲伦探测器几十年前的雷达原始数据,它训练神经网络,把金星地表高程地图从原来覆盖五分之一,拓展到三分之一,分辨率从10‑20公里提升至2‑3公里,测高精度最高提升25%,帮科研人员补齐金星地表测绘资料。

计算生物学场景下,它还能自动编写GPU专用算子,优化计算缓存,七套开源深度学习模型借助它的改写,运行速度最高提升2.5倍,直接缓解科研项目GPU算力瓶颈。

但高风险能力不会无门槛放开。Mythos5.1延续前代管控,生物相关高阶能力不会随便对外开放,设置两套专门验证计划。生命科学验证计划面向生命科学专业研究者,网络安全验证计划给到防御方向安全研究人员,完成资质审核之后,才能解锁对应的高阶能力。

四、企业安全与合规落地,兼顾能力与风险管控

随着模型能力越来越强,安全、数据隐私、合规,已经是企业选型绕不开的话题。

Fable5.1没有爆出重大安全漏洞,针对恶意编程、操控计算机的高危请求,拒绝拦截水平和前代旗舰模型保持同一水准。网络安全场景误报数量下降60%,模型可以挖掘软件漏洞,但不会生成攻击利用代码。

面向企业推出全新EFS企业安全防护体系,实现近似零数据留存效果,用户数据完全保存在客户自己管控的云服务器上,这套功能今年秋末分批上线给企业客户。

同时遵循欧盟AI法案相关规定,9月之后发布的模型输出内容全部增加水印。水印不会损伤生成内容质量,水印信息不携带用户身份、对话隐私,满足监管溯源要求。

五、大模型算账逻辑已经发生变化

Fable5.1这一轮更新,给行业带来一个很现实的启示。过去大家看API报价,只盯着输入、输出每百万Token多少钱,但是对于Agent、自动化工作流这类高频复用上下文的业务,这个数字已经不能代表真实开销。

缓存命中率、推理档位高低,才是决定最终账单的关键。这次Anthropic没有简单一刀切把全部价格打到底,而是把缓存读取大幅降价,同时开放高低推理档位。同样一个模型,开发者自己选择,追求极致性能就开高档位,预算有限就切低档位,把性能和成本的选择权交到使用者手里。

旗舰大模型之间的比拼,不再仅仅比拼榜单跑分。如何平衡性能、调用成本、安全合规,适配企业真实业务,已经成为各家竞争新战场。OpenAI迅速放出新品预告,也预示接下来一段时间,全球头部大模型的迭代竞速还会持续升温。

展开阅读全文

更新时间:2026-09-03

标签:游戏   上线   预告   新品   模型   档位   开发者   能力   缓存   测试   场景   性能   成本   业务

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号

Top