
让最贵的模型只负责定方向、做验收,实现环节全部交给便宜模型。一位开发者把这套编排思路做成了现成的包,实测下来顶级模型的额度消耗砍掉 98%,文档、测试照跑不误。
刚上线那一周,额度确实宽裕。有开发者一口气用了 5 亿(500M)token,离每周上限还差得远,平台又送过两次免费重置,用起来相当省心。可没过多久风向就变了:限速提示频繁弹出,为了把下一个 5 亿 token 跑完,他前后重置了 4 次。月度 20 倍档的套餐,照样不够烧。
他先试的是老办法:把此前给别的智能体写好的技能搬过来,让顶级模型把构建类任务转包出去。结果不痛不痒,用量只降了 10% 左右,还带出一堆新问题。同一套流程在 Claude 的 Fable 上跑得挺顺,挪到 codex 里就处处别扭。
接着他又试了子智能体混编,让几款大小模型分别承担不同环节。每款都有自己的长处和短板,换来的改善却都算不上实质性。折腾了一大圈,方向始终没对准:真正卡住他的是分工,跟模型强弱关系不大。这样使劲,无异于缘木求鱼。
真正的变化来自一次换人。把实现环节交给 DeepSeek V4.1 Flash 之后,输出质量立刻上了一个台阶,据他描述已经能跟 Opus 5 掰手腕,顶级模型的用量当场降了 60%。
代价还低得离谱。每百万 token 的价差摆出来,任谁看了都心动:
计费项 | 顶级模型 | V4.1 Flash | 贵出倍数 |
未命中缓存的输入 | 10 美元 | 0.15 至 0.30 美元 | 33 到 67 倍 |
命中缓存的输入 | 1 美元 | 0.003 至 0.006 美元 | 167 到 333 倍 |
输出 | 50 美元 | 0.60 至 1.20 美元 | 42 到 83 倍 |
拿顶配模型去写实现,正是杀鸡焉用牛刀。
后面的优化,全花在"少让顶级模型亲自动手"上。得其大者可以兼其小,把决策和验收这两件大事抓住,实现这种细活自然就有着落了。
安装路径不复杂:
跑起来就三步:顶级模型管范围、架构设计,把每个阶段拆成任务简报;Flash 负责摸底、实现、测试,逐项汇报;顶级模型再审、再验,逐项决定通过还是打回重做。
他的对照数据相当直白:一场 7 小时的构建,只消耗每周额度的 2%;而更早那次 5 小时的构建,烧掉了 28% 还多。
基准图里的账更细。顶级模型的 token 消耗从 856 万降到 9.59 万,降幅 98.9%。同一段提示词,薄编排跑出 47449 行源码与测试,比全用顶级模型的 34425 行还多 39%。折算到每千行实现代码,顶级模型的开销从 11.32 美元压到 0.26 至 0.34 美元。候选跑那一轮,6706 个测试全部通过,0 失败,63 条验收标准一条不落。
以人为镜,可以明得失。别人踩过的坑已经写在明处,照着调配置就好,不必自己从头再撞一遍。
原文链接:
https://www.reddit.com/r/vibecoding/comments/1wl3lfi/i_built_an_orchestration_package_that_lowered_my/
仓库地址:
github.com/ethanplusai/astra-flash-orchestrator
更新时间:2026-10-06
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号