AA (aardio autos)今天发布的版本有较大改进。当其他 Agent 还在 Shell 命令行里苦苦挣扎读写文件出错,不小心清空了 C 盘等问题,在 AA里 AI 已经可以流畅地自主写游戏 …… 自己玩游戏了,全程自主操作。
最重要的是 AA 的运行环境只有几 MB,下载开箱即用。不需要任何复杂的配置,鼠标点几下就会用。最古老的 XP 电脑都能流畅运行(不需要安装任何其他东西)。
今天我们就顺手使用 AA 对全部主流模型做一次测试与对比。
以下是测试总结,位置靠上的模型效果更好,位置靠右费用成本更高。

在 AA 新版里用 DeepSeek 4 Pro(推理强度=xhigh)“写个见缝插针”的效果如下图(GIF 画质受限,实际效果非常惊艳,吊打 Claude Fable 5 肯定没问题。测试过程的思考风格与平时差别很大,怀疑是撞到了什么隐藏实力的版本),本次测试费用 ¥0.88

AA 新版里 GPT 5.6 Sol(推理强度=max) “写个见缝插针” 的效果如下图,配色比上次的截图效果低调,但仅凭在内存里手绘就可以将 UI 细节做得很精致。本次测试费用 ¥16

DeepSeek Flash(推理强度=max)在新版 AA 里测试“写个见缝插针”的效果截图如下,本次测试费用 ¥0.25

AA 最新版本中 GPT 5.6 Luna(推理强度=max) 测试“写个见缝插针”的效果截图如下,本次测试费用 ¥0.27

Gemini Flash 3.6(推理强度=high) 在 AA 新版中测试“写个见缝插针”的效果截图如下,测试费用 0 元(AI Studio 免费)。很多人以为 Gemini 弱 —— 这其实是很大的一个误解。Gemini 最大的问题就是不愿意调用工具(而 Agent 是一个勤能补拙的环境),例如这个任务,它调用了几次工具就立即交付代码了,有的模型调用几十次工具做得还不如它。

Kimi3(推理强度=max) 在 AA 新版中测试“写个见缝插针”的效果截图如下,本次测试费用 ¥4.2

Hy3(推理强度=high)大模型在 AA 中AA 新版中测试“写个见缝插针”的效果截图如下,本次测试费用 ¥0.28

豆包家的最新模型是 Doubao Seed Evolving , 号称持续进化、滚动升级,高频迭代,没有版本号 …… 让我们也来试试它到底如何。
注意火山的 openai / responses 协议都存在不兼容的字段,我已经做了处理,请先升级到 aardio 最新版本。
AA 最新版 Doubao Seed Evolving 模型(推理强度=high)测试“写个见缝插针”的效果截图如下,本次测试费用 0 元(火山协作计划每天有几百万免费 tokens)。Doubao Seed Evolving 实际定价与 GLM 5.2 在同一梯队。

Claude Fable 5(推理强度=xhigh) 在 AA 最新本测试“写个见缝插针”的效果截图如下,本次测试费用 ¥56 元。每一个像素都散发着美元烧焦的味道 。

GLM 5.2 (推理强度=high) 在 AA 最新本测试“写个见缝插针”的效果截图如下,本次测试费用 ¥5.8 元。有一个缺陷:绘图区覆盖了窗口标题栏。

Qwen 3.8 Max (推理强度=max), 在 AA 最新本测试“写个见缝插针”的思考时间有点长。估计超过了半小时,其他模型最多几分钟就完成任务),因为我想看看它想这么久到底会写出什么效果,所以一直等待没有点中止。最后输出的成果截图如下。本次测试费用 ¥12.62
更新时间:2026-08-11
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号