先说结论,省得你往下翻:我一开始把 agent 的默认模型设成了当时最新的 gpt-5.6,跑了两周把计费日志拉出来对了一遍——它是我这几个模型里最贵、也最慢的一个,每次调用平均 36 秒、约 0.0108 美元。而真正扛住这两周绝大多数调用量的,是一个我一开始没怎么看得上的便宜货:deepseek-v4-flash,平均每次 11 秒、0.0009 美元。差了 12 倍的钱、3 倍的时间。
这篇不聊 benchmark 分数,只聊我自己这套服务两周里的真实计费数据,以及它改变了我给 agent 配模型的方式。
我在做一个叫 AI 网吧(ainetcafe.com)的东西——把一堆开源 AI 应用托管起来、给 AI agent 直接调用,所有模型调用都过一个统一网关计费。所以我手上有一份别人没有的东西:同一批 prompt、同一套计费口径下,不同模型的真实每次成本和延迟,不是厂商 pricing 页上那个标称值。
利益披露先摆这儿:下面会提到我这套服务怎么用,你当广告看也行;但表格里的数字全是真的,我把复现方法也写在最后了,你可以自己验。
| 模型 | 真实调用次数 | 平均延迟 | 平均每次成本 | 平均输出 token |
|---|---|---|---|---|
| deepseek-v4-flash | 353 | 11.5s | $0.00089 | 520 |
| gemini-3.5-flash | 16 | 10.5s | $0.0048 | 301 |
| gpt-5.4-mini | 1 | 5.4s | $0.0028 | 16 |
| GLM5.2 | 77 | 29.3s | $0.0057 | 1311 |
| gpt-5.6-luna | 27 | 36.2s | $0.0108 | 1673 |
几个我没料到的点:
一、旗舰模型的延迟是会咬人的。 gpt-5.6 和 GLM5.2 平均都在半分钟以上。放在人来回聊天的场景无所谓,但 agent 是要串联着调的——一个任务里连着调五六次,前面这半分钟一乘就是三分钟,用户早跑了。我后来把"日常轻任务"的默认档换成了 deepseek-v4-flash,重任务才升到大模型,整体体感立刻不一样。
二、"贵"很多时候是因为它话多。 gpt-5.6 平均吐 1673 个 token,是 deepseek 的三倍多。你按 token 付费,它啰嗦你就多掏钱。很多场景我根本不需要它展开写小作文,一个 max_tokens 封顶 + 一句"直接给结论"的 system,成本能砍掉一大半。
三、便宜模型不等于不能打。 deepseek-v4-flash 扛了 353 次调用、占了绝大头,失败率并不比贵的高。日常问答、结构化提取、短文本处理这些,它完全够用。真正需要上旗舰的是少数硬骨头。
一句话:分档,别一把梭。
max_tokens;最后这条是血泪:我有个模型被上游悄悄撤了通道,agent 还在照着旧 id 调,一半请求直接 503,排查了半天才发现是模型没了而不是我代码的问题。
模型迭代很快,这张表过俩月数字肯定变,但"先看自己的真实账单再定默认模型"这件事不会过时。你要是也有一手数据,欢迎对一对,我挺想知道别人跑出来的是不是同一个结论。
给你的 agent 接上 AI 网吧(一行 MCP)→