同题实测 · SAME PROMPT, MEASURED

同一道题,各家实际收费相差 26.6 倍

厂商公布的是「每百万 token 多少钱」。但一次调用花多少钱,取决于模型自己愿意吐多少 token —— 同一道题,有的模型十几个 token 收工,有的写好几百。所以标价便宜的,实付未必便宜。 下面这张表把同一道题发给每个模型,按它们各自真实上报的 token 用量算实付。

同一道题,各家实付

短问答(两句话解释一个概念)

模型这道题实付tokens 入/出耗时样本
deepseek-v4-flash ← 最便宜 $0.000152 26 / 201 4554 ms 1
GLM5.2 $0.000742 34 / 200 19610 ms 1
claude-sonnet-5 $0.000994 21 / 116 4088 ms 1
gemini-3.5-flash $0.001351 688 / 73 6797 ms 1
claude-opus-4-8 $0.002124 21 / 102 7095 ms 1
Kimi-K3 $0.002239 28 / 181 6438 ms 1
claude-fable-5 $0.004048 21 / 97 3477 ms 1

同一道题,最贵的比最便宜的贵 26.6 倍

摘要(一段技术文字 → 三个要点)

模型这道题实付tokens 入/出耗时样本
deepseek-v4-flash ← 最便宜 $0.000223 178 / 227 4692 ms 1
claude-sonnet-5 $0.001464 206 / 137 4846 ms 1
GLM5.2 $0.001612 182 / 400 15637 ms 1
Kimi-K3 $0.002849 177 / 202 9647 ms 1
claude-opus-4-8 $0.003924 206 / 155 4781 ms 1
claude-fable-5 $0.007808 206 / 154 4798 ms 1

同一道题,最贵的比最便宜的贵 35 倍

结构化抽取(纯 JSON,不要散文)

模型这道题实付tokens 入/出耗时样本
deepseek-v4-flash ← 最便宜 $0.000083 55 / 90 5331 ms 1
claude-sonnet-5 $0.000277 54 / 23 3225 ms 1
claude-opus-4-8 $0.000676 54 / 23 5379 ms 1
GLM5.2 $0.000971 62 / 256 6887 ms 1
claude-fable-5 $0.001352 54 / 23 4481 ms 1
Kimi-K3 $0.001589 57 / 121 4854 ms 1

同一道题,最贵的比最便宜的贵 19.1 倍

怎么测的:固定提示词、temperature 0、限定 max_tokens,每晚各跑一次,成本按上游返回的 token 用量乘以我们实际支付的单价计算。没有返回 usage 的调用直接丢弃,不做估算。 窗口 30 天,更新于 2026-08-06T09:19。

路由抖动:同一个模型,有时会贵一个数量级

同一道题、同一个模型,上游有时把请求路由到一条带大段缓存前置的通道——我们发一个词过去, 它报回来 4,000 多个 prompt token。这不是模型的属性,是路由行为,所以上表已把这类请求剔除, 单独列在这里。做批量任务前值得知道它的发生率:

模型命中前置的比例命中时单次干净时单次每次多付
gemini-3.5-flash 67% $0.005864 $0.001351 $0.004513
gpt-5.5 100% $0.019911

判据:单次请求中缓存命中的 prompt token ≥ 1000。样本随每晚探针累积,比例会越来越准。

另一组数:真实生产流量的实付

模型单次均价样本数平均 tokens 入/出可信度
deepseek-v4-flash $0.001288133 1413 / 547 ✅ 样本充足
claude-sonnet-5 $0.0022222 254 / 223 ⚠️ 样本少
gpt-5.4-mini $0.0027521 4490 / 16 ⚠️ 样本少
gemini-3.5-flash $0.0030803 1477 / 182 ⚠️ 样本少
GLM5.2 $0.00528869 1192 / 1230 ✅ 样本充足
Kimi-K3-codex $0.0091772 151 / 637 ⚠️ 样本少
gpt-5.6-luna $0.01183621 4831 / 1661 ⚠️ 样本一般
Kimi-K3 $0.0140502 151 / 1049 ⚠️ 样本少

这张表不能横向比较 —— 每个模型跑的是不同的真实任务,列在一起的差异里混着任务难度, 不是模型本身的差价。选型请看上面那张同题表;这张表回答的是另一个问题: 「在真实使用中,一次调用大概是什么量级」。样本数 < 10 的行只能当方向性参考。

给 Agent 的接口
curl "https://ainetcafe.com/api/model-costs"
curl "https://ainetcafe.com/t/model_costs?days=30"
返回 JSON,standard_bench 是同题可比口径,production_mixed 是生产流量口径。 数据 CC BY 4.0,引用请注明 "AI NetCafe real model cost dataset, https://ainetcafe.com/costs"。 想直接按这些价格调用:给 Agent 的接入文档