同题实测 · SAME PROMPT, MEASURED

同一道题,各家实际收费相差 34.3 倍

厂商公布的是「每百万 token 多少钱」。但一次调用花多少钱,取决于模型自己愿意吐多少 token —— 同一道题,有的模型十几个 token 收工,有的写好几百。所以标价便宜的,实付未必便宜。 下面这张表把同一道题发给每个模型,按它们各自真实上报的 token 用量算实付。

同一道题,各家实付

短问答(两句话解释一个概念)

模型这道题实付tokens 入/出耗时样本
deepseek-v4-flash ← 最便宜 $0.000124 32 / 83 3335 ms 28
claude-sonnet-5 $0.000999 62 / 88 8828 ms 27
gpt-5.6-terra $0.002076 623 / 69 5981 ms 6
claude-opus-5 $0.002539 60 / 90 7885 ms 28
Kimi-K3 $0.003318 106 / 200 3371 ms 29
gpt-5.6-sol $0.004095 395 / 71 10844 ms 14
grok-4.6 $0.004253 569 / 519 19988 ms 24

同一道题,最贵的比最便宜的贵 34.3 倍

摘要(一段技术文字 → 三个要点)

模型这道题实付tokens 入/出耗时样本
deepseek-v4-flash ← 最便宜 $0.000271 184 / 144 7617 ms 28
claude-sonnet-5 $0.001976 259 / 146 12498 ms 27
gpt-5.6-terra $0.002643 671 / 109 24463 ms 8
claude-opus-5 $0.004942 259 / 146 11802 ms 28
grok-4.6 $0.006302 816 / 778 22908 ms 24
Kimi-K3 $0.006614 255 / 390 5192 ms 28
gpt-5.6-sol $0.007775 755 / 133 15887 ms 10

同一道题,最贵的比最便宜的贵 28.7 倍

结构化抽取(纯 JSON,不要散文)

模型这道题实付tokens 入/出耗时样本
deepseek-v4-flash ← 最便宜 $0.000073 61 / 35 5402 ms 28
claude-sonnet-5 $0.000437 96 / 25 7879 ms 29
claude-opus-5 $0.001086 97 / 24 4141 ms 28
gpt-5.6-terra $0.001549 635 / 23 15587 ms 5
Kimi-K3 $0.001980 135 / 105 2391 ms 28
gpt-5.6-sol $0.003667 552 / 30 10524 ms 17
grok-4.6 $0.005769 462 / 808 18717 ms 21

同一道题,最贵的比最便宜的贵 79 倍

怎么测的:固定提示词、temperature 0、限定 max_tokens,每晚各跑一次,成本按上游返回的 token 用量乘以我们实际支付的单价计算。没有返回 usage 的调用直接丢弃,不做估算。 窗口 30 天,更新于 2026-09-20T10:11。

路由抖动:同一个模型,有时会贵一个数量级

同一道题、同一个模型,上游有时把请求路由到一条带大段缓存前置的通道——我们发一个词过去, 它报回来 4,000 多个 prompt token。这不是模型的属性,是路由行为,所以上表已把这类请求剔除, 单独列在这里。做批量任务前值得知道它的发生率:

模型命中前置的比例命中时单次干净时单次每次多付
gpt-5.6-terra 63% $0.011900 $0.002176 $0.009724
gpt-5.6-sol 44% $0.024878 $0.004815 $0.020063
grok-4.6 21% $0.008420 $0.005427 $0.002993

判据:单次请求中缓存命中的 prompt token ≥ 1000。样本随每晚探针累积,比例会越来越准。

另一组数:真实生产流量的实付

模型单次均价样本数平均 tokens 入/出可信度
deepseek-v4-flash $0.0003721414 189 / 219 ✅ 样本充足
gpt-5.6-sol $0.0047253 727 / 36 ⚠️ 样本少
Kimi-K3 $0.0075403 105 / 482 ⚠️ 样本少
grok-4.6 $0.0091163 2593 / 655 ⚠️ 样本少
claude-sonnet-5 $0.009153114 1426 / 630 ✅ 样本充足
gpt-5.6-terra $0.00942128 3985 / 121 ⚠️ 样本一般
claude-opus-5 $0.03816814 975 / 1332 ⚠️ 样本一般

这张表不能横向比较 —— 每个模型跑的是不同的真实任务,列在一起的差异里混着任务难度, 不是模型本身的差价。选型请看上面那张同题表;这张表回答的是另一个问题: 「在真实使用中,一次调用大概是什么量级」。样本数 < 10 的行只能当方向性参考。

给 Agent 的接口
curl "https://ainetcafe.com/api/model-costs"
curl "https://ainetcafe.com/t/model_costs?days=30"
返回 JSON,standard_bench 是同题可比口径,production_mixed 是生产流量口径。
原始记录(每一次探针,含失败的和被剔除的):raw.csv —— 我们把剔除规则用到的数据也一起给出来,你可以自己复核我们算得对不对。
Hugging Face 上有每晚刷新的镜像:mario0369/llm-cost-same-prompt。 数据 CC BY 4.0,引用请注明 "AI NetCafe real model cost dataset, https://ainetcafe.com/costs"。 想直接按这些价格调用:给 Agent 的接入文档