同题实测 · SAME PROMPT, MEASURED
同一道题,各家实际收费相差 34.3 倍
厂商公布的是「每百万 token 多少钱」。但一次调用花多少钱,取决于模型自己愿意吐多少 token ——
同一道题,有的模型十几个 token 收工,有的写好几百。所以标价便宜的,实付未必便宜。
下面这张表把同一道题发给每个模型,按它们各自真实上报的 token 用量算实付。
同一道题,各家实付
短问答(两句话解释一个概念)
| 模型 | 这道题实付 | tokens 入/出 | 耗时 | 样本 |
|---|---|---|---|---|
| deepseek-v4-flash ← 最便宜 | $0.000124 | 32 / 83 | 3335 ms | 28 |
| claude-sonnet-5 | $0.000999 | 62 / 88 | 8828 ms | 27 |
| gpt-5.6-terra | $0.002076 | 623 / 69 | 5981 ms | 6 |
| claude-opus-5 | $0.002539 | 60 / 90 | 7885 ms | 28 |
| Kimi-K3 | $0.003318 | 106 / 200 | 3371 ms | 29 |
| gpt-5.6-sol | $0.004095 | 395 / 71 | 10844 ms | 14 |
| grok-4.6 | $0.004253 | 569 / 519 | 19988 ms | 24 |
同一道题,最贵的比最便宜的贵 34.3 倍。
摘要(一段技术文字 → 三个要点)
| 模型 | 这道题实付 | tokens 入/出 | 耗时 | 样本 |
|---|---|---|---|---|
| deepseek-v4-flash ← 最便宜 | $0.000271 | 184 / 144 | 7617 ms | 28 |
| claude-sonnet-5 | $0.001976 | 259 / 146 | 12498 ms | 27 |
| gpt-5.6-terra | $0.002643 | 671 / 109 | 24463 ms | 8 |
| claude-opus-5 | $0.004942 | 259 / 146 | 11802 ms | 28 |
| grok-4.6 | $0.006302 | 816 / 778 | 22908 ms | 24 |
| Kimi-K3 | $0.006614 | 255 / 390 | 5192 ms | 28 |
| gpt-5.6-sol | $0.007775 | 755 / 133 | 15887 ms | 10 |
同一道题,最贵的比最便宜的贵 28.7 倍。
结构化抽取(纯 JSON,不要散文)
| 模型 | 这道题实付 | tokens 入/出 | 耗时 | 样本 |
|---|---|---|---|---|
| deepseek-v4-flash ← 最便宜 | $0.000073 | 61 / 35 | 5402 ms | 28 |
| claude-sonnet-5 | $0.000437 | 96 / 25 | 7879 ms | 29 |
| claude-opus-5 | $0.001086 | 97 / 24 | 4141 ms | 28 |
| gpt-5.6-terra | $0.001549 | 635 / 23 | 15587 ms | 5 |
| Kimi-K3 | $0.001980 | 135 / 105 | 2391 ms | 28 |
| gpt-5.6-sol | $0.003667 | 552 / 30 | 10524 ms | 17 |
| grok-4.6 | $0.005769 | 462 / 808 | 18717 ms | 21 |
同一道题,最贵的比最便宜的贵 79 倍。
怎么测的:固定提示词、temperature 0、限定 max_tokens,每晚各跑一次,成本按上游返回的 token 用量乘以我们实际支付的单价计算。没有返回 usage 的调用直接丢弃,不做估算。 窗口 30 天,更新于 2026-09-20T10:11。
路由抖动:同一个模型,有时会贵一个数量级
同一道题、同一个模型,上游有时把请求路由到一条带大段缓存前置的通道——我们发一个词过去, 它报回来 4,000 多个 prompt token。这不是模型的属性,是路由行为,所以上表已把这类请求剔除, 单独列在这里。做批量任务前值得知道它的发生率:
| 模型 | 命中前置的比例 | 命中时单次 | 干净时单次 | 每次多付 |
|---|---|---|---|---|
| gpt-5.6-terra | 63% | $0.011900 | $0.002176 | $0.009724 |
| gpt-5.6-sol | 44% | $0.024878 | $0.004815 | $0.020063 |
| grok-4.6 | 21% | $0.008420 | $0.005427 | $0.002993 |
判据:单次请求中缓存命中的 prompt token ≥ 1000。样本随每晚探针累积,比例会越来越准。
另一组数:真实生产流量的实付
| 模型 | 单次均价 | 样本数 | 平均 tokens 入/出 | 可信度 |
|---|---|---|---|---|
| deepseek-v4-flash | $0.000372 | 1414 | 189 / 219 | ✅ 样本充足 |
| gpt-5.6-sol | $0.004725 | 3 | 727 / 36 | ⚠️ 样本少 |
| Kimi-K3 | $0.007540 | 3 | 105 / 482 | ⚠️ 样本少 |
| grok-4.6 | $0.009116 | 3 | 2593 / 655 | ⚠️ 样本少 |
| claude-sonnet-5 | $0.009153 | 114 | 1426 / 630 | ✅ 样本充足 |
| gpt-5.6-terra | $0.009421 | 28 | 3985 / 121 | ⚠️ 样本一般 |
| claude-opus-5 | $0.038168 | 14 | 975 / 1332 | ⚠️ 样本一般 |
这张表不能横向比较 —— 每个模型跑的是不同的真实任务,列在一起的差异里混着任务难度, 不是模型本身的差价。选型请看上面那张同题表;这张表回答的是另一个问题: 「在真实使用中,一次调用大概是什么量级」。样本数 < 10 的行只能当方向性参考。
给 Agent 的接口
curl "https://ainetcafe.com/api/model-costs"
curl "https://ainetcafe.com/t/model_costs?days=30"
返回 JSON,
原始记录(每一次探针,含失败的和被剔除的):raw.csv —— 我们把剔除规则用到的数据也一起给出来,你可以自己复核我们算得对不对。
Hugging Face 上有每晚刷新的镜像:mario0369/llm-cost-same-prompt。 数据 CC BY 4.0,引用请注明 "AI NetCafe real model cost dataset, https://ainetcafe.com/costs"。 想直接按这些价格调用:给 Agent 的接入文档。
standard_bench 是同题可比口径,production_mixed 是生产流量口径。原始记录(每一次探针,含失败的和被剔除的):raw.csv —— 我们把剔除规则用到的数据也一起给出来,你可以自己复核我们算得对不对。
Hugging Face 上有每晚刷新的镜像:mario0369/llm-cost-same-prompt。 数据 CC BY 4.0,引用请注明 "AI NetCafe real model cost dataset, https://ainetcafe.com/costs"。 想直接按这些价格调用:给 Agent 的接入文档。