同题实测 · SAME PROMPT, MEASURED
同一道题,各家实际收费相差 26.6 倍
厂商公布的是「每百万 token 多少钱」。但一次调用花多少钱,取决于模型自己愿意吐多少 token ——
同一道题,有的模型十几个 token 收工,有的写好几百。所以标价便宜的,实付未必便宜。
下面这张表把同一道题发给每个模型,按它们各自真实上报的 token 用量算实付。
同一道题,各家实付
短问答(两句话解释一个概念)
| 模型 | 这道题实付 | tokens 入/出 | 耗时 | 样本 |
|---|---|---|---|---|
| deepseek-v4-flash ← 最便宜 | $0.000152 | 26 / 201 | 4554 ms | 1 |
| GLM5.2 | $0.000742 | 34 / 200 | 19610 ms | 1 |
| claude-sonnet-5 | $0.000994 | 21 / 116 | 4088 ms | 1 |
| gemini-3.5-flash | $0.001351 | 688 / 73 | 6797 ms | 1 |
| claude-opus-4-8 | $0.002124 | 21 / 102 | 7095 ms | 1 |
| Kimi-K3 | $0.002239 | 28 / 181 | 6438 ms | 1 |
| claude-fable-5 | $0.004048 | 21 / 97 | 3477 ms | 1 |
同一道题,最贵的比最便宜的贵 26.6 倍。
摘要(一段技术文字 → 三个要点)
| 模型 | 这道题实付 | tokens 入/出 | 耗时 | 样本 |
|---|---|---|---|---|
| deepseek-v4-flash ← 最便宜 | $0.000223 | 178 / 227 | 4692 ms | 1 |
| claude-sonnet-5 | $0.001464 | 206 / 137 | 4846 ms | 1 |
| GLM5.2 | $0.001612 | 182 / 400 | 15637 ms | 1 |
| Kimi-K3 | $0.002849 | 177 / 202 | 9647 ms | 1 |
| claude-opus-4-8 | $0.003924 | 206 / 155 | 4781 ms | 1 |
| claude-fable-5 | $0.007808 | 206 / 154 | 4798 ms | 1 |
同一道题,最贵的比最便宜的贵 35 倍。
结构化抽取(纯 JSON,不要散文)
| 模型 | 这道题实付 | tokens 入/出 | 耗时 | 样本 |
|---|---|---|---|---|
| deepseek-v4-flash ← 最便宜 | $0.000083 | 55 / 90 | 5331 ms | 1 |
| claude-sonnet-5 | $0.000277 | 54 / 23 | 3225 ms | 1 |
| claude-opus-4-8 | $0.000676 | 54 / 23 | 5379 ms | 1 |
| GLM5.2 | $0.000971 | 62 / 256 | 6887 ms | 1 |
| claude-fable-5 | $0.001352 | 54 / 23 | 4481 ms | 1 |
| Kimi-K3 | $0.001589 | 57 / 121 | 4854 ms | 1 |
同一道题,最贵的比最便宜的贵 19.1 倍。
怎么测的:固定提示词、temperature 0、限定 max_tokens,每晚各跑一次,成本按上游返回的 token 用量乘以我们实际支付的单价计算。没有返回 usage 的调用直接丢弃,不做估算。 窗口 30 天,更新于 2026-08-06T09:19。
路由抖动:同一个模型,有时会贵一个数量级
同一道题、同一个模型,上游有时把请求路由到一条带大段缓存前置的通道——我们发一个词过去, 它报回来 4,000 多个 prompt token。这不是模型的属性,是路由行为,所以上表已把这类请求剔除, 单独列在这里。做批量任务前值得知道它的发生率:
| 模型 | 命中前置的比例 | 命中时单次 | 干净时单次 | 每次多付 |
|---|---|---|---|---|
| gemini-3.5-flash | 67% | $0.005864 | $0.001351 | $0.004513 |
| gpt-5.5 | 100% | $0.019911 | — | — |
判据:单次请求中缓存命中的 prompt token ≥ 1000。样本随每晚探针累积,比例会越来越准。
另一组数:真实生产流量的实付
| 模型 | 单次均价 | 样本数 | 平均 tokens 入/出 | 可信度 |
|---|---|---|---|---|
| deepseek-v4-flash | $0.001288 | 133 | 1413 / 547 | ✅ 样本充足 |
| claude-sonnet-5 | $0.002222 | 2 | 254 / 223 | ⚠️ 样本少 |
| gpt-5.4-mini | $0.002752 | 1 | 4490 / 16 | ⚠️ 样本少 |
| gemini-3.5-flash | $0.003080 | 3 | 1477 / 182 | ⚠️ 样本少 |
| GLM5.2 | $0.005288 | 69 | 1192 / 1230 | ✅ 样本充足 |
| Kimi-K3-codex | $0.009177 | 2 | 151 / 637 | ⚠️ 样本少 |
| gpt-5.6-luna | $0.011836 | 21 | 4831 / 1661 | ⚠️ 样本一般 |
| Kimi-K3 | $0.014050 | 2 | 151 / 1049 | ⚠️ 样本少 |
这张表不能横向比较 —— 每个模型跑的是不同的真实任务,列在一起的差异里混着任务难度, 不是模型本身的差价。选型请看上面那张同题表;这张表回答的是另一个问题: 「在真实使用中,一次调用大概是什么量级」。样本数 < 10 的行只能当方向性参考。
给 Agent 的接口
curl "https://ainetcafe.com/api/model-costs"
curl "https://ainetcafe.com/t/model_costs?days=30"
返回 JSON,
standard_bench 是同题可比口径,production_mixed 是生产流量口径。
数据 CC BY 4.0,引用请注明 "AI NetCafe real model cost dataset, https://ainetcafe.com/costs"。
想直接按这些价格调用:给 Agent 的接入文档。