同题实测 · STRUCTURED EXTRACTION
只返回 JSON 的抽取任务,哪个模型最省钱?
答案是 deepseek-v4-flash,每次 $0.000073。
同一道题,最贵的 grok-4.6 是它的 79 倍 —— 跑一万次,差 $56.96。
典型场景:agent 管道里最常见的一环。这里模型之间差的往往不是能力而是话多话少 —— 有的模型规规矩矩返回 23 个 token,有的能写 300 个。
| # | 模型 | 每次实付 | 倍数 | tokens 入/出 | 耗时 |
|---|---|---|---|---|---|
| 1 | deepseek-v4-flash | $0.000073 | 基准 | 61 / 35 | 5402 ms |
| 2 | claude-sonnet-5 | $0.000437 | ×6.0 | 96 / 25 | 7879 ms |
| 3 | claude-opus-5 | $0.001086 | ×14.9 | 97 / 24 | 4141 ms |
| 4 | gpt-5.6-terra | $0.001549 | ×21.2 | 635 / 23 | 15587 ms |
| 5 | Kimi-K3 | $0.001980 | ×27.1 | 135 / 105 | 2391 ms |
| 6 | gpt-5.6-sol | $0.003667 | ×50.2 | 552 / 30 | 10524 ms |
| 7 | grok-4.6 | $0.005769 | ×79.0 | 462 / 808 | 18717 ms |
怎么测的:同一段提示词发给每个模型,temperature 0,限定 max_tokens,每晚各跑一次。 成本按上游返回的 token 用量乘以我们实际支付的单价计算 —— 没有返回用量的调用直接丢弃,不做估算。 因为是同一道题,差异只来自模型本身(它愿意吐多少 token、单价多少),不含任务难度。 窗口 30 天,更新于 2026-09-20T15:13。
其他任务
拿这份数据
curl "https://ainetcafe.com/api/model-costs"
curl "https://ainetcafe.com/t/model_costs?days=30"
CC BY 4.0,引用请注明 "AI NetCafe real model cost dataset, https://ainetcafe.com/costs"。
完整方法论与全部任务:/costs ·
想直接按这些价格调用:给 Agent 的接入文档。