同题实测 · STRUCTURED EXTRACTION

只返回 JSON 的抽取任务,哪个模型最省钱?

答案是 deepseek-v4-flash,每次 $0.000083。 同一道题,最贵的 Kimi-K3 是它的 19.1 倍 —— 跑一万次,差 $15.06

典型场景:agent 管道里最常见的一环。这里模型之间差的往往不是能力而是话多话少 —— 有的模型规规矩矩返回 23 个 token,有的能写 300 个。

#模型每次实付倍数tokens 入/出耗时
1deepseek-v4-flash $0.000083 基准 55 / 90 5331 ms
2claude-sonnet-5 $0.000277 ×3.3 54 / 23 3225 ms
3claude-opus-4-8 $0.000676 ×8.1 54 / 23 5379 ms
4GLM5.2 $0.000971 ×11.7 62 / 256 6887 ms
5claude-fable-5 $0.001352 ×16.3 54 / 23 4481 ms
6Kimi-K3 $0.001589 ×19.1 57 / 121 4854 ms

怎么测的:同一段提示词发给每个模型,temperature 0,限定 max_tokens,每晚各跑一次。 成本按上游返回的 token 用量乘以我们实际支付的单价计算 —— 没有返回用量的调用直接丢弃,不做估算。 因为是同一道题,差异只来自模型本身(它愿意吐多少 token、单价多少),不含任务难度。 窗口 30 天,更新于 2026-08-06T11:59。

其他任务

拿这份数据
curl "https://ainetcafe.com/api/model-costs"
curl "https://ainetcafe.com/t/model_costs?days=30"
CC BY 4.0,引用请注明 "AI NetCafe real model cost dataset, https://ainetcafe.com/costs"。 完整方法论与全部任务:/costs · 想直接按这些价格调用:给 Agent 的接入文档