LLM 真实成本对比(2026-09-14 更新):按账户扣费计量,不是照抄标价

7 个模型的真实单次成本与延迟,数据来自 14 天内的实际调用并按账户扣费差值反推。最贵的比最便宜的贵 null 倍。每日自动更新。

测的是什么

数据来自本站真实调用(近 14 天,排除内部评测)。成本读上游 usage 逐次计量,不是按官网标价换算。

近 14 天真实调用聚合,仅保留样本数 ≥2 的模型。延迟为端到端耗时含网络。不同任务的成本差异很大,此表用于比较量级而非精确定价。每日 09:25 自动重新生成。

结果

模型花费延迟输出备注
gpt-5.6-luna $null52.6s792 字 OpenAI 轻量档(上游未公布单价,成本按最贵档保守计) · 29 次样本
deepseek-v4-flash $0.0003098.1s188 字 开源系·最快·推理型 · 717 次样本
gpt-5.6-sol $0.00472515.3s36 字 OpenAI 旗舰·注意有约 3.8k token 固定前置,短调用不划算 · 旗舰档(需自带 Key) · 3 次样本
Kimi-K3 $0.0075413.3s482 字 开源系旗舰·中文强 · 旗舰档(需自带 Key) · 3 次样本
grok-4.6 $0.00911620.2s655 字 推理型·会吐思考 token · 旗舰档(需自带 Key) · 3 次样本
gpt-5.6-terra $0.00931429.2s127 字 OpenAI 均衡档 · 23 次样本
claude-opus-5 $0.03816824.0s1332 字 最强推理 · 旗舰档(需自带 Key) · 14 次样本

发现

最贵的比最便宜的贵 null 倍

claude-opus-5 均价 $0.038168,gpt-5.6-luna 均价 $null。单次调用差别不大,但批量任务跑几千次就是量级差别。这也是我们做这张表的原因——按标价换算算不出这个结论。

最快的是 deepseek-v4-flash(8.1s)

贵不等于快。延迟和价格经常反向——推理型模型出答案前要先花 token 思考,所以又慢又贵;而某些便宜模型反而响应更快。

为什么不能照抄官网标价

我们一开始就是这么做的,结果拿已知模型一验就露馅:用通用换算公式算 claude-sonnet-5 得到 $75/M,实际约 $8/M。改用「调用前后账户用量差」反推才对得上,还顺带发现自己表里有个模型标高了近 3 倍。

自己跑一遍

这些模型在本站都能免注册直接切换试用,每次调用显示实际花费。也可以让 agent 直接调 MCP 的 compare_models 工具,用你自己关心的提示词跑对比。

自己跑一遍对比 →

免注册就能试,每次调用都显示实际花费。也可以让 agent 直接调 compare_models