Kimi K3 上线后我们真跑了一遍:同一个编码任务、五个模型,成本按账户真实扣费反推而不是照抄标价。结果和直觉相反。
五个模型跑同一个提示词,各一次,非流式,不设 max_tokens。成本不是按官网标价换算——我们先用「调用前后账户用量差」反推出真实单价($/M = model_ratio × 1.60 输入,× completion_ratio 输出,由两组独立实测反解且一致),再据此计量。过程中还发现我们自己表里 deepseek 的价格标高了近 3 倍,已一并修正。单次样本,仅供参考量级。
| 模型 | 花费 | 延迟 | 输出 | 备注 |
|---|---|---|---|---|
| deepseek-v4-flash | $0.001404 | 26.5s | 620 字 | 最便宜,但慢 |
| claude-sonnet-5 | $0.002253 | 9.3s | 570 字 | 又快又便宜,本次综合最优 |
| GLM5.2 | $0.005437 | 24.1s | 479 字 | 中间档 |
| Kimi-K3-codex | $0.00665 | 9.4s | 448 字 | 比基础版便宜一半,且快得多 |
| Kimi-K3 | $0.017102 | 35.8s | 571 字 | 最贵且最慢 |
最贵的比最便宜的贵 12.2 倍
实测输出单价约 $12/M。同一个任务,K3 花 $0.0171,DeepSeek 花 $0.0014。要跑几千次批量任务的话,这就是量级差别。
K3 是推理型模型,出答案前会先花大量 token 思考。而 claude-sonnet-5 在这个任务上又便宜 7.6 倍、又快 3.8 倍。注意 K3 的耗时波动很大——同类提问我们另一次只用了 11.9 秒,推理预算是浮动的。
Kimi-K3-codex 与基础版单价相同,但在编码任务上思考得更克制——$0.0067 对 $0.0171,9.4 秒对 35.8 秒。要用 K3 写代码,直接选 codex 版。
我们把 max_tokens 压到 200 测过一次,K3 的推理 token 吃光了全部预算,可见输出为 0,但费用照收。正常调用(不设限或给到 600 以上)没有这个问题——这不是 K3 的缺陷,而是所有推理型模型的通性,值得在你自己的应用里留意。
免注册就能试,每次调用都显示实际花费。也可以让 agent 直接调 compare_models。