Kimi K3 实测:最贵也最慢,但有一类活它值这个价

Kimi K3 上线后我们真跑了一遍:同一个编码任务、五个模型,成本按账户真实扣费反推而不是照抄标价。结果和直觉相反。

测的是什么

写一个 JavaScript 函数:数组去重且保持原顺序,并给出 3 条边界情况的断言。只给代码。

五个模型跑同一个提示词,各一次,非流式,不设 max_tokens。成本不是按官网标价换算——我们先用「调用前后账户用量差」反推出真实单价($/M = model_ratio × 1.60 输入,× completion_ratio 输出,由两组独立实测反解且一致),再据此计量。过程中还发现我们自己表里 deepseek 的价格标高了近 3 倍,已一并修正。单次样本,仅供参考量级。

结果

模型花费延迟输出备注
deepseek-v4-flash $0.00140426.5s620 字 最便宜,但慢
claude-sonnet-5 $0.0022539.3s570 字 又快又便宜,本次综合最优
GLM5.2 $0.00543724.1s479 字 中间档
Kimi-K3-codex $0.006659.4s448 字 比基础版便宜一半,且快得多
Kimi-K3 $0.01710235.8s571 字 最贵且最慢

最贵的比最便宜的贵 12.2 倍

发现

K3 是五个里最贵的,比最便宜的贵 12 倍

实测输出单价约 $12/M。同一个任务,K3 花 $0.0171,DeepSeek 花 $0.0014。要跑几千次批量任务的话,这就是量级差别。

它也是最慢的:35.8 秒 vs Claude 的 9.3 秒

K3 是推理型模型,出答案前会先花大量 token 思考。而 claude-sonnet-5 在这个任务上又便宜 7.6 倍、又快 3.8 倍。注意 K3 的耗时波动很大——同类提问我们另一次只用了 11.9 秒,推理预算是浮动的。

codex 版反而更划算:便宜一半、快近 4 倍

Kimi-K3-codex 与基础版单价相同,但在编码任务上思考得更克制——$0.0067 对 $0.0171,9.4 秒对 35.8 秒。要用 K3 写代码,直接选 codex 版。

给推理型模型留足 max_tokens,否则可能白花钱

我们把 max_tokens 压到 200 测过一次,K3 的推理 token 吃光了全部预算,可见输出为 0,但费用照收。正常调用(不设限或给到 600 以上)没有这个问题——这不是 K3 的缺陷,而是所有推理型模型的通性,值得在你自己的应用里留意。

自己跑一遍对比 →

免注册就能试,每次调用都显示实际花费。也可以让 agent 直接调 compare_models