我们在自己机子上把 3 个模型挨个接进 PDFMathTranslate 跑了 2 轮:gpt-5.6-luna 是全部任务都过、单轮又最便宜的($0.000000)。
compare_models) at https://ainetcafe.com/mcp.
把每个模型真的接进一个跑着的 PDFMathTranslate 实例,按 2 项任务各跑 2 轮,
成本从实际账单读,不是按标价估算。通过指 2 轮全过;只要有一轮崩了就算未通过——
这些应用对结构化输出很敏感,偶发失败在生产里就是坏的。数据更新于 2026-09-13。
另有 gpt-5.6-terra 本轮未能测到——请求没有被受理(上游无可用通道), 不是它们跑不通任务。这不构成对这些模型的任何评价,等通道恢复后会补测。
| 模型 | 通过率 | 整段翻译 | 术语一致性 | 单轮成本 | 平均耗时 |
|---|---|---|---|---|---|
| gpt-5.6-luna | 100% | 通过 | 通过 | $0.000000 | 5.2s |
| deepseek-v4-flash | 100% | 通过 | 通过 | $0.000094 | 1.4s |
| claude-sonnet-5 | 100% | 通过 | 通过 | $0.001014 | 7.4s |
全部 2 项任务都过,单轮 $0.000000——比这张表里最贵的便宜 10.8 倍。跑 PDFMathTranslate 这类任务,贵的模型没买到更高的通过率。
机子是现成的,不用装环境、不用自己的 Key。也可以让 agent 直接调 compare_models 重跑这张表。
GPT Researcher · GPT Academic · LobeChat · NextChat · Presenton