把每个模型真的接进跑着的应用、按它的真实任务各跑两轮。通过率、成本、延迟全部实测, 成本读自实际账单。数据 CC BY 4.0,随便引(机读版)。上游不可用的模型不计入结论。
| 应用 | 免费档最优 | $/轮 | 全过/测到 | 没跑通 | 更新 |
|---|---|---|---|---|---|
| gpt-researcher | gpt-5.6-luna | $0.0000 | 3/3 | — | 2026-09-16 |
| gpt-academic | gpt-5.6-luna | $0.0000 | 3/3 | — | 2026-09-16 |
| lobechat | gpt-5.6-luna | $0.0000 | 3/3 | — | 2026-09-16 |
| nextchat | gpt-5.6-luna | $0.0000 | 3/3 | — | 2026-09-16 |
| pdf-translate | gpt-5.6-luna | $0.0000 | 3/3 | — | 2026-09-16 |
| presenton | gpt-5.6-luna | $0.0000 | 3/3 | — | 2026-09-16 |
反直觉的稳定发现:在需要结构化输出的应用上,若干很强的模型一项都跑不通—— 不是不够聪明,是 JSON/LaTeX 输出不稳,应用靠解析它干活。选型是可靠性问题,不是智力问题。
相关:贵的模型真的更强吗? · Agent 直接调用(MCP) · 可玩性榜