开源 AI 应用 × 大模型实测

把每个模型真的接进跑着的应用、按它的真实任务各跑两轮。通过率、成本、延迟全部实测, 成本读自实际账单。数据 CC BY 4.0,随便引(机读版)。上游不可用的模型不计入结论。

应用免费档最优$/轮全过/测到没跑通更新
gpt-researcher gpt-5.6-luna $0.0000 3/3 2026-09-16
gpt-academic gpt-5.6-luna $0.0000 3/3 2026-09-16
lobechat gpt-5.6-luna $0.0000 3/3 2026-09-16
nextchat gpt-5.6-luna $0.0000 3/3 2026-09-16
pdf-translate gpt-5.6-luna $0.0000 3/3 2026-09-16
presenton gpt-5.6-luna $0.0000 3/3 2026-09-16

反直觉的稳定发现:在需要结构化输出的应用上,若干很强的模型一项都跑不通—— 不是不够聪明,是 JSON/LaTeX 输出不稳,应用靠解析它干活。选型是可靠性问题,不是智力问题。

相关:贵的模型真的更强吗? · Agent 直接调用(MCP) · 可玩性榜