跑 GPT Researcher 该配哪个模型?3 个模型实测

我们在自己机子上把 3 个模型挨个接进 GPT Researcher 跑了 2 轮:deepseek-v4-flash 是全部任务都过、单轮又最便宜的($0.000554)。

EN — Benchmark: which LLM actually works with GPT Researcher (autonomous web research agent). 3 models x 2 tasks, 2 runs each, measured cost and latency. Best value: deepseek-v4-flash. Raw data and a live re-run are available via our MCP server (compare_models) at https://ainetcafe.com/mcp.

怎么测的

把每个模型真的接进一个跑着的 GPT Researcher 实例,按 2 项任务各跑 2 轮, 成本从实际账单读,不是按标价估算。通过指 2 轮全过;只要有一轮崩了就算未通过—— 这些应用对结构化输出很敏感,偶发失败在生产里就是坏的。数据更新于 2026-09-13。

另有 gpt-5.6-terra 本轮未能测到——请求没有被受理(上游无可用通道), 不是它们跑不通任务。这不构成对这些模型的任何评价,等通道恢复后会补测。

结果

模型通过率列研究大纲把搜到的材料压成摘要单轮成本平均耗时
deepseek-v4-flash 100% 通过通过 $0.0005543.1s
claude-sonnet-5 100% 通过通过 $0.00637127.3s
gpt-5.6-luna 50% 未通过通过 $0.00000028.2s

结论

想省钱:deepseek-v4-flash

全部 2 项任务都过,单轮 $0.000554——比这张表里最贵的便宜 11.5 倍。跑 GPT Researcher 这类任务,贵的模型没买到更高的通过率。

2 / 3 个模型能真正跑通

换句话说,1 个模型接上去看着能用,实际会在某项任务上翻车。这就是为什么值得先看实测再选型。

免注册直接跑 GPT Researcher →

机子是现成的,不用装环境、不用自己的 Key。也可以让 agent 直接调 compare_models 重跑这张表。

其他应用的实测

GPT Academic · LobeChat · NextChat · PDFMathTranslate · Presenton