榜单 · 2026-06 首发 · 全表逐行复核 2026-09-01 · 第一档 OpenAI 行更新 2026-09-05
哪个模型当龙虾的“大脑”更合适
龙虾本身不带智商,它要接一个大模型当大脑。换个模型,同一只龙虾的表现可能差出一截。新手最常踩的坑,是照着别人推荐随手接一个,结果跑多步任务时它中途忘事、工具参数填错、或者一句中文指令理解偏了——任务就废在半路。所以选模型这件事,对智能体比对聊天机器人重要得多:聊天只要它“答得好”,智能体要它“一连串动作都不出错”。
下面这张表把 10 个常见模型按同一套口径排了个序。刚换代不久的那几款,档位先按各家官方文档给出的定位放,等它们在我们自己的任务集上跑够了再校。先说清楚评分方法,再看排名。
排档看什么(四项,按看重程度从高到低,与关于页口径一致)
- 工具调用稳定性 让它跑同一批多步任务,看中途崩不崩、参数填对的比例。这一项排在最前——智能体调不动工具,别的都白搭。
- 长任务连贯性 任务拉长后会不会忘了前面、自己绕进死循环。
- 中文表现 中文指令的理解和输出质量,含术语别译错。
- 成本与可得性 API 价格、能不能本地跑、量化后掉多少。
这是编辑部排的序,不是官方跑分。下表的“推荐档”是上面四项综合后的定性判断,分第一档 / 第二档 / 第三档,排名只靠 # 列的先后体现,我们不打精确分数,因为没有谁真做过统一的官方基准测试。这是编辑部的观点,会随版本更新,最近一次全表逐行复核是 2026-09-01;此后第一档里 OpenAI 这一行在 2026-09-05 单独复核并换了模型,其余各行没有跟着重核。它不等于任何公开榜单的成绩。每项怎么看、用的什么任务集,写在关于与评分方法里,你可以拿同样的口径自己核对。
榜单(全表复核 2026-09-01 · 第一档 OpenAI 行更新 2026-09-05)
本榜 2026-09-01 对着各家官方文档逐行看过一遍,那一次闭源第一档的两行按新阵容改了;2026-09-05 我们只回头核了 OpenAI 这一行,把第 2 行换成了刚发布的 GPT-6 Astra。两次改了什么,都写在下面这节。3-10 名这次没有逐行重核,也没有可核实的新信息,维持 09-01 的状态——宁可标着旧的,也不猜一个新的填上去。
| # | 模型 | 推荐档 |
|---|---|---|
| 1 | Claude Opus 5 | 第一档 |
| 2 | GPT-6 Astra | 第一档 |
| 3 | Gemini 3 Pro | 第一档 |
| 4 | DeepSeek-V3.2 | 第二档 |
| 5 | Qwen3-32B | 第二档 |
| 6 | GLM-5 | 第二档 |
| 7 | Llama 4 | 第二档 |
| 8 | Mistral Large 3 | 第三档 |
| 9 | Kimi K2 | 第三档 |
| 10 | MiniMax-01 | 第三档 |
推荐档是我们的主观判断,会随版本和测试任务变化,不必当成定论。看到和你的体感不一致很正常——不同任务对“稳定性”的要求差别很大。建议照评分方法里的口径,拿你自己常跑的活试一两个候选,比看任何榜单都准。如果你发现某条标注(比如“本地可跑”)不对,欢迎到更正记录页看我们怎么改、或者告诉我们。
第一档动过什么(按时间倒序留档)
2026-09-05:第 2 行从 GPT-5.6 换成 GPT-6 Astra
OpenAI 于 2026-09-03 发布 GPT-6 Astra(gpt-6-astra),官方把它写成目前最能打的一款,冲着最难的端到端活去:computer use、浏览、软件工程、科学与专业工作这几块官方点名它到了 SOTA,长处是跨代码、浏览器和专业软件的多步流程。这正好是龙虾这类智能体天天在干的事,所以第一档里 OpenAI 的代表换成它。价格 $10 / $50 每百万 token,上下文 1,050,000、最大输出 128,000。这里有一处容易看漏,跟 GPT-5.6 那边同理:输入超过 272K 的请求,整条请求按 2 倍的输入与缓存费率、1.5 倍的输出费率重算,不是只给超出的那部分加价。要不要给龙虾换、换之前该先审哪些 skills,写在GPT-6 Astra 给龙虾当大脑。
换行不等于 GPT-5.6 过时了,这点容易看反。官方给旧 GPT-5 线(gpt-5-2025-08-07 等将于 2026-12-11 关停)指的迁移方向,正是 GPT-5.6 的 Sol / Terra / Luna——它是被推荐的那一档,不是被淘汰的那一档。Astra 的单价是 Sol 的 2.5 倍(输入输出都是),走量的活留在 5.6 三档更划算,所以第 2 行的点评把这两件事写在了一起。三档分别适合什么活,仍看GPT-5.6 三档解读。
这一次只重新核了 OpenAI 这一行,3-10 名没有逐行重核,仍是 09-01 那次的状态。另外我们还没拿 Astra 跑过自己的任务集,上面写的是官方文档的定位,不是我们的实测结论;等它在我们常跑的活上跑够了再回来校档位。本节的价格与规格照抄官方文档,核对日期 2026-09-05。
2026-09-01:Opus 4.8 换成 Opus 5、GPT-5.1 换成 GPT-5.6
那次改动之前,榜首挂的还是 Claude Opus 4.8,它已经被官方移进 Legacy 名单——还能调,但不再是当前旗舰。按当时的官方模型总览页,Anthropic 在售的是四款:
- Claude Fable 5.1(
claude-fable-5-1) $10 / $50 每百万 token,1M 上下文、最大输出 128K。官方定位是吃推理、跑长程的智能体活。 - Claude Opus 5(
claude-opus-5) $5 / $25,1M / 128K。面向复杂智能体编码与企业级工作,官方说大多数场景都该从它起步。 - Claude Sonnet 5(
claude-sonnet-5) $2 / $10,1M / 128K。速度与智力之间取平衡的那一档。 - Claude Haiku 4.5(
claude-haiku-4-5) $1 / $5,200K / 64K。四款里最快,官方说它的智能已经接近前沿。
那为什么榜首放 Opus 5,而不是更贵、更新的 Fable 5.1?因为官方自己就是这么建议的:大多数场景从 Opus 5 起步;Fable 5.1 留给 demanding reasoning 和 long-horizon agentic work,或者你在 Opus 5 上把 effort 调高之后、跑自己的评测仍然不达标的时候。它贵整整一倍,不是“谁都该换过去的更强版”——所以那一版我们把它写成第一档里的加档选项,而不是让它单独占一行压在 Opus 5 头上。龙虾这种一圈圈转的智能体循环,绝大多数人在 Opus 5 上先把 effort 调上去就够了。怎么接、effort 五档怎么定,写在龙虾AI 接 Claude Opus 5;到底值不值得往 Fable 5.1 换、换前要改哪几处配置,写在Fable 5.1 该不该换。
另一头,OpenAI 的 GPT-5.6 于 2026-07-09 全面发布,再上一版我们只给了观察位,那次正式接替 GPT-5.1 进第一档——站内三篇文章都在讲它,榜上还挂着 5.1 说不过去。(这一行后来在 2026-09-05 又换成了 GPT-6 Astra,见上一节;GPT-5.6 本身没有退役,仍是官方推荐的长期档位。)它按长期档位分三层:Sol(旗舰)$4 / $20、Terra(强性能低成本)$2 / $12、Luna(最快最省)$0.20 / $1.20。有两处容易看漏:Sol 的现价是促销价,官方标注至少持续到 2026-11-21;长上下文档位的单价是上面这组的两倍。三档分别适合什么活,写在GPT-5.6 三档解读;和 Claude 一侧怎么取舍,写在GPT-5.6 与 Claude 的对比。
本节(2026-09-01 那次)的价格、model ID 和上下文规格照抄各家官方文档,核对日期同为 2026-09-01。这类数字改得比模型本身还勤,真要按它算成本,请回官方定价页看当时显示的数。