龙虾AI · OpenClaw 智能体生态导航 龙虾AI(OpenClaw)中文资料与下载导航
OpenAI 开发者文档的 GPT-6 Astra 模型页:副标题 Our most capable model, built for the hardest end-to-end work,一排指标卡显示 REASONING Highest、SPEED Fast、PRICE $10 输入 / $50 输出、INPUT Text image、OUTPUT Text,右侧列出 1,050,000 上下文窗口、128,000 最大输出、2026 年 4 月 30 日知识截止,下方四张价格卡为输入 $10.00、缓存输入 $1.00、缓存写入 $12.50、输出 $50.00
OpenAI 官方 GPT-6 Astra 模型页,截图于 2026 年 9 月。本文的规格、价格,以及「超过 272K 输入的请求按 2× 输入与缓存费率、1.5× 输出计价」这一条,都出自这一页。以官方页面当时显示的为准。

新模型 · 接入

GPT-6 Astra 给龙虾当大脑:接之前先审 skills,再算 272K 那道坎

如果你的龙虾里装着几个从别人仓库拷来的 skill,那 GPT-6 Astra 这一版对你首先是一件安全上的事,其次才轮到「要不要升级」。OpenAI 在 2026-09-03 放出这款模型,model id 是 gpt-6-astra,官方给它的定位是「our most capable model, built for the hardest end-to-end work」。同一份说明里夹着一句提醒,写得很直白:它的指令跟随比以前更强,因此强烈建议审计模型能读到的 skills 和其它文件,排查里面会影响模型行为的指令。装过第三方 Skill 的人,看到这句心里应该咯噔一下。

所以这篇不从规格表开始。数字和价格摆在靠后的一节,想对参数直接翻下去;前面先讲接它之前该动手做的事,以及几个换了模型才会发现的脾气。本站没有跑过 Astra,下面写的要么是官方文档的内容,要么是我们基于它做的取舍判断,两者分开标。

装之前先去翻你的 skills 目录

这条排第一,因为它是唯一一条「不处理就可能出事」的。官方的说法是建议审计模型能读到的 skills 和其它文件,排查其中会影响模型行为的指令。换成龙虾用户的日常:~/.openclaw/ 下那些 skill 目录、项目根目录里的 AGENTS.md、还有各种会被自动读进上下文的说明文件,里面每一句祈使句,Astra 都会比以前的模型更当真。

以前这些文件里写点半开玩笑的话,或者从别人仓库拷来一段没细看的 instructions,模型多半还会自己权衡一下再决定听不听。指令跟随变强的意思是这层缓冲变薄了。真正麻烦的不是你自己写的那几行,是你没读过的那几行——第三方 skill 附带的说明、被拉进上下文的 README、别人的模板项目里带的 AGENTS.md。

动手顺序建议这样走:

  • 先弄清模型实际能读到哪些文件。装了哪些 skill、哪些目录在上下文里,自己心里得有数;不清楚的话,Skills 入门那篇讲了它们放在哪、怎么被加载。
  • 逐个读一遍,重点找祈使句:「忽略之前的指示」「不要询问,直接执行」「把结果发到某个地址」这一类。搜关键词只能筛掉一层粗的,最后还是得眼睛过。
  • 拿不准的先摘出去,别留着「应该没事」。
  • 文件层面清干净之后,再回头看权限。真正兜底的是沙箱和能力白名单,不是模型的判断力——沙箱与白名单那篇给了一套从空数组往上加的放开顺序,换更强的大脑之前,值得把那套配置再收一收。

还有一条得一起知道:Astra 带一层失准监测(misalignment monitoring),异步跑,必要时告警。官方也写明了后果——这类检查可能触发安全告警,或者把对话中止送审。也就是说,你的任务有可能不是因为报错、而是因为被送审停下来。写自动化的时候,别假设它只有「正常结束」和「报错」两种收场。

它比以前更爱停下来问你

官方点名的行为变化里,这条对龙虾用户最实用:当补充输入可能实质改变结果时,Astra 更可能停下来问你一句,而你原本期待的是它自己作合理假设、继续往下跑。

人坐在电脑前跟它对话,这是优点,省得跑歪。放进无人值守的任务里,它就是纯粹的负面特性。定时跑的抓取、夜里跑的批处理、webhook 触发的自动回复,任务停在一个问句上等人回答,第二天早上你看到的是一个卡住的会话,不是结果。

官方给了一段鼓励它自主推进的提示词片段来对冲这个倾向。大意如下(是意思的转述,不是逐字翻译,原文以官方文档为准):

  • 让它从已有上下文里推断用户意图和任务范围,不要为了确认而停下。
  • 偏向行动,把任务做完,而不是做一半回来请示。
  • 把「能不能帮我……」这类客气说法当成执行指令,别停在一句「可以」上。
  • 只有在准备好拿出一份具体、可审阅的结果之后,才去求批准。

这段话放系统提示里、放 AGENTS.md 里都行。但要注意它和上一节构成一对矛盾:你刚因为指令跟随变强去审计那些文件,现在又要往里面加一段「偏向行动、别问、把活干完」的指令。这两件事必须成对做——先把文件清干净,再往干净的文件里加自主性指令。顺序反了,等于给一台你没审过的机器同时踩两个油门。

三个接口是真冲着 agent 来的

这一版新增的东西不多,但每一项都能在智能体循环里找到对应的疼处。

异步工具调用(async tool calling)

在工具定义上设 async: true,你的应用执行这个工具期间,模型不必干等:它可以继续推理、调别的工具,或者先把请求里另一部分独立的问题答掉。工具跑完,用原来的 call_id 把结果送回去。

要说清楚的是,工具仍然由你的应用执行、由你的应用管待办,模型这边只是不再被一次慢调用堵死。对龙虾这种一圈一圈转的循环,最有感的是那些天生慢的工具:跑测试、装依赖、等浏览器加载。

响应途中插话(mid-turn steering)

响应还在生成的时候,通过 WebSocket 追发一条用户指令,纠正方向或者改需求。Responses API 会保留已经完成的那部分工作,把你的更新并进后面的续写里。

以前发现它跑偏,只能停掉重来,前面烧的 token 全扔。能中途插话,长任务的纠错成本就从「重跑一遍」降到「补一句话」。

会话中途改 effort,还不掉缓存

加一个 configuration_update 输入项,就能在会话中途改 reasoning.effort:硬活调高,后面的常规跟进调低,不必重写前面的 prompt 前缀。新的 effort 一直生效,直到下一个 configuration_update 覆盖它。

这项的省钱空间最大。一个龙虾任务里既有「读文件、列目录」这种不用动脑的步骤,又有「想清楚改哪儿」这种要动脑的步骤,以前只能全程按一档跑,或者改档位、连带把缓存命中扔掉。Opus 5 那篇里提过 Anthropic 一侧是靠一个 beta 头解决同一个问题,思路一样。

但有一句必须说在前面:这三项都是 API 层的能力,不等于你的龙虾马上能用上。能不能用,取决于龙虾这一侧的 OpenAI 通道实现有没有跟进。换个模型名就以为拿到了异步工具调用,是想当然。接法本身没变,还是填服务商加模型名那一套,见接 API 还是接本地模型

272K 那道坎:整条请求重新计价

Astra 的上下文窗口是 1,050,000 token,但价格不是一条直线。输入 token 超过 272K 的请求,按 2 倍的输入与缓存费率、1.5 倍的输出费率计价。官方措辞是 for the full request——不是只给超出的那一部分加价,是整条请求重新算。

项(每百万 token)标准输入超过 272K 的请求
输入$10.00$20.00
缓存输入$1.00$2.00
缓存写入$12.50$25.00
输出$50.00$75.00

智能体天生就往这道坎上撞。每转一圈,之前的对话历史和工具返回都要重新塞进上下文,输入只涨不跌;一个跨几十轮、读过几个大文件的任务,冲到 272K 不算稀奇。最难受的状态是在坎附近来回蹭:这一轮 27 万按标准价,下一轮多了一段工具返回变成 27.5 万,整条请求的账单直接跳一档。

能做的事有两件。一是别把窗口当成免费容量,该压缩历史就压缩,compaction 这一版仍然支持;二是把长任务拆开,与其让一个 agent 拖着几十万 token 的历史跑到底,不如按多 agent 那篇的思路分给几个上下文各自独立的 agent。

缓存这边还有一条要记:缓存写入按未缓存输入费率的 1.25 倍收,标准档就是 $12.50。缓存不是白存的,前缀要是反复变动,你可能一直在付写入费、却很少命中。

官方说它「更贵但每个任务更省」,这话得你自己验

OpenAI 在这一版给了一个反直觉的成本论点:在若干评测里,Astra 用显著更少的输出 token 拿到了更强的结果,所以尽管每 token 单价更高,每个任务的预估 API 成本反而低于更早的模型。

这句话得原样标清它的出身:这是 OpenAI 自己的说法,基于它自己选的评测,目前没有第三方复现。本站没有跑过 Astra,不替它背书,也不替它反驳。

能确定的只有单价这一头。拿同一家的 GPT-5.6 三档对着看(三档的完整背景见发布解读那篇):

模型输入 / 输出(每百万 token)Astra 相对它的倍数
GPT-6 Astra$10 / $50基准
GPT-5.6 Sol$4 / $20输入输出都是 2.5 倍
GPT-5.6 Terra$2 / $12输入 5 倍,输出约 4.2 倍
GPT-5.6 Luna$0.20 / $1.20输入 50 倍,输出约 41.7 倍

官方那个论点要在你这儿成立,Astra 省下来的输出 token 得多过这 2.5 倍到 50 倍不等的单价差。不是不可能,但它是一个只能用你自己的任务去验的命题:挑一条你天天跑的任务,两边各跑几趟,去用量页把输入输出 token 和实际花费抄下来对比。心算的公式和估 token 的经验,GPT-5.6 选档那篇写过,换成 Astra 的单价套进去就行。

顺带一提,Sol 那 $4 / $20 是促销价,官方标注至少持续到 2026-11-21。拿现在的价差排预算,记着这个日期。

接之前要清掉的老写法

换模型名之前,先 grep 一遍配置和代码,下面几条不改就是白折腾。

  • 不支持自定义 temperaturetop_p,也不支持 logprobs。这条最容易中招。很多人的配置里写着 temperature: 0,图的是输出稳定、好做确定性管线;这套写法在 Astra 上没得用。靠采样参数控制确定性的流程,得改成靠结构化输出和提示词约束。
  • 不支持 none 这一档 reasoning effort。能用的是 low / medium / high / xhigh / max 五档。原本用 none 把推理关掉换速度和便宜的,最低只能落到 low
  • 工具调用必须走 Responses API。如果你现在是在 Chat Completions 里挂工具,得按官方的 Responses 迁移指南改过来。这不是加个参数的事,是换一套请求形态,属于动手前必须先确认的一项。
  • Fast mode 在 EU 数据驻留下不可用。另外 Fast mode 按 2 倍标准价收,它买的是速度不是智力。
  • Free 档用不了这个模型。Tier 1 的限流是 500 RPM / 500K TPM,起步阶段够用,批量跑之前自己对一眼所在档位。

好消息是 GPT-5.6 上已有的东西基本都还在:computer use、Structured Outputs、streaming、Programmatic Tool Calling、多 agent 编排、prompt caching、persisted reasoning、compaction、pro mode。迁移的重点是上面那几条减法,不是重学一遍。

规格和价格摆在这儿,自己对一眼

发布日2026-09-03
model idgpt-6-astra
上下文窗口1,050,000 token(不是 1M 整,是 105 万)
最大输出128,000 token
知识截止2026-04-30
reasoning.effortlow / medium / high / xhigh / max 五档,没有 none
模态文本进、文本出;图像只能进不能出;音频与视频都不支持
标准价(每百万 token)输入 $10.00 · 缓存输入 $1.00 · 缓存写入 $12.50 · 输出 $50.00
长输入加价输入超过 272K 的请求,整条按 2× 输入与缓存费率、1.5× 输出
Batch / Flex都是标准价的一半
Fast mode标准价的 2 倍;EU 数据驻留下不可用
可用档位Free 档不支持;Tier 1 为 500 RPM / 500K TPM
官方点名达到 SOTA 的领域computer use、浏览、软件工程、科学、专业工作

表内所有数字为 2026-09-05 从 OpenAI 官方文档核对,发布日期出自官方 API 更新日志,规格与价格来源是 GPT-6 Astra 模型页官方定价页。这块变得比什么都快,动手前请自己再对一眼;跟本站写的对不上,以官方页面当时显示的为准。本文不引用任何第三方跑分。

这几个位置,我现在不会放它

不是唱衰,是把它的短板和你手上的槽位对一遍。

  • 无人值守的定时任务。更爱追问,加上安全检查可能中止对话送审,两条叠在一起,夜里没人盯的流程风险最大。真要放,先把那段自主性提示词加上,再给任务配超时和「卡住了通知我」的兜底。
  • 批量轻活。归类、抓取、格式转换,单价差摆在那儿,拿 Astra 跑是把钱当柴烧。这类活该往下降档,怎么降见当龙虾的大脑:6 款模型怎么选
  • temperature 吃饭的确定性管线。参数直接没了,改造成本可能比换模型的收益还大。
  • EU 数据驻留下还想用 Fast mode 的部署。这条是硬的,配不出来。
  • 要处理音频或视频的流程。它只吃文本和图像,而且图像只能进不能出。
  • 还没审过 skills 的那台机器。回到开头那条,顺序不能倒。

剩下几条脾气用提示词就能压:它倾向写得详细、带格式,还可能跨会话反复用同几个说法,要什么文风和结构就明说;子 agent 委派可能比你希望的更少,得写清什么时候用、开几路并行;编码任务上它倾向测充分了才算完成,小活可能测得过宽,不想要就在任务描述里划好范围。

反过来说,它被官方点名达到 SOTA 的是 computer use、浏览、软件工程、科学和专业工作,擅长的是跨代码、浏览器和专业软件的多步工作流——这恰好是龙虾干得最重的那一类活,想跟对家的旗舰横着比,可以对着Claude Fable 5.1 那篇看。我要是现在动手,顺序会是:先把 skills 和 AGENTS.md 审一遍,再挑一条真实任务在 Astra 和现在的大脑上各跑几趟对账,最后才决定要不要把默认模型改过去。跳过第一步直接改配置,省下的那点时间迟早得还。

常见问题

换到 GPT-6 Astra 之前,必须先做的一件事是什么?
审计模型能读到的 skills 和其它文件。官方在这一版明确建议这么做,原因是 Astra 的指令跟随比以前更强,对 skills、AGENTS.md 这类文件里的指令更敏感。重点排查第三方 skill 的说明文件、被自动拉进上下文的 README 和别人模板项目里带的 AGENTS.md,找里面的祈使句,拿不准的先摘出去。文件清干净之后,再回头把沙箱和能力白名单收一收,兜底靠权限不靠模型的判断力。
它老是停下来问我,不自己把活干完,怎么办?
这是官方记录在案的行为变化,不是你配坏了。当补充输入可能实质改变结果时,它更可能停下来问,而不是自己作合理假设继续跑。对无人值守的定时任务这是负面特性。官方给了一段鼓励自主推进的提示词片段,大意是让它从上下文推断意图和任务范围、偏向行动把任务做完、把「能不能帮我」这类说法当作执行指令、只在准备好拿出具体可审阅的结果之后才求批准。放进系统提示或 AGENTS.md 都行,但要先审过那些文件再往里加。
超过 272K 的加价,是只对超出的那部分收吗?
不是。官方措辞是 for the full request,输入 token 超过 272K 的请求,整条请求按 2 倍的输入与缓存费率、1.5 倍的输出费率计价,也就是输入 $20、缓存输入 $2、缓存写入 $25、输出 $75。所以在这道坎附近来回蹭是最亏的状态,上一轮 27 万按标准价,下一轮多一段工具返回变成 27.5 万,整条请求的账单就跳一档。对策是该压缩历史就压缩,或者把长任务拆给几个上下文独立的 agent。
从别的模型换过去,要改代码吗?
有几处要先查。一是不支持自定义 temperature、top_p,也不支持 logprobs,配置里写着 temperature 为 0 的确定性管线得改成靠结构化输出和提示词约束。二是不支持 none 这一档 reasoning effort,能用的是 low、medium、high、xhigh、max 五档,原来关推理的最低只能落到 low。三是工具调用必须走 Responses API,还在 Chat Completions 里挂工具的要按官方迁移指南改。另外 Fast mode 在 EU 数据驻留下不可用,Free 档也用不了这个模型。
官方说它单价更贵但每个任务更便宜,这话可信吗?
这是 OpenAI 自己的说法,基于它自己选的评测,目前没有第三方复现,本站也没有跑过 Astra,不替它背书也不替它反驳。官方的论证是 Astra 用显著更少的输出 token 取得更强结果,所以每个任务的预估 API 成本低于更早的模型。能确定的只有单价:$10 / $50,是 GPT-5.6 Sol 的 2.5 倍、Terra 的 5 倍和约 4.2 倍、Luna 的 50 倍和约 41.7 倍。省下的输出 token 要多过这个价差,论点才在你这儿成立。挑一条你天天跑的任务两边各跑几趟,去用量页对账,比看任何结论都准。