AI 参与说明(Agent:Grok):本文由 Grok Bot 根据 OpenAI 官方 Codex 文档与 API 文档整理。所有价格、限制和行为说明均于 2026-10-08 读取官方页面核对,来源链接附在对应段落;文中的 token 数是为了演示算法而假设的,不是实测数据。执行入口 Grok Bot;模型标识与 reasoning effort 未取得运行记录;提供方 xAI。
Ultra 不是一个更强的模型,而是一种工作方式:主代理把任务拆成几块,交给多个 subagents 并行处理,再把结果合起来。所以它有没有用,取决于任务能不能拆开;它花多少钱,取决于所有代理加起来用了多少 token。官方没有给 Ultra 定一个固定价格或统一倍率。Models、Subagents
本文先讲原理,再讲成本,最后讲怎么用。型号和价格总表见主文 GPT-6 Astra 与 Ultra:能力、用法与 Sol 成本对比。
原理:Ultra 在做什么
单代理和多代理的区别
单代理是一条上下文从头做到尾:读代码、改代码、跑测试,所有中间输出都堆在同一个对话里。
Ultra 是多代理:
- 主代理先理解目标,把工作拆成几块。
- 每块交给一个 subagent。每个 subagent 有自己的上下文,自己调模型、调工具。
- subagent 做完,只把结论交回主代理。
- 主代理汇总、检查,再交付。
flowchart LR
A[主代理:理解目标并拆分] --> B[子代理 A:读代码]
A --> C[子代理 B:跑测试]
A --> D[子代理 C:查资料]
B --> E[主代理:汇总结论]
C --> E
D --> E
E --> F[检查后交付]
官方对 Ultra 的描述是:它「超出单代理运行」,用 subagents 加速复杂工作,适合能分给多个子代理的大任务。Models
为什么能更快
互相独立的几块工作可以同时跑。理想情况下,总耗时接近最慢的那一块,而不是每块耗时加起来。
前提是这几块真的互不依赖。如果第二块必须等第一块的结果,就只能排队,并行省不下时间。
为什么有时效果更好
官方 Subagents 文档解释了一个常被忽略的原因:上下文污染。探索笔记、测试日志、堆栈和命令输出这类中间内容如果全堆进主对话,有用的信息会被淹没,模型表现会随对话变长而下降。Subagents
把这些「吵闹」的工作交给 subagent,主代理只看各支的摘要,就能把注意力留给需求、决策和最终结果。
为什么有时效果更差
官方明确列出了不适合并行的情况:Multi-agent
- 强串行:每一步都直接依赖上一步。
- 抢同一份可变资源:比如多个代理同时改同一个文件,会冲突,协调成本上升。
- 任务本身很小:一次短运行就能做完,拆分反而多花一轮。
- 被一个慢操作卡住:比如整体时间都花在等一个外部调用上。
Subagents 文档的建议也一致:读多写少的工作(探索、测试、排查、总结)适合并行;写多的工作要谨慎。
Ultra 和 Max 的区别
两者都在 reasoning 控件里,但方向不同:Models
| 模式 | 做法 | 适合 |
|---|---|---|
| Max | 让选定的模型在单个任务上想得更久 | 最难的单个问题,深度比速度重要 |
| Ultra | 用 subagents 并行处理任务的不同部分 | 能拆成几块有意义的部分的复杂任务 |
官方还特别提醒:大多数任务不需要 Max 或 Ultra。
成本:钱花在哪里
计费原理
Ultra 没有单独的价目表。总费用就是所有参与的代理各自的用量加起来:
总费用 = 主代理 + 每个子代理的(输入 + 缓存命中 + Cache writes + 输出)× 各自单价
几点要注意:
- reasoning tokens 按输出计费,即使它们不显示在最终回答里。Reasoning
- 每个 subagent「做自己的模型和工具工作」,所以官方说 subagent 工作流比可比的单代理运行消耗更多 token。Subagents
- 官方没有列出「Ultra 每次固定价」,也没有统一的 Ultra 加价倍率。
为什么通常更贵
每个子代理开工前都要读一部分上下文(任务说明、相关代码),这些都算输入 token。三个子代理就可能读三遍相近的内容。主代理汇总时还要再读一遍各支的结论。
一个可复算的例子
下面的 token 数是假设值,只用来演示怎么算。
假设:1 个主代理用了 60,000 输入、10,000 输出;3 个子代理每个用了 40,000 输入、8,000 输出。无缓存命中、无 Cache writes,Standard processing,每次请求输入都不超过 272K。
合计:输入 180,000,输出 34,000。
| 模型 | 单价(输入 / 输出,美元每百万 tokens) | 算式 | 费用 |
|---|---|---|---|
| GPT-6 Astra | 50 | 0.18 × 10 + 0.034 × 50 | $3.50 |
| GPT-6.1 Sol | 10 | 0.18 × 2 + 0.034 × 10 | $0.70 |
单价来自 GPT-6 Astra 模型页 和 GPT-6.1 Sol 模型页。
以下 Python 3 脚本只做本地算术,不调用 API。保存为 ultra_cost.py,运行 python3 ultra_cost.py:
# 单价:美元 / 百万 tokens(Standard,输入不超过 272K)
rates = {
"gpt-6-astra": {"input": 10, "output": 50},
"gpt-6.1-sol": {"input": 2, "output": 10},
}
# 假设的 token 数:1 个主代理 + 3 个子代理,无缓存命中、无 Cache writes
agents = [("main", 60_000, 10_000)] + [(f"sub{i}", 40_000, 8_000) for i in (1, 2, 3)]
total_in = sum(a[1] for a in agents)
total_out = sum(a[2] for a in agents)
print(f"total input={total_in:,} output={total_out:,}")
for model, r in rates.items():
cost = (total_in * r["input"] + total_out * r["output"]) / 1_000_000
print(f"{model}: ${cost:.2f}")
输出:
total input=180,000 output=34,000
gpt-6-astra: $3.50
gpt-6.1-sol: $0.70
把假设的 token 数换成你自己任务的实际用量,就能比较。要比较「值不值」,还要拿同一个任务的单代理运行做对照。
两种计费口径不能混算
- API key:按上面的 API 单价算。
- ChatGPT 登录的 Codex:按 credits 算。例如 Standard 下,GPT-6 Astra 是每百万输入 250 credits、输出 1,250 credits;GPT-6.1 Sol 是输入 50、输出 250。Codex Pricing
credits 的购买价格取决于套餐或协议,官方也说明 API 价格不能用来估算订阅里包含的任务量。
Fast 和 Ultrafast 不是 Ultra
这三个名字很像,但管的是不同的事:
| 名称 | 管什么 | 计费 |
|---|---|---|
| Ultra | 任务怎么拆、几个代理并行 | 所有代理 token 累加 |
| Fast mode | 单个模型生成速度 | API 为 Standard 的 2 倍;Codex 订阅额度按 2.5 倍、购买的 credits 按 2 倍消耗 |
| Astra Ultrafast | GPT-6 Astra 的更快生成速度 | Codex 订阅额度按 8 倍、购买的 credits 按 6 倍消耗 |
官方说明 Ultrafast 的 token 生成速度最高是 Standard 的 8 倍,这个数字比较的是生成速度,不是整体任务完成时间。Ultrafast 只对 Pro $500 和符合条件的 Enterprise、Edu 开放。Speed、Codex Pricing
什么时候用 Ultra
适合
- 大的代码改动,能按目录或模块分开。
- 多来源调研,每个来源可以单独核查。
- 代码审查:安全、测试覆盖、可维护性各派一个子代理。
- 一边实现,一边让子代理跑测试、查边界情况。
不适合
- 小改动、简单问答。
- 一步扣一步的推导。
- 必须集中改同一个文件的重构。
怎么写任务,才好拆
官方建议一个好的 subagent 提示要说清三件事:怎么分工、要不要等所有子代理做完再继续、每个子代理交回什么。Subagents
官方文档里的示例:
Review this branch with parallel subagents. Spawn one subagent for security risks, one for test gaps, and one for maintainability. Wait for all three, then summarize the findings by category with file references.
改成中文任务时,可以照这个结构写:
用三个并行子代理审查当前分支:一个查安全风险,一个查测试缺口,一个查可维护性。
三个都只读代码,不改文件。等三个都完成后,按类别汇总发现,并附文件位置。
怎么判断值不值
拿一批真实任务,分别用 High、Max、Ultra 跑,比较四个数:完成率、总耗时、总 token(或总费用)、返工次数。如果 Ultra 只是更快一点、费用却翻倍,就不一定值。
用法
Codex CLI
在交互会话里输入 /model,选模型,再选 More reasoning…,就能看到该模型支持的 Max 或 Ultra。Models
ChatGPT 桌面 App
如果模型支持 Ultra,但滑块里没有,去 Settings > Configuration,打开 Ultra in model picker slider。Models
什么时候会自动派子代理
这一点不同客户端不一样,官方文档写得很细:Subagents
- ChatGPT Work:在大多数档位需要你明确要求派子代理;选 Ultra 时,ChatGPT 会在并行明显有帮助时主动派子代理。
- 本地 Codex(桌面 App、CLI、IDE 插件):当前版本在你直接要求,或
AGENTS.md、Skill 指令要求时才派子代理。
所以在本地 Codex 里,想让 Ultra 发挥作用,最好在任务里写明哪些部分要并行。
子代理用什么模型
在 Codex 里,如果不单独配置,子代理继承主代理的模型和 reasoning effort。也可以在 config.toml 的 [agents] 里设默认值,或在自定义 agent 文件里单独设 model 和 model_reasoning_effort。官方的例子是用 gpt-6-luna 做快速扫描、用 gpt-6.1-sol 做需要更多推理的工作。Subagents
这是控制 Ultra 成本最直接的办法:读代码、查资料这类简单子任务,不一定要用 Astra。
API 里没有「Ultra」这个值
API 的 reasoning.effort 里没有 ultra。API 侧对应的是 Responses API 的 Multi-agent(beta):Multi-agent
- 在请求里设
multi_agent.enabled: true,根代理就可以派子代理。 max_concurrent_subagents限制同时活跃的子代理数,默认 3,官方推荐多数场景用默认值。- 子代理和这次请求用同一个模型、同一套工具,不会自动换成更便宜的模型。
- 开启后不支持
/responses/compact、reasoning.summary和max_tool_calls。
适用模型要注意:Multi-agent 指南写的是 beta 支持 GPT-6.1 Sol 和全部 GPT-5.6 模型,并提醒启用前先看模型页。用 Astra 之前,先在模型页确认。
限制
- GPT-6 Luna 最高支持到 Max,不支持 Ultra。Models
- Max 和 Ultra 能不能用,取决于套餐和设置。
FAQ
GPT-6 Ultra 是一个单独的模型吗?
不是。Ultra 是 Codex 和 ChatGPT Work 里的一个档位:用 subagents 并行处理任务。模型还是你选的那个,比如 Astra 或 6.1 Sol。
GPT-6 Astra Ultra 一次多少钱?
没有固定价。费用等于主代理和所有子代理的 token 用量乘以各自单价。本文的例子里,同样的 token 用量,Astra 是 6.1 Sol 的 5 倍。
Ultra 一定比 High 好吗?
不一定。任务拆不开时,Ultra 只会多花 token。官方也说大多数任务不需要 Max 或 Ultra。
能不能让子代理用便宜的模型?
在 Codex 里可以,用 [agents] 默认值或自定义 agent 文件设置。API 的原生 Multi-agent 里,子代理和请求用同一个模型。
相关阅读
- GPT-6 Astra 与 Ultra:能力、用法与 Sol 成本对比:型号对照表、API 价格和 Codex credits。
- Sol 系列怎么选:GPT-5.6 Sol 的定位,以及什么时候不用升级:5.6 Sol、6 Sol、6.1 Sol 的区别和迁移清单。
- LLM 文档概览
资料来源(2026-10-08 读取)
| 来源 | 用途 |
|---|---|
| Models(ChatGPT Learn) | Ultra / Max 定义、Luna 限制、CLI 和桌面 App 用法 |
| Subagents(ChatGPT Learn) | 子代理原理、token 消耗、触发方式、模型继承 |
| Speed(ChatGPT Learn) | Fast、Ultrafast 的倍率和适用范围 |
| Pricing(ChatGPT Learn) | Codex credits 单价 |
| Multi-agent(OpenAI API) | API 侧的多代理、适用模型和限制 |
| GPT-6 Astra 模型页、GPT-6.1 Sol 模型页 | API 单价 |
价格、可用性和产品行为可能变化,使用前以官方页面为准。