Ultrafast 推理档结束邀请制预览。OpenAI 10 月 8 日在 Responses API 里给 GPT-6.1 Sol 正式开放这一服务档位,并第一次在定价页上标出价格。调用时模型仍填 gpt-6.1-sol,把 service_tier 设成 "ultrafast" 即可。模型本身没换,缩短的是输出 token 之间的间隔。
这一档对所有 API 用户开放,受速率限制,支持全球处理,也支持美国和欧盟的数据驻留。Codex 和 ChatGPT Work 同步上线,但只给 Pro 500、符合条件的企业按量计费套餐和按点数计费的教育套餐;企业版需要管理员手动打开。
五个档位怎么收费
按 OpenAI 定价页,272K 输入 token 以内算短上下文,各档价格如下(美元 / 百万 token):
| 档位 | 输入 | 缓存输入 | 缓存写入 | 输出 |
|---|---|---|---|---|
| Batch / Flex | 1 | 0.05 | 1.25 | 5 |
| Standard | 2 | 0.10 | 2.50 | 10 |
| Fast | 4 | 0.20 | 5 | 20 |
| Ultrafast | 12 | 0.60 | 15 | 60 |
超过 272K 的长上下文,Ultrafast 涨到输入 24 美元、输出 90 美元。所有单价都是标准档的 6 倍,缓存相关的两项也一样。
到底快多少
OpenAI 文档只给相对倍数,没有写绝对速度。OpenAI 开发者账号对外的口径是”最高约 8 倍”;多家媒体引述的拆分更细,Codex 里最高约 8 倍,API 里最高约 6 倍。VentureBeat 报道的速度约为每秒 300 token,这个数没有出现在官方文档里,以倍数口径为准。
Ultrafast 有单独的速率限额:Build 档每分钟 100 万 token,Launch 档 400 万,Grow 档 4000 万,不占用标准档和 Fast 档的额度。
OpenAI 列出的适用场景是这样写的:
“Built for work where speed and intelligence make a difference: debugging an outage, agents navigating apps, and live experiences where every second counts.” (为速度和智能都重要的工作准备:排查线上故障、在应用里操作的智能体,以及分秒必争的实时体验。)
算一笔账
假设一次智能体任务读入 20 万 token、输出 2 万 token,不计缓存。粗算下来,标准档约 0.6 美元,Fast 档约 1.2 美元,Ultrafast 约 3.6 美元。
速度按 API 场景最高 6 倍估算,原本 6 分钟的任务能压到 1 分钟左右,省下 5 分钟,多付约 3 美元,相当于每少等 1 分钟多花 0.6 美元。这是最理想的情况;实际提速达不到上限时,每分钟的价钱会更高。
一个工程师排查线上事故时,这点钱几乎不用考虑;批量跑离线任务的团队,会继续用 Batch 和 Flex,后两档的价格只有标准档一半。
这一档此前走过一段预览。8 月 13 日 Ultrafast 以有限预览亮相,只挂在 GPT-5.6 Sol 上,OpenAI 当时的说法是每秒最多 750 个 token、比标准处理快至多 14 倍,算力来自 Cerebras 的晶圆级芯片。到了 GPT-6.1 Sol 正式开放,官方倍数变成最高 6 到 8 倍,底层硬件这次的公告没有提及。
Ultrafast 的调用量和付费用户占比,OpenAI 还没有公布。它会不会延伸到 Astra 等其他模型,文档里也没有提到。
参考来源:OpenAI 开发者更新日志、CocoLoop、OpenAI API 定价页(各档短上下文与长上下文单价)、VentureBeat、Runtime Wire;Runtime Wire 核对速率限额与开放范围。