PHP 8.6 于 9 月 22 日功能冻结、11 月 19 日 GA。PFA 用 ? 占位符预绑定参数并与管道操作符组合,是近年最大的一次语法手感升级;但升级重点在 Session 三个默认值变更(Laravel 基本免疫)和 26 项弃用——mb_ereg 系列因 oniguruma 停维影响最广。
先说结论:GPT-6 的 Sol 和 Luna 不是"更便宜的 Astra",而是三个针对不同工作类型的档位。 9 月 22 日 OpenAI 补上这两档之后,价格分别是 Astra 的 1/5($2 / $10 每百万 token)和 1/100($0.10 / $0.50)。但真正的重点不是"便宜了多少",而是三档的能力差距不是均匀缩水,而是按工作类型分叉——编码任务上 Luna 只比 Sol 低 2.2 分、成本却只有 Sol 的二十分之一;换成需要自己判断下一步的智能体任务,它直接掉 12.5 分。选型的正确姿势是按工作类型选,不是按价签选。
这篇不谈"新模型发布了"这种三秒就能搜到的信息,只谈其他快讯不会展开的四件事:三档之间差在哪里、计费表上没写的隐藏条款、代际之间到底升级了没有、以及落到代码里的路由怎么写。
一、先把三档的关系理清楚
这不是新一代,是同一代往下铺档位
时间线是这样的:
| 日期 | 事件 |
|---|---|
| 9 月 4 日 | GPT-6 Astra 发布,定位旗舰 |
| 9 月 22 日 | GPT-6 Sol、GPT-6 Luna 发布,补中低档 |
间隔只有 19 天。 也就是说 Astra 不是一个"后来被超越"的前代,而是同一代里的最上一档——它今天依然在售、依然是 OpenAI 官方口中"最难的端到端工作"的首选。
另一个细节值得注意:命名结构变了。 GPT-5.6 那一代是三层命名 Sol / Terra / Luna,GPT-6 变成 Astra / Sol / Luna——Terra 这一档直接消失了。OpenAI 没有解释原因,但从产品结构上读得出来:三层中间档的意义不大,用户要么预算紧(用最低档),要么追能力(用最高档),中间那层经常是"两边都不占"。
规格表:三档的上下文窗口完全一样
| Astra | Sol | Luna | |
|---|---|---|---|
| API 模型名 | gpt-6-astra | gpt-6-sol | gpt-6-luna |
| 官方定位 | 最难的端到端工作 | 复杂 Coding 与 Agent 工作流 | 高频、任务集中的批量活 |
| 输入 / 百万 token | $10.00 | $2.00 | $0.10 |
| 输出 / 百万 token | $50.00 | $10.00 | $0.50 |
| 缓存读 / 百万 token | $1.00 | $0.20 | $0.01 |
| 缓存写 / 百万 token | $12.50 | $2.50 | $0.125 |
| 上下文窗口 | 1,050,000 | 1,050,000 | 1,050,000 |
| 最大输出 | 128,000 | 128,000 | 128,000 |
| 知识截止 | 2026-04-30 | 2026-04-20 | 2026-05-18 |
| 推理档位 | low→max | none→max | none→max |
这张表里有三个反直觉的点:
第一,上下文窗口三档完全一样。 都是 105 万 token 窗口、128K 最大输出(实际可用输入约 92.2 万)。这是这代最值得注意的设计选择:差异全在能力和价格,不在容量。 上一代 GPT-5.6 的窗口是 272K,这一代直接拉到 105 万——最便宜的 Luna 也享受这个待遇,意味着"长文档批处理"这件事的门槛被打掉了。
第二,知识截止日期和档位高低不是一回事。 Astra 是 4 月 30 日,正好夹在 Sol(4 月 20 日)和 Luna(5 月 18 日)中间——最便宜的 Luna 反而是三档里知识最新的。这说明知识截止日期取决于训练数据的准备时间点,和模型能力档位没有因果关系。以后再看到"截止日期更晚=更新更强"的说法,可以直接否掉。
第三,Sol 和 Luna 的推理档位比 Astra 多一档。 Astra 从 low 开始,Sol 和 Luna 多了 none——可以把推理整个关掉。这个选项看着不起眼,但在高并发、任务简单的场景里价值很大:关掉推理意味着模型不再生成思维链 token,延迟和成本同时往下掉。三档默认值都是 medium。
可用性和这个"没有 Chat"的细节
- API:三个模型名都能直接调用,也上了 Amazon Bedrock 和 GitHub Copilot
- ChatGPT Work / Codex:Plus、Pro、Business、Enterprise、Edu 订阅都能用 Sol 和 Luna
- Free 和 Go 用户:只能用 Luna,且只在桌面端 App 里
- 标准版 ChatGPT 聊天界面:暂时都没有,OpenAI 说是分阶段上线
最后一个细节对企业用户有直接影响:Enterprise 管理员需要先在后台开启,员工才看得到这两个模型。 如果你的团队走企业账号,迁移不是一个改 model 字符串的动作,而是一串审批流程。
二、价格:50% 降价是真的,但计费表里有四个隐藏条款
OpenAI 强调"降价 50%、永久价格非促销",对 GPT-5.6 同名前代而言这确实是真的:Sol 从 $4/$20 降到 $2/$10,Luna 从 $0.20/$1.20 降到 $0.10/$0.50(输出降幅 58%)。
但目录价不等于实际成本,有四个条款会吃掉你的省钱预期:
条款一:272K 是个分界线,越线整单重新计价。 请求超过 272,000 输入 token 后,输入和缓存输入价格翻倍,输出价格涨 1.5 倍。这意味着 Sol 在长上下文区间会被重定价到约 $4 输入 / $15 输出——你为了省钱迁移过去,在长上下文场景里省下来的基本归零。
条款二:缓存读打九折,但缓存写要加价。 缓存命中的输入 token 只按普通输入价的 10% 收费(Sol $0.20、Luna $0.01),这是真便宜。但缓存写是普通输入价的 1.25 倍。对"同一段长 prompt 反复调用"的场景(RAG、固定 system prompt + 长上下文)非常划算,对"每次 prompt 都不一样"的场景毫无意义。
条款三:处理模式有倍数。 Batch 和 Flex 是标准价的一半;Fast 模式是两倍;带区域数据驻留的端点再 +10%。这三个开关的组合空间很大,实际成本可以差 4 倍以上。
条款四:模型本身的 token 消耗变多了。 这点官方不会说。第三方评测机构 Artificial Analysis 把"跑完它那套 Intelligence Index 的单任务成本"算了出来:
| GPT-5.6 Sol | GPT-6 Sol | 变化 | |
|---|---|---|---|
| 单任务成本 | $1.99 | $1.06 | −47% |
| 单任务输出 token | 29k | 31k | +7% |
成本降了 47%,但输出 token 涨了 7%。 说明这次降价几乎全部来自标价调整,不是模型变"省话"了。方向是对的(用户确实少付了钱),但理解这一点很重要:如果你的业务是按输出 token 计费的,实际省钱幅度会比标价的 50% 小一点。
三、核心发现:能力不是均匀缩水,是按工作类型分叉
这是这篇最想说的一件事。看 OpenAI 自己公布的六项评测,三档摆一起:
| 评测项 | Luna | Sol | Astra |
|---|---|---|---|
| DeepSWE v1.1(真实代码库工程) | 66.6% | 68.8% | 74.1% |
| FrontierCode 1.1(代码可合并性) | 42.4% | 49.3% | 53.3% |
| AutomationBench(47 工具的业务工作流) | 20.7% | 33.2% | 41.4% |
| Agents' Last Exam(长链路专业任务) | 50.9% | 56.4% | 59.3% |
| OSWorld 2.0(计算机操作) | 52.7% | 64.4% | 73.5% |
| 事实错误率(越低越好) | 7.6% | 4.6% | 3.9% |
把数字按"工作类型"分组,规律立刻浮出来:
在编码类任务上,Luna 几乎追平 Sol。 DeepSWE 上 66.6% vs 68.8%,只差 2.2 个百分点,而 Luna 的价格是 Sol 的二十分之一。这是整个发布里最反直觉的一个数字,也是 OpenAI 在宣传里没有放在最前面的数字——因为它太好看了,反而会让用户怀疑 Sol 的存在意义。
在智能体类任务上,Luna 掉下悬崖。 AutomationBench 20.7% vs 33.2%,差 12.5 分;OSWorld 52.7% vs 64.4%,差 11.7 分;事实错误率 7.6% 对 4.6%,几乎翻倍。
怎么解释这个分叉
把这两组数字放在一起,能读出一个很具体的画像:
Luna 是执行者,不是规划者。
- 任务一次交代清楚("把这份文档抽取成结构化 JSON"、"给这批评论分类"、"总结这 50 页 PDF"、"生成这个函数的第一版实现")→ Luna 干得又快又便宜,代码质量接近 Sol
- 需要自己判断下一步做什么(多轮工具调用、浏览器操作、跨软件长链路任务、中途排错)→ Luna 会迷路,Sol 才是及格线
AutomationBench 测的正是后一种:给模型 47 个工具,看它能不能独立完成一个端到端的业务流程。OSWorld 2.0 更直接——让模型操作真实桌面环境完成长链路任务。这两个评测的共同点是模型必须自己决定下一步干什么,而不是执行一个被拆好的步骤。
所以那句"Luna 便宜 100 倍"要加个前提:便宜 100 倍只在"你替它把活拆好"的前提下成立。 一旦你让它自己拆,省下的钱会用任务失败率还回去。
顺带说一个 OpenAI 自己给的成本口径,值得学:它们公布 Sol 在 AutomationBench 上的成绩时,用的单位是"每成功任务 $0.27",不是"每百万 token"。 这才是评估 Agent 成本正确的单位——token 单价只决定你的账单,每成功任务成本才决定你的业务能不能跑通。
四、代际对比:GPT-6 Sol 真的比 GPT-5.6 Sol 强吗
这是很多人默认不会问的问题——"新一代当然更强"。但对这一代,答案没那么干脆。
四个评测涨,两个评测退
同档 max 对比(OpenAI 自报):
| 评测项 | GPT-5.6 Sol | GPT-6 Sol | 变化 |
|---|---|---|---|
| AutomationBench | 28.8% | 32.0% | +3.2 |
| Agents' Last Exam | 52.8% | 56.4% | +3.6 |
| FrontierCode 1.1 | 47.5% | 49.3% | +1.8 |
| DeepSWE v1.1 | 72.7% | 68.8% | −3.9 |
| OSWorld 2.0(离线集) | 66.2% | 64.4% | −1.8 |
| 事实错误率(越低越好) | 8.5% | 4.6% | 改善 46% |
六项里涨了四项、退了两项。 而且退的那两项恰好是编码和计算机操作——对开发者最重要的两项。
两个隐藏代价
代价一:幻觉减半,是靠"少答"换来的。
第三方评测机构 Artificial Analysis 的 AA-Omniscience 测试给了很关键的一组数据:
| 指标 | GPT-5.6 Sol | GPT-6 Sol |
|---|---|---|
| 幻觉率 | 92% | 60% |
| 尝试回答率 | 99% | 83% |
| 回答准确率 | 59% | 54% |
看明白了:GPT-6 Sol 只尝试回答 83% 的题目(前代是 99%),靠"拒答"把错误答案砍掉了约四分之一,但准确率反而降了 5 个点。
这不是造假,是权衡——工程上"不知道就说不知道"通常比"胡说但自信"更好。但如果你把错误率下降理解成"它懂更多了",就会判断错。它只是更谨慎了,不是更聪明了。
代价二:真实办公交付物退了一大步。
GDPval-AA v2.1 这个评测覆盖 44 个职业的经济价值任务(Elo 制),结果是:
| GPT-5.6 Sol | GPT-6 Sol | 变化 | |
|---|---|---|---|
| GDPval-AA v2.1 | 1588 Elo | 1487 Elo | −101 |
掉了整整 100 个 Elo。 Artificial Analysis 人工审查了数百份输出,结论是:回退不是算错,而是交付物更短、更容易漏掉任务要求的条目——口语说法就是"偷工减料"。
同一个方向上,AA-Briefcase v1.1(跨多周的知识工作、上千个输入文件)上 Luna 退了约 45 Elo,Sol 基本持平。
合起来看:纯写代码的评测在涨,做完整交付物的评测在退。 如果你的用法是"给我一个函数",新版更好;如果是"给我一份能直接交出去的方案",新版反而更嫩。
长上下文:新版最尴尬的地方
Sol 省钱的前提是请求压在 272K 以内。超过这条线,价格重定价,优势归零。
更麻烦的是能力数据缺失:GPT-5.6 Sol 有公开的长上下文检索实测——MRCR v2 八针测试在 256K 到 512K 区间 91.5%,网页调研类 BrowseComp 90.4。GPT-6 Sol 这两个项目都没有对标数字。
这意味着在长上下文检索和深度调研这两个场景里,你面对的是一个更便宜但能力未经验证的新模型,对比一个贵一些但数字可查的旧模型。这种情况下,"新的一定更好"的判断没有依据。
Artificial Analysis 的总结很克制也很准确:GPT-6 Sol 和 Luna 的 Intelligence Index 与前代基本持平(47 到 48,涨 1 分),Coding Agent Index 涨 2 分(55 到 57),有些评测进步、有些回退;它们的位置是从成本效率前沿上抢占来的,不是从能力前沿上抢来的。
五、落到代码:模型路由该怎么写
聊到这儿,结论已经很清楚了:这不是"选一个模型"的问题,是"给不同任务分配不同模型"的问题。 而这件事以前是可选的优化项,现在变成了架构里的必选项——因为档位之间的价格差是 100 倍,选错一次就是 100 倍的账单。
路由决策表
| 任务类型 | 选谁 | 理由 |
|---|---|---|
| 分类、抽取、摘要、批量转换 | Luna | 任务边界清晰,Luna 接近 Sol 水平,成本 1/20 |
| 文档解析、长文档批处理 | Luna | 105 万上下文 + 极低单价,批处理场景无敌 |
| 单文件代码生成、初稿 | Luna | DeepSWE 只差 2.2 分,人工或强模型复核即可 |
| 多轮工具调用的 Agent 主循环 | Sol | Luna 在 AutomationBench 掉 12.5 分,是假省钱 |
| 代码库级重构、跨文件调试 | Sol | 需要判断"该改哪里",这是规划能力 |
| 浏览器自动化、桌面操作 | Astra | OSWorld 73.5% 对 Sol 64.4%,这是全表最大差距 |
| 需要交付完整文档、方案 | Astra 或旧版 Sol | GDPval 上 GPT-6 Sol 退 100 Elo |
| 超 272K 上下文的长文档检索 | 先双跑对比 | GPT-6 Sol 缺对标数据,且价格优势归零 |
一段最小的路由实现
用 PHP 写,思路是把"推理档位"和"模型选择"一起当成路由参数——因为推理档位本身也是成本杠杆,Sol 在 xhigh 上的成绩能压过 Astra 在 low 上的成绩,但成本只有几分之一。
<?php
class Gpt6Router
{
/**
* 按工作类型选模型 + 推理档位
* 注意:none 档位只有 Sol / Luna 支持,Astra 最低是 low
*/
public function route(string $workload): array
{
return match ($workload) {
// 任务边界清晰、可以批量并行
'classify', 'extract', 'summarize', 'translate' => [
'model' => 'gpt-6-luna',
'reasoning' => ['effort' => 'none'], // 关掉思维链,延迟成本双降
],
// 单文件代码生成:给足推理,但用便宜的模型
'codegen' => [
'model' => 'gpt-6-luna',
'reasoning' => ['effort' => 'high'],
],
// Agent 主循环:这里必须上 Sol,Luna 会迷路
'agent_loop' => [
'model' => 'gpt-6-sol',
'reasoning' => ['effort' => 'xhigh'],
],
// 代码库级重构
'refactor' => [
'model' => 'gpt-6-sol',
'reasoning' => ['effort' => 'max'],
],
// 计算机操作:全表差距最大的一项,别省
'computer_use' => [
'model' => 'gpt-6-astra',
'reasoning' => ['effort' => 'max'],
],
default => [
'model' => 'gpt-6-sol',
'reasoning' => ['effort' => 'medium'],
],
};
}
}
有个实用特性值得单独提:推理档位可以在同一段对话中途改,而且不会打断缓存。 也就是说,你可以在 Agent 的第一步(判断要干什么)用 max 档好好想,后续执行步骤降到 low 或 none 省成本——缓存照样命中。
成本估算的一个例子
一个每条任务调用 10 次的 Agent 流程,每次 2K 输入 / 1K 输出:
| 模型 | 单次任务成本 | 每月 100 万次 |
|---|---|---|
| GPT-5.6 Sol | $0.28 | $280,000 |
| GPT-6 Sol | $0.14 | $140,000 |
| GPT-6 Luna | 约 $0.007 | 约 $7,000 |
Luna 和 Sol 之间差了 20 倍——这就是为什么"Luna 能不能用"这个问题值得认真回答,而不是拍脑袋。 判断标准也很直接:你的任务里,"下一步做什么"是代码决定的还是模型决定的?代码决定 → Luna;模型决定 → Sol 起步。
六、这次发布真正的信号
把技术细节放到一边,这次发布在行业层面释放了三个信号。
信号一:模型能力"下放"正在变成常规动作。 以前的做法是发新一代、老一代降价;现在的做法是同一代内部铺三档,把旗舰能力压缩到中低档。对用户是好消息(能力普及更快),但也意味着等下一代的收益在变小——下一代旗舰和中档之间的差距,可能不如你想象的大。
信号二:命名结构在收敛。 GPT-5.6 的三层 Sol / Terra / Luna 到 GPT-6 变成 Astra / Sol / Luna,Terra 被砍。这说明"档位太多"对用户是负担——三层是极限,四层就是选择困难。 企业级模型产品大概率会稳定在"旗舰 + 主力 + 廉价"这个三段式。
信号三:价格战正式开打。 Anthropic 发布 Claude Opus 5.5 之后 90 分钟,OpenAI 就把 Sol 和 Luna 端上桌。而且定价卡得很精准:Sol 的 $2/$10 正好是 Opus 5.5 的一半;Luna 的 $0.10/$0.50 是 Astra 的 1%。这一晚,模型能力还没来得及被独立验证,价格先打起来了。 对做 AI 应用的团队来说,这是实实在在的利好——推理成本正在从"产品能不能做"的约束条件,变成"利润率有多少"的调节项。
最后的结论回到开头:Astra、Sol、Luna 三档不是"好、中、差",而是"规划、执行、批处理"三种角色。 按价签选模型,你会在该用 Astra 的地方用 Luna 然后被失败率教育;按工作类型选,你能把成本砍掉 90% 而基本不损失效果。
顺带说一句,OpenAI 公布 Sol 的成绩时用的单位是"每成功任务 $0.27"。把评估成本的单位从"每百万 token"换成"每成功任务",是这次发布里最值得抄走的一件事。
FAQ
Q:GPT-6 Sol 和 Luna 现在能在普通 ChatGPT 里用吗?
不能。目前只在 ChatGPT Work 和 Codex 里可用(Plus/Pro/Business/Enterprise/Edu),Free 和 Go 用户只能用 Luna 且限桌面端 App。标准版 ChatGPT 聊天界面官方说是分阶段上线。企业账号还需要管理员先在后台开启。
Q:GPT-6 Sol 比 GPT-5.6 Sol 强吗?值得迁移吗?
分情况。价格确实降了约 50%,Agent 与代码审查类评测也涨了 1.8 到 3.6 分,事实错误率从 8.5% 降到 4.6%。但 DeepSWE 掉了 3.9 分、OSWorld 掉了 1.8 分,GDPval(真实办公交付物)退了约 100 Elo,而且幻觉降低主要靠"少答"实现。日常编码和 Agent 跑量任务值得迁;长上下文检索、深度调研、要交付完整文档的场景建议先双跑对比再决定。
Q:Luna 便宜 100 倍,我的 Agent 项目能直接用 Luna 吗?
看"下一步做什么"由谁决定。如果任务流程是代码固定好的(分类、抽取、摘要、批量转换、初稿生成),Luna 在编码类评测上只比 Sol 低 2.2 分,成本只有 1/20,可以放心用。如果流程需要模型自己决定下一步(多轮工具调用、浏览器操作、跨软件长链路),Luna 在 AutomationBench 上比 Sol 低 12.5 分、错误率翻倍,这是假省钱。
Q:要不要现在就用满 105 万上下文?
注意成本结构:超过 272K 输入 token 后整单重新计价,输入翻倍、输出涨 1.5 倍。如果你只是"能塞进去就塞",账单会失控。另外 Sol 和 Luna 都缺少长上下文检索的公开评测数据(前代 Sol 有 MRCR v2 在 256K-512K 区间 91.5% 的公开数字),长文档检索场景建议保留前代模型做对照。