
我的 GPT-5.6 取消五小时限制之后,仅仅过了一天,周额度只剩 30%,我人都麻了。
以前有五小时窗口,我还能算着用。大概知道这一轮能干多少活,也能卡在周额度刷新前,把最麻烦的任务集中处理掉。现在这道门槛没了,看起来很爽,实际上一天跑掉 50% 周额度也不是没可能。我现在反而不敢随便开 Sol。
GPT-5.6 给我的感觉很直接:模型变强了,消耗也变猛了。
更让我头疼的是模型选择页。GPT-5.6 分成 Sol、Terra、Luna 三档:Sol 最强,Terra 负责中间那一大段日常工作,Luna 偏向快速和低成本。每一档下面又有不同推理强度,轻度、中度、高度、极高、最大;部分入口还能看到更激进的“超高”模式。
这么多按钮摆在面前,最常见的问题也就来了:Sol 最强,我是不是永远选 Sol?推理强度拉满,是不是就能得到最好答案?
我这几天看下来,答案都是否定的。
模型决定“这件事交给谁做”,推理强度决定“允许它为这件事花多少时间和额度”。把这两件事混着选,周额度很快就会教你做人。
免费用户目前主要还是 GPT-5.5。Plus、Pro 用户在 Chat 里可以直接选 Sol;进入 Work 和 Codex,Sol、Terra、Luna 都能用。API 也能调用全系,只是另外按量计费。
我只在 Chat 里聊天、查普通资料、写一段短文时,不会特意去开 Sol。默认模型已经够快,Sol 留给那些需要认真想一会儿的问题。
我在 Work 和 Codex 里,Terra 会是第一个点开的模型。
比如改已有功能、补测试、整理一批客户反馈、处理已经讲清楚的需求,我都会先交给 Terra。它做得不对,我再补充信息让它重跑一轮;任务本身开始变复杂,再换 Sol。
Luna 在我这里更像一个能大量派活的助理。批量分类、统一格式、把一堆内容拆成固定结构、生成一批测试样例,都可以让它做。前提是我能很快检查结果,错了也能直接重来。
Sol 是我拿来处理麻烦事的:跨很多文件的错误、看着像好几个系统一起出了问题的故障、需要查日志和资料才能推进的任务。它做完第一轮,我依然会看结果,但至少不用一开始就盯着每一步。
我给自己定了一个顺序:先选模型,再选推理强度。
Sol、Terra、Luna 解决的是模型分工;轻度、中度、高度、极高、最大,解决的是这一次任务要让它想多深。很多人一上来就 Sol 拉满,结果相当于请了最贵的专家,去帮自己把会议纪要改成三种格式。
我现在大致这么用:
轻度,只交给 Luna。任务已经拆清楚,结果也好检查,例如批量分类、统一格式、从固定字段里提取内容。它没必要在这种活上想半天,我也没必要为此付出更高额度。
中度,是我最常用的一档。Terra 中度适合处理大多数日常工作:改已有功能、补测试、整理资料、查一个范围明确的问题。它有足够时间理解上下文,又不会把每次任务都烧成大工程。
高度,留给需要判断的活。例如一个问题涉及几处代码、需求有一点模糊、要比较几种方案,或者我已经知道这次不能只靠“照着做”。Terra 高度和 Sol 中度,往往是我更愿意先试的组合。
极高和最大,我只在任务真的卡住时才开。比如跨很多文件的排错、迁移一个老项目、追一个断断续续的线上问题、让模型读完资料后给出完整方案。它们确实可能多走几步、多查几轮,也可能把额度吃得很快。Sol 最大档不是日常更聪明的 Sol,它更像给难题准备的加班模式。
OpenAI 目前允许 Plus、Pro 等用户在 Work 和 Codex 中给 Sol、Terra、Luna 分别设置推理强度;最大档可用,部分套餐和入口还有超高模式。普通 Chat 里,Sol 对应的是中度、高度和极高等选择。不同套餐看到的按钮不完全一致,别拿别人的界面硬套自己的。
我现在最少做的一件事,就是让 Sol 一上来就开最大。
Terra 中度没解决,我会先补充信息,再试 Terra 高度;还不行,换 Sol 中度;问题确实复杂到需要它自己查工具、读很多上下文,我才会继续往上加。这样做不一定最炫,至少不会下午三点就开始盯着周额度发呆。
如果你以前没用过 Claude,Fable 5 这个名字确实很突然。
它是 Anthropic 面向开发者开放的高端长任务模型,价格也高:每百万输入/输出单位 $10/$50。Sol 的价格是 $5/$30。我把它放进来,是因为 Sol 和 Fable 5 在抢同一种工作:复杂代码、长流程研究、模型得自己调用工具往下做的任务。
我想弄明白的不是“谁家模型更聪明”。我更关心一件事:Sol 到底替我省下了多少时间和钱,Fable 5 又在哪些地方还值得花那笔贵钱。
我找了三组有完整任务和测试方法的公开实测,结果比我预想得更分裂。
我的结论先放在这里:Sol 很适合把工具活干快、干便宜;Fable 5 还有一些很具体的工程任务能赢;GPT-5.6 里,我最愿意长期留在手边的反而是 Terra。
Viktor 是一个做智能体开发工具的团队。他们搭了模拟工作区和工具环境,让 Sol 和 Fable 5 都以高推理档完成同一批多步骤任务。
结果很有意思:两边通过率都是 76%。
Sol 的单任务成本是 $33.55,Fable 5 是 $96.35;Sol 的中位完成时间是 82 秒,Fable 5 是 129 秒。
我看完这份测试,对 Sol 的定位更明确了。
如果我已经知道要做什么,任务里有工具、有步骤、有能检查的结果,Sol 的性价比非常狠。它不只是每次少收一点钱,同样完成度下三倍的成本差,放到团队里会直接影响模型该怎么分工。
这份测试也没有让我放弃 Fable 5。Viktor 测的是他们自己的任务集,模型都开了高推理档。换到另一个具体工作,结果很快就变了。
Zyte 是一家做网页数据提取的公司。他们准备了 6 个网站、21 个测试页面,让模型写抓取代码,再把抓到的数据和人工标注答案对照。
Fable 5 得分 0.910,Sol 得分 0.857。
Fable 5 的一次运行平均约 9 分 48 秒,成本 $4.74;Sol 平均约 6 分 38 秒,成本 $1.47。
我很喜欢这组数据,因为它把“新模型一定全方位更强”这件事拆掉了。
Zyte 同一张表里,GPT-5.5 得分是 0.878,也高于 Sol。Sol 在规划、调用工具、推进长流程时进步很明显;当任务变成网页结构、提取规则和边界情况,旧模型和 Fable 5 仍然可能做得更好。
我不会因为 Sol 是最新的模型,就把它拿去替换掉每一条旧工作流。
RuBench 是一个测试代码仓库任务的研究项目。它不只看最终得分,还追踪了模型执行过程。
研究者发现,25 个任务里有 5 个任务在 Claude Code 内被安全策略从 Fable 5 切到了 Opus 4.8。
这件事让我收起了对模型名的迷信。
我平时买到的是 Claude Code、Codex、Work 这些产品,里面还夹着模型路由、工具权限、安全策略和账号状态。宣传页上写着 Fable 5,最后跑完任务的也未必全程都是 Fable 5。
对国内用户来说,Claude 还有一个更现实的问题:账号能不能一直稳定用。Anthropic 的规则里写着暂停、终止和申诉流程,社区里关于地区、误封和申诉困难的讨论也不少。我的项目要赶进度时,不会把唯一的工作流压在一个账号风险很高的平台上。
Sol 的宣传声量最大,Luna 的价格最低,Terra 正好夹在中间,很容易被忽略。
我连续做日常工作时,最常遇到的并不是“让模型从零写一个巨大项目”,而是十几个中等难度的小任务混在一起:修几个问题,补几段测试,整理一批资料,顺手查一下某个接口为什么返回异常。
这种时候我先开 Terra。
它跑不通,我再换 Sol;它能完成,我就没必要为每个小任务付 Sol 的消耗。Terra 的价值不靠一张总榜第一来证明,它让我不用在“太轻”与“太贵”之间反复纠结。
Luna 也是同样的道理。我把任务拆到足够具体,规则写清楚,检查方法也准备好,Luna 就能帮我快速把重复劳动清掉。它犯错并不可怕,最怕的是我交给它一个自己都没讲明白的大问题。
我只会在一种情况下认真考虑 Fable 5:代码仓库很大,需求还在变,我没法把任务拆得特别细,模型得自己读很多历史代码,慢慢把问题摸出来。
这种任务里,Fable 5 可能会让我少来回几轮。它贵,但有时候省下的是我坐在电脑前反复解释的时间。
日常改动、批量处理、能自动检查结果的任务,我不会优先用它。价格摆在那里,订阅内的使用窗口也一直在变。Anthropic 之前已经明确过,Fable 5 的订阅可用期有限,之后会转为使用积分。
我会把 Fable 5 当成项目陷进死胡同时请来的高级帮手,不会拿它处理每天都会来的杂活。
五小时限制还在时,我会看着时间安排任务。现在少了这道门,我只能盯着周额度。
Sol 上线后,社区里有一类反馈很具体:多智能体任务会让子任务继承父任务的高消耗设置和上下文,使用量会比预期高很多。开发者已经给出临时处理方式,OpenAI 还没有就这个问题公开完整修复方案。
我现在给自己定了个很笨的规矩:当天周额度已经掉了 20%,后面能用 Terra 或 Luna 的活,就不再开 Sol。它听着不酷,至少能防止我周一下午把这一周最贵的额度全烧掉。
我也希望 OpenAI 多重置几次额度。现在这个阶段,大家并不是突然变得贪心,只是模型比以前更会消耗,规则又还在变化。
我只在 Chat 里解决复杂问题,就用 Sol,普通聊天继续默认模型。
我进 Work 或 Codex 干活,先点 Terra。任务明确、重复量大,再切 Luna。Terra 已经跑过、问题还是没收住,或者我知道这件事一旦做错就得返工半天,我才让 Sol 出场。
Fable 5 还会留在我的工具箱里。它适合大仓库、长任务、信息混乱的项目;我会先确认账号、使用积分和任务预算,再决定值不值得开。
GPT-5.6 让我最舒服的地方,不是 Sol 有多强。
是我终于不用每一次都把最强的模型叫出来。