幻兹测评
GPT-5.6怎么选模型更划算?
菠萝派
2026年07月14日
阅读 3.4万 次

我的 GPT-5.6 取消五小时限制之后,仅仅过了一天,周额度只剩 30%,我人都麻了。

以前有五小时窗口,我还能算着用。大概知道这一轮能干多少活,也能卡在周额度刷新前,把最麻烦的任务集中处理掉。现在这道门槛没了,看起来很爽,实际上一天跑掉 50% 周额度也不是没可能。我现在反而不敢随便开 Sol。

GPT-5.6 给我的感觉很直接:模型变强了,消耗也变猛了。

更让我头疼的是模型选择页。GPT-5.6 分成 Sol、Terra、Luna 三档:Sol 最强,Terra 负责中间那一大段日常工作,Luna 偏向快速和低成本。每一档下面又有不同推理强度,轻度、中度、高度、极高、最大;部分入口还能看到更激进的“超高”模式。

这么多按钮摆在面前,最常见的问题也就来了:Sol 最强,我是不是永远选 Sol?推理强度拉满,是不是就能得到最好答案?

我这几天看下来,答案都是否定的。

模型决定“这件事交给谁做”,推理强度决定“允许它为这件事花多少时间和额度”。把这两件事混着选,周额度很快就会教你做人。

我先把这三个模型放回它们该在的位置

免费用户目前主要还是 GPT-5.5。Plus、Pro 用户在 Chat 里可以直接选 Sol;进入 Work 和 Codex,Sol、Terra、Luna 都能用。API 也能调用全系,只是另外按量计费。

我只在 Chat 里聊天、查普通资料、写一段短文时,不会特意去开 Sol。默认模型已经够快,Sol 留给那些需要认真想一会儿的问题。

我在 Work 和 Codex 里,Terra 会是第一个点开的模型。

比如改已有功能、补测试、整理一批客户反馈、处理已经讲清楚的需求,我都会先交给 Terra。它做得不对,我再补充信息让它重跑一轮;任务本身开始变复杂,再换 Sol。

Luna 在我这里更像一个能大量派活的助理。批量分类、统一格式、把一堆内容拆成固定结构、生成一批测试样例,都可以让它做。前提是我能很快检查结果,错了也能直接重来。

Sol 是我拿来处理麻烦事的:跨很多文件的错误、看着像好几个系统一起出了问题的故障、需要查日志和资料才能推进的任务。它做完第一轮,我依然会看结果,但至少不用一开始就盯着每一步。

模型选完,推理强度怎么点

我给自己定了一个顺序:先选模型,再选推理强度。

Sol、Terra、Luna 解决的是模型分工;轻度、中度、高度、极高、最大,解决的是这一次任务要让它想多深。很多人一上来就 Sol 拉满,结果相当于请了最贵的专家,去帮自己把会议纪要改成三种格式。

我现在大致这么用:

轻度,只交给 Luna。任务已经拆清楚,结果也好检查,例如批量分类、统一格式、从固定字段里提取内容。它没必要在这种活上想半天,我也没必要为此付出更高额度。

中度,是我最常用的一档。Terra 中度适合处理大多数日常工作:改已有功能、补测试、整理资料、查一个范围明确的问题。它有足够时间理解上下文,又不会把每次任务都烧成大工程。

高度,留给需要判断的活。例如一个问题涉及几处代码、需求有一点模糊、要比较几种方案,或者我已经知道这次不能只靠“照着做”。Terra 高度和 Sol 中度,往往是我更愿意先试的组合。

极高和最大,我只在任务真的卡住时才开。比如跨很多文件的排错、迁移一个老项目、追一个断断续续的线上问题、让模型读完资料后给出完整方案。它们确实可能多走几步、多查几轮,也可能把额度吃得很快。Sol 最大档不是日常更聪明的 Sol,它更像给难题准备的加班模式。

OpenAI 目前允许 Plus、Pro 等用户在 Work 和 Codex 中给 Sol、Terra、Luna 分别设置推理强度;最大档可用,部分套餐和入口还有超高模式。普通 Chat 里,Sol 对应的是中度、高度和极高等选择。不同套餐看到的按钮不完全一致,别拿别人的界面硬套自己的。

我现在最少做的一件事,就是让 Sol 一上来就开最大。

Terra 中度没解决,我会先补充信息,再试 Terra 高度;还不行,换 Sol 中度;问题确实复杂到需要它自己查工具、读很多上下文,我才会继续往上加。这样做不一定最炫,至少不会下午三点就开始盯着周额度发呆。

我为什么还要拉上 Claude Fable 5

如果你以前没用过 Claude,Fable 5 这个名字确实很突然。

它是 Anthropic 面向开发者开放的高端长任务模型,价格也高:每百万输入/输出单位 $10/$50。Sol 的价格是 $5/$30。我把它放进来,是因为 Sol 和 Fable 5 在抢同一种工作:复杂代码、长流程研究、模型得自己调用工具往下做的任务。

我想弄明白的不是“谁家模型更聪明”。我更关心一件事:Sol 到底替我省下了多少时间和钱,Fable 5 又在哪些地方还值得花那笔贵钱。

我找了三组有完整任务和测试方法的公开实测,结果比我预想得更分裂。

我的结论先放在这里:Sol 很适合把工具活干快、干便宜;Fable 5 还有一些很具体的工程任务能赢;GPT-5.6 里,我最愿意长期留在手边的反而是 Terra。

Sol 让我看到的是效率,不是无敌

Viktor 是一个做智能体开发工具的团队。他们搭了模拟工作区和工具环境,让 Sol 和 Fable 5 都以高推理档完成同一批多步骤任务。

结果很有意思:两边通过率都是 76%。

Sol 的单任务成本是 $33.55,Fable 5 是 $96.35;Sol 的中位完成时间是 82 秒,Fable 5 是 129 秒。

我看完这份测试,对 Sol 的定位更明确了。

如果我已经知道要做什么,任务里有工具、有步骤、有能检查的结果,Sol 的性价比非常狠。它不只是每次少收一点钱,同样完成度下三倍的成本差,放到团队里会直接影响模型该怎么分工。

这份测试也没有让我放弃 Fable 5。Viktor 测的是他们自己的任务集,模型都开了高推理档。换到另一个具体工作,结果很快就变了。

网页抓取这件事,Fable 5 赢得很干脆

Zyte 是一家做网页数据提取的公司。他们准备了 6 个网站、21 个测试页面,让模型写抓取代码,再把抓到的数据和人工标注答案对照。

Fable 5 得分 0.910,Sol 得分 0.857。

Fable 5 的一次运行平均约 9 分 48 秒,成本 $4.74;Sol 平均约 6 分 38 秒,成本 $1.47

我很喜欢这组数据,因为它把“新模型一定全方位更强”这件事拆掉了。

Zyte 同一张表里,GPT-5.5 得分是 0.878,也高于 Sol。Sol 在规划、调用工具、推进长流程时进步很明显;当任务变成网页结构、提取规则和边界情况,旧模型和 Fable 5 仍然可能做得更好。

我不会因为 Sol 是最新的模型,就把它拿去替换掉每一条旧工作流。

我用模型时,越来越在意它最后到底是谁在干活

RuBench 是一个测试代码仓库任务的研究项目。它不只看最终得分,还追踪了模型执行过程。

研究者发现,25 个任务里有 5 个任务在 Claude Code 内被安全策略从 Fable 5 切到了 Opus 4.8。

这件事让我收起了对模型名的迷信。

我平时买到的是 Claude Code、Codex、Work 这些产品,里面还夹着模型路由、工具权限、安全策略和账号状态。宣传页上写着 Fable 5,最后跑完任务的也未必全程都是 Fable 5。

对国内用户来说,Claude 还有一个更现实的问题:账号能不能一直稳定用。Anthropic 的规则里写着暂停、终止和申诉流程,社区里关于地区、误封和申诉困难的讨论也不少。我的项目要赶进度时,不会把唯一的工作流压在一个账号风险很高的平台上。

Terra 为什么成了我的日常选择

Sol 的宣传声量最大,Luna 的价格最低,Terra 正好夹在中间,很容易被忽略。

我连续做日常工作时,最常遇到的并不是“让模型从零写一个巨大项目”,而是十几个中等难度的小任务混在一起:修几个问题,补几段测试,整理一批资料,顺手查一下某个接口为什么返回异常。

这种时候我先开 Terra。

它跑不通,我再换 Sol;它能完成,我就没必要为每个小任务付 Sol 的消耗。Terra 的价值不靠一张总榜第一来证明,它让我不用在“太轻”与“太贵”之间反复纠结。

Luna 也是同样的道理。我把任务拆到足够具体,规则写清楚,检查方法也准备好,Luna 就能帮我快速把重复劳动清掉。它犯错并不可怕,最怕的是我交给它一个自己都没讲明白的大问题。

Fable 5 什么时候值得掏钱

我只会在一种情况下认真考虑 Fable 5:代码仓库很大,需求还在变,我没法把任务拆得特别细,模型得自己读很多历史代码,慢慢把问题摸出来。

这种任务里,Fable 5 可能会让我少来回几轮。它贵,但有时候省下的是我坐在电脑前反复解释的时间。

日常改动、批量处理、能自动检查结果的任务,我不会优先用它。价格摆在那里,订阅内的使用窗口也一直在变。Anthropic 之前已经明确过,Fable 5 的订阅可用期有限,之后会转为使用积分。

我会把 Fable 5 当成项目陷进死胡同时请来的高级帮手,不会拿它处理每天都会来的杂活。

五小时限制没了,我得自己给 Sol 设限

五小时限制还在时,我会看着时间安排任务。现在少了这道门,我只能盯着周额度。

Sol 上线后,社区里有一类反馈很具体:多智能体任务会让子任务继承父任务的高消耗设置和上下文,使用量会比预期高很多。开发者已经给出临时处理方式,OpenAI 还没有就这个问题公开完整修复方案。

我现在给自己定了个很笨的规矩:当天周额度已经掉了 20%,后面能用 Terra 或 Luna 的活,就不再开 Sol。它听着不酷,至少能防止我周一下午把这一周最贵的额度全烧掉。

我也希望 OpenAI 多重置几次额度。现在这个阶段,大家并不是突然变得贪心,只是模型比以前更会消耗,规则又还在变化。

我现在会怎么选

我只在 Chat 里解决复杂问题,就用 Sol,普通聊天继续默认模型。

我进 Work 或 Codex 干活,先点 Terra。任务明确、重复量大,再切 Luna。Terra 已经跑过、问题还是没收住,或者我知道这件事一旦做错就得返工半天,我才让 Sol 出场。

Fable 5 还会留在我的工具箱里。它适合大仓库、长任务、信息混乱的项目;我会先确认账号、使用积分和任务预算,再决定值不值得开。

GPT-5.6 让我最舒服的地方,不是 Sol 有多强。

是我终于不用每一次都把最强的模型叫出来。

Copyright © 幻兹网 All Rights Reserved粤ICP备2026034579号粤公网安备44030002012995号