幻兹观察
GPT-5.6,ChatGPT想包办一切
菠萝派
2026年07月10日
阅读 9.6万 次

GPT-5.6 发了。

我这次最先注意到的,不是榜单又换了谁第一,而是 OpenAI 顺手把 ChatGPT 的野心摊在了桌面上。

新版 ChatGPT 把 Chat、Work、Codex 放进同一个 App:想聊天,就 Chat;想做研究、文档、表格、演示稿,就进 Work;想碰代码、终端和仓库,就切 Codex。原来的 Codex App 更新后会直接变成这个新版 ChatGPT,老 ChatGPT 桌面端则被叫作 ChatGPT Classic。

这件事看起来像一次界面整合,味道却很不一样。ChatGPT 过去更像一个哪儿都能问两句的工具,现在开始像一个什么都想接手的工作台。OpenAI 显然不满足于让它留在聊天框里了。

我打开新版产品时最强烈的感觉是:它是不是想把我电脑上能干的事,都先收进 ChatGPT?

一个 App,开始装下三种工作

Chat 很好理解,还是那个熟悉的聊天框。Work 和 Codex 才是 OpenAI 这次往前跨的一步。

Work 面向研究和交付物:让 ChatGPT 读资料、分析信息、做文档、表格、报告,甚至生成可编辑的演示稿;Codex 则继续干软件开发的活,能碰本地文件、代码仓库、终端和开发工具。官方把这三块明确塞进了同一款桌面 App 里。

以前大家总把“AI 工作流”理解成一串互相接力的工具:聊天模型负责想,另一个工具负责查,再开一个工具写代码,最后自己把结果拼起来。OpenAI 现在想把这条链压缩到 ChatGPT 下面。

GPT-5.6 就是它给这张工作台换上的发动机。

它最值得关注的能力,不是多回答一道题,而是能把一项任务往下推。OpenAI 说,GPT-5.6 可以在任务中调用工具、处理过程信息、检查进度,再决定下一步怎么做。需要更重的活时,ultra 会默认让四个智能体并行推进。

翻译成人话:你不该只得到一段“建议你这样做”的文字,而是有机会拿到一份已经做出形状、可以继续修改的东西。

这对内容创作者、独立开发者和小团队才有实际价值。大家在意的不是 AI 会不会把一份大纲写得更花,而是它能不能少掉一次返工,少掉一次把资料重新讲给另一个工具听,少掉一次“看起来很会,交出来却不能用”。

OpenAI 给出的评测很猛:它宣称 GPT-5.6 Sol 在一项覆盖长任务的专业工作评测中拿到 53.6 分,并把“更少 token、更多完成工作”当作这代产品的核心卖点。首批体验者的评价也分成两派:有人觉得它在日常复杂任务里更稳、更愿意把事做完;也有人仍偏爱 Anthropic 模型更强的原始能力。

这恰好说明,GPT-5.6 的战场已经不只是谁更聪明。谁更能把一件麻烦事推进到交付,谁才更有机会留在用户电脑上。

宇宙三件套,先把模型名换得像人话

GPT-5.6 这次不是只发了一颗模型,而是一次放出了三种不同定位的模型版本:Sol、Terra、Luna。它们分别负责最高能力、日常平衡和低成本高速度,也把后面的选择题一起带来了。

Sol、Terra、Luna 这组名字,乍一看像 OpenAI 把模型发布会搬进了天文馆。

Sol 是太阳,Terra 是地球,Luna 是月亮。按公开资料看,OpenAI 没有解释这场命名会到底发生了什么;它只确认,5.6 代表模型代际,Sol、Terra、Luna 是会各自更新的能力层级。

不过这个“宇宙三件套”确实比 mininano 好记。

Sol 是旗舰,适合最难、最贵、最需要耐心的任务;Terra 是日常干活的平衡档;Luna 主打速度和成本。开发者在 API 里能直接看到价格差:Sol 的输入和输出分别是每百万 token 5 美元和 30 美元,Terra 是 2.5 美元和 15 美元,Luna 则是 1 美元和 6 美元。

名字给人的感觉很像消费品:太阳负责大场面,地球负责日常,月亮负责轻快省钱。

问题是,OpenAI 刚把名字讲得好懂,转头又把菜单摆复杂了。

普通 ChatGPT 对话里,用户并不能直接自由挑 Sol、Terra、Luna。默认还是 GPT-5.5 Instant;有资格使用 GPT-5.6 的人,看到的是 Medium、High、Extra High 和 Pro。Terra、Luna 主要出现在 Work、Codex 和 API 里。

像是先给你一张星图,再让你去选电饭煲火力。

模型解决“请谁来干活”,推理档位解决“让他坐多久”。这两个选择叠在一起,对熟手很有用,对普通人就是新的认知负担。

OpenAI 把算力选择,塞回了用户手里

我不觉得 OpenAI 在筛选“高智用户”。这么写太偷懒了。

它更像是在筛选另一种东西:谁知道自己的任务值不值得多花算力,谁有足够复杂、足够值钱的工作,能把更强模型的价格吃回来。

一个开发团队要跑长代码任务,可以在 Sol、Terra、Luna 之间算成本;一个企业用户要处理一堆内部资料,也会愿意为更高的推理档位买单。对他们来说,选模型不是麻烦,是控制交付质量和预算的按钮。

普通用户面对的却是另一套体验。

在标准 ChatGPT 里,高推理不直接显示成一笔 token 账单,但会占用不同的使用额度;额度用完后,系统还可能切回较小的替代模型。用户经常只会感到两个变化:今天它怎么突然变慢了,或者怎么没有刚才那么聪明。

这就是我对 GPT-5.6 最别扭、也最感兴趣的地方。

OpenAI 一边把产品入口收得很紧:Chat、Work、Codex,全放进 ChatGPT;一边又把能力拆得很细:模型分档、推理分档、套餐分档、使用额度也分档。

高端用户会越用越爽,因为他终于能像调云算力一样调 ChatGPT。任务简单时省钱,任务难时加码,关键交付再上最高档。

很多普通用户则会陷进另一种迷茫:我这次到底该点哪个?我选错了,是结果变差,还是额度白烧?

以前用户得记住哪个 App 干什么;现在只需要打开 ChatGPT,却得慢慢学会给 AI 分派不同等级的工作。

万能 App 的理想很大,现实还没完全合上

OpenAI 的产品路线很明确:让 ChatGPT 成为一个总入口,外部应用、文件、任务和智能体都围着它转。

但“总入口”不等于所有体验已经打通。

Work 目前仍在逐步开放;可用范围跟套餐、工作区设置、文件类型和使用端有关。桌面端的本地 Work 任务和云端 Work 对话在上线时也没有完全互通,PowerPoint 也不在当前桌面 Work 的支持范围内。ChatGPT 把三个身份装进一个 App,不代表三套体验已经严丝合缝。

这反而给了文章一个更真实的判断:OpenAI 现在卖的不是一款已经完成的万能工具,而是一种新的默认入口。

它希望用户以后别再先想“我要打开哪个软件”,而是先说“我要把什么事做完”。ChatGPT 再决定该用聊天、Work、Codex,还是更贵、更慢、更能想的那颗脑子。

这个方向我买账。工具越多,人越不该被迫做工具管理员。

我不太买账的地方也很明确:当一个产品承担的事越来越多,它最好把复杂度藏回自己身上,而不是让用户站在模型选择器前,学着给太阳、地球和月亮排班。

下一次打开 ChatGPT,真正该被检验的也许不是 GPT-5.6 又赢了哪张榜。

而是我丢进去一句“把这件事做完”之后,还要不要先研究半天,到底该请哪颗星球来上班。

Copyright © 幻兹网 All Rights Reserved粤ICP备2026034579号粤公网安备44030002012995号