#
从“聊天”到“干活”,AI的进化速度再次刷新了我们的认知。
北京时间2026年7月10日,OpenAI正式向全球全面开放了GPT-5.6系列模型。这距离它6月底开始的有限预览,仅仅过去了两周。但如果你以为这只是一次常规的“跑分更高、推理更强”的升级,那可能就错过了重点。
这次发布,OpenAI悄悄撕掉了GPT身上“聊天机器人”的旧标签,试图让它成为你电脑里一个能真正替你“干活”的同事。
## 不止一个模型,而是一支“AI天团”
首先,GPT-5.6不是一个模型,而是一个系列。OpenAI抛弃了过去的命名方式,引入了以天体命名的新体系:
• GPT-5.6 Sol(太阳):旗舰款。负责处理最复杂的推理、编程、科学研究和网络安全等高难度任务。它是家族里最聪明的那个。• GPT-5.6 Terra(地球):均衡款。专为日常工作设计,性能对标上一代GPT-5.5,但成本直接减半。它是性价比最高的主力担当。• GPT-5.6 Luna(月亮):轻量款。主打速度和低成本,适合需要高频调用的场景,比如批量摘要、分类等。在大家最关心的性能上,旗舰版Sol在多个基准测试中刷新了纪录。例如在衡量专业工作流的“Agents‘ Last Exam”中,Sol的得分(53.6分)比竞争对手Claude Fable 5(自适应推理)高出了13.1分。而在编程智能体指数上,Sol同样以80分创下新高,且输出Token减少了一半以上,耗时缩短超一半。
如果说Sol是秀肌肉的“理科状元”,那么Terra和Luna就是负责开疆拓土的“成本杀手”。这清晰的三层定价策略,目标明确:让不同需求的用户都能找到最合适的那款,而不是所有任务都杀鸡用牛刀。
## 从“能聊天”到“会干活”的关键一跃
如果说模型升级是面子,那产品形态的变革就是里子。
这次发布最值得关注的,其实是ChatGPT Work和Codex App并入ChatGPT桌面应用。
• ChatGPT Work:你的AI实习生:它不再是一个问答框,而是一个能交付结果的智能体。你可以给它一个目标,比如“根据Slack聊天记录和上周的销售数据,做一份Q3营收预测的PPT”。它就能自己拆解步骤,跨应用(邮箱、日历、云盘、CRM)调取资料,连续工作几小时,最后直接给你一份完整的成品。这标志着AI正式从“建议者”变为“执行者”。• Codex合体:编码能力融入工作流:拥有超过500万周活用户的Codex,现在直接集成到了新版ChatGPT桌面应用里。有趣的是,其中超过100万用户用它来做非开发工作。这说明编码智能体那套“理解目标-拆解任务-调用工具-自我纠错”的能力,天然适用于任何知识工作。OpenAI敏锐地抓住了这一点,将Coding能力泛化为Working能力。这背后的技术支撑,是新引入的 ultra模式。在处理最棘手的问题时,ultra模式可以自动启动多个智能体并行协作,相当于为一项任务组建了一个“AI特工队”。再加上更强的计算机操作能力,GPT-5.6能自己检查和优化渲染后的网页效果,更像一个人类设计师了。
## 更强能力背后的“紧箍咒”
不过,这次发布还有一个有趣的背景:它经历了美国政府两周的严格安全审查。
由于GPT-5.6在网络安全和生物等领域的潜在风险,应美国政府要求,OpenAI进行了为期数周的安全评估和有限预览。这或许是未来前沿AI模型发布的新常态:能力越强,缰绳越紧。
OpenAI也坦承,他们为模型配备了迄今最稳健的防护措施,包括实时的网络安全和生物滥用分类器,对于高风险请求甚至会在生成到一半时暂停,交由更大的模型进行审查。这套分层防护机制,旨在让被禁止的攻击性活动更困难,同时保留对防御性安全研究等合法工作的访问权限。
这次GPT-5.6的发布,就像AI行业的一个缩影。一方面,模型在“智商”和“动手能力”上突飞猛进;另一方面,围绕安全、伦理和监管的博弈也在同步升级。
总而言之,GPT-5.6的意义可能超越了单纯的性能提升。它通过分层模型(Sol/Terra/Luna) 实现了更精准的商业覆盖,通过Work和Codex的整合展示了向“通用智能体”演进的决心,同时也让我们窥见了未来AI治理的复杂图景。AI竞赛,已然进入了一个全新的维度。