今天凌晨,OpenAI 和 Anthropic 又撞车了,一口气发了三个新模型。
Claude 更新了 Opus 5.5,也是罕见直接跳过了几个版本直接上到了 5.5,所以更新应该挺大。
今天我会跟你们聊下这两个模型我体验后感觉到的一些区别,以及在产品工作和日常工作流里该选什么模型以及开到什么推理等级。
OpenAI 这次发布的是 GPT-6 Sol 和 Luna,这么一来,GPT-6 就集齐了 Astra、Sol、Luna 全家桶。

这里要说下,Sol 在 6 里不是最强的,Astra 目前还是顶流。
另外,GPT-6 Sol 的 API 价格,每百万 Token 输入 2 美元、输出 10 美元,相比上一代的促销价直接砍半。

GPT-6 的价格比 GPT-5.6 便宜了一半,但是我看缓存好像没啥差别。
不管怎么说,还在用 5.6 的可以直接升级 6,现在 Codex 客户端已经可以用了,5.6 全系就别再用了。

Sol 沿用了 Astra 的新训练方法,编程、操作电脑和跨软件执行任务的成本效率都有改善。
关于模型的进步和各种参数和吊炸天的测评我就不说了,反正跟我们也没关系,我只说跟普通人日常使用有关的一些建议。
先说一个问题。
你每天让 AI 写文档、做产品、分析数据,到底有没有必要一直开最贵的?
显然,没必要。
不过,单价便宜的模型,用起来也可能更费钱。
OpenAI 的内部事实测试里,它犯错的数量大约降了一半,但这不代表回答可以免核查。
GPT-6 Luna 更便宜,每百万 Token 输入 0.1 美元、输出 0.5 美元,也就是开头说的那个价格。
它适合范围明确、需要反复执行的任务。
比如,按已有规则给资料分类、提取订单字段、整理内容标签,这种一天可能要跑几百上千次的工作,单次成本很重要。
Astra 仍然负责更难的分析、规划和复杂任务,Sol 承担日常工作,Luna 承担高频处理。
就拿我来说,如果我要做的是参考多项因素做产品规划工作,那我直接用 GPT-6 Astra 并把推理等级开到中等。
注意,这种工作开到中等就够了,没必要上高和超高,毕竟不是搞科研。
如果只是我公众号日常数据的分析,那我现在用 GPT-6 Sol 并开到中或者高也够了,用高完全是我要让它从数据中做深度洞察。
至于每日信息日报或者一些定时认为之类的,直接挂到 GPT-6 Luna 并把推理等级开到中就行,不要顶格开。

关于我的 AI 工作流在 Codex 里用什么模型和推理等级,我在之前《给你们看下我的账单》里说过了,但那时候还没有发布 6 的 Sol 和 Luna,现在我全部升级了。
这么一来,你的额度一定是够用的,该省省该花花,token 才能不焦虑。
但实际上,我发现很多人不会区分任务类型,什么都是顶格开,那一个月 100 美金的 ChatGPT 会员 20x 也压不住。
再说下 Claude 这边,这次更新的是 Opus 5.5。
它重点加强了编程和专业工作,也调整了表达方式,减少绕弯和不必要的解释。
Anthropic 公布的输出速度,比 Opus 5 快了 30% 以上。
而且根据 A 厂自己发布的对比里看,Opus 5.5 在很多方面都强于 O 厂的 GPT-6 系列。

价格方面。
Opus 5.5 每百万 Token 输入 4 美元、输出 20 美元,单价降了 20%。
缓存读取降到 0.2 美元,也就是相同资料被缓存后,再次读取会更便宜。

官方对典型任务的测算是,默认设置下总成本下降约 40%。
注意,20% 是单价降幅,40% 是特定任务下的成本估算,不是你每次都能省这么多。
上面这些也都是 API 调用价格,不代表 ChatGPT 和 Claude 的订阅费同步减半。
不过话说回来,要说内容文案创作类工作的表现,我觉得 Opus 系列的模型还是略强于 GPT 系列,更多体现在那种自然感、活人感、以及字里行间的过度感。
我试了下用 Opus 5.5 和 GPT-6 去写同一个主题的内容,前者会更好一点,但后者也并不差。
但没办法,A 厂对国内并不友好,各种封号就不说了,现在基本也只能通过中转站去掉 API 用。
该说不说,我觉得 A 厂的模型做得还是不错的,虽然我并不喜欢这公司。
想试 Sol 和 Luna,目前可以去 Codex 或 ChatGPT Work 找,发布时还没进入普通 Chat 对话。
再说一个点,我觉得选模型不能只看价格表。
比如一个模型便宜,却反复理解错需求,你来回纠正十几次,最后还得自己重做。
贵一点的模型一次做对,算上你的时间,反而更划算。
而且,得把模型选择放到真实场景里去看。
比如,你负责一个电商产品,最近结算转化率下降了,业务方让你赶紧改版。
这个阶段,我会倾向于用 Astra,先从中等推理开始。
把转化数据、用户访谈、版本变更和业务限制交给它,让它区分已知事实、可能原因和还需要验证的假设。
用户究竟卡在运费、支付,还是根本没看懂优惠?问题没弄清楚,直接让 AI 画一个新结算页,很容易做出一个漂亮但没用的方案。
需求确认后,交互路径、页面状态和验收标准都明确了,可以换 Sol 做 PRD、可交互原型和测试用例。
需要进一步写代码、调整前端和调试时,Opus 5.5 也值得拿同一份需求试一下。比较的是能不能跑、细节有没有漏,以及要返工几次。
数据分析也是类似的。
清洗表格、去重、计算转化率和画图,可以先用 Sol。让它写代码实际计算,保留公式、筛选条件和结果,方便你检查。

但如果你问的是「这次下降到底是不是改版造成的」,就需要进一步分析新老用户、流量来源、活动变化和统计口径,复杂时再用 Astra。
换一个更强的模型,也不能凭空补出缺失的证据。没有对照和验证,相关性依然不能直接当成因果。
再说内容创作。
观点和素材已经明确,写一篇短文、改标题、调整表达,我会先选 GPT-6 Sol 中等推理。
如果要读多篇资料,判断其中的分歧,再写一篇有自己观点的长文,我会选 Astra 中等推理。
材料越复杂、事实越有争议,越值得提高推理等级。
Opus 5.5 可以作为文字表达的另一个候选,拿同样的素材和样稿各写一版,看哪一版更接近你的口吻、事实更准确、需要你改的地方更少。
像我写文章,就要给它自己的原稿、亲改记录和产品方法。只告诉它「像真人一点」,它并不知道这个真人是谁。
图片设计我觉得要单独说,因为这里特别容易混淆。
这些模型可以帮你想创意、写设计要求、用代码做页面,但做封面和海报时,还要看实际调用的生图模型。
比如 GPT Image 2.5,Flare 更偏速度,Sunburst 更偏质量和精细修改。
先试构图可以考虑前者,对商品、人物和局部修改要求更高,再试后者。
让它给商品换个背景,结果连商品样子都改了,那这张图再漂亮也不能用。做设计的读者应该很容易理解这种区别。
这是我平时给副业做视频封面的效果,抠图、打光、背景、文字,都是 AI 做的。

这是原图实拍,就是用下面实拍的给 AI,然后它会根据我的要求和 Skill 做出上面的效果。
还有一点要跟你们说。
如果在同一个地方连续失败,先检查资料和要求有没有缺失。信息给全了还做不出来,就换更强的模型,别一直让它原地重试。
你可以拿手头三个真实任务做一次对比,比如一份产品方案、一张数据表、一篇文章。
给不同模型相同的资料和要求,记录完成时间、错误、修改次数和费用。
最终,留下那个能稳定交付的组合。
我现在带 AI 员工做事,始终要自己判断什么算做对了。
模型越便宜,越容易让人觉得多跑几次没关系。但如果任务定义错了,它只是用更低的价格,帮你做了更多没用的工作。
以上这些建议,希望对你们有用。
要用好 AI,拼的不是谁用的模型最强,也不是谁的会员等级更高,更不是谁消耗的 token 最多。
在我看来,这里面依旧是人的差异。
人的方法、惊艳、直觉、审美,直接决定了 AI 在你手上是神器还是工具。
人的价值,依旧很大。
本文来自微信公众号 “唐韧”(ID:RyanTang007),作者:唐韧,36氪经授权发布。