大数跨境

如何用好 GPT-6 系列 AI 模型?OpenAI 放出指南,教你选模型、优化提示词等

如何用好 GPT-6 系列 AI 模型?OpenAI 放出指南,教你选模型、优化提示词等 AI范儿
2026-10-05
5
导读:本文整理 OpenAI 的 GPT-6 家族实用指南:三款模型怎么选、推理强度、提示词怎么写、长任务和计算机使用,以及怎样用缓存省钱。

现在的模型越来越多了。不管是 OpenAI 还是 Anthropic,同一个系列里往往有好几款模型,而且每款模型还有不同的推理级别。

这对很多人来说,怎么选就变得非常困难。

所以大部分人用的时候,可能根本不去选,从头到尾都用同一个模型。这样不仅没有发挥出模型的最佳性能,往往还消耗了更多的 token。

OpenAI 官方也意识到了这个问题,所以前两天专门发了一份 GPT-6 使用指南,教大家怎么选模型。

01 三款模型,怎么分工

先看官方给的定位和标价。

模型
输入
(美元)
输出
(美元)
缓存输入
(美元)
官方说它适合
GPT-6 Astra
10
50
1
需要最高智能水平、难度最大的推理工作
GPT-6.1 Sol
2
10
0.10
复杂编程、研究、计算机使用
GPT-6 Luna
0.10
0.50
0.01
大规模、目标明确的重复任务

这张表列的是 OpenAI 目前 GPT-6 系列三款主要模型的价格,以及官方对它们的定位。

官方说得很明确。目标明确的日常重复性工作,比如提取发票字段、对请求分类、生成结构化摘要,用最便宜的 Luna 就行。

我的理解是,那些不需要思考、只需要执行的事,有 Luna 就够了。

更复杂的编程、研究和计算机使用任务,除了执行,还要一定的思考能力,用 Sol 比较合适。

目前 GPT-6.1 Sol 应该算是性价比最好的一款,官方说它的智能水平接近 Astra,价格只有 Astra 的五分之一。

最厉害的当然是 Astra,但大家都知道,它的 token 消耗量也非常大。所以最难、最需要推理的事,才用 Astra。

▲ 图:三款模型分工示意

之前 AI 给过我一个建议:在我的日常工作里,最多只有 5% 的任务需要用到 Astra。绝大部分用 Luna 就能完成,剩下的交给 Sol。

02 推理强度,别一上来就开满

选完模型,还要选推理级别,也就是让模型花多少力气去想。官方给了四档:

  • 低:提取事实、小改动这类活。
  • 中:需要判断的活,比如规划功能、比较几个方案。
  • 高:高难度调试、深入分析、细致审查。
  • 极高或 Max:“高”还不够的时候再试。只有效果提升抵得过多花的时间和钱,才继续用。

最后一档官方说得很克制,意思就是别默认开。

▲ 图:推理强度四档阶梯

在 API 里,对话中途可以调整推理强度,缓存不会失效。在 Codex 里,先用模型的默认级别,简单任务往下调,要深入分析再往上调。

速度也是要花钱的。

API 里有个快速模式,响应更快更稳,但每个 token 更贵。官方建议用在聊天应用、编程工具这类对响应时间要求高的场景。

还有个超高速模式,Codex 和 API 都能用,生成速度更快,推理强度不变。官方说它适用于 Astra,适合需要快速迭代代码、更快的响应值得多花钱的时候。

03 提示词:写少一点

这一点很多人会觉得反直觉,其实很好理解。

我们原来学的提示词写法,总是教我们写得越详细、越具体越好。但这种教法是建立在以前的模型还不够智能的前提上。

现在的模型能力远远超过了之前,我们不能再拿教小学生的那一套去教一个博士生。

OpenAI 开发者体验团队的 Eric Provencher 说,模型理解细微差别和模糊含义的能力已经大幅提升,过去有帮助的详尽指导,如今反而可能妨碍模型发挥。

对新模型来说,最重要的是先把任务说清楚:你想要什么结果,面向谁,有哪些相关的上下文和限制,怎样才算完成。老的写法,也要跟着模型的能力一起更新。

就像我之前介绍 Anthropic 时说的那样,我们也可以从下面四个方面去更新。这四点,官方摘自另一篇《重新思考 GPT-6 Astra 的技能与提示词》:

  • 技能:用一句短描述写清什么时候用。补充细节等需要时再加载,不要写死操作步骤。
  • AGENTS.md:写清哪些文档和测试适用于哪些情况。安全的常规流程直接授权,比如用一次性数据跑本地测试,不碰生产环境。
  • 决策边界:说清哪些事它可以自己定,哪些要你批准。别一刀切写成“始终先询问”。
  • 做到底:定义什么叫完成,包括改完、跑通、检查结果、修掉问题。再说明哪些决策要你来审。

输出这边,官方的例子是:模型可以自己决定摘要怎么组织,但改项目范围之前要先问你。回复用通俗语言,技术细节贴合读者,最后带一段简短的交接说明:改了什么,查了什么,还剩什么。

04 长任务:中途能改,也能干别的

官方说,GPT-6 系列可以处理持续数小时甚至数天的任务。

对这种长任务,如果还像普通对话那样一轮一轮来,等它做完再进行下一轮,就会浪费大量 token。因为在它做的过程中,你可能会冒出新想法,或者想纠正点什么。这时候你不用等它结束,中途就可以让它调整。

OpenAI 明确了一些可以用的能力。API 这边有三个:

  • 轮次中途引导:模型干活的时候,你可以通过 Responses WebSocket API 发纠正信息。更新会进队列,不会取消正在跑的工具,也不会撤销已经做完的操作。
  • 异步工具调用:应用在跑测试这种慢任务时,模型可以先去做别的独立工作。依赖测试结果的部分,等结果回来再开始。
  • 多智能体:GPT-6.1 Sol 能通过 Responses API,把独立的活分给子智能体,比如各查代码库的一块,最后汇总。这个功能还在测试阶段。

▲ 图:长任务三种方式的时间线对比

长时间运行的任务,中途可能遇到需要你决策的事,而这种事很难在最开始的提示词里就想到、写明白。所以过程中也可以做澄清和引导。Codex 这边有两个:

  • 边做边问:GPT-6 Astra 在 Codex 里可以中途请求澄清。你要离开的话,先说清哪些任务可以继续,什么时候该停下来等你。
  • 改方向:需求变了,就用新信息引导当前任务,说明什么要改,什么不动。省得它在一个已经不对的方案上继续耗。

05 计算机使用:能走 API 就别点屏幕

自从 Astra 出来之后,计算机使用就变得非常流行。我也经常用,很多默认的任务,最后也会借助它来完成。但用过的人都知道,这种操作非常费 token。

三款模型都支持计算机使用,可以直接操作网站和桌面应用,没有 API 也行。官方举的例子是:让模型调查一个缺陷,改完代码,再打开你的产品,在浏览器里确认修好了没有。

那到底哪些任务该用?我自己一直也有点好奇。官方的原则是选最简单可靠的路:

  1. API 或者已连接的工具能直接办,就用它们。
  2. 要读屏幕、点按钮、填表单的时候,才用计算机使用。

▲ 图:计算机使用决策流程

这其实已经说得很直白了:能不用就尽量不用。我自己也一样,现在能通过 CLI、MCP 解决的,绝对不会用计算机使用。

如果你要自己做集成,就给模型一个能跑代码的工具来控制浏览器或桌面。官方点名了两个:浏览器用 Playwright,桌面应用用 PyAutoGUI。

06 上线前:缓存和测试

省钱方面,官方最看重提示词缓存。缓存输入的费用,比未缓存的输入最多低 95%,具体看模型。回头看上面的表,三款模型的缓存价,都是各自输入价的十分之一。

想用好缓存,有两个条件:

  • 固定的指令和参考资料,放在会变的任务细节前面。
  • 工具定义保持一致。

这里我举个例子,不然不太好理解。

假设你做了一个合同审核助手。每次来一份新合同,你都要先给模型一大段审核规则,再把这份合同交给它。

审核规则每次都一样,合同每次都不一样。

规则放前面、合同放后面,从第二份合同开始,前面那一大段一模一样的规则,就可以直接按缓存价算,只有新合同按原价。官方标价里,缓存价是原价的十分之一。

反过来,合同放在最前面,开头每次都不一样,后面的规则就复用不上了。这就是官方要求“固定的放前面”的原因。

07 像分配员工一样分配模型

我经常听到读者朋友说,套餐额度消耗太快了。我曾经也这么觉得。我的习惯是不管什么任务,都用最好的那个模型。但摸索了一段时间之后,我发现自己的用法大错特错。

可能很多朋友跟我一样,都用最好的模型,从来不选推理级别,都用默认的,更搞不清楚什么叫快速模式。

其实理解起来很简单。你是一个 Manager,手下有三个能力各不相同的员工。任务来了,你肯定会按难易程度分给他们,对吧?如果把所有任务都丢给你认为最强的那一个,肯定不合适。

希望这篇文章对你有所帮助。

08 参考资料

01|OpenAI:GPT-6 系列模型指南(2026 年 10 月 2 日)

https://openai.com/zh-Hans-CN/index/practical-guide-building-gpt-6/

【声明】内容源于网络
0
0
AI范儿
只讲人话,带你玩转AIGC。
内容 53
粉丝 0
AI范儿 只讲人话,带你玩转AIGC。
总阅读941
粉丝0
内容53