大数跨境

上手体验 OpenAI DevDay 新玩意:Dots、Decisions API、开源 Codex Harness 更新

上手体验 OpenAI DevDay 新玩意:Dots、Decisions API、开源 Codex Harness 更新 AI大模型应用实践
2026-10-03
18
导读:OpenAI DevDay 更新不少,哪些真好用?一起来上手体验。

点击上方蓝字加入我们

长假期间,让我们关注些轻松的话题,一起来体验一下前两天 OpenAI DevDay 发布的新玩意。

除了热议的 500 刀新计划、GPT-6.1 Sol 这些不痛不痒的更新,我更关注的是:

  • 云端助手 Dots

  • 用于决策的 Decisions API

  • 开源 Codex-Harness 的更新

  • 协作空间 ChatGPT Space

这些更新,有的给 ChatGPT 用户提供了全新的工作与协同方式,有的给开源项目带来了福利。下面我们一个个看看这些新能力能帮我们做些什么,又能怎样融入自己的应用。

一、Dots:一个能持续跟进的云端助手

本次推出的 Dots,是常驻云端的个人 Agent,由 GPT-6 Astra 驱动。

没错,对标的就是最近火爆的 Muse。

每个 Dot 有自己的电脑和浏览器,可以查资料、处理文件、记住工作背景,并在必要时委派给 GPT Work 或 Codex 任务。

最重要的是,你离开对话后,它仍能推进你交给它的工作任务。

  • 如何使用

使用很简单。将 ChatGPT 更新到最新版本,如果账号已获开放,就能看到 Your Dot 的入口。

你可以定制 Dot 的形象和昵称,这样就拥有了一个随时可以召唤的云端助手:

这里可以看到 Dot 拥有两个电脑:云端电脑可以独立工作;但要处理本机文件、代码和应用,则要在上图中的 Computers 中授权连接本地电脑;使用时本机需保持在线、ChatGPT 应用也需打开,一人只能连接一台个人电脑。

这样,Dot 在工作时可以按需创建本地 Work/Codex 任务,也可以继续指定的本地 Codex 任务(但两边浏览器登录不互通)。

  • “打电话”派任务

你可以在对话中随时“拨打电话”给 Your Dot;接通后,直接布置任务、讨论取舍或追问进度,还能一边说话一边补充文字资料。

比如你可以直接口头吩咐:“替我筹备一个 DevDay 的线上分享会,准备议程和讲解稿,完成后通知我。”(是不是有一种牛马翻身的感觉?)

  • 任务实测

现在我们来让 Dot 完成一个真实的任务,我给它的要求是:

筹备一场 DevDay 的分享会。参考 OpenAI 官方文档,最后交付一份议程 Excel 和一份可以打开阅读的 HTML 讲解材料,一共三个主题,要有茶歇....

然后大概喝杯茶的时间,Dot 会完成任务,并等待你审核:

Dots 实际生成并打开的 HTML:原版 90 分钟议程、演示脚本、环境条件、替代方案和校验程序。

你可以接着在与 Dot 的对话界面中要求进行修改或者调整,这一切和你在本地 ChatGPT中交互并无太大区别 — 只是这些任务都是在云端完成,包括搜索、Web 访问、文档生成、核查;生成的产物默认也会保留在云端(可以下载)。

如果任务需要本机资源,Dot 则可以通过前面连接的本地电脑协同完成。

最后:Dots 目前还只向 Pro 等部分账户开放,且与 Dot 的对话不占用套餐用量。

二、Decisions API:新的决策型接口

前面两篇文章刚介绍过 JEV — 面向高性能场景的决策模型,这不决策API就来了。

Decisions API,顾名思义,就是面向分类、分流和下一步动作选择等场景的决策接口:

你提供文字或图片的上下文、定义问题和有限的候选答案、由 API 做选择。其目标很单一且明确:让 Agent 更直接、快速地拿到判断结果,而不是在“思考”后的长篇大论。

关于决策模型的更多知识,可以翻阅:

拆解爆火的 JEV(上):10 分钟看懂这款 Agent 的高速“协处理器”。

拆解爆火的 JEV(下):在 Agent 系统中的 8 类典型应用场景。

  • 与 Chat API 区别在哪里

传统的 Chat API 通常用来生成回复和解释(虽然也能用结构化输出与提示词限定答案),它很灵活,但如果每个小的控制决策都使用这种 API ,可能带来不必要的延迟和成本。比如:

  • 分类,把邮件归为咨询、投诉或其他

  • 分流,把工单交给售后、技术支持或人工复核

  • 下一步选择,让 Agent 在继续检索、核验结果、询问用户之间选一个

Decisions API 的重点,就是把这类有限选择做成专门的接口。

但不要把 Decisions API 理解成换个名字的Chat API JSON 输出模式。

决策 API 在判断时,有着更短的答案生成路径:它的“答案空间“在推理生成之前就被限定;而不是在文本生成之后再通过 JSON 输出再加以限定。

当然,写长文、规划任务等仍要用通用模型;而明确的 if/else 规则也应该继续写代码,而不是简单的倒向 Decisions API。

  • Decisions API 的使用
目前 Decisions API 尚处于有限预览阶段,下面用一个概念示例说明它的用法,并非官方请求格式:
{
  "context": {
    "ticket": "The customer was charged twice.",
    "account_tier": "business",
    "recent_events": ["payment_succeeded", "payment_succeeded"]
  },
  "question": {
    "name": "route",
    "prompt": "Which approved workflow owns this case?",
    "answers": ["refund_review", "technical_support", "account_security"]
  }
}
基本思路是:给定一个上下文(context),提出自己的问题(prompt),同时给出候选的答案(answers),然后由 Decisions API 输出最后的决策结果(通常还会结合一个置信度)。
  • Decisions API 对比 JEV

尽管两者都同样面向决策场景,但一个是专用 API,一个是决策模型及其配套接口,不能完全画等号。

  • Decisions API 的背后是 GPT-6 Luna 模型;而 JEV 则是全新的独立决策模型

  • Decisions API 有一个重要的能力 — 支持多模态输入;而 JEV 尚未支持

  • JEV 模型的强化训练方法上采用了不同的 RLCD,即“面向校准决策的强化学习”

  • Decisions API 目前支持的问题形式是 Choice(从候选答案中选择);但 JEV 支持 Choice(选择)、Score(评分)、Noul(是否)三种问题形式

相比传统大模型,两者都有着极高的响应性能(Decisions API 号称比 GPT-6 Luna 快十倍)和更低的成本;不过 Decisions API 还处于局部预览阶段,很可能在正式版会有更多增强。

三、开源 Codex Harness:不影响任务的即时打断

前面主要体验的是 OpenAI 提供的产品和接口,而开源 Codex Harness 的更新,则关系到我们自己的 Agent 系统。

大概总结下,最新版本 Codex Harness 的更新主要有:

    • 即时打断:开启后可以在任务过程中追加要求、调整目标。甚至可以在 Code Mode 的工具调用中让模型先接话,后台继续运行,稍后再收取结果。

    • 历史锚点分页:以某轮任务中的一条记录为“书签”,读取它前后的一段历史。应用可以据此实现“点击某个报错,展开附近的执行过程”这样的功能。

    • CLI 等体验优化:欢迎页更紧凑,等待确认计划时也能翻看历史;Mermaid 图表支持更丰富,复制记录时能保留表格和排版。

    • 权限与运行稳定性修复:批准命令后仍保留明确禁止访问文件的规则,并修复 macOS 沙箱中的 TLS 网络访问、Windows 后台进程闪窗等问题。

    下面来体验下新的即时打断功能(instant_interrupt)。

    • 真实体验 instant_interrupt

    现在用我本地构建的一个 Agent 演示应用 - Forge 做简单测试。Forge 前端通过对话交互,展示消息、工具调用以及输出产物;后端则通过 JSON-RPC 连接 Codex Harness(app-server模式)构建,并可通过适配接入第三方模型(比如我这里接入 MiniMax):

    实测一:打断,修改任务目标

    做一个简单演示:让 Agent 等待一段时间(以留出时间窗口追加指令)后写个 90 分钟提纲;然后我追加指令“改成 45 分钟”。最终 Agent 按照我的追加要求完成了任务:

    MiniMax 的实际交付与追加要求。这里核验的是时间和变更采纳,提纲中的产品表述仍需人工审阅。
    实测二:打断,要求临时先响应
    前一个测试是属于临时修改任务目标和要求,现在来测一个复杂点的场景:
    如果 Agent 的工具调用还没跑完,它是否能够临时“跳出来”先回应我?
    我让 Forge 先启动一个 40 秒的计时任务,随后追加:“先回复已收到变更,再继续等计时结果。” 可以看到,Agent 先回复了“已收到变更,后台计时继续”,然后会接着等待原来的计时任务。计时结束后,它取回了结果。
    也就是说,它先接住了我的话,原来的任务仍在后台继续,没有被停止或重新执行。
    就像同事手上正忙着,听到你补充要求,先应一声,再接着把事情做完。

    四、Space 和 Page:共同工作空间

    在最新的ChatGPT 侧边栏会看到一个 Space 按钮,这就是最新的 ChatGPT Space。

    Space 把页面(page)、文件和共享工作成果放在一起,你可以和 ChatGPT 一起编辑维护其中的内容。

    它解决了工作成果散落在聊天记录里、不方便查找的问题。比如你让 AI 生成的图片、用 Astra 制作的 3D 交互站点等,保存到 Space 后,下次就不用再翻聊天记录,可以直接在这里查找和打开。

    在 Space 中,你可以创建多个空间,按照某个主题、项目或者团队进行组织;并为每个空间设置团队与协作者的访问权限(企业用户)。
    Space 中的一个重要新功能是Page:
    一种支持分块编辑的 MD 协作文档(类似 Obsidian 笔记),供你、同事与ChatGPT共同编辑,可以写作、研究、制作图表、甚至评论。
    Page 最特别的是它与 ChatGPT 的深度集成 — 用斜杠 / 随时唤出 AI 帮助你编辑页面、生成内容。
    比如,唤起 ChatGPT 插入一段内容:
    或者选择 Visualize,插入一个交互式可视化内容:
    你还可以用@命令来链接你的某个历史聊天、其他页面和文件;甚至 @ 你的 Dot 或 ChatGPT,让它们参与页面修改和评论。


    整个体验下来,本次 DevDay 的更新量很足,但真正让人眼前一亮的并不算多。
    有点像当年的苹果,在 iPhone 惊艳亮相后,逐渐转向更稳妥的迭代路线:Dots 让人想到 Muse,Decisions API 则让人联想到 JEV。
    不过尽管方向相近,最终还是要看用起来怎么样。
    对我来说,Dots 能把云端任务与本地工作接起来;Codex Harness 的更新为构建自己的 Agent 系统提供了更强大的 Harness 基座;Space 也让平时的 AI 成果有了一个可以继续整理、修改和协作的空间。这些都有实际价值,也期待它们在后续迭代中变得更成熟、更好用。
    -- END --
    感谢阅读,交流与合作请后台留言

    喜欢就关注哦
    Image
    动动小手点个赞
    Image
    点在看最好看
    Image

    【声明】内容源于网络
    0
    0
    AI大模型应用实践
    专注大模型应用的深度研究与开发实践。《基于大模型的RAG应用开发与优化》、《MCP原理揭秘与开发指南》作者。ToB为主,ToC为辅。
    内容 64
    粉丝 0
    AI大模型应用实践 专注大模型应用的深度研究与开发实践。《基于大模型的RAG应用开发与优化》、《MCP原理揭秘与开发指南》作者。ToB为主,ToC为辅。
    总阅读1.0k
    粉丝0
    内容64