万字长文带你从零精通 OpenAI Codex
▲ 图 1:Codex 从入门到精通指南封面
初次接触 Codex,用户常困惑于其核心概念:项目与任务的区别、Local/Worktree/Cloud 的选择、Plan 模式的必要性、权限分级,以及 Plugins、Skills、MCP 的共存逻辑。
本文旨在厘清底层逻辑,助您掌握界面交互、工作区机制及核心运行原理,从而构建标准工作流,精准控制权限,高效审查改动(Diff),并在实际场景中灵活运用 Plan、Skill、Plugin、MCP 及 Automation。
核心收益:独立建立标准工作流、规范控制读写权限、精准审查改动(Diff),清晰判断何时使用 Plan、Skill、Plugin、MCP、Automation 以及 /goal。
▲ 图 3:Codex 的核心能力模型与协作生态
一、先理解 Codex 到底是什么
Codex 并非普通的“聊天机器人”,而是能够实际落地操作的自主智能体(Agent)。
- 普通聊天工具:仅生成文本建议。
- Codex:不仅提供分析,还能读取本地文件、修改代码/文档、执行终端命令、审查 Git 改动、操作浏览器与桌面应用,并调用外部系统工具。
交付给 Codex 的任务应具备材料明确、边界清晰、结果具体的特征。其核心运行生命周期包含四个阶段:
- Prompt:输入精准的任务上下文与目标;
- Plan:评估操作路径与影响面;
- Execute:读写文件与执行 Shell 命令;
- Verify(最关键):检查改动并验证。注意:Codex 提示“已完成”仅代表执行结束,必须通过测试与 Diff 校验确保逻辑正确。
▲ 图 4:Codex 提供的五大主要交互入口
五大入口选择建议
初学者无需同时掌握所有入口:
- 推荐先使用桌面 App掌握可视化与交互逻辑;
- 熟悉终端后再引入CLI工具提升效率;
- Cloud、IDE 插件与 Chrome 扩展仅用于特定协作场景,按需集成。
二、Codex App 界面三栏架构解析
Codex App 采用标准的三栏式架构:左侧管任务、中间管交互、右侧管审查。
|
|
|
|
|---|---|---|
| 左侧面板 | 项目与任务管理 |
|
| 中间面板 | 执行与控制台 |
|
| 右侧面板 | 代码审查 (Diff) |
|
▲ 图 5:Codex App 三栏式主界面与核心功能区分布
1. 左侧:项目(Project)与任务(Thread)
- 项目(Project):对应一个本地根工作目录,定义了 Codex 的上下文读取边界与默认文件写入权限。
- 任务(Thread):属于项目下的单次独立对话线程。建议一个任务聚焦一个确定目标,有始有终。
- 最佳实践:若旧对话混入大量冗余上下文,果断新建 Thread;若仅在原有改动上微调,则保留原 Thread。
2. 中间:交互与即时控制
底部输入框不仅是聊天区,更是实时任务控制台:
- 发送/打断:可随时打断偏离预期的执行;
- 模型/沙盒:即时切换模型配置与只读/写入权限;
- 快捷交互:支持附件拖拽、快捷键
Ctrl+M语音转文字; - 即时纠偏原则:执行过程中无需等待全部结束。发现方向错误,立即发送“只分析不要改动”或“先停下,仅列出计划”,及早纠偏成本最低。
3. 右侧:Diff 面板与精准审查
右侧 Diff 面板(绿色新增、红色删除)是掌控 Agent 的核心安全阀:
- Inline 行级评论:直接在具体代码行旁留批注,比模糊描述更精准;
- 精细化控制:支持按文件或代码块(Hunk)进行暂存(Stage)与回退(Revert);
- 闭环操作:直接在 App 内完成 Commit、Push 或开启 Pull Request。
三、工作区选择:最小权限原则
选错目录是导致 Codex“找不到文件”、“误改无关文件”、“读取无关材料导致 Context 爆炸”的主因。
核心原则:完成此事所需的文件,能否集中放在一个最小目录里?能,就只打开这个目录。切忌直接开放根目录或杂乱总目录。
常用场景隔离方案
- 独立项目开发:打开该独立工程的根目录;
- Monorepo / 多项目同仓:分别作为独立 Project 添加进 Codex;
- 前后端分离工程:以主要目录启动,需要交互时通过追加目录权限补充;
- 纯代码审计:开启目标目录,但严格将权限设置为 Read-only;
- 在 CLI 中精确控制:
# 指定 frontend 为主工作区,并向 backend 追加可写权限
codex --cd ~/projects/frontend --add-dir ../backend
四、执行环境:Local、Worktree 与 Cloud 怎么选?
新建任务时,选择任务运行环境至关重要:
|
|
|
|
|
|---|---|---|---|
| Local |
|
|
优点:最直观快捷 缺点:易与开发者本人正在编辑的文件产生冲突 |
| Worktree |
|
|
优点:高度隔离、安全支持并行 缺点:占用额外磁盘空间,需 Handoff 合并 |
| Cloud |
|
|
优点:解放本地算力,无需守着电脑 缺点:依赖网络,无法直接访问本地未提交环境 |
▲ 图 6:不同执行模式与沙盒隔离级别示意
五、Plan 的使用时机与规范
Plan(规划模式)是执行复杂任务的“路线图”,能提前暴露范围过宽、步骤颠倒等隐患。
如何启用 Plan
- CLI 指令:
/plan 先检查当前目录结构,给出重构方案,暂不要修改任何文件 - App 对话示例:“先不要修改代码。请列出你理解的核心目标、需读取的文件清单与分步操作方案,等我确认后再动手。”
Plan 使用判别标准
- 必须用 Plan:涉及多文件重构、改动影响核心逻辑、原因未明的 Bug 排查、方案比选。
- 没必要用 Plan:修改单一字段、调整样式属性、执行一条明确的格式化命令。
高质量 Plan 必备四要素:
- 真正要解决的核心问题是什么?
- 需要参考哪些上下文材料?
- 将要修改哪些具体文件与模块?
- 最后通过什么测试/标准来证明已完成?
六、安全权限控制与审批策略
Codex 拥有强大的系统交互能力,权限分配必须严谨:
|
|
|
|
|
|---|---|---|---|
| Read-only |
|
|
🟢 安全(零风险) |
| Workspace-write(推荐日常) |
|
日常绝大多数开发任务的标准配置 | 🟡 受控(推荐) |
| Full access / YOLO |
|
|
🔴 极高(谨慎使用) |
遇到审批弹窗必查四项:
- 执行的具体命令是什么?
- 在哪个目标目录下执行?
- 是否触发了外部网络请求?
- 该操作是否对于实现当前目标绝对必要?
(注:涉及删除数据、修改系统配置、安装第三方未验证依赖时,务必逐项核查!)
七、容易被忽视的 5 大核心内置工具
▲ 图 7:集成终端联动与报错排查能力
- 集成终端(Integrated Terminal):
- macOS 快捷键
Cmd+J唤出。 - 特点:Codex 能直接读取终端的实时输出。遇报错时只需说“检查终端中的错误并修复”,无需手动复制 Log。
- macOS 快捷键
- 内置浏览器(In-App Browser):
- 用于实时渲染本地前端页面。支持直接在 UI 元素上点选并留下位置批注(如“将此 Button 与输入框对齐”)。
- Computer Use(桌面交互操作):
- 支持 Agent 点击、拖拽、识别屏幕并控制无 API 的本地软件。
- 注意:涉及转账、账号权限、发布上线等关键操作必须由人工确认。
- 图片输入与分析:
- 支持拖拽设计稿或 UI 截图至输入框:
codex -i screenshot.png "排查页面此区域在移动端为何发生样式塌陷"
- 支持拖拽设计稿或 UI 截图至输入框:
- Memory(偏好记忆系统):
- 自动沉淀用户开发习惯与长期偏好。
- 提示:固定的项目技术规范建议写入
AGENTS.md;个人零散协作偏好依靠 Memory。
八、CLI 终端最常用命令与操作指南
▲ 图 8:Codex CLI 全屏 TUI 交互界面与斜杠命令
核心子命令速查
codex # 启动全屏交互式 TUI
codex exec "任务内容" # 非交互模式:单次执行并退出
codex resume --last # 快速恢复上一次的会话上下文
TUI 常用按键与技巧
@:快速搜索并引用工作区中的文件路径;!+ 命令:直接在当前上下文执行原生 Shell 命令;Enter(运行中):向当前正在运行的 Agent 快速追加指令;Tab(运行中):排队插入下一轮执行任务;- 双击
Esc:快速编辑上一条已发送的消息; Ctrl + L:仅清屏(保留上下文状态);/clear:重置当前对话历史,开启全新上下文。
九、AGENTS.md:建立可继承的项目规则
AGENTS.md 是 Codex 进入项目时优先读取的指令规范文件,可让新任务自动继承项目约定。
# 项目协作规则
- 【执行原则】接到需求优先判断最短可靠路径,能局部重构就不大范围重写。
- 【上下文】修改前必须先读取实际对应文件,严禁凭空推测项目目录结构。
- 【边界控制】严格在当前项目目录内读写,严禁无故安装额外依赖。
- 【验收标准】任务结束后运行 npm test,并主动向用户汇报已验证与未验证项。
维护经验:规则应来自实战。每当 Codex 在某处犯错,就补充一条针对性的清晰约束,保持简练有效。
十、彻底搞懂:Skills vs. Plugins vs. MCP
三者定位分明,切勿混淆:
|
|
|
|
|
|---|---|---|---|
| Skill | 做事的方法与工作流 |
|
SKILL.md 的文件夹、脚本或模板
|
| Plugin | 能力聚合安装包 |
|
|
| MCP | 外部系统连接协议 |
|
|
▲ 图 9:Codex Plugins 插件生态中心
1. Skills 实操
- 显式调用:在 Prompt 中输入特定 Skill(如 $skill-name);
- 隐式调用:Codex 依据任务自动匹配;
- 创建工具:可通过 $skill-creator 引导式构建自定义规则并沉淀于
.agents/skills/。
2. Plugins 生态
在应用内或 CLI /plugins 中安装,常见生态包括:
- 协作与项目管理:Atlassian Rovo (Jira/Confluence)、GitLab Issues、GitHub 连接器;
- CI/CD 与审查:CircleCI、Render、CodeRabbit;
- 办公协同:Microsoft Suite、Google Drive、Slack。
3. MCP 扩展能力
- 常见集成:Figma MCP(读设计稿)、Playwright MCP(浏览器自动化测试)、Sentry MCP(线上错误排查)。
- CLI 操作:
codex mcp add <server-name> <command> codex mcp list
十一、Automations 定时任务工作流
▲ 图 10:Automations 定时自动化任务配置面板
Automations 适合周期性健康检查、无人值守报表生成与长周期任务推进。
5 步创建 Automation 流程:
- 指定项目(Project):圈定代码库与运行上下文;
- 编写 Prompt 模板:支持在 Prompt 中通过 $skill-name 调用预设能力;
- 配置触发周期:支持单次触发或 Cron 周期运行;
- 指定运行环境:强烈建议选择 Worktree 隔离运行,避免污染本地活动分支;
- 权限核验并保存:任务执行结果将自动汇总至 Triage(收件箱),便于集中审查。
十二、/goal、Plan 与 Automation 的本质差异
▲ 图 11:/goal、Plan 与 Automation 的协作定位差异
|
|
|
|
|
|---|---|---|---|
| Plan | 路线图 |
|
|
| Automation | 定时闹钟 |
|
|
| /goal | 里程碑状态机 |
|
|
十三、从 0 到 1 进阶成长路线图
阶段一:基础掌控 (目录 / 任务 / 权限 / Diff)
↓
阶段二:质量与安全 (Plan / 集成终端 / 审查 /review)
↓
阶段三:进阶并行 (Git Worktree 隔离 / 多 Agent 并行)
↓
阶段四:生态赋能 (沉淀 Skill / 接入 MCP / 定时 Automation)
- 第一阶段(基础建立):严格控制 Workspace 边界,学会利用右侧 Diff 面板评估每一处变更,掌握打断与纠偏。
- 第二阶段(质量跃升):复杂任务前主动要求列出 Plan,善用终端读取报错,利用
/review引入独立 Agent 审查。 - 第三阶段(并行协作):熟练利用 Worktree 进行多任务并行实验与隔离开发。
- 第四阶段(生态沉淀):把高频固定工作流固化为 Skill,对接 MCP 连通企业系统,利用 Automation 实现自动化运维。
十四、Codex 核心机制速查总览
▲ 图 12:Codex 核心功能、命令与权限速查全景图
官方通道与资源
- Codex 中国官网:访问 codexinstall.asia
- Codex 国内站:https://momoai.asia/home
▲ 图 13:Codex 站点访问与资源入口

