编者摘要:CMU 2026秋新开AI Agents研究生课,由OpenHands作者与Meta前Agent团队学者联合授课。课程摒弃浅层科普,以「搭建框架-构建评测-模型训练-科研落地」为核心流水线,聚焦可训练、可评测的完整Agent系统。配套作业工程深度拉满,资源全开源,依托专属算力支持实操,兼顾工程落地与前沿科研,是目前最顶尖的Agent系统实战课程。
10个关键问题问与答
Q1:这门课的核心定位是什么?A:非概念科普课,是面向工程落地与前沿研究的系统课,主打从零搭建、评测、训练LLM智能体,而非简单调API、写Prompt。
Q2:课程核心能力公式是什么?A:Agent能力=模型能力×环境接口(Harness)×评测信号(Eval),RL是串联三者、实现能力迭代的核心闭环引擎。
Q3:课程授课师资有哪些核心优势?A:由OpenHands核心开发者Graham Neubig、Meta前Agent团队Daniel Fried主讲,搭配各领域顶尖客座学者、专项TA,集结CMU顶尖Agent研究力量。
Q4:课程整体学习流水线是什么?A:前半学期通过三次个人作业完成框架搭建、评测构建、模型训练;后半学期以小组科研项目为主,聚焦前沿问题研究。
Q5:作业1(Harness)核心考察什么能力?A:手写ReAct智能体循环,实现工具调用、上下文压缩、技能系统,依托云端沙箱完成代码实操与消融实验,吃透SWE-Agent底层逻辑。
Q6:课程最大的差异化优势是什么?A:不堆砌论文,形成因果连贯的工程教学体系,贴合工业级Agent生产标准,作业对标一线开源项目,远超普通Demo式课程。
Q7:课程考核权重如何分配?A:个人作业40%、期末科研项目50%、课后思考随笔10%,极度重视实操落地与原创研究能力。
Q8:课程AI工具使用规则是什么?A:作业、报告可使用AI辅助,但学生必须完整答辩所有设计决策;课后随笔禁止使用AI,杜绝躺平式学习。
Q9:校外自学者可以完整跟读吗?A:理论、基础作业可完整复刻;RL训练、期末科研项目依赖专属赞助算力,个人难以独立完成。
Q10:课程适合哪些人群学习?A:适合掌握Python、有LLM基础,想深耕Agent底层工程、系统训练与前沿科研,而非仅做应用层开发的开发者与研究者。
概览
CMU LTI 2026 秋季研究生新课《AI Agents》,由 OpenHands 作者 Graham Neubig 与曾任职 Meta Agent 团队的 Daniel Fried 联合授课。不是 Agent 概念科普课,是系统建造 + 训练 + 研究导向工程课。课程官网:https://www.cmu-agents.com/,讲义、作业、YouTube 录播全部对外公开,校外爱好者可跟读。
课程核心目标:基于开源大模型从零实现完整智能体,搭建评测体系,使用 SFT/RL 完成模型训练,并独立开展 Agent 方向开放研究。 底层认知:Agent 能力 = 模型能力 × 环境接口 (Harness) × 评测信号 (Eval),RL 是闭环引擎。课程弱化 Prompt 工程,将 Agent 视为可训练、可量化评估的完整软件系统。
课程整体架构:一条造 Agent 流水线
学期主线:搭建 Harness → 构建评测 Eval → 模型训练 Training → 开放研究项目
-
前半学期:3 份个人作业打通工程全链路 -
Assignment1(Harness,9.14 截止):搭建 Agent 运行框架 -
Assignment2(Eval,9.24 截止):构建智能体评测体系 -
Assignment3(Training,10.22 截止):SFT 与 RL 训练落地 -
后半学期:2–3 人小组做原创研究项目,占总成绩 50%
六大教学模块(共 28 次课)
- Agent 基础能力(第 1–5 讲)
拆解 Agent 核心组件,阅读经典文献与前沿工作:Agent 定义(Toolformer、ReAct、Mini-SWE-Agent)、工具调用(含 XGrammar 约束解码工程细节)、长上下文管理、记忆与技能系统(MemGPT、OpenHands 技能协议)、任务规划分解、多智能体协同,包含 Cursor Plan Mode 工业案例。 - 应用领域(第 6、7、9 讲)
分三大 Agent 赛道:代码智能体(SWE-Bench 体系)、GUI 智能体(OSWorld 作者主讲)、深度网页研究智能体(WebWalker 研究者 Akari Asai 主讲)。 - 训练方法(第 8、10–12 讲)
SFT → RL 基础 → 高级 RL 算法 → RL 系统工程。单独开设 RL Systems 专题,聚焦 Agent RL 真实瓶颈:rollout 沙箱、异步执行、推理吞吐,贴合 vLLM/SGLang 底层实践。 - 安全(第 13、16 讲)
沙箱隔离、凭证管理、可观测性与监控。作业直接使用 Modal 远程沙箱执行模型生成代码,理论与实操结合。 - 框架(第 14、15 讲)
OpenHands、LangGraph 两大主流 Agent 框架团队分享业界工程实践。 - 交互、搜索与进阶(第 17–24 讲)
大规模 AI 劳动力影响、多智能体交互、人机交互、重排序 / 批评模型、树搜索;压轴客座演讲:Karthik Narasimhan、Sasha Rush;预留 Project Hours 供小组推进项目。
亮点:大量课程由领域一线研究者、TA 客座授课,相当于 CMU LTI 及合作圈 Agent 研究力量的集中输出。
作业体系(工程深度标杆)
作业 1:Build an Agent Harness(公开仓库 cmu-agents/assignment-1)
基于 DeepSeek-v4-flash(也支持 GPT-OSS),手写 ReAct 循环实现可复用 Agent,分 3 部分:
- 代码智能体
实现消息构造、ReAct 循环、工具分发,遵循 Agent Skills 协议(技能目录前置,完整定义按需加载);在 SWE-Bench 任务修复国际象棋 bug 程序,输出 patch;模型代码在 Modal 云端沙箱运行。 - 上下文压缩
实现 context compaction 工作记忆,精简历史中间步骤,保留目标、试错经验;在真实 SWE-Bench 任务上做消融,对比 token 消耗并撰写权衡分析。 - 象棋智能体
复用同一 Agent 循环,接入 UCI 象棋工具、局面模拟器;支持模型编写 Python 代码批量搜索,仅提交最终走子;完成 2×2 消融实验(两个模型 × 是否提供合法走子列表)。 评分关注生产级细节:工具调用错误可恢复、并行调用约束等。完成后,可吃透 SWE-Agent/OpenHands 底层运行机制。
作业 2:搭建 Agent 评测框架,解决当前领域评测方法论缺失问题。 作业 3:落地 SFT、RL 训练流水线,完成智能体模型优化。
考核与课程政策
-
个人作业 40%,期末研究项目 50%(提案 5%+ 中期 5%+ 海报 10%+ 报告 30%),课程亮点随笔 10% -
项目鼓励产出论文;若教师 / TA 提供实质性贡献,可邀请共同署名,研究导向极强 -
AI 工具规则:作业、报告允许 AI 辅助,但必须能答辩解释所有设计决策;课后随笔禁止使用 AI -
代码规则:核心模块必须自研,不可直接套用现成完整实现;提供 2 天宽限日
算力与开放生态
算力赞助方:Fireworks、Modal、Prime Intellect、Sail,学生可使用 Modal 沙箱与免费推理额度,普通研究生也能开展 Agent RL 实验。 课程全部资源对外开源:课件、录播视频、作业仓库,校外自学者可完整跟学。
课程价值与门槛
标杆意义
- 教学叙事
把零散 Agent 论文整合成因果连贯的工程流水线:Harness → Eval → RL,而非文献堆砌。 - 工程深度
作业约束对标一线开源 Agent 项目,远超普通 Demo 课程。 - 研究孵化
高占比期末项目 + 顶级客座讲师,批量培养 Agent 方向研究人才。
门槛
先修要求高,需要有 LLM 训练基础;RL 训练依赖赞助算力,自学者很难完整复现作业 3 与期末项目。 一句话总结:这是 2026 年公开资源里,最完整、工程化、研究导向的 LLM 智能体建造课程。

