大数跨境

CMU 秋季新课 AI Agents:OpenHands 作者亲授- Harness、评测、RL 训智能体

CMU 秋季新课 AI Agents:OpenHands 作者亲授- Harness、评测、RL 训智能体 苏哲管理咨询
2026-09-10
1
导读:MU 2026秋新开AI Agents研究生课,由OpenHands作者与Meta前Agent团队学者联合授课。课程摒弃浅层科普,以「搭建框架-构建评测-模型训练-科研落地」为核心流水线,聚焦可训练、

编者摘要:CMU 2026秋新开AI Agents研究生课,由OpenHands作者与Meta前Agent团队学者联合授课。课程摒弃浅层科普,以「搭建框架-构建评测-模型训练-科研落地」为核心流水线,聚焦可训练、可评测的完整Agent系统。配套作业工程深度拉满,资源全开源,依托专属算力支持实操,兼顾工程落地与前沿科研,是目前最顶尖的Agent系统实战课程。

10个关键问题问与答

Q1:这门课的核心定位是什么?A:非概念科普课,是面向工程落地与前沿研究的系统课,主打从零搭建、评测、训练LLM智能体,而非简单调API、写Prompt。

Q2:课程核心能力公式是什么?A:Agent能力=模型能力×环境接口(Harness)×评测信号(Eval),RL是串联三者、实现能力迭代的核心闭环引擎。

Q3:课程授课师资有哪些核心优势?A:由OpenHands核心开发者Graham Neubig、Meta前Agent团队Daniel Fried主讲,搭配各领域顶尖客座学者、专项TA,集结CMU顶尖Agent研究力量。

Q4:课程整体学习流水线是什么?A:前半学期通过三次个人作业完成框架搭建、评测构建、模型训练;后半学期以小组科研项目为主,聚焦前沿问题研究。

Q5:作业1(Harness)核心考察什么能力?A:手写ReAct智能体循环,实现工具调用、上下文压缩、技能系统,依托云端沙箱完成代码实操与消融实验,吃透SWE-Agent底层逻辑。

Q6:课程最大的差异化优势是什么?A:不堆砌论文,形成因果连贯的工程教学体系,贴合工业级Agent生产标准,作业对标一线开源项目,远超普通Demo式课程。

Q7:课程考核权重如何分配?A:个人作业40%、期末科研项目50%、课后思考随笔10%,极度重视实操落地与原创研究能力。

Q8:课程AI工具使用规则是什么?A:作业、报告可使用AI辅助,但学生必须完整答辩所有设计决策;课后随笔禁止使用AI,杜绝躺平式学习。

Q9:校外自学者可以完整跟读吗?A:理论、基础作业可完整复刻;RL训练、期末科研项目依赖专属赞助算力,个人难以独立完成。

Q10:课程适合哪些人群学习?A:适合掌握Python、有LLM基础,想深耕Agent底层工程、系统训练与前沿科研,而非仅做应用层开发的开发者与研究者。

附录  CMU 11-768: AI Agents 课程精读总结

概览

CMU LTI 2026 秋季研究生新课《AI Agents》,由 OpenHands 作者 Graham Neubig 与曾任职 Meta Agent 团队的 Daniel Fried 联合授课。不是 Agent 概念科普课,是系统建造 + 训练 + 研究导向工程课。课程官网:https://www.cmu-agents.com/,讲义、作业、YouTube 录播全部对外公开,校外爱好者可跟读。

课程核心目标:基于开源大模型从零实现完整智能体,搭建评测体系,使用 SFT/RL 完成模型训练,并独立开展 Agent 方向开放研究。 底层认知:Agent 能力 = 模型能力 × 环境接口 (Harness) × 评测信号 (Eval),RL 是闭环引擎。课程弱化 Prompt 工程,将 Agent 视为可训练、可量化评估的完整软件系统。

课程整体架构:一条造 Agent 流水线

学期主线:搭建 Harness → 构建评测 Eval → 模型训练 Training → 开放研究项目

  • 前半学期:3 份个人作业打通工程全链路
    • Assignment1(Harness,9.14 截止):搭建 Agent 运行框架
    • Assignment2(Eval,9.24 截止):构建智能体评测体系
    • Assignment3(Training,10.22 截止):SFT 与 RL 训练落地
  • 后半学期:2–3 人小组做原创研究项目,占总成绩 50%

六大教学模块(共 28 次课)

  1. Agent 基础能力(第 1–5 讲)
    拆解 Agent 核心组件,阅读经典文献与前沿工作:Agent 定义(Toolformer、ReAct、Mini-SWE-Agent)、工具调用(含 XGrammar 约束解码工程细节)、长上下文管理、记忆与技能系统(MemGPT、OpenHands 技能协议)、任务规划分解、多智能体协同,包含 Cursor Plan Mode 工业案例。
  2. 应用领域(第 6、7、9 讲)
    分三大 Agent 赛道:代码智能体(SWE-Bench 体系)、GUI 智能体(OSWorld 作者主讲)、深度网页研究智能体(WebWalker 研究者 Akari Asai 主讲)。
  3. 训练方法(第 8、10–12 讲)
    SFT → RL 基础 → 高级 RL 算法 → RL 系统工程。单独开设 RL Systems 专题,聚焦 Agent RL 真实瓶颈:rollout 沙箱、异步执行、推理吞吐,贴合 vLLM/SGLang 底层实践。
  4. 安全(第 13、16 讲)
    沙箱隔离、凭证管理、可观测性与监控。作业直接使用 Modal 远程沙箱执行模型生成代码,理论与实操结合。
  5. 框架(第 14、15 讲)
    OpenHands、LangGraph 两大主流 Agent 框架团队分享业界工程实践。
  6. 交互、搜索与进阶(第 17–24 讲)
    大规模 AI 劳动力影响、多智能体交互、人机交互、重排序 / 批评模型、树搜索;压轴客座演讲:Karthik Narasimhan、Sasha Rush;预留 Project Hours 供小组推进项目。

亮点:大量课程由领域一线研究者、TA 客座授课,相当于 CMU LTI 及合作圈 Agent 研究力量的集中输出。

作业体系(工程深度标杆)

作业 1:Build an Agent Harness(公开仓库 cmu-agents/assignment-1)

基于 DeepSeek-v4-flash(也支持 GPT-OSS),手写 ReAct 循环实现可复用 Agent,分 3 部分:

  1. 代码智能体
    实现消息构造、ReAct 循环、工具分发,遵循 Agent Skills 协议(技能目录前置,完整定义按需加载);在 SWE-Bench 任务修复国际象棋 bug 程序,输出 patch;模型代码在 Modal 云端沙箱运行。
  2. 上下文压缩
    实现 context compaction 工作记忆,精简历史中间步骤,保留目标、试错经验;在真实 SWE-Bench 任务上做消融,对比 token 消耗并撰写权衡分析。
  3. 象棋智能体
    复用同一 Agent 循环,接入 UCI 象棋工具、局面模拟器;支持模型编写 Python 代码批量搜索,仅提交最终走子;完成 2×2 消融实验(两个模型 × 是否提供合法走子列表)。 评分关注生产级细节:工具调用错误可恢复、并行调用约束等。完成后,可吃透 SWE-Agent/OpenHands 底层运行机制。

作业 2:搭建 Agent 评测框架,解决当前领域评测方法论缺失问题。 作业 3:落地 SFT、RL 训练流水线,完成智能体模型优化。

考核与课程政策

  • 个人作业 40%,期末研究项目 50%(提案 5%+ 中期 5%+ 海报 10%+ 报告 30%),课程亮点随笔 10%
  • 项目鼓励产出论文;若教师 / TA 提供实质性贡献,可邀请共同署名,研究导向极强
  • AI 工具规则:作业、报告允许 AI 辅助,但必须能答辩解释所有设计决策;课后随笔禁止使用 AI
  • 代码规则:核心模块必须自研,不可直接套用现成完整实现;提供 2 天宽限日

算力与开放生态

算力赞助方:Fireworks、Modal、Prime Intellect、Sail,学生可使用 Modal 沙箱与免费推理额度,普通研究生也能开展 Agent RL 实验。 课程全部资源对外开源:课件、录播视频、作业仓库,校外自学者可完整跟学。

课程价值与门槛

标杆意义

  1. 教学叙事
    把零散 Agent 论文整合成因果连贯的工程流水线:Harness → Eval → RL,而非文献堆砌。
  2. 工程深度
    作业约束对标一线开源 Agent 项目,远超普通 Demo 课程。
  3. 研究孵化
    高占比期末项目 + 顶级客座讲师,批量培养 Agent 方向研究人才。

门槛

先修要求高,需要有 LLM 训练基础;RL 训练依赖赞助算力,自学者很难完整复现作业 3 与期末项目。 一句话总结:这是 2026 年公开资源里,最完整、工程化、研究导向的 LLM 智能体建造课程。


【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2188
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读43.9k
粉丝0
内容2.2k