大数跨境

AI 编程 | 团队 AI 编程成熟度模型(L1-L5)

AI 编程 | 团队 AI 编程成熟度模型(L1-L5) TechLead 少个分号
2026-08-11
0
导读:为了在研讨会达成关于 AI 编程的能力基线共同语言,参照智能驾驶成熟度分级,团队 AI 编程能力分为五个等级。

为了在研讨会达成关于 AI 编程的能力基线共同语言,参照智能驾驶成熟度分级,团队 AI 编程能力分为五个等级:

太长不看版本:

详细评估框架:

等级
名称
判定标准
类比智能驾驶
L1
辅助编程
AI 用于代码补全、文档生成、简单问题解答;
无自动化流程;
依赖人工编写测试
L1 辅助驾驶(定速巡航)
L2
部分自动化
AI 参与需求分析、代码生成、测试辅助;
有部分自动化流程;
人工审批所有产出
L2 部分自动驾驶(自适应巡航)
L3
有条件自动化
AI 能独立完成完整功能开发;
有完善的自动化测试闭环;
人工Review Plan,需要审查代码
L3 有条件自动驾驶(高速路自动驾驶)
L4
高度自动化
AI 能完成从需求到部署的端到端闭环;
无人值守领取任务和修复故障;
人工仅做业务验收和方案抽查
L4 高度自动驾驶(城市道路)
L5
完全自动化
AI 自主规划迭代路线;
完全无人值守运营;
人工仅做战略方向决策
L5 完全自动驾驶(无需人类干预)

受限于对 L5 的想象力有限,当前的评分表格可以对应到 L4 的程度。

通用评分刻度

评分
含义
5分
标准化、全员执行、有量化度量、形成闭环
4分
有流程但未完全标准化、执行率 > 80%
3分
有尝试但不成体系、执行率 50%-80%
2分
零星使用、无流程
1分
未开始或极少使用

维度一:AI 就绪的工程基础设施(权重:25%)

Item
评估条件(Criteria)
评分标准(1-5分)
评估方法
1.1 需求规格的结构化程度
1. 需求是否采用结构化风格编写
2. 需求是否明确标注边界条件(异常流、超时、空值、并发)
3. 需求是否包含可量化验收标准(如"< 200ms")
4. BA 是否使用 AI 进行需求反讲验证
5. BA 是否使用 Git 和 Markdown 工作在代码库中
5分
:结构化编写,模块整体提供,提供变更点,使用精确的字段名、提供字段表(定义数据来源、显示格式化、处理规则)、使用条目化的规则
3分:50%-79%结构化 + 边界条件部分覆盖 + BA参与但不使用代码库工具
1分:纯自然语言,无结构化,无边界描述 + BA独立于代码库工作
访谈BA
:需求怎么写?AI反讲用了吗?有没有案例?会用Git和Markdown吗?
数据验证:抽查10个需求文档,核验访谈结论 + 查看代码库中BA的提交记录
1.2 测试资产的代码化与自动化
1. API 测试是否能不依赖外部环境启动(Mock/容器化)
2. E2E 测试是否能不依赖外部环境启动(本地浏览器/模拟服务
3. 测试代码是否与业务代码同仓管理
4. CI 是否强制测试通过才能合并
5. 是否存在长期未处理的 Flaky Tests
5分
:API/E2E测试均可独立启动 + 同仓管理 + CI硬门禁 + 无Flaky
3分:部分测试可独立启动 + 同仓管理 + 门禁可跳过 + 少量Flaky
1分:测试依赖外部环境 + 测试在外部平台 + 无门禁 + 大量Flaky
访谈QA
:测试怎么管理?API/E2E测试能本地独立启动吗?Flaky怎么处理?
数据验证:尝试本地运行API/E2E测试 + 查看仓库目录结构 + CI日志分析
1.3 架构 AI 友好性
1. 本地是否能端到端启动(一键启动完整环境)
2. 是否配置 MCP 能访问数据库、浏览器(Chrome Devtools)、Figma 等设计工具
3. 是否采用 Mono Repo 结构便于 AI 跨模块理解
4. 代码结构是否模块化、低耦合,便于 AI 定位和修改
5分
:本地一键端到端启动 + MCP配置完整(数据库+浏览器+Figma) + Mono Repo + 模块化低耦合
3分:本地启动需手动配置 + MCP部分配置 + 多仓库但有关联 + 中等耦合度
1分:本地无法启动或配置复杂 + 无MCP配置 + 独立仓库无关联 + 高耦合单体架构
访谈Tech Lead
:本地启动方便吗?配置了哪些MCP工具?仓库结构是怎样的?
数据验证:尝试本地启动验证 + 查看MCP配置文件 + 检查仓库结构
1.4 AI 文档库的完备性与可用性
1. 是否存在 docs/standards 等结构化文档目录
2. 文档是否包含代码规范、架构决策、API参考等AI必需信息
3. 文档是否使用结构化格式(Markdown/JSON Schema)便于AI解析
4. 文档更新频率与代码变更的同步性
5分
:完整目录结构 + 覆盖规范/架构/API + AI可直接消费格式 + 文档与代码同步更新
3分:有文档但不完整 + 部分结构化 + 更新滞后
1分:无专门文档目录 + 纯自然语言 + 文档陈旧
访谈Tech Lead
:AI需要的文档有哪些?文档怎么维护?
数据验证:检查仓库docs目录结构 + 抽查文档更新时间与关联代码提交时间
1.5 AI Agent 宪法(Agents.md)
1. 是否存在 Agents.md 或类似的 AI 宪法文件
2. 是否定义了 AI 加载的必要上下文(文档、规范、工具、skills)
3. 是否包含索引常用文档的链接或路径
4. 是否包含团队特有的工具和技能清单
5. 是否定期更新以反映团队工具链变化
5分
:有完整Agents.md + 包含上下文定义 + 文档索引完备 + 工具技能清单完整 + 定期更新
3分:有Agents.md但内容不全 + 部分上下文 + 文档索引不完整 + 更新滞后
1分:无Agents.md + AI无统一上下文 + 文档分散无索引
访谈Tech Lead
:AI加载了哪些上下文?有Agents.md吗?怎么维护更新?
数据验证:检查仓库是否有Agents.md + 审查内容完整性 + 查看更新频率

维度二:AI 辅助编码的深度与质量(权重:30%)

Item
评估条件(Criteria)
评分标准(1-5分)
评估方法
2.1 AI 编码的采纳率与留存率
1. AI 补全的初始采纳率
2. AI 代码合入30天后的留存率
3. AI 代码的首次 CI 通过率
4. 拒绝 AI 建议的主要原因
5分
:采纳率≥70% + 留存率≥90% + 首次CI通过率≥80%
3分:采纳率50%-69% + 留存率70%-89% + 首次CI通过率50%-79%
1分:采纳率<50% 或 留存率<70%
访谈开发者
:AI代码质量怎么样?什么情况下拒绝?修改多不多?
数据验证:IDE后台导出采纳率 + git blame算留存率 + CI系统算首次通过率
2.2 缺陷注入率与代码健壮性
1. AI 生成的 PR 中严重缺陷率(P0/P1)
2. AI 代码是否通过安全扫描
3. AI 代码是否自动修复 Lint 警告
4. 是否有 AI 代码导致的生产回滚
5分
:缺陷率<5% + 0安全漏洞 + Lint合规≥95% + 0回滚
3分:缺陷率5%-15% + 无高危漏洞 + Lint合规80%-94%
1分:缺陷率>15% 或 有高危漏洞
访谈QA+Tech Lead
:AI代码的Bug多吗?哪些类型的缺陷最常见?回滚过吗?
数据验证:Jira统计AI相关Bug + SonarQube安全报告
2.3 任务复杂度与上下文感知
1. 单次 AI 会话平均时长
2. 单次任务 AI 平均修改文件数
3. AI 代码中内部库复用率(是否重复造轮子)
4. 是否完成过跨模块重构任务
5分
:会话≥30min + 修改≥10文件 + 复用率≥40% + 完成跨模块重构
3分:会话10-30min + 修改3-9文件 + 复用率20%-39%
1分:会话<10min + 修改<3文件 + 复用率<20%
访谈开发者
:AI能处理多复杂的任务?跨模块能用AI吗?会不会重复造轮子?
2.4 团队代码生成的一致性与组件复用
1. 团队是否有统一的 AI 代码风格规范(Prompt 模板、代码模式)
2. AI 生成的组件是否形成可复用库(如组件模板、工具函数)
3. 是否定期回顾和沉淀 AI 生成的优秀代码片段
4. 团队成员之间的 AI 代码风格一致性如何
5分
:统一风格规范 + 组件库完备 + 定期回顾沉淀 + 代码风格高度一致
3分:有规范但不统一 + 部分组件库 + 不定期回顾 + 风格基本一致
1分:无规范无模板 + 无组件库 + 无回顾 + 代码风格差异大
访谈Tech Lead
:团队AI代码风格统一吗?有哪些可复用组件?会定期回顾吗?
数据验证:查看团队Prompt模板库 + 组件库目录 + 回顾会议记录

维度三:无人值守与自动化闭环(权重:20%)

Item
评估条件(Criteria)
评分标准(1-5分)
评估方法
3.1 AI 端到端开发能力
1. AI 是否能根据需求文档制定开发 Plan
2. AI 是否能执行 Plan 完成从开发到测试的闭环
3. AI 是否能自动识别依赖并补全相关代码
4. AI 是否能处理开发过程中的异常并自动调整
5分
:AI自主制定Plan(人工 Review) + 全流程闭环执行(开发→测试→验证→文档刷新) + 自动识别依赖补全 + 异常自适应调整
3分:AI辅助制定Plan + 部分流程自动化 + 依赖需人工提示 + 异常需人工介入
1分:AI仅辅助编码 + 人工接受修改+ 依赖完全人工管理 + 异常人工处理
访谈Tech Lead
:AI能独立完成端到端开发吗?Plan执行效果怎么样?
3.2 AI Agent 独立领取与完成任务
1. 是否配置 AI Agent 自动从 Jira 领取任务
2. 月均自动完成并合入的任务数
3. 任务复杂度
4. 直接合入率
5分
:月均≥5个 + 含中高复杂度 + 直接合入率≥50%
3分:月均1-4个 + 仅简单Bug + 直接合入率20%-49%
1分:0个 或 未配置
访谈Tech Lead
:AI Agent用得怎么样?适合领什么任务?不敢让它领什么?
数据验证:统计AI Agent近3个月完成的任务
3.3 故障的无人值守修复闭环
1. 监控异常是否自动触发 AI Agent
2. AI 创建修复 PR 的 MTTR
3. AI 修复是否包含根因分析+测试+文档
5分
:监控联动 + MTTR≤15min + 修复含完整根因+测试+文档
3分:人工触发 + MTTR 15-60min + 仅修复代码
1分:完全人工 + MTTR>60min
访谈SRE
:AI参与故障修复吗?效果怎么样?
数据验证:查看监控Webhook配置 + 统计故障修复MTTR
3.4 测试执行闭环(Loop)
1. AI 是否能根据 API 文档生成测试用例并自动执行
2. E2E 测试工具(如 Cypress/Playwright)是否支持 AI 驱动的场景生成与执行
3. 测试失败后 AI 是否能自动分析失败原因并修复代码
4. 测试执行结果是否形成完整的反馈闭环(生成→执行→分析→修复→验证)
5分
:API文档驱动测试自动生成+执行 + E2E AI场景生成 + 失败自动分析修复 + 完整反馈闭环
3分:AI生成测试用例但需人工执行 + 部分E2E自动化 + 失败需人工分析
1分:测试完全人工编写执行 + 无AI参与测试流程
访谈QA
:AI怎么参与测试流程?E2E测试AI能用吗?失败怎么处理?
数据验证:查看测试框架配置 + 统计AI生成测试占比 + CI日志分析

维度四:团队 AI 素养与持续进化(权重:10%)

Item
评估条件(Criteria)
评分标准(1-5分)
评估方法
4.1 AI 技能培训与知识沉淀
1. 是否有 AI Prompt 工程最佳实践库
2. 是否定期进行 AI 案例复盘会
3. 是否有 AI 适用/不适用场景清单
4. 新员工是否有 AI 工具链培训
5分
:完整Playbook + 每月复盘 + 明确清单 + 新人培训考核
3分:零散文档 + 不定期复盘
1分:无沉淀
访谈Tech Lead+新员工
:知识沉淀做得怎么样?新员工怎么学AI工具?
数据验证:检查内部Wiki是否有AI相关文档
4.2 对抗性:认知退化防御
1. 是否进行无AI辅助编码测验
2. AI依赖系数(无AI vs 有AI效率落差)
3. 是否有"禁止AI生成"的核心模块清单
4. Tech Lead 是否抽查AI代码理解度
5分
:依赖系数<50% + 有明确禁止清单 + TL定期抽查
3分:依赖系数50%-69% + 有清单但执行不严
1分:依赖系数≥70% 或 无人能手工复现
访谈Tech Lead
:担不担心团队过度依赖AI?怎么防范?
面对面抽查:随机抽5个AI代码块,让作者讲解逻辑
数据验证:查看测验记录
4.3 AI 伦理与安全意识
1. 是否有 AI 使用安全规范(明文)
2. 是否定期进行 AI 安全审计
3. 团队是否知晓 AI 工具的数据留存政策
4. 是否有 AI 导致的安全事故
5分
:明文规范 + 季度审计 + 全员知晓 + 0事故
3分:口头约定 + 不定期审计
1分:无意识 或 发生过事故
随机访谈
(3-5人):哪些数据不能贴AI?哪些AI会保存数据?
数据验证:查看安全规范文档 + 安全审计报告
4.4 AI 模型的依赖策略与风险管控
1. 是否能避免对模型的高度依赖
2. 能否使用其他模型替换
3. 是否避免高额费用
4. 是否避免模型管制风险
5分
:多模型切换机制 + 费用可控 + 规避管制风险
3分:有模型切换但未全面应用 + 费用部分可控
1分:高度依赖单一模型 + 费用失控 + 存在管制风险
访谈Tech Lead
:用了哪些AI模型?担心模型服务不可用吗?担心费用和管制吗?
数据验证:查看模型配置文件 + 费用账单 + 模型切换记录
4.5 团队 AI 编程体系的一致性
1. 团队是否使用统一的文档规范(如需求文档、设计文档格式)
2. 团队是否有统一的工作契约(如PR规范、代码风格、提交规范)
3. 团队是否使用统一的 AI 工具链(IDE插件、Prompt模板)
4. 是否有统一的 AI 工作流程定义
5分
:文档规范统一 + 工作契约完整 + 工具链统一 + 流程定义清晰
3分:部分规范统一 + 工作契约不完整 + 工具链不一致 + 流程模糊
1分:无统一规范 + 无工作契约 + 工具链各异 + 无流程定义
访谈Tech Lead
:团队在文档规范、工作契约、工具链方面统一吗?
数据验证:检查团队文档模板 + 工作契约文件 + 工具链配置
4.6 团队 AI 的参与度
1. 团队所有成员是否愿意使用 AI 编程工具
2. 团队成员是否主动参与 AI 工具的优化和反馈
3. 团队是否定期分享 AI 使用经验和技巧
4. 是否有成员积极贡献 AI 相关工具和技能(Skills/MCP)
5分
:全员积极参与 + 主动优化反馈 + 定期分享 + 积极贡献工具
3分:大部分参与 + 被动反馈 + 不定期分享 + 少量贡献
1分:部分成员抵触 + 无反馈 + 无分享 + 无贡献
全员访谈
:对 AI 编程的接受度如何?愿意参与 AI 建设吗?
数据验证:查看分享会议记录 + 工具贡献记录 + 使用率统计

综合评分卡

维度
权重
维度得分(1-5)
加权得分
1. AI 就绪的工程基础设施
30%


2. AI 辅助编码的深度与质量
35%


3. 无人值守与自动化闭环
25%


4. 团队 AI 素养与持续进化
10%


加权合计 100%

/ 5.00

评级标准

评级
得分
核心特征
🏆 进化级
4.6 - 5.0
夜间无人值守;PR几乎不需人工介入;团队重心转向架构决策
🟢 自治级
3.6 - 4.5
AI独立完成中高复杂度任务;Review效率显著提升
🟡 协作级
2.1 - 3.5
完成单函数/单模块任务;有自动化尝试但未形成闭环
🔴 起步级
1.0 - 2.0
AI仅作为搜索引擎;产出碎片化需大幅修改

访谈对象与核心问题一览

角色
人数
核心问题
Tech Lead
1人
整体使用情况?AI最适合/最不适合什么?担心认知退化吗?AI文档库维护得怎么样?用了哪些AI模型?担心模型服务不可用吗?本地启动方便吗?配置了哪些MCP工具?仓库结构是怎样的?AI能独立完成端到端开发吗?AI加载了哪些上下文?有Agents.md吗?团队AI代码风格统一吗?有哪些可复用组件?会定期回顾吗?团队在文档规范、工作契约、工具链方面统一吗?
开发者
3-5人
AI代码质量?什么情况拒绝?能处理多复杂任务?节省多少时间?对AI编程的接受度如何?愿意参与AI建设吗?
BA/PM
2-3人
需求怎么写?AI反讲用了没?有没有案例?会用Git和Markdown在代码库中工作吗?
QA
2人
测试怎么管理?AI生成测试质量?Flaky怎么处理?AI怎么参与测试流程?E2E测试AI能用吗?失败怎么处理?
SRE/DevOps
1人
AI自动修复故障正确率?
新员工
1-2人
入职AI培训实用吗?上手顺利吗?

【声明】内容源于网络
0
0
TechLead 少个分号
知名技术咨询公司 TechLead(技术经理),分享系统设计技术方案和技术管理。 公众号愿景和定位是:做好软件,带好团队。 原名《DDD和微服务》,合作请留言。
内容 126
粉丝 0
TechLead 少个分号 知名技术咨询公司 TechLead(技术经理),分享系统设计技术方案和技术管理。 公众号愿景和定位是:做好软件,带好团队。 原名《DDD和微服务》,合作请留言。
总阅读1.2k
粉丝0
内容126