为了在研讨会达成关于 AI 编程的能力基线共同语言,参照智能驾驶成熟度分级,团队 AI 编程能力分为五个等级:
太长不看版本:
详细评估框架:
|
|
|
|
|
|---|---|---|---|
| L1 |
|
无自动化流程; 依赖人工编写测试 |
|
| L2 |
|
有部分自动化流程; 人工审批所有产出 |
|
| L3 |
|
有完善的自动化测试闭环; 人工Review Plan,需要审查代码 |
|
| L4 |
|
无人值守领取任务和修复故障; 人工仅做业务验收和方案抽查 |
|
| L5 |
|
完全无人值守运营; 人工仅做战略方向决策 |
|
受限于对 L5 的想象力有限,当前的评分表格可以对应到 L4 的程度。
通用评分刻度
|
|
|
|---|---|
| 5分 |
|
| 4分 |
|
| 3分 |
|
| 2分 |
|
| 1分 |
|
维度一:AI 就绪的工程基础设施(权重:25%)
|
|
|
|
|
|---|---|---|---|
| 1.1 需求规格的结构化程度 |
2. 需求是否明确标注边界条件(异常流、超时、空值、并发) 3. 需求是否包含可量化验收标准(如"< 200ms") 4. BA 是否使用 AI 进行需求反讲验证 5. BA 是否使用 Git 和 Markdown 工作在代码库中 |
5分
3分:50%-79%结构化 + 边界条件部分覆盖 + BA参与但不使用代码库工具 1分:纯自然语言,无结构化,无边界描述 + BA独立于代码库工作 |
访谈BA
数据验证:抽查10个需求文档,核验访谈结论 + 查看代码库中BA的提交记录 |
| 1.2 测试资产的代码化与自动化 |
2. E2E 测试是否能不依赖外部环境启动(本地浏览器/模拟服务) 3. 测试代码是否与业务代码同仓管理 4. CI 是否强制测试通过才能合并 5. 是否存在长期未处理的 Flaky Tests |
5分
3分:部分测试可独立启动 + 同仓管理 + 门禁可跳过 + 少量Flaky 1分:测试依赖外部环境 + 测试在外部平台 + 无门禁 + 大量Flaky |
访谈QA
数据验证:尝试本地运行API/E2E测试 + 查看仓库目录结构 + CI日志分析 |
| 1.3 架构 AI 友好性 |
2. 是否配置 MCP 能访问数据库、浏览器(Chrome Devtools)、Figma 等设计工具 3. 是否采用 Mono Repo 结构便于 AI 跨模块理解 4. 代码结构是否模块化、低耦合,便于 AI 定位和修改 |
5分
3分:本地启动需手动配置 + MCP部分配置 + 多仓库但有关联 + 中等耦合度 1分:本地无法启动或配置复杂 + 无MCP配置 + 独立仓库无关联 + 高耦合单体架构 |
访谈Tech Lead
数据验证:尝试本地启动验证 + 查看MCP配置文件 + 检查仓库结构 |
| 1.4 AI 文档库的完备性与可用性 |
docs/standards 等结构化文档目录2. 文档是否包含代码规范、架构决策、API参考等AI必需信息 3. 文档是否使用结构化格式(Markdown/JSON Schema)便于AI解析 4. 文档更新频率与代码变更的同步性 |
5分
3分:有文档但不完整 + 部分结构化 + 更新滞后 1分:无专门文档目录 + 纯自然语言 + 文档陈旧 |
访谈Tech Lead
数据验证:检查仓库docs目录结构 + 抽查文档更新时间与关联代码提交时间 |
| 1.5 AI Agent 宪法(Agents.md) |
Agents.md 或类似的 AI 宪法文件2. 是否定义了 AI 加载的必要上下文(文档、规范、工具、skills) 3. 是否包含索引常用文档的链接或路径 4. 是否包含团队特有的工具和技能清单 5. 是否定期更新以反映团队工具链变化 |
5分
3分:有Agents.md但内容不全 + 部分上下文 + 文档索引不完整 + 更新滞后 1分:无Agents.md + AI无统一上下文 + 文档分散无索引 |
访谈Tech Lead
数据验证:检查仓库是否有Agents.md + 审查内容完整性 + 查看更新频率 |
维度二:AI 辅助编码的深度与质量(权重:30%)
|
|
|
|
|
|---|---|---|---|
| 2.1 AI 编码的采纳率与留存率 |
2. AI 代码合入30天后的留存率 3. AI 代码的首次 CI 通过率 4. 拒绝 AI 建议的主要原因 |
5分
3分:采纳率50%-69% + 留存率70%-89% + 首次CI通过率50%-79% 1分:采纳率<50% 或 留存率<70% |
访谈开发者
数据验证:IDE后台导出采纳率 + git blame算留存率 + CI系统算首次通过率 |
| 2.2 缺陷注入率与代码健壮性 |
2. AI 代码是否通过安全扫描 3. AI 代码是否自动修复 Lint 警告 4. 是否有 AI 代码导致的生产回滚 |
5分
3分:缺陷率5%-15% + 无高危漏洞 + Lint合规80%-94% 1分:缺陷率>15% 或 有高危漏洞 |
访谈QA+Tech Lead
数据验证:Jira统计AI相关Bug + SonarQube安全报告 |
| 2.3 任务复杂度与上下文感知 |
2. 单次任务 AI 平均修改文件数 3. AI 代码中内部库复用率(是否重复造轮子) 4. 是否完成过跨模块重构任务 |
5分
3分:会话10-30min + 修改3-9文件 + 复用率20%-39% 1分:会话<10min + 修改<3文件 + 复用率<20% |
访谈开发者
|
| 2.4 团队代码生成的一致性与组件复用 |
2. AI 生成的组件是否形成可复用库(如组件模板、工具函数) 3. 是否定期回顾和沉淀 AI 生成的优秀代码片段 4. 团队成员之间的 AI 代码风格一致性如何 |
5分
3分:有规范但不统一 + 部分组件库 + 不定期回顾 + 风格基本一致 1分:无规范无模板 + 无组件库 + 无回顾 + 代码风格差异大 |
访谈Tech Lead
数据验证:查看团队Prompt模板库 + 组件库目录 + 回顾会议记录 |
维度三:无人值守与自动化闭环(权重:20%)
|
|
|
|
|
|---|---|---|---|
| 3.1 AI 端到端开发能力 |
2. AI 是否能执行 Plan 完成从开发到测试的闭环 3. AI 是否能自动识别依赖并补全相关代码 4. AI 是否能处理开发过程中的异常并自动调整 |
5分
3分:AI辅助制定Plan + 部分流程自动化 + 依赖需人工提示 + 异常需人工介入 1分:AI仅辅助编码 + 人工接受修改+ 依赖完全人工管理 + 异常人工处理 |
访谈Tech Lead
|
| 3.2 AI Agent 独立领取与完成任务 |
2. 月均自动完成并合入的任务数 3. 任务复杂度 4. 直接合入率 |
5分
3分:月均1-4个 + 仅简单Bug + 直接合入率20%-49% 1分:0个 或 未配置 |
访谈Tech Lead
数据验证:统计AI Agent近3个月完成的任务 |
| 3.3 故障的无人值守修复闭环 |
2. AI 创建修复 PR 的 MTTR 3. AI 修复是否包含根因分析+测试+文档 |
5分
3分:人工触发 + MTTR 15-60min + 仅修复代码 1分:完全人工 + MTTR>60min |
访谈SRE
数据验证:查看监控Webhook配置 + 统计故障修复MTTR |
| 3.4 测试执行闭环(Loop) |
2. E2E 测试工具(如 Cypress/Playwright)是否支持 AI 驱动的场景生成与执行 3. 测试失败后 AI 是否能自动分析失败原因并修复代码 4. 测试执行结果是否形成完整的反馈闭环(生成→执行→分析→修复→验证) |
5分
3分:AI生成测试用例但需人工执行 + 部分E2E自动化 + 失败需人工分析 1分:测试完全人工编写执行 + 无AI参与测试流程 |
访谈QA
数据验证:查看测试框架配置 + 统计AI生成测试占比 + CI日志分析 |
维度四:团队 AI 素养与持续进化(权重:10%)
|
|
|
|
|
|---|---|---|---|
| 4.1 AI 技能培训与知识沉淀 |
2. 是否定期进行 AI 案例复盘会 3. 是否有 AI 适用/不适用场景清单 4. 新员工是否有 AI 工具链培训 |
5分
3分:零散文档 + 不定期复盘 1分:无沉淀 |
访谈Tech Lead+新员工
数据验证:检查内部Wiki是否有AI相关文档 |
| 4.2 对抗性:认知退化防御 |
2. AI依赖系数(无AI vs 有AI效率落差) 3. 是否有"禁止AI生成"的核心模块清单 4. Tech Lead 是否抽查AI代码理解度 |
5分
3分:依赖系数50%-69% + 有清单但执行不严 1分:依赖系数≥70% 或 无人能手工复现 |
访谈Tech Lead
面对面抽查:随机抽5个AI代码块,让作者讲解逻辑 数据验证:查看测验记录 |
| 4.3 AI 伦理与安全意识 |
2. 是否定期进行 AI 安全审计 3. 团队是否知晓 AI 工具的数据留存政策 4. 是否有 AI 导致的安全事故 |
5分
3分:口头约定 + 不定期审计 1分:无意识 或 发生过事故 |
随机访谈
数据验证:查看安全规范文档 + 安全审计报告 |
| 4.4 AI 模型的依赖策略与风险管控 |
2. 能否使用其他模型替换 3. 是否避免高额费用 4. 是否避免模型管制风险 |
5分
3分:有模型切换但未全面应用 + 费用部分可控 1分:高度依赖单一模型 + 费用失控 + 存在管制风险 |
访谈Tech Lead
数据验证:查看模型配置文件 + 费用账单 + 模型切换记录 |
| 4.5 团队 AI 编程体系的一致性 |
2. 团队是否有统一的工作契约(如PR规范、代码风格、提交规范) 3. 团队是否使用统一的 AI 工具链(IDE插件、Prompt模板) 4. 是否有统一的 AI 工作流程定义 |
5分
3分:部分规范统一 + 工作契约不完整 + 工具链不一致 + 流程模糊 1分:无统一规范 + 无工作契约 + 工具链各异 + 无流程定义 |
访谈Tech Lead
数据验证:检查团队文档模板 + 工作契约文件 + 工具链配置 |
| 4.6 团队 AI 的参与度 |
2. 团队成员是否主动参与 AI 工具的优化和反馈 3. 团队是否定期分享 AI 使用经验和技巧 4. 是否有成员积极贡献 AI 相关工具和技能(Skills/MCP) |
5分
3分:大部分参与 + 被动反馈 + 不定期分享 + 少量贡献 1分:部分成员抵触 + 无反馈 + 无分享 + 无贡献 |
全员访谈
数据验证:查看分享会议记录 + 工具贡献记录 + 使用率统计 |
综合评分卡
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 加权合计 | 100% |
|
/ 5.00 |
评级标准
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
访谈对象与核心问题一览
|
|
|
|
|---|---|---|
| Tech Lead |
|
|
| 开发者 |
|
|
| BA/PM |
|
|
| QA |
|
|
| SRE/DevOps |
|
|
| 新员工 |
|
|

