大数跨境

一个Agent、一组CLI、若干Skill:DWS智能诊断的架构设计哲学

一个Agent、一组CLI、若干Skill:DWS智能诊断的架构设计哲学 华为云AI
2026-09-04
11
导读:数仓运维排障,本质是"信息采集→模式识别→根因推理→方案输出"的闭环。

数仓运维排障本质是“信息采集→模式识别→根因推理→方案输出”的闭环。传统模式下,该流程高度依赖 DBA 个人经验,需手动登录终端、执行 CLI 命令并关联多维指标,效率低下且知识难以沉淀。一次典型性能排障往往耗时数十分钟至数小时。

华为云数仓 DWS 近日上线 AI 诊断功能,采用"Agent + CLI + Skill"三层架构,将上述闭环系统化、自动化及可进化化。

走进产品:集群详情页一键触达

AI 诊断入口位于 DWS 管理控制台的集群详情页面。运维人员无需跳转工具或编写脚本,直接选择时间段和诊断维度(CPU/IO/内存),即可一键发起诊断。

页面交互遵循“最少操作步骤”原则:

  • 时间段选择:自由选择 7 天内的诊断时间窗口,系统自动汇聚该时段全链路指标,精准获取异常数据;
  • 诊断维度选择:CPU、IO、内存三大核心维度开箱即用,覆盖最常见性能瓶颈场景;
  • 一键发起:后台 Agent 自动调度 Skill 完成采集、分析并生成报告

诊断完成后自动生成结构化报告,包含异常摘要、根因链路、影响范围和优化建议,支持在线查看和一键导出,便于团队协作与复盘追溯。

设计哲学一:关注点分离

三层架构的核心原则是关注点分离,每层仅专注单一职责,通过标准化接口交互:

  • CLI 层(采集):负责轻量、只读、标准化的指令集合,从集群底层获取原始运行数据,确保准确性和低开销,不关心数据含义;
  • Skill 层(分析):每个 Skill 封装一项独立诊断能力,内置分析逻辑、判定阈值和输出模板,彼此解耦;
  • Agent 层(编排):接收用户请求,决定调用哪些 CLI、调度哪些 Skill 以及如何关联结果,最终生成诊断报告。

新增诊断能力只需开发新 Skill 注册,无需改动 Agent 或 CLI;优化采集策略仅需调整 CLI 层。各层独立演进,互不牵制。

设计哲学二:Skill 即知识单元

Skill 不仅是功能模块,更是“知识单元”,是对成熟 DBA 诊断模式的代码化封装。首批上线三大 Skill:

  • CPU 诊断 Skill:采集 CPU 使用率、节点负载分布及高消耗 SQL 等指标,识别负载倾斜与资源争抢,输出资源优化与 SQL 改写建议;
  • IO 诊断 Skill:分析读写延迟、IOPS 峰值及下盘数据量,关联高 IO 查询,定位表扫描异常、排序溢出等根因;
  • 内存诊断 Skill:解析动态内存分配与回收,识别异常会话与 SQL,预警 OOM 风险,提供参数调优与资源隔离方案。

Skill 采用插件化设计,后续可持续扩展锁等待、长事务、SQL 倾斜及网络诊断等能力,新 Skill 上线对现有架构零侵入。

设计哲学三:Agent 做编排,不做分析

Agent 被严格限定为“编排者”,仅决定“做什么”和“按什么顺序做”,不亲自执行具体分析。Agent 不负责具体指标计算和根因判定,从而确保其轻量和通用性:无论未来新增多少 Skill,编排逻辑均保持稳定。

设计哲学四:从工具到可生长平台

  • Skill 可复用:独立于具体集群,支持跨集群共享,也允许用户基于业务场景自定义扩展;
  • CLI 可组合:标准化接口可嵌入企业已有监控告警、CI/CD 流水线或运维工单系统。CLI 模块正式发布后,用户可直接基于 Skill + CLI,在自有 Agent 平台上构建 DWS 智能运维能力;
  • Agent 可演进:随 Skill 增多和经验积累,关联分析与根因推理能力持续增强,逐步从“辅助诊断”走向“自主运维”。

实战场景:CPU 飙到 96%,一条自关联 SQL 吃掉全部算力

架构的价值需在真实场景中验证。某 DWS 集群在晚间业务时段节点 CPU 使用率飙升至 96% 以上,查询响应明显变慢。运维人员在集群详情页选择异常时段,点击 CPU 维度一键诊断,Agent 自动调度 CPU 诊断 Skill,分钟级输出结构化报告:

此场景折射出 AI 诊断的深层价值——它不只是在“看指标”,更是在“理解业务”。传统排障中,DBA 需手动登录节点、逐条执行命令并在多终端间切换比对,过程耗时且易遗漏,高度依赖个人经验。

而 AI 诊断在分钟级内完成了从“异常感知”到“根因推理”再到“方案输出”的全链路闭环:不仅精准锁定了问题 SQL 的写法缺陷,还主动发现了跨层级的资源争抢风险,并给出了可直接落地的优化路径。

这正是 Agent + CLI + Skill 三层架构的意义所在:将资深 DBA 的诊断思维模式沉淀为平台级的标准化能力,让每一次排障都达到专家水准,且可复制、可进化。

结语

一个 Agent、一组 CLI、若干 Skill——DWS AI 诊断的架构并不复杂,但背后的设计哲学清晰:用关注点分离降低复杂度,用 Skill 将运维经验转化为可复用知识单元,用 Agent 编排替代人工串联,用插件化设计为未来留足空间。

从产品体验看,运维人员只需在集群详情页一键操作,分钟级获得包含根因分析和优化建议的报告。这套架构不仅让排障从“小时级”压缩到“分钟级”,更为数仓智能运维提供了可扩展、可演进、可沉淀的能力框架,推动数仓运维从“依赖个人”走向“依赖平台”。

目前 AI 诊断功能已在北京四和贵阳一上线,欢迎前往 DWS 管理控制台集群详情页体验。部分 Skill 已上架华为云 Skill 市场,开发者也可基于 Skill + CLI 在自有 Agent 平台上构建定制化诊断能力。

华为云 Skill 市场:https://github.com/huaweicloud/huaweicloud-skills/tree/master/skills/bigdata/dws

【声明】内容源于网络
0
0
华为云AI
1234
内容 211
粉丝 0
华为云AI 1234
总阅读3.8k
粉丝0
内容211