大数跨境

从自动化到自进化大数据运维 Agent 实践与思考

从自动化到自进化大数据运维 Agent 实践与思考 DataFunSummit
2026-09-26
8
导读:熊伟 中移九天人工智能科技(北京)有限公司 大数据运营维护中心架构师

导读

作为运营商核心数字化基础设施,大数据集群的稳定运行直接关系到上层业务的连续性与用户体验。然而,传统的大数据运维长期面临着告警风暴泛滥、排障强依赖专家经验、变更事故频发等痛点,以“人力密集型”对抗系统复杂度的模式已难以为继。中移九天人工智能大数据运维中心结合自身在海量集群管理中的深厚积累,积极拥抱人工智能,提出了“自动化为基础、智能化为手段、自进化为目标”的大数据智能运维演进路径。本文详细阐述了构建运维智能体的背景与痛点、三步走战略与核心技术闭环,深入剖析了在生产环境已初步落地的七大核心实践案例,并分享了数据治理、信任建立等关键维度的实战挑战,最后展望了从点状智能走向主动式 AIOps 新范式的技术蓝图。

今天的介绍会围绕下面四点展开:

  1. 为何做运维智能体
  2. 如何做运维智能体
  3. 典型场景案例
  4. 挑战、应对和展望

分享嘉宾|熊伟 中移九天人工智能科技(北京)有限公司 大数据运营维护中心架构师

编辑整理|李笑宇

出品社区|DataFun

01 为何做运维智能体:大数据智能运维时代转型必然

1. 传统运维的核心痛点

告警风暴泛滥,故障定位效率低下:在大数据生产运维中,工作任务往往是非线性的,大多数情况下是被动的“告警驱动”。当底层单一组件或物理硬件发生故障时,极易引发系统级的连锁反应,在瞬间产生千百条冗余告警。运维人员在面临排山倒海般的“告警海洋”时,极难快速分辨出故障的主次关系与根本原因。这不仅使故障根因定位的效率大幅降低,更导致平均故障修复时间(MTTR)显著增加。长此以往,运维人员处于 7×24 小时高频响应的疲劳状态中,容易产生心理懈怠与麻木(即“狼来了”效应),一旦被忽略的微小故障刚好是更大范围、更深层次故障的诱因,便会给系统稳定性带来毁灭性打击。

变更高风险,人为操作与配置不当频发:根据行业研究机构 Gartner 2025 年的研究数据,多达 80% 的计划外停机均是由人为操作不当或变更不规范导致的。这一预测数据与中移九天团队在日常变更、割接、国产化以及信创替代过程中的实际数据高度吻合。另外,有 42% 的技术中断主要源于内部配置、不规范变更或管理松懈。大数据环境下的配置项极度繁杂,传统的工单评审和变更审计往往流于形式,参与评审的各方人员往往只关注其局部的细节,缺乏全局观,导致变更过程处于“黑盒”状态,极易因操作人员疲劳或疏忽而引入破坏性的操作风险。

专家经验强依赖,异构技术栈排障极其困难:当前的大数据技术栈高度复杂且高度异构,开源组件(如 Hadoop、Hive、Flink、HBase 等)与商业版生态并存,涉及的排查项目极其繁多。传统的排障手段极大程度上强依赖高阶专家的个人经验。一旦现场一线运维人员的经验不足或面对复杂的疑难杂症,问题就必须逐级上升到二线甚至三线专家解决。从故障发生到最终业务恢复,行业的平均用时常在一到两个小时以上。这种强依赖专家经验、层层升级的模式,由于排障时间长,显然远远超出了企业核心业务对中断时间的容忍极限。

2. 从“人力密集”到“数据驱动”的必然选择

面对复杂的大系统,传统的运维预警和预见性维护(例如预测性扩容、预防性参数优化等),在本质上属于“用人力对抗系统的复杂度”。然而,随着集群规模和业务复杂度的几何级增长,单纯依靠增加人力的“人力密集型”模式已触及效率和成本的极限。从“人力密集型”走向“数据驱动型”是智能运维发展的必然选择。即使大语言模型在现阶段天然带有一部分不确定性(幻觉问题),大数据运维也必须积极拥抱 AI。通过构建高可靠、安全受控的运维智能体(Agent),将人类专家的经验沉淀为数字化、智能化的生产力,从而打破系统复杂度的牢笼,实现智能运维的根本转变。

02 如何做运维智能体:三步走

1. 大数据运维智能体建设的“三步走”战略

第一步数据驱动基础化(数据治理):通用的开源或商业大模型虽然已经足够聪明,能解决很多日常的逻辑推理问题,但它们面临的最大短板是“无法直接理解专业的运维数据和行业特定的语义”。因此,运维 AI 化的核心基础首先在于数据治理,包括事实数据和语义数据两大支柱:事实数据即基础的运维数据,包括性能指标(Metrics)、系统日志(Logs)、告警事件(Events)以及 CMDB 拓扑关系等。语义数据指构建统一的运维本体和知识图谱。将大数据技术栈中晦涩的专有名词、逻辑关系进行映射,让大模型能真正看懂运维数据,理解运维语境。这是后续建设的核心基石,而诸如 HARNESS、局部工程(Local Engineering)等则可以作为工程底座在后续逐步落地。

第二步 AI 模型智能化:在大数据运维智能体的实际建设中,“十次故障,九次由于变更”是行业的共识。为了规避因运维人员个体经验水平差异导致的管理质量波动,团队在推进 AI 模型智能化时,总结并践行了两条核心原则:规则先行原则指的是切忌为了 AI 而 AI。对于一些逻辑极其清晰、边界非常明确的标准化、线性任务(如常规阈值告警、标准的配置变更等),仍然应当依照既定的规则(Rule-based)去做。在实际工作中,80% 的日常运维任务依旧可以用规则高效解决。AI 智能体攻坚非线性、模糊复杂场景的原则:对于根因分析、异常检测、影响范围研判等非线性、模糊且极其复杂的场景,由于其逻辑关系复杂,无法用简单的 if-else 逻辑进行穷举,这些才是大模型和智能体应该重点攻坚的领域。目前团队构建的运维智能体已全面覆盖了优化治理(如容量预测规划)、日常巡检、故障管理(告警风暴与根因分析)、影响分析这四个象限。

第三步自主进化:自主进化是智能体建设的终极目标。在这一阶段,AI 智能体需要具备卓越的自然语言交互能力,能够深度、准确地理解复杂的业务意图,实现跨域协同的自主决策、自动化执行以及自我学习优化。虽然自进化是极具吸引力的远期目标,但目前在生产环境中仍处于探索阶段。

2. 运维智能体协同体系的核心技术架构

为了在保障生产高可靠、安全合规的前提下发挥智能体的作用,中移九天团队设计了一套执行闭环的技术架构体系。该架构体系由四大核心组件构成:用户交互终端、LLM 决策中枢、MCP 管控网关、Ansible 执行器。其技术执行流程呈闭环流转,架构具体如下:

用户交互终端:作为智能体与人类运维人员的交互媒介,接收日常自然语言指令或承接系统异常告警。

LLM 决策中枢:接收来自终端的请求,理解业务意图并调动大模型强大的推理能力,输出具体的运维操作决策路线。

MCP 管控网关(核心卡点):作为极其重要的安全屏障,负责将大模型的非结构化决策流转化为结构化的标准 API 调用。在此环节提供严密的权限验证与参数合法性校验,拒绝非安全操作,确保智能体的动作绝对合规、可控。

Ansible 执行器(双手与双脚):作为基础设施的直接操纵者,直连物理机/虚拟机集群。通过安全地执行预定义的标准化运维脚本(例如拉起某一个失败的作业、安全重启 HiveServer2 服务等),将智能体的意图安全落地到生产环境,完成闭环。

03 案例分享:从易到难的七大核心生产实践

在建设大数据运维智能体的道路上,中移九天坚持“场景单一、边界清晰、从小步快跑向大而全过渡”的原则。通过围绕实际痛点做局部突破,成功在生产环境落地了七大核心实践案例。以下按从易到难的顺序进行详细剖析。

1. Hadoop 自愈智能体(快速止血与高频场景自愈)

在大数据日常运维中,“磁盘根目录满”和“核心组件(如 HiveServer2)服务异常中断”是发生频率最高的两类故障。传统处理极度依赖人工,响应慢且缺乏标准的故障验证,导致同类故障在生产环境中反复发生。为此,自愈智能体被优先推出,通过自动化手段实现快速止血。

  • 应用层:聚焦高频痛点,提供磁盘根目录自动清理与扩容、HiveServer2 服务异常安全重启两大核心自愈场景。
  • 能力层:构建“监测-决策-执行-验证”的智能闭环引擎,内含故障精准识别算法、自动处置执行器以及效果深度校验模块,确保每一步自愈操作均可追溯、可回滚。
  • 底座层:沉淀了 4 套通用的故障处置工作流与 3 个核心运维插件,结合智能异常分析模型,为上层场景提供灵活的动作编排底座。

在技术实现上,Hadoop 自愈智能体具备两大亮点:一是场景化定制的无损自愈策略,针对磁盘爆满独创了“先移动后压缩”的无损策略,保障生产数据零丢失;针对服务异常,建立“探测-重启-健康检查”闭环,规避频繁无效的操作。二是轻量化探针技术,采用直连探针模式,无需在集群各节点安装侵入式的 Agent,不消耗生产计算资源,实现毫秒级感知。

核心成效指标 具体量化效果
故障处置效率 提升 900% (从人工小时级缩短至自动化分钟级)
运维人力成本 降低 60% (自动化完全替代人工重复排查与处置)
故障自愈成功率 达到 100% (覆盖磁盘自动清理、HiveServer2自动恢复)

2. Hadoop 集群管家智能体(一站式运维数据问答)

由于传统的资产信息(CMDB)、监控系统以及日常巡检报告分散在不同的孤岛系统中,数据不互通、查询极其不便。如果通过传统方式搭建统一的大数据运维数仓,不仅建设成本高昂,且数据的实时性和时效性也难以得到保证。

  • 应用层:提供一站式集群信息智能查询、故障根因快速分析、异常风险主动识别以及运维决策建议输出,直接解决日常信息检索的痛点。
  • 能力层:依托自然语言 SQL(NL-to-SQL)引擎、多维度关联分析模型、异常检测算法以及运维知识图谱推理,实现强大的智能脑部驱动。
  • 底座层:打通 CMDB、实时监控指标、巡检报告与集群元数据,实现异构数据的标准化汇聚与统一治理。

该智能体实现了全量数据融合,能够消除多系统切换的信息壁垒;提供自然语言交互,无需运维人员编写复杂的 SQL 或工具命令,用日常口语即可秒级查询指标与状态,显著降低了门槛。此外,支持主动风险治理,基于数据关联自动识别异常节点或容量瓶颈,并同步输出针对性优化建议。

核心成效指标 具体量化效果
信息查询效率 提升 500% (自然语言交互,秒级获取多维度集群信息)
故障定位时长 缩短 80% (从小时级压缩至分钟级)
运维操作门槛 降低 90% (自然语言替代HDFS/YARN指令及SQL,零基础可上手)
风险识别能力 提升 300% (实现从人工巡检向AI全天候实时感知的飞跃)

3. Hadoop 配置质检智能体(配置全生命周期主动治理)

Hadoop 技术栈中配置参数成百上千。传统方式依赖人工巡检,不仅工作量巨大,且人工难以准确理解所有复杂参数的实际含义,容易导致认知偏差。更严重的是,从管控页面(前台)下发的配置,往往由于各种原因无法在底层实际节点(后台)完全生效,导致前后台配置不一致(配置漂移),给集群稳定运行埋下隐患。

  • 应用层:具备多源配置一致性自动校验、配置异常风险智能预警、配置知识智能问答与优化建议输出四大核心能力。
  • 能力层:依托配置比对校验引擎、大模型语义理解引擎与资源优化分析引擎,是智能体的核心大脑。
  • 底座层:打破孤岛,汇聚全集群多源配置数据、资源监控指标、任务运行日志与业务负载数据,奠定全量配置数据底座。

该智能体支持多源配置自动比对,能够自动抓取前后台数据进行全量自动化比对,分钟级完成全集群巡检并精准锁定漂移问题;提供大模型智能问答,内置配置知识库,支持运维通过自然语言查询配置含义与大约束,消除认知歧义。

核心成效指标 具体量化效果
配置巡检效率 提升 100% (实现全量自动化分钟级校验,覆盖率达100%)
风险识别提前率 达到 95% (在异常配置引发业务故障前主动识别、实时预警)
配置认知偏差率 降低 90% (建立标准化知识库,规避因参数理解偏差导致的人为误操作)

4. TopSQL 分析智能体(慢 SQL 智能定位与重写)

在大数据场景下,批处理任务是绝对的主流。这些任务呈流水线式运行,一环扣一环。若单个 SQL 运行慢或占用资源过大,不仅会影响当前队列,更会引起下游链路的连锁崩溃。传统排查需要人工在茫茫日志中捞取,极其耗时耗力。

  • 应用层:提供 TopSQL 性能全景视图、多维风险识别与智能重写/调优代码建议。
  • 能力层:搭载大模型 SQL 语法解析树(AST)引擎与专家诊断规则库,辅助深度诊断。
  • 底座层:实时采集 Hive 元数据、YARN 运行日志与底层任务执行的多维物理指标。

该智能体构建了全景性能画像(覆盖运行时长、CPU、内存、扫描行数等多维度)。核心亮点在于引入大模型进行“语法树解析”,将原本极其难懂的复杂执行计划翻译成通俗易懂的文字,并直接输出优化、重写后的 SQL 代码。此外,支持 AI 智能风险识别,自动对齐专家规则,排查全表扫描、数据倾斜等底层顽疾。

核心成效指标 具体量化效果
排查定位效率 提升 600% (诊断定位时长从人工的30分钟骤降至AI的5分钟)
异常发现率 达到 100% (从传统人工随机抽查升级为全量任务自动扫描覆盖)
计算资源利用率 优化 30% (削减无效扫描行数,集群恢复通畅,直接节省千万级节点扩容成本)

5. 集群健康度智能体(系统级“治未病”量化评分)

传统的集群管理缺乏标准、量化的健康度评分标准。当决策层询问集群整体健康状态时,运维只能凭借主观感觉罗列个别指标,数据时效性差且覆盖面窄。此外,由于无法科学衡量集群水位,也导致后续的硬件淘汰与资源预算规划只能“凭感觉”,缺乏数据依据。

  • 应用层:提供直观的全集群健康度打分大盘、异常指标一键下钻分析及全局优化建议。
  • 能力层:搭载动态权重评分模型、历史趋势异常检测模型以及专家推理引擎。
  • 底座层:自动聚合与清洗集群近 30 天的全量运行数据(含 CPU/内存负载水位、HDFS健康度等)。

该智能体可对 30 余项核心指标进行聚合清洗与评分,构建直观的“健康度六边形画像”。其核心价值在于可输出系统级的“治未病处方”,针对异常输出具体的容量扩展、系统重构或冷热数据分离的优化建议。此外,智能体能对多集群异常进行共性根因推理,指导全局基础设施的合理规划。

核心成效指标 具体量化效果
健康检测效率 提升 500% (全集群健康度回溯从人工天级/小时级缩短至分钟级)
指标全景覆盖率 达到 100% (无死角覆盖所有纳管集群的核心健康指标)
精细化容量管理 提升 90% (提前感知瓶颈,规划冷热数据分离,避免突发式采购)
基础设施规划科学度 提升 40% (通过具体得分指导硬件淘汰与硬件预算,告别凭感觉采购)

6. Flink 作业健康度智能体(高时效实时流作业诊断)

Flink 作为实时流计算的中枢,其数据时效要求极高,且数据流量特征变化频繁、压力巨大。在传统的运维链路上,SRE 从“看到告警”到“动手修复”通常需要 30-60 分钟。巡检高度依赖人工,故障定位需要拼凑指标、翻看长日志,排障耗时长,无法满足高实时性业务的要求。

  • 应用层:提供集“全局总览 + 巡检列表 + AI 诊断报告”三件套于一体的 Flink Doctor 系统。
  • 能力层:基于大语言模型(如 Qwen3-32B)构建的多模态融合根因推理引擎。
  • 底座层:实时采集包含 CPU 负载、堆内存、任务反压、Checkpoint、重启次数、Kafka 延迟在内的 Prometheus 六维核心指标数据。

该智能体独创了六维立体归因矩阵,统一评分标准且扣分明细完全可追溯,并支持人工 30 秒复核。其核心突破在于将结构化的指标曲线、文本日志和配置参数合并“喂”给 AI 做多模态联合推理,形成“异常现象 -> 异常原因 -> 诊断结论 -> AI 处方”的标准化诊断流水线。该系统成功实现了新集群监控能力 1 个人天即可接入,赋能初级工程师快速处理复杂的 Flink 内存泄漏等深度故障。

核心成效指标 具体量化效果
评估耗时节省 提升 95% (从传统链路的30分钟骤降至智能页面的1.5分钟)
故障定位时长 缩短 88% (排查耗时从45分钟缩减至5分钟以内)
作业巡检覆盖率 达到 100% (200+生产作业全量接入,巡检覆盖率从20%飞升至100%)

7. 割接变更管理智能体(超高风险场景安全管控)

割接变更往往是引发重大安全故障的“头号杀手”。中移九天目前管理着 30-40 个 Hadoop 集群以及 100 多套 HBase 集群,每月变更高达 300-400 次。传统人工评审往往流于形式,参与者各执一词,缺乏全局观。此外,割接完毕后的验证流于表面,而大数据批处理任务具有滞后性,许多深层报错到第二天清晨才爆发。

  • 应用层:提供工单智能审核、变更影响面拓扑分析及智能安全割接看板。
  • 能力层:依赖智能图谱引擎评估变更的“爆炸半径”,配合 MCP 安全管控网关进行下发与受控执行。
  • 底座层:打通 CMDB 资产关系链、历史变更事故知识库以及标准操作 SOP 库。

该智能体实现了全生命周期管控:一是事前智能评估拦截,自动解析变更文档并绘制影响面拓扑,拦截高危风险操作;二是事中严格受控执行,大模型拆解工单,通过 MCP 安全网关步步确认、防范误操作;三是事后全息自动比对,割接后一键启动全套自动化巡检并深度比对前后业务指标,减少遗漏。

核心成效指标 具体量化效果
重大变更事故率 降低 100% (彻底排除疲劳与疏忽风险,由不当变更引起的生产事故降至0)
工单审批效率 提升 300% (通过大模型自动初审,大幅压缩人工评审等待队列)
变更执行耗时 降低 70% (人工零散敲命令升级为流水线受控执行,缩短割接窗口)

04 挑战、应对和展望

挑战主要在于两点:

一是运维数据的低价值密度与治理 ROI 冲突。在大数据智能运维中,海量的日志和监控指标往往呈现出极低的价值密度。如果效仿业务数据治理,耗费巨额成本和精力进行大而全的数据治理,其投资回报率(ROI)会极低。这往往也是阻碍智能体落地的首要难题。
应对策略:团队采取“小步快跑、点状突破”的渐进式策略。在初始阶段不盲目追求全量数据的完美治理,而是选择高频且边界明确的点状场景(如磁盘空间、特定服务自愈、重点配置)切入,这些场景的数据质量更容易把控,能在短期内实现快速闭环,获得确定性的回报。

二是人机信任建立缓慢与人机协作的角色转变。大模型本身的概率特征决定了其无法做到 100% 准确。在落地初期,由于语义库有待完善或经验未沉淀,不可避免会出现一些误判或分析偏差,导致运维团队对 AI 的信任建立缓慢。同时,部分运维人员对岗位被 AI 取代产生危机感和排斥心理。
应对策略:明确智能运维智能体并非现有运维系统的彻底替代,而是生产力的延展与放大。大数据运维对高可用和可靠性要求极高,因而在架构设计上必须保持“人为审批卡点”,在关键变更和敏感操作环节保留人工介入机制。同时,底层知识图谱、规则引擎的持续建设与资产化沉淀,高度依赖高级专家的经验。通过智能体把人类从枯燥的 7×24 小时值守与基础巡检中解放出来,转而投入到系统架构优化、知识工程建设和自主工具定制等高价值工作中,帮助运维人员实现从“人力密集劳动者”到“知识工程构建者”的角色蜕变与平滑转型。

未来展望如下:

1. 近期规划:扩大场景覆盖与深化语义模型

在近期的规划中,团队将继续深挖高频故障场景,通过自动化手段实现快速止血与标准化管理。

  • 扩大智能体能力覆盖:当前的智能体主要服务于 Hadoop 生态组件。在近期规划中,团队拟将智能体的场景监控与管控自愈能力拓展至底层数据库、消息队列等更广泛的核心技术中间件,打破局部运维孤岛,实现复杂业务场景下全链路的智能化统一监控与管理。
  • 引入运维知识图谱深化模型能力:在模型底层,将引入深度运维知识图谱来全量构建大数据运维特有的专业知识库。结合实时产生的告警流数据、系统运行日志与历史真实故障案例,进行深层次的关联推理,显著提升故障根因诊断的精准度,同时也增强了 AI 决策输出的可解释性,进一步增进人机信任。

2. 远期展望:跨域深度协同与共建共享技术生态

目前团队在智能体上的建设多局限于场景单一、边界清晰的点对点场景。一旦遇到超出预设场景和动作的复杂跨系统、跨集群任务,智能体尚未完全突破。团队长远发展的愿景是实现从“被动响应”向“主动创造”的演进。基于机器学习全面实现底层基础设施资源水位、故障趋势的超前预判。从传统的“事后补救式”运维彻底转向“事前预防、受控自主执行”的新范式,确保系统达到极致稳定。

以上就是本次分享的内容,谢谢大家。


分享嘉宾简介

熊伟
中移九天人工智能科技(北京)有限公司 大数据运营维护中心架构师

先后承担中国移动数据仓库(经营分析)系统的规范设计、验收、运维,主持设计了中国移动规范符合度测试、POC 选型测试等技术文档 80 余册、300 多万字;带领团队构建新一代数智化运维体系,承接梧桐大数据 6.4 万+台节点规模,600+PB 价值数据资产数智化运维工作;开展中国移动集团关键核心技术攻关,完成大数据架构去 IOE,操作系统国产替代。荣获通信行业协会荣誉 5 项,移动集团级荣誉 8 项,多项信通院标准起草人。

【声明】内容源于网络
0
0
DataFunSummit
DataFun社区旗下账号,专注于分享大数据、人工智能领域行业峰会信息和嘉宾演讲内容,定期提供资料合集下载。
内容 1393
粉丝 0
DataFunSummit 北京鸿润嘉诚企业管理咨询有限公司 DataFun社区旗下账号,专注于分享大数据、人工智能领域行业峰会信息和嘉宾演讲内容,定期提供资料合集下载。
总阅读50.5k
粉丝0
内容1.4k