本站点使用Cookies,继续浏览表示您同意我们使用Cookies。 Cookies和隐私政策>
数据飞轮效应加速放大,成为驱动企业增长的主引擎。根据《IDC Global DataSphere Forecast, 2026–2030》报告预测,2030年全球数据量将超过700ZB,年复合增长率超30%。存储系统作为数据的载体,其规模和复杂度同步飞速增长。
处理告警、分析指标异常、扩容、迁移、报表输出……这是当下许多存储管理员的真实日常,长此以往,困于繁杂、机械的标准化操作之中。如何应对?最为有效的方式是让AI进入运维工作流,加速从辅助作业,迈向智能体运维新阶段(即AgenticOps),从每个员工、业务流程到运维体系,实现全方位的提质增效。
过去几年,AIOps(AI for IT Operations, 智能运维)通过引入机器学习、大数据分析等技术,在传统存储运维体系中取得了显著效果,已成为业界广泛接纳和采用的运维模式。比如:异常检测算法能够从百万级IOPS、毫秒级时延、TB级吞吐量曲线中捕捉到人工难以察觉的劣化;根因分析算法可在故障发生时快速锁定问题根因,将平均修复时间(MTTR)从数小时缩短至10分钟内;容量和性能预测算法让采购和扩容从经验驱动走向数据驱动。但行业也逐渐看到了AIOps的局限性:
第一,基于先验知识,难以应对未知风险:AIOps的训练多以依赖大量历史故障样本和专家标注为主,通过规则检测和阈值判断触发。面对新型的或过往经验未包含的故障模式,容易出现算法失效甚至误判。
第二,缺乏基于目标的自主能力:AIOps大多止步于“感知-诊断-建议”阶段,比如,在预测“存储池利用率将在30天后超过90%”后,不会主动决定是在线扩容、回收资源还是迁移数据等。感知、决策与行动之间的断层,使得运维效率难以实现量级跨越。
大模型和Agent技术的快速发展,让构建一个能够理解业务目标、自主规划、安全执行、持续进化的运维智能体成为可能。AgenticOps的架构核心包含四大组件:大语言模型(LLM)担任推理与规划的大脑;知识库(包含运维手册、最佳实践、故障模式等)充当长期记忆和经验来源;Skill库封装不同场景化运维技能;工具库包含指标查询、配置调整、故障定位等API集合。基于该架构,相较于AIOps模式,存储运维将迎来三个关键能力跃迁:
1)对话式人机交互,消除经验鸿沟:管理员输入自然语言下达指令,AgenticOps理解意图后,自主完成任务编排、调用性能指标、配置管理等工具、汇集结果并生成可读的结论。原来需要跨数个界面操作、执行数十条命令的排查过程,被压缩成一次对话交互。更重要的是,过去培养复合型IT运维专家需要五年以上时间,现在企业可利用知识库和Skill库,把海量运维经验转化为可被随时调用的技能,快速培养专业运维人才。
2)风险态势感知与主动应对,构筑纵深防御:结合知识图谱和实时数据流,AgenticOps不再孤立地判断某个指标,而是系统性地理解存储当前有哪些风险威胁、主动生成预防性应对措施、评估影响范围、生成工单,真正实现从“应急救火”到“风险前移”的转型,并且具有非常好的场景泛化性。
3)基于目标的自动化编排,逐步迈向自动驾驶:管理员无需步步下达操作指令,只需设定业务目标,比如保障Tier 1存储设备时延小于1毫秒,可用容量维持在30%以上。AgenticOps便能根据系统实时状态、预判系统风险、寻找损失最小的优化方案。通过目标驱动,形成感知、决策、执行、验证的完整闭环。
华为在iMaster DME存储管理软件中打造了DataMaster存储运维智能体,利用AgenticOps技术,解放存储管理员双手,让存储系统以最优状态稳定运行。它拥有四大核心能力:
1)运维Copilot,存储管理员的数字助手:通过自然语言交互,管理员不再需要记住复杂的操作步骤、在海量的告警和KPI里挖掘线索和分析异常,只需一句“分析A虚拟机性能下降的原因”等类似简单指令,智能体便开始自动输出相关分析结论。过去遇到问题先翻手册、查社区、找厂商,在AI时代都将成为过去。
2)故障Agent,实现主动预防与分钟级恢复:存储系统运行中可能出现传输抖动、光模块异常等小概率事件,一旦触发,轻则导致上层应用性能受损,重则引发严重事故,而依赖告警和KPI阈值很难发现此类故障。华为设计了一种多模态风险态势感知机制,在基于规则与阈值的快速检测识别已知故障外,还能实时分析日志、KPI指标的时序变化特征去识别潜在风险,基于因果推理模型和知识图谱提供修复方案。它将传统的被动通知、多工具、多界面、低效率、易出错的故障诊断流程,转化为主动、实时、单入口的模式,满足快速闭环要求。
3)优化Agent,目标导向,自主寻优:容量、时延、冷热数据分布、资源回收等优化工作的效果高度依赖存储管理员的经验。依托智能体,可根据设定的服务级别目标 (Service-Level Objective, SLO)自动分析相关指标,当存在违规风险时,自动调用相关Skill设计优化方案,并在管理员确认后自动执行。
4)云地协同,智能体在线持续迭代:智能体中的模型、知识库、Skill需要频繁迭代,并满足数据主权的合规要求。华为采用云地协同的工作机制,在云端构建智能体大脑提供MaaS服务,以周为单位迭代升级;在本地数据中心内,智能体调用MaaS服务和本地工具,对配置、KPI、日志等进行分析和处理。这种机制兼顾了技术快速迭代和用户数据安全,让智能体用得好、用得放心。

虽然当下AgenticOps技术已展现巨大潜力,但距离实现“自动驾驶”级自主运维仍面临着诸多技术挑战,比如:
智能体的幻觉与安全:智能体可能会生成设备重启等看似合理但危险的操作建议,迈向自动驾驶前必须在行动层设置权限围栏、爆炸半径控制、交叉校验机制等,让关键操作可审计、可熔断。
优化的预期效果判断:智能体虽然能够给出优化方案,但要保障优化效果的达成,必须依赖实时的数字孪生环境仿真。构建统一的存储语义数据底座以及因果图谱,从而让Agent具备存储常识,从相关性推断走向因果推断。
跨域的智能体协同:在跨数据中心、跨业务域、跨厂商设备的智能体协同时,将存在语义鸿沟、智能体间的协商、冲突消除等新挑战,我们正在结合联合创新项目,与客户和伙伴进行早期探索。
技术演进的方向始终是帮助人,而非替代人。AgenticOps带给存储管理的最大价值,是通过“人+智能体”的深度协同,让管理员从重复性日常操作中抽身,聚焦于架构设计、成本优化和业务创新。华为将持续深耕存储运维智能体技术,与客户伙伴一道,结合全球经验从容拥抱智能时代的变化与不确定性。
免责声明:文章内容和观点仅代表作者本人观点,供读者思想碰撞与技术交流参考,不作为华为公司产品与技术的官方依据。如需了解华为公司产品与技术详情,请访问产品与技术介绍页面或咨询华为公司人员。