您当前的位置:首页 >> 休闲 >> 正文
智能运维第一步:HDD磁盘故障预测
发布时间:2025-01-29 14:06:54  来源:一哄而上网

北京2023年10月31日 /美通社/ -- 当今数字化时代,智能障预信息技术扮演着企业和组织运营的第步关键角色。然而,磁测随着IT环境不断复杂化和数据量激增,盘故传统的智能障预运维管理方法已经无法满足日益增长的需求。为应对这一挑战,第步智能运维(Artificial intelligence for IT operations,磁测简称AIOPS)应运而生。盘故

AIOPS融合了人工智能、智能障预自动化和数据分析等技术,第步旨在优化IT运维的磁测效率、可靠性和可用性。盘故在AIOPS的智能障预范畴内,硬盘驱动器(HDD)故障预测是第步其中一个至关重要的组成部分。在数字化时代,磁测数据被誉为“新时代的石油”,HDD作为数据存储的基础设备,在数据中心、服务器和个人计算机中广泛使用,扮演着关键角色。然而其敏感、精确、结构复杂的特性往往也使得某些故障难以避免。因此,通过AIOPS来实现HDD故障预测,避免数据丢失、业务中断、维护成本上升,从而保障数据可用性和系统稳定性,逐渐成为保障业务正常运转的重要手段。

为什么硬盘会出现故障?

由旋转磁盘和漂浮在其上方的读/写头组合而成的硬盘驱动器尽管结构复杂,但它们已经证明了自己作为数据载体的价值。然而,引起机械硬盘发生故障的原因有多种:首先,如高温、湿度、机械磨损、读写操作频率等,这些因素之间的相互作用使得故障模式变得更为复杂,大大提高了预测难度。其次,温度、振动、读写速度、错误率等多样性HDD性能数据在规模庞大的数据存储环境中对进行有效利用和分析,无疑也是一个挑战。

传统的故障预测方法主要基于固定的阈值和经验判断,存在明显的限制:传统方法只能在故障已经发生或接近发生时才采取行动,无法预测性地防止故障;基于阈值的警报往往容易误报,因为某些参数可能因正常使用而产生波动;传统方法通常需要大量的人工干预,增加管理成本。相比之下,智能算法的引入为HDD故障预测带来诸多可能性,利用大数据和机器学习技术,其强大的学习和自适应能力可以更好地利用和分析这些多样化的数据,从海量的硬盘驱动器数据中提取有价值的信息,进而更加准确地进行故障预测。

HDD故障预测解决方案

方案主要包含两部分:模型离线训练以及实时监测和警报。首先通过离线训练得到可用的预测模型,然后将模型运用到实际生产环境中进行实时故障预测。

  • 模型离线训练

模型离线训练整体流程如图1所示。模型所需数据为S.M.A.R.T.(Self-Monitoring Analysis and Reporting Technology,自我监测、分析及报告技术,即一种自动的硬盘状态检测与预警系统和规范)数据,主要指硬盘运行过程中的指标值。在数据预处理阶段,由于并非所有原始属性都是机器学习模型的可用特征,因此需要先去除冗余和不相关的特征并选择与预测结果相关的特征,然后对于空缺的数据进行向前补全。同时,故障盘最后两周的样本均为潜在故障样本(预示着该硬盘可能随时会发生故障),即需要将最后两周的样本设置为故障盘样本标签。最后,二维数据类图构建则是将时间作为第二维度(SMART属性作为第一维度),使用滑动窗口的方式,构建出二维数据图,如图2所示。经过此阶段处理能够保持SMART数据的时间局部性,有利于磁盘故障预测。最后将得到的数据进行数据划分,分别组成训练集、验证集和测试集用于模型训练和评估。

图1 模型离线训练
图1 模型离线训练

图2 滑动窗口构建数据类图
图2 滑动窗口构建数据类图

在故障预测模型训练过程中(图3中虚线框所示),只使用健康硬盘的样本。编码器GE用来对原始输入图片x进行编码,得到图片特征z,解码器GD对编码后的图片特征z`进行解码。得到重构图片x`。为检测异常,添加一个编码器E来学习重构样本x`的特征表示z`。对于原始样本x和生成图片x`,交由判别网络D来判别真伪,这样,在判别网络进行更新时,判别网络的判别能力会得到提升。

图3 故障预测模型
图3 故障预测模型

在模型预测过程中(图3中实线框所示),无判别网络,只利用生成网络。将硬盘当前的二维SMART数据类图作为输入,经过模型中生成网络的处理,得到输入类图的特征表示z和生成网络的特征表示z`。其预测原理是,利用z和z`之间的差异来衡量样本生成的有效性,且两者差异越小,样本生成越好。因此,两者的L2范式A(X)=||z-z`||2被用于衡量样本的异常度,即当值大于某一阈值时,表示样本异常,即该硬盘将发生故障。其背后原因是,在训练过程中只利用和学习健康硬盘样本的分布,则使得健康硬盘样本的差异更小,即z和z`的差距更小。在预测时,如果输入样本来自故障硬盘,则会因为故障样本偏离健康样本的分布,导致z和z`差异更显著。

模型每次迭代训练使用AUC(Area Under Curve,接受者操作特征曲线下面积)区域预测效果最好的模型参数进行保存并供后续预测使用。模型训练完成后使用准确率对模型的性能进行评估,经评估模型的预测准确性可达99%。

  • 实时监测和警报

当模型训练完成后将HDD故障预测引擎顺利整合到多设备管理软件InView端,允许实时采集硬盘SMART数据,并利用模型进行在线推理预测未来两周内硬盘发生故障可能性(如图4所示)。当系统检测到硬盘出现故障风险立即触发告警机制,及时通知用户进行换盘处理。此机制不仅能够确保数据的安全可靠性,还提高了硬盘驱动器的整体性能和维护效率,强力保障了业务的连续性和数据管理的稳定性。

图4 InView端HDD故障预测
图4 InView端HDD故障预测

通过AIOPS技术,浪潮信息HDD磁盘故障预测解决方案不仅实现了业界领先的预测准确性,还成功整合预测引擎和实时监测系统,能够在故障风险出现时采取及时的措施,保护数据的安全和业务的连续性。

未来,将继续优化和拓展HDD磁盘故障预测能力:

  • 除SMART数据外拓展更多类型数据,全方位多角度评估硬盘健康状况;
  • 通过机器学习和深度学习技术的发展为识别和预测复杂的故障模式提供更多工具;
  • 进一步改进实时监测和警报系统,提高智能化和自适应性,使系统学习并适应不断变化的硬盘性能和环境条件;
  • 研究自动化响应机制,实现更快速的故障处理,进一步降低业务中断的风险。

面对生成式AI掀起的变革浪潮,5G、AI大语言模型、自动驾驶等各类新技术融合,大容量HDD依然是企业级数据中心、云服务提供商以及超大规模云业务领域的首选,浪潮信息将继续秉承“极致存储,智慧有数”的理念,基于自身技术优势不断创新,持续推动该领域的技术发展,以可靠高效的一体式解决方案守护企业数据安全,助力千行百业数字化转型。

头条
读图

友情链接:晨光与你温暖相约“卡斯波和丽莎:永远的好朋友”主题乐园阿特拉斯•科普柯荣获财联社2023"致远奖•可持续发展价值传播奖"物产中大华妍产品科室会顺利举行,进一步扩张衢州市场物产中大华妍产品科室会顺利举行,进一步扩张衢州市场舒肤佳携宋轶举办"健康传中国TA们的新年愿望 由"李"锦上添花,李锦记博爱学校的新年礼物即将送达潮涌珠江,广州国际轻纺城携手祁刚联名大秀卷动东方美学新潮龙庭草居全球独家引入瑞士百年抗衰与长寿医疗先驱瑞珀妮迎接2024年的30周年庆典 东京威斯汀酒店重装开业 构筑东京市中心健康绿洲移动互联时代专属人工耳蜗科利耳®Nucleus™ 7声音处理器ARC'TERYX始祖鸟2023•财联社企业ESG论坛落幕 软通动力荣获可持续发展价值传播奖晨光与你温暖相约“卡斯波和丽莎:永远的好朋友”主题乐园共筑新程 携手未来: 恒基中国上海项目聚力再出发【冰雪国韵 泉暖万家】第四届萍乡万龙山君澜温泉文化节温暖启幕Al+风电!运达股份携手浪潮信息打造风电场智慧运维新模式物产中大华妍学术交流会在郑州成功举办采用中国第一滋补食材的正官庄"燕窝"产品进驻韩国免税店至味传说:中国葡萄酒专业人士齐聚 GRANDI LANGHE 2024 葡萄酒预品活动上海国展蛟龙君澜大饭店荣获【年度人气口碑商务酒店】国内首家 SGS助力J酒店上海中心通过HSB12项可持续发展基准验证必维为盛新锂能颁发“双碳”项目及能源管理体系认证证书2023•财联社企业ESG论坛落幕 软通动力荣获可持续发展价值传播奖深圳康莱德酒店携手HR赫莲娜探索臻美艺术梦境物产中大华妍线上直播课程顺利开展这个元旦,跟着李锦记希望厨师学做菜!采用中国第一滋补食材的正官庄"燕窝"产品进驻韩国免税店2024成都医博会观众登记开启,邀您3月82023•财联社企业ESG论坛落幕 软通动力荣获可持续发展价值传播奖日新月盛,捷城而来 无锡盛捷太湖新城CBD服务公寓岁末扬帆,盛世启航埃尔奥拉猎鹰杯赛的首次举办提升了埃尔奥拉作为沙特阿拉伯传统体育重要主场的地位国内首家 SGS助力J酒店上海中心通过HSB12项可持续发展基准验证浪潮信息首提"高质量算力" 从五大特征来定义2024成都医博会观众登记开启,邀您3月8信达生物宣布玛仕度肽 (IBI362) 高剂量9 mg中国肥胖III期临床研究GLORYSCIEX全球副总裁、中国区总经理元旦祝福迎接2024年的30周年庆典 东京威斯汀酒店重装开业 构筑东京市中心健康绿洲仪电云云操作系统获得浪潮信息澎湃技术认证2024成都医博会观众登记开启,邀您3月8必维为盛新锂能颁发“双碳”项目及能源管理体系认证证书
外链:

Copyright ©2025 Powered by 智能运维第一步:HDD磁盘故障预测  一哄而上网  sitemap