恒丰银行:信创底座下自研可观测的运维数智化创新实践

恒丰银行:信创底座下自研可观测的运维数智化创新实践 来源鑫智奖·2026第七届金融机构数智化转型优秀案例评选获奖单位恒丰银行荣获奖项智能运维创新优秀案例奖一、项目背景及目标新需求, 诸如运维数字化以及智能化等, 难以借由传统运维办法予以解决, 得跳出现有的模式, 要运用新的角度以及与之相适配的运维理念来解决。在行业内部, 运维工具的平台化建设已然成为一种共识, 呈现出自动化以及智能化的趋势。运维数智化平台把运维经验和知识进行标准化, 且沉淀至运维平台, 以此解决竖井化建设模式所存在的弊端, 进而促进运维自身的数字化转型。1构建自动化巡检建设可扩展多模态的自动化巡检模型2先将分散的数据予以整合, 接着开展“运维分析集市”的建设工作, 凭借规范分析以及集中存储来对数据驱动决策进行支撑。3赋予运维中心能量, 凭借智能方式提升自动化以及资源调度的效率, 让容量预测等智能场景得到实现, 促使运维从“人工操作”朝着“数据智能”进行升级, 达成效能的跨越式提升。4引入人工智能智能体, 借助多模态巡检以及趋势分析, 识别异常状况, 自动触发故障自愈行为, 达成“检测 - 分析 - 处置”的闭环。在恒丰银行数智化转型加快推进的情况下, 各类业务系统持续迭代扩容, IT基础设施也不断迭代扩容, IT运维场景变得越发复杂且多样, 对运维效率提出了全新的高标准要求, 对响应速度提出了全新的高标准要求, 对管控精度提出了全新的高标准要求。从银行业整体的发展趋势来讲, 高效、智能、集约的一体化运维范式, 已然变成降本增效、保障业务稳定运转的核心必需条件。当下急切需要破除运维的障碍, 达成运维流程自动化, 成就运维数据一体化, 达成运维管理智能化, 去解决运维的难点, 支撑业务长期稳固、毫不动摇地发展。这时, 业务系统的复杂度, 跟运维工作量, 呈现出指数级增长, 传统运维模式的弊端, 一天比一天明显, 已经不能符合高效运营的发展需求了, 核心有三大痛点:运维入口存在分散的情况, 操作效率比较低, 运维系统的数量众多, 工具建设出现竖井化、烟囱化, 平台相互独立, 日常巡检、故障排障等工作要频繁切换不同的操作入口, 操作流程呈现碎片化、不连贯的状况, 这不但增加了运维人员的重复工作量, 还增加了人力运营成本。其一, 数据孤岛现象显著其二, 管理能力较为柔弱。运维数据呈现分散留存于各个独立系统的状况, 其三, 欠缺统一整合以及共享机制, 其四, 日常巡检工作依靠人工越过平台提取数据、着手汇总表格、于线下登记记录, 其五, 存在数据更新不及时、信息不一致、准确性难以获得保障等情况, 其六, 无法为运维决策给予有效支撑。第一, 人工依赖程度较高, 自动化以及智能化水平欠缺不足。第二, 变更执行、配置下发、故障排查等核心运维环节, 主要依靠人工操作来进行, 进而使得运维工作量较繁重, 因人为失误引发运维风险的概率很高, 限制了故障响应以及问题处理的速度。为了去破解传统运维所存在的棘手难题, 为了去补齐运维管理之中的那份短板之处, 是致力于达成运维工作质量的提升局面, 这样也就特地进行启动实施这个项目, 以此来打造构建智能化且一体化的这么一重的运维管理的体系, 借着这股力量来助力数智化转型能够稳定有序地一直保持推进去, 从而实现运维模式达成全方位的升级, 具体所设定的目标情况如下:(1)构建全量自动化巡检体系建立能够进行扩展、具备多模态性质的自动化样式检查模型, 达成对于服务器、网络中所使用的设备、应用系统、数据库等全部种类的IT资源进行全面覆盖。借助多源数据整合汇聚、融合AI智能异常检测技术手段, 取代传统的人工进行巡检的方式, 达成对于运维出现的异常进行精准识别、快速发现, 提高巡检所具备的全面性以及时效性, 降低人工完成巡检所需要花费的成本。(2)打造一体化运维分析集市将分散的运维数据资源统一起来, 建成一种机制, 这种机制要高效且顺畅, 能让应急信息快速同步, 达成运维数据的统一归集, 统一分析以及统一共享, 突破数据孤岛的局面, 给故障处置、运维决策提供支撑, 且此支撑要是实时的、精准的数据支撑。(3)搭建统一脚本自动化平台设置集中化的脚本管理平台, 达成运维脚本的统一管控, 令其自动化执行, 还要将配置精准下发, 全面涵盖变更执行、配置下发、故障处理等重复性的运维操作, 促使运维工作的自动化得以落地, 提高运维操作的准确率, 把运维人力释放出来, 降低人为操作存在的风险。(4)形成智能应用系统画像搭建全方位的应用系统运行画像, 深入探寻AI智能体应用、容量趋势预测剖析、故障自我修复、数字画像等智能化情形, 达成运维工作从被动反响朝主动预估、自动处理转化, 全方位提高运维智能化程度, 确保业务系统平稳、高效、安全运转。二、创新点(1)打破数字底座的竖井化状态, 利用低代码技术架构促使各运维系统高效串连以及流程畅通, 消除竖井化建设模式的弊病, 推进运维模式朝着集约化、一体化以及数字化方向转变。(2)与AI智能体进行对接, 以历史数据和关联分析为依据达到多模态异常识别的效果, 同时提供智能决策, 进而自动触发故障自愈, 形成一种由AI智能体进行驱动的闭环。(3)依据数据来推动决策, 将分散的数据予以整合, 构建起“运维分析集市”, 以此来支撑实时的监控以及趋势进行预测, 借助数据驱动对系统风险作出预判。三、项目技术方案1.核心功能规划运维数智化平台依照功能模块区分, 可分成运维数据集市, 智能巡检平台, 脚本自动化平台, 智能系统画像这四大核心模块, 与此同时强化权限与安全管控, 各个模块协同进行联动, 以此形成覆盖运维全流程的一体化管控体系。(1)运维数据集市这是平台的数据核心底座, 是运维数据集市, 它构建了一体化数据中台, 这个中台涵盖数据整合、分析以及可视化, 它能为平台各项智能功能, 还有管理决策, 提供的数据支撑全面、精准并且实时。第一, 多源数据接入, 要全面对接诸多现有运维系统, 像应用监控平台、系统监控平台、日志管理平台、鲁班批处理调度系统、网络设备监控、运维自动化平台之类, 还要接入多维度运维数据, 分别是应用数据、交易数据、系统数据、日志数据、数据库数据、批量数据、网络数据、特色运行数据等, 最终达成数据全域汇聚。②数据标准化处理, 对接入的海量异构数据, 进行统一清洗, 进行格式转换, 进行去重整合, 进行质量校验, 消除数据冗余与误差, 构建标准化、规范化运维数据资产库。③分层存储的架构为, 运用一种模式, 此模式是“实时存储 离线存储”的双架构, 这种架构能够保障高速写入实时数据, 像系统指标、运行日志、实时告警这些数据实现高速传入, 并且可以进行实时查询, 同时呢, 它又能够保障长期留存离线数据, 例如资产台账、历史巡检记录、历史故障信息, 还能对这些离线数据进行批量分析。④可视化跟数据服务: 给出资产的概览, 呈现巡检的状态, 作趋势的分析, 搞性能容量的分析呀等属于多维度的可视化报表, 还支持去开展自定义报表配置、进行数据导出支持参照资产、依据时间、按照异常类型等多样条件来做到精准检索, 达成运维数据全流程的数据追溯, 辅助作根因分析。⑤应急数据予以支撑: 构建应急信息实时同步通道, 对数据架构加以优化, 让应急场景下数据调取效率得以提升, 使应急同步延迟降低, 给突发故障处置供给实时数据保障。(2)智能巡检平台构建能够可进行扩展的、具备多模态特性的自动化巡检体系, 将AI智能异常检测技术予以融合, 取代传统的人工巡检方式, 达成巡检工作的标准化、自动化以及智能化, 从而全面地掌握IT系统的运行状态。可改写为: 全维度巡检指标, 仅举应用系统巡检报告这样个例来说, 指标涵盖相关种种, 有交易成功率检查, 有交易量排名前十交易的分析, 还有系统交易量状况展开的分析, 包括日志以及应用服务状态的检查, 定时任务或者批量任务的检查, 数据库前十大表文件大小和表空间膨胀情形的观测判断, 表分区以及序号自动计数的检查, 数据库表空间使用情况的把控等核心运维巡检场景的方方面面, 达成运维关键指标整全覆盖。②自动报告生成, 其依托运维数据集市的巡检数据以及巡检报告模型算法, 系统按照预先设置的周期, 自动生成周巡检报告, 自动生成季度巡检报告, 自动生成重大保障与特殊时期专项巡检报告, 并且自动推送至运维人员邮箱。三个方面, 其一为巡检数据管理, 它能够支持用户依据自身需求自定义时间段来进行查询, 还可以导出巡检报告, 同时会提供巡检结果的统一视图。其二是实现巡检信息能够从快速检索开始, 进而汇总, 最后进行分析。其三是搭建智能巡检看板, 此看板会实时展示应用运行的状态, 还有异常告警列表以及趋势预测结果等内容, 通过这些直观地呈现出系统运行带来的健康度。图 1 数据平台(3)脚本自动化平台搭建起集中化的、标准化的脚本管理以及执行平台, 达成运维操作的自动化与流程化, 削减人工介入, 降低操作方面的风险, 达成故障的智能处置以及自愈。搭建集中化脚本管理库, 用来梳理及标准化运维原子操作库。达成运维脚本的统一录入, 以及审核、存储、版本管控, 避免脚本出现混乱状况和杜绝违规使用, 这就是标准化脚本管理。二来, 自动化流程管控通过与对接运维自动化平台, 凭借运维数据集市的数据予以支撑, 构建起从任务编排一直到专家审核, 再到脚本执行再到结果校验的全流程自动化体系, 并且支持一键进行变更发布以及一键状态巡检, 以此替代重复性的人工操作, 进而提升运维效率。③智能故障进行处置, 要对接AI智能体, 依据历史运维数据以及关联分析算法, 自动去检测网络、应用、数据库、中间件等的多维度运行状态, 达成多模态异常识别、根因定位并且生成分析报告, 支持自动或者手动来执行异常应用实例重启、异常网络流量隔离等修复操作, 实现故障自己治愈, 保障业务系统能够持续稳定运行。首先, 异常故障触发之后, 会自动生成运维工单, 接着, 该工单会精准地推送至对应的运维人员, 然后, 它支持工单的自动流转, 同时能够实时跟踪处置进度, 并且自动回写处置结果 , 从而形成工单从发起, 到处置, 最终闭环的全流程管理, 以此实现运维任务的可追溯。⑤操作日志追溯, 它会完整记录下, 所有自动化操作的执行时间以及操作参数, 还有执行结果与操作人员, 它能够为操作日志进行精准查询打下基础, 并且支持全程追溯, 进而为故障复盘以及流程优化提供相应依据。(4)智能系统画像围绕企业级的 IT 架构, 去构建全生命周期的智能应用系统画像体系, 此体系还要具备多视角, 以此来实现应用系统全方位的精准管控, 进而提升 IT 资产管理以及运维管控的精细化水平。先建立一个画像模型, 里头有覆盖架构完整性、风险合规完整性、自动化覆盖度、监控覆盖度、容量健康度、证书/秘钥健康度、资源记录完整性、知识完整性等核心指标, 目标是全面完整地呈现应用系统运行与管理那复杂难测的状态, 这就叫多维度画像指标。②协同绘制机制: 要搭建起一种协同机制, 这种协同机制是业务、架构、开发、测试、总装、运维多视角实例化的应用画像的协同机制, 它依托运维数据集市里的数据, 借助线上化管理、自动化实施、人工补全相互结合的方式, 一步步完善应用画像的自绘制能力以及自更新能力, 以此保证应用系统画像的质量。(5)权限与安全管控这一平台, 运用的乃严格的身份认证机制, 以及权限管控机制, 以此去保障系统访问的安全, 还有数据安全, 以及操作的合规。①进行统一身份认证, 与身份认证管理系统IAM对接, 达成用户账号经由统一方式注册, 通过连贯流程认证, 依循特定规定注销以及予以全面管理。②精细的权限分配, 要对接云平台配置管理数据库CMDB, 以此获得用户与应用对应的关系, 然后依据“知所必需、最小权限、职责分离”这个原则, 来达成用户权限的最小化。③智能权限模型: 构建起以RBAC加上ABAC模型为基础之访问规则, 达成权限精确映照以及动态管控。经由梳理角色, 区分人员职能还有最小必要权限, 达成权限映照。配置超级管理员的权限、普通管理员权限, 应用运维人员的权限以及操作系统专业人员权限、中间件专业人员权限、数据库专业人员等多类角色权限, 保证菜单操作、数据访问权限跟角色相匹配, 提高安全性以及合规性。2.技术架构图 2 逻辑架构图1核心架构理念双平面隔离本平台针对网络安全方面, 划分成了两个处于物理隔离状况的平面, 以此来达成金融级安全运维的要求。①数据平面访问控制面向办公网和生产网用户通过单独域名访问。功能的定位是, 只仅仅做出提供只读类型, 非敏感性质的操作, 像是巡检报告的查看, 数据报表的剖析以及大屏的展示。②执行平面访问控制方面, 只有生产运维区的跳板机能够进行访问, 办公网中独立的域名其物理状态是不可达的。功能定位: 承担着网络故障自动化诊断的相关工作, 还要负责进行批量作业下发这般具有 HIGH 风险的执行操作。2部署单元详细说明①入口与转发层Nginx数据入口处, 要托管Vue3静态文件, 借助特定的请求头X -:, 把请求给转发到巡检主平台后端, 以此达成菜单的平台级过滤。执行入口, 同样对Vue3文件进行托管, 把执行类请求转接交付到执行平台予以处理, 并且注入X - :exec标识。②业务逻辑层核心后端数据主平台Java/, 它是基于若依框架构建而成的, 此框架在整个平台居于核心地位, 如同“大脑”一般关键。它承担着多项重要职责, 涵盖了RBAC权限管理工作, 负责审计日志的记录与管理, 承担Token签发任务, 执行定时任务调度Xxl - Job, 还直接参与到Linux服务器的运维工作当中。执行平台, 它专注的是复杂网络环境下的执行逻辑, 它利用适配多数厂商网络状况的网络设备, 它通过实时推送执行日志的方式, 它从Redis那里读取巡检主平台签发的Token去进行身份验证, 以此 实现免登录跳转。③数据处理与适配层数据接入单元, 其岗位职责是, 从APM、日志平台等这样的外部数据源那里获得数据, 并借助API、文本、Excel或者数据库直连手法来采集最原始的运维数据。执行复杂聚合统计的, 是数据运算单元 Java它在消费数据接入单元接过采集的数据之后, 生成 PDF/Excel 格式的标准化巡检报告。涉及Java的那个数据模型单元, 它承担着和行内CMDB进行对接的职责, 借助全量或者增量的机制, 把其中的非结构化资产数据转变成关系型数据, 再同步到主库中去。3基础设施与外部对接①数据存储身为涵盖全体且进行共享的中心数据库, 用以存放全部业务方面的数据, 以及执行的记录, 还有审计的日志, 为业务逻辑层次、数据处理和适配层次的所有单元提供通过的条件或者给予访问的权限。Redis分担着Token共享的职责, 承担着同步的任务, 负责数据接入单元与数据运算单元之间的任务队列工作, 它是双平面解耦因而没有失去连接的关键所在。②目标对象服务器Linux由数据主平台通过SSHJ直接执行及。网络设备包含华为的设备, 还有H3C的设备, 以及Cisco等各厂商的设备, 这些设备是由执行平台通过引擎来执行的。4安全与合规亮点物理层面的隔离, 其执行功能于网络平面彻底隐匿, 哪怕黑客成功破解办公网, 也没法触及执行引擎。掌控指令: 一切操作都得经由数据接入单元指令库予以审核, 协同数据主平台的多级审批流程避免临时命令所引发的风险。四、运营情况已在生产环境中部分落地的运维数智化平台, 正在持续进行迭代研发, 其整体运营所取得的成效非常显著。于智能巡检范畴之内, 平台达成了同系统监控、应用监控等运维系统的数据汇聚整合, 凭借自动化巡检能力, 达成了对两万余台服务器的全域覆盖, 每月自动生成标准化巡检报告2000余份, 凭借容量趋势分析达成智能预警, 能够提前识别并且处置潜在风险, 回收冗余配置的服务器资源, 在降低运维风险之际, 有效削减资源浪费。于自动化运维实施范畴内, 平台达成网络设备跟服务器资源的深度融合, 极大程度提升运维执行效率, 提高标准化水准, 则给予业务稳定运行妥善支撑。五、项目成效运维数智化平台是恒丰银行所自主研发的内部系统, 它聚焦于内部运维业务的需求, 并不参与外部市场的竞争, 此平台上线运行之后, 能够有效支撑运维人员迅速进行响应, 高效地处置各种各样的问题, 显著提高了运维工作的质效, 降低了人力投入以及运维操作的风险, 并且减少了因系统故障、服务中断而带来的潜在经济损失和社会影响, 为信息系统安全稳定的运行给予了坚实的保障。六、经验总结在运维数智化平台项目进行建设时, 碰到了诸多问题, 在这个项目推广的过程里, 积累了较为丰富的实施方面的经验, 并且还形成了能够复用的改进思路。在项目建设阶段, 采用了敏捷开发模式, 借助拆分微小迭代、分步骤落地施行的策略, 先是上线基础能力, 然后再逐步迭代完善核心智能能力, 然而还是出现了部分模块开发延期的情况, 在后续项目实施计划里多预留了10%缓冲时间, 于关键节点合理增加配有开发资源, 进一步降低开发延期风险, 从而有效保障了平台稳步推进。对多系统对接情形而言, 平台关联的运维系统数量繁杂, 接口对接状况复杂, 尽管前期已着手开展接口现状的调研工作, 不过在实际落地的进程里, 依旧存在对接方面的难点, 这在一定程度上对实施进度造成影响, 后续的同类项目会强化前期的深度摸排工作, 将接口方案以及对接流程予以细化, 提前做好技术方面的协调事宜, 最大程度地避免工期出现延误状况, 从而提升项目整体的实施效率, 以上所提及的两项因素致使工期出现短暂延误, 在未来的项目实施过程中都应当予以避免。有更多的金融科技方面的案例, 以及金融数据智能的优秀解决方案, 在数字金融创新知识服务平台, 也就是金科创新社案例库、选型库那里去查看。