尧图精选

低版本FusionCompute V100R003C00部署运维与故障排查实战

🕒 发布时间:2026/10/1 17:34:14 📁 来源:尧图网络
1. 低版本FusionCompute为什么还有人在用先说个真实情况2025年的今天我手上还在维护两套FusionCompute V100R003C00的集群。一套跑着某制造企业的MES系统另一套是某三甲医院的PACS归档节点。说出来可能有人不信这两套系统从2016年上线到现在中间经历过机房停电、硬盘批量告警、甚至一次误删除虚拟机的重大事故但底层虚拟化平台一次都没崩过。这就是低版本FusionCompute还能在现网大量存在的核心原因它足够稳定而且业务根本不敢随便动它。1.1 这些老版本都藏在哪些环境里从我这几年接触到的客户和环境来看V100R003C00这批低版本主要集中在几类场景制造业和老牌企业的核心生产系统MES、ERP这类系统业务部门的要求永远是能跑就行别升级。一次虚拟化平台升级意味着虚拟机要迁移、要停机窗口、要回滚预案而这些系统往往连几小时的维护窗口都批不下来。医疗行业的历史遗留系统医院信息科的人员流动大早期部署FusionCompute的厂商工程师可能早就联系不上了系统依赖的驱动、存储多路径版本、虚拟机内的老操作系统统统没有文档记录谁也不敢去动底座。教育、电力、交通等行业的灾备节点或小规模资源池这些环境通常不是核心当年采购时顺手搭的后续也没人管就一直停留在初始版本。培训与测试环境有些公司做华为虚拟化技术培训反而会刻意保留低版本环境因为低版本的报错信息更原始、功能边界更清晰适合教学演示。换句话说别以为低版本只是过时的老古董——它可能是很多行业真正跑在业务一线的“隐形功臣”。对做运维、做集成、做售后的朋友来说懂低版本的部署、运维和调优反而是能真正解决客户问题的技能。1.2 V100R003C00这个版本到底是个什么定位FusionCompute V100R003C00是华为FusionSphere虚拟化套件演变过程中的一个重要里程碑版本。从命名规则上就能看出一些信息V100代表产品大版本R003代表第三个大的Release版本C00代表这个Release下的初始Build版本。这个版本处在两个关键时期的交汇点上一方面它已经具备现代云数据中心虚拟化平台的基本雏形——有统一的管理集群、有HA高可用、有动态资源调度DRS、有在线迁移Live Migration另一方面它还有很多老派的设计痕迹——比如管理面依赖Java Web Start启动客户端、存储多路径需要单独安装UltraPath、对服务器型号和网卡的兼容性列表远没有现在的版本宽。华为虚拟化的版本演进大致可以这样理解V100R001~R002功能探索期很多理念还在对齐当时的VMware vSphere 5.xV100R003C00架构定型期VRMCNA两层架构走向成熟大量政企项目在这个版本上规模落地V100R005功能增强期开始加入更多云盘、快照、QoS特性V100R006界面和交互大改版逐渐向自研UniCope管理框架过渡后来演变为FusionCompute 8.x、FusionCompute 6.x等新命名体系所以很多老运维口中的华为虚拟化其实指的就是V100R003C00这一代的架构和操作习惯。理解了它再看后面的高版本会发现核心逻辑基本没变变的只是交互方式和外围功能。这正是我在文章标题里强调低版本分享的初衷——低版本不是一无是处它是理解整个华为虚拟化体系最好的一把钥匙。2. 低版本FusionCompute的架构与控制面拆解很多刚开始接触FusionCompute的朋友会被VRM、CNA、DVS、UltraPath这一堆名词搞晕。其实低版本FusionCompute的逻辑特别清晰总的来说就是一套管理平面加一堆计算节点。2.1 VRMCNA两层架构是怎么跑的FusionCompute V100R003C00的核心架构就两个角色VRMVirtual Resource Management管理节点负责整个集群的调度、虚拟机生命周期管理、资源统计、告警管理。VRM本身也是一台虚拟机可以部署在主备模式下即VRM主节点和VRM备节点通过虚拟IP对外提供服务。CNACompute Node Agent计算节点上的代理组件负责所在物理服务器上的虚拟机创建、启动、迁移、资源隔离等底层操作。我在实际部署中反复跟新人强调先分清管理面和数据面。VRM是管理面只管下指令、收状态CNA是数据面真正干活的还是CNA节点上的内核虚拟化能力。低版本FusionCompute基于KVM/QEMU的深度定制这一点和高版本的底层技术同源所以排查问题时思路可以通用。VRM主备切换的细节值得留意。低版本VRM没有像高版本那样引入复杂的仲裁机制主备两台VRM之间通过心跳通信备节点实时同步数据库和配置文件。如果主节点出故障备节点会自动接管管理面IP规划的虚拟IP也会切换到备节点上。整个过程对上层业务无感知——因为业务跑在CNA上VRM的切换不影响虚拟机运行。但这里有个前提主备VRM的心跳网络必须稳定如果管理网有抖动可能出现双主或者频繁切换这种问题在低版本上排查起来相当费劲。2.2 存储、网络与License的关键设计存储方面V100R003C00支持两种主流方式虚拟化存储把CNA节点的本地硬盘组成存储池通过FusionCompute自带的虚拟化存储技术提供给虚拟机使用。这种方式适合小规模场景我见过不少单机或者双机场景就是靠本地盘加虚拟化存储跑起来的。外部存储通过FC-SAN或iSCSI挂载存储阵列比如华为S5500T、S5600T在CNA上配置存储多路径UltraPath把LUN映射给虚拟机。生产环境基本都会选择这种方式。网络方面低版本FusionCompute已经有DVS分布式虚拟交换机的概念了但配置逻辑和高版本有点区别。低版本DVS的规划完全依赖物理网卡的分组和VLAN配置需要提前想清楚哪块物理网卡跑业务、哪块跑存储、哪块跑管理。我在多个项目里多次强调网络规划图的优先级高于一切配置操作哪怕少配一个VLAN后面排查起来都是一整晚的事。License方面低版本FusionCompute采用License文件授权方式License文件与宿主机序列号MAC地址绑定。这里有个坑如果服务器网卡被更换或MAC地址变了License可能失效需要重新申请。部分老项目的License已经无法从原渠道补办处理这种问题时只能联系华为400走特殊流程周期很长所以操作前一定要谨慎。2.3 与主流高版本的功能差异清单经常有朋友问我低版本能不能干这干那我直接把差异整理成了下面这张表看完就明白边界在哪里功能维度V100R003C00低版本高版本8.x等管理界面Java Web Start启动的GUI客户端Web化UniCope界面浏览器直接访问动态资源调度DRS支持按主机CPU/内存负载阈值触发支持且策略更细化如按存储、按网络负载在线迁移支持但要求源宿主机同版本、同CPU型号支持跨CPU型号迁移需开启增强特性GPU直通支持有限兼容显卡型号少支持vGPU、直通兼容性列表更宽快照支持单层快照操作粒度较粗支持多快照链、内存快照备份接口以兼容第三方备份为主需额外配置支持华为自有Backup等生态对接安全加固基础密码策略、账号管理更完善的三权分立、登录锁定、审计日志容器支持不支持部分新版本支持虚拟机容器混合调度概念这张表不是让大家去嫌弃低版本相反它说明了一个很重要的点**低版本能做80%的基础虚拟化工作剩下的20%才是高版本的核心价值增量。**对很多业务变化不大、需求稳定的场景来说低版本完全够用。反而是有些用户急着升级结果新版本UI不会操作、特性用不上还引入了兼容性问题得不偿失。3. 低版本部署实操从兼容性检查到安装配置聊了这么多背景接下来进入真正的实操环节。这一部分我按自己实际部署两台FusionCompute V100R003C00环境的完整过程来讲把关键步骤和参数选择逻辑都写清楚。3.1 部署前先对照这份兼容性清单华为虚拟化最大的特点之一是兼容性管控非常严格。低版本更是如此——不支持列表很长而且当年官方兼容性查询工具现在叫Compute Compatibility对老版本的资料已经不太维护了。所以部署前最稳妥的做法是确认服务器型号。EQE9000刀片、RH系列机架服务器是那个时代的主流。如果是后来新采购的服务器跑老版本大概率不在兼容列表里网卡、RAID卡驱动都可能有坑。确认网卡型号和固件版本。Intel 82599、X520等是那个时代常见的万兆网卡但要特别注意小版本号。很多诡异的丢包、虚拟机网卡时通时断问题最后都归结到网卡固件太老或太新。确认存储型号和微码版本。如果是华为存储阵列微码版本必须和FusionCompute版本配套如果是第三方存储如某主流国外品牌更得查厂商的互操作列表。RAID卡和硬盘模式。低版本对RAID卡的驱动集成不如高版本全经常需要手动加载驱动。系统盘建议做成RAID1数据盘看场景选择RAID5/RAID10或者JBOD直通。管理网和业务网IP规划。提前规划好VRM主备IP、虚拟IP、CNA管理IP以及用于虚拟机DHCP或手动分配网段。这个在部署文档里就要定死不要边装边想。3.2 部署流程与关键参数低版本FusionCompute整体部署思路是先装CNA再装VRM最后初始化集群。CNA的安装介质是一张ISO通过服务器光驱或者iBMC挂载虚拟光驱启动。安装过程和常规Linux安装类似但有几个关键参数需要提前设定主机名规划好命名规则比如CNA01、CNA02别装完再改后期域名解析会麻烦。管理IP必须和VRM管理网络互通网段规划错误是部署时最常犯的低级错误。存储配置如果采用外部存储系统装完后还要手动配置存储多路径并扫描LUN千万别跳过这一步。VRM的安装是在CNA上创建一台管理虚拟机。装VRM的时候需要指定VRM主备节点的分布位置以及VRM虚拟机的系统磁盘位置尽量放在可靠的共享存储上。这一步如果规划成主备VRM都在同一台CNA上那高可用就是个摆设——主机宕机时VRM跟着挂整个集群管理面全瘫。安装完成后通过Java Web Start下载客户端并登录接下来要做的第一件事是创建集群、添加主机、配置资源池。集群是DRS和HA生效的基本单元主机就是CNA节点资源池是给不同业务划分资源配额的逻辑单位。我在初始化时习惯把计算资源池划分为CPU池、内存池、存储池三个维度去审视——比如把MES系统单独划一个资源池指定CPU预留和内存限额避免和其他业务互相争抢。3.3 登录操作台的经典问题Java Web Start提到低版本FusionCompute就绕不开Java Web Start这个东西。很多新人在这一关就被卡住了——下载了客户端文件双击后要么打不开要么打开后登录报错。这个问题的根源在于低版本FusionCompute的客户端基于Java技术开发而现在的操作系统普遍预装的JRE版本已经太新了老版本的Java程序在JRE 8u201以上版本上会出现兼容问题尤其是TLS加密和本地策略文件校验这两个环节。我自己的解决思路是准备一台专用的运维跳板机比如Windows 10 LTSC把Java版本固定到JRE 8u181或者更老的版本不要装新版本Java也不要让浏览器自动更新Java。在Java控制面板里把FusionCompute管理面的IP加入不受限站点列表并且降低安全级别。这一步不做的话很多情况下客户端能下载但启动直接白屏。如果客户端启动后一直卡在正在获取服务器信息多半是管理网络不通或者VRM服务异常先在CNA上用命令检查VRM虚拟机状态和网络连通性。这个兼容性问题看起来小但实际项目中真的能卡住整个项目验收。我后来干脆在跳板机上做了个脚本一键设置Java环境变量和策略文件算是彻底解决。3.4 集群创建与资源池初始化的注意事项初始化集群时有几个参数很容易被忽略我一个个点名HA功能参数配置HA的心跳网络和检测周期低版本里默认值偏保守对网络抖动特别敏感。如果机房网络质量一般建议把检测周期调大一点否则大量主机频繁误判宕机会把所有虚拟机都触发重建那场面绝对不想经历。DRS阈值默认的负载均衡阈值比较激进如果业务流量有明显高峰低谷建议把迁移触发阈值调低避免频繁迁移导致的性能波动。时间同步低版本对NTP要求很严VRM和CNA时间偏差过大会直接导致证书校验失败、虚拟机迁移异常。所以部署完第一件事就是配置统一的NTP服务器并且在CNA上确认时间同步状态。资源池初始化的技巧在于命名和配额。我在做政企项目时总结了一套命名规范业务系统-环境-资源池比如MES-PROD-ComputePool。配额方面给核心业务池预留20%的冗余CPU和内存测试池不做预留但设置硬上限这样既保证核心业务突发时能调度资源又防止测试环境把集群资源吃光。4. 日常运维里最容易踩的坑低版本FusionCompute的运维和高版本有大量的共同点但因为它带了很多那个时代的设计特色所以坑也特别有时代感。以下都是我真实踩过并解决的。4.1 证书过期、NTP漂移一个都不能忽略我曾经接手过一套客户的FusionCompute现象是新建虚拟机失败提示证书校验错误排查了存储、网络、模板整整一天最后发现是VRM的证书过期了。低版本的证书有效期默认是三年到五年到期后管理面的很多操作会被卡住但虚拟机的运行不受影响——所以很多环境在证书过期后看起来正常直到某天要做变更才发现动不了。处理办法是重新生成证书并导入。低版本在VRM上可以通过命令行工具重新生成证书但需要注意的是重新生成证书后所有CNA和VRM之间的通信会短暂中断建议在维护窗口内操作。另外NTP漂移和证书问题经常一起出现——如果宿主机时间一直不准可能导致证书校验失败。我接手任何一套新环境的第一件事就是检查所有CNA和VRM的date输出跟标准时间对比偏差超过5秒就立即调整NTP配置。4.2 VRM数据库备份不能只靠系统自带的定时任务FusionCompute的配置信息、告警信息、性能历史数据都存在VRM的内置数据库里。低版本自带备份任务但默认备份文件是存储在VRM虚拟机本地磁盘上的这就意味着如果VRM虚拟机本身损坏备份也一起丢了。我自己的习惯是在VRM上挂载一个外部存储目录把备份路径改到外部存储上并且做异地拷贝。操作步骤很简单在外部存储上创建一个LUN映射给VRM虚拟机。在VRM内格式化并挂载到例如/backup目录。修改FusionCompute的备份配置把备份路径指过去。配置外部调度任务每天把备份目录同步到异地服务器。数据库备份这个环节大多数环境都做得不好。但真到出故障那一天有没有这份备份就是一天恢复和一周重建的区别。4.3 磁盘精简配置与空间回收低版本FusionCompute支持精简配置Thin Provisioning但它的空间回收机制比高版本弱很多。虚拟机删除后它占用的存储空间不会自动释放回存储池LUN的空间只会越用越少。如果空间监控不及时很容易出现存储池写满导致所有虚拟机IO卡死的事故。我在一个医院客户那里遇到过存储写满的问题——PACS系统产生的影像数据增长特别快删了大量过期影像和中间数据后存储池可用空间没有回升。排查发现是FusionCompute没有执行存储空间回收。解决方法是在底层存储上执行unmap操作或者通过存储系统自带的回收功能配合FusionCompute的卷清理命令来释放空间。注意低版本环境下这一操作最好在业务低峰期做否则会有额外的IO开销。4.4 低版本碰到新硬件怎么办这是低版本最典型的痛点。有些项目后期扩容客户买了新的服务器结果发现FusionCompute V100R003C00的兼容列表里没有这款服务器安装时要么找不到网卡驱动要么识别不到RAID卡。我的处理思路分几步用华为的兼容性工具查处理器、网卡、RAID卡芯片是否在兼容范围内。如果芯片组兼容但服务器型号不在列表通常可以通过手动加载驱动解决。准备同版本对应的驱动ISO在安装CNA时使用driverupdate方式加载。如果芯片本身就不在兼容列表唯一的稳妥方案是换服务器或者找两套FusionCompute中间做互通如果网络支持。硬塞往往会导致后续无法预测的稳定性问题。这里多说一句低版本扩容时优先找二手市场流通的当年的同型号服务器往往是性价比和稳定性最高的选择。我在一个备件采购项目里就是这么做的客户对成本控制和稳定性都很满意。5. 典型故障排查方法汇总以下是低版本FusionCompute运维中最高频的几个故障场景和排查思路我直接整理成速查表方便大家对照处理故障现象常见原因排查命令/动作处理参考客户端下载后无法启动Java版本不兼容检查JRE版本、浏览器插件配置安装JRE 8u181并使用32位浏览器如IE登录VRM提示证书错误VRM证书过期查看VRM服务日志、系统时间重新生成证书并重启VRM服务先确认NTP正常新建虚拟机失败存储池空间不足/存储多路径异常检查存储池容量、virm和ultrapath状态回收空间或扩容LUN检查UltraPath链路健康虚拟机迁移失败网络抖动、CPU型号不匹配检查主机CPU型号、管理网络连通性调整DRS策略确保源和目标主机网络互通集群主机显示故障心跳网络不稳定、内存ECC报错查看告警、检查CNA日志、查看服务器带外信息维护网络稳定性必要时重启CNA服务或主机存储空间无法释放精简配置未回收检查存储池使用率、LUN映射状态底层执行unmap或使用的存储回收工具虚拟机内网卡频繁掉线网卡驱动不兼容比对网卡固件、驱动版本回退固件或升级兼容驱动、调整网卡属性这张表里每一项我都至少实际处理过一次其中登录VRM提示证书错误和存储空间无法释放是最容易反复出现的。在处理故障时我还有一个习惯所有操作先看日志。FusionCompute的日志体系虽然不太现代但关键信息都有记录。CNA上的日志主要在/var/log/messages里VRM的相关日志一般通过管理面导出。日志时间一定要和NTP时间对齐否则排查时对不上时间线会非常痛苦。6. 低版本是升级还是继续坚守聊到最后不可避免地要面对这个问题。我的建议从来都是六个字看情况别折腾。6.1 不建议升级的几个真实场景有一种声音是反正都要升早升早安宁但我在实际中见过太多升级翻车案例。以下是我不建议升级的情况业务系统常年不允许停机升级FusionCompute涉及VRM重启、CNA重启即使做在线迁移也必须有足够的缓冲时间。有些MES系统全年只有春节才给几小时窗口升级这种环境不适合等待一个复杂的大版本升级流程。依赖的特殊硬件/驱动已经不可替代有些老的GPU卡、加密卡、特殊板卡低版本有完整驱动高版本反而没有适配。升级前必须先确认所有硬件和驱动都有对应支持否则升完就是踩进坑里。没有完整的技术人员承接升级需要本地运维人员有能力处理升级后的问题如果团队不懂出了故障处理成本比收益高得多。低版本已经稳定运行多年这一条最朴素也最有力。对业务而言稳定就是最大的价值。很多时候什么都没发生就是最好的运维成果。6.2 如果要升级怎么把风险压到最低如果确实到了必须升级的节点比如等保合规要求、利旧服务器要退役、业务需要新特性我的建议是先在测试环境完整复刻生产配置做一轮功能验证和性能对比。没有测试环境的升级都是耍流氓。制定详细的回退方案确认VRM虚拟机有可用的独立备份、记录所有配置信息、导出现有虚拟机的配置文件和磁盘映射关系。选择业务低峰期按先备节点、后主节点的方式升级VRMCNA逐个滚动升级每升完一个节点都要检查集群状态和业务虚拟机状态。升级期间禁止做配置变更只做状态监控。很多升级事故都是升级和变更并行导致的。准备一台未纳入集群的主机作为升级失败时的逃生舱——可以把关键虚拟机先迁移到这台机器上。6.3 低版本折腾下来反而帮你把原理吃透了最后说点个人体会。这些年我接触过很多精通各种高版本特效的运维同行但真遇到底层问题时反而是那些在低版本上摸爬滚打过的老司机思路最清晰。原因很简单低版本功能少、封装浅很多逻辑是直接暴露出来的。比如低版本里看到一条存储报错你得自己去查LUN映射、查多路径、查RAID组高版本里同样的报错直接给你一个告警代码加建议操作省事但人也变钝了。所以我的观点是如果你刚接触华为虚拟化找一个低版本环境练手比直接上高版本学到的东西多得多。你会被迫理解什么是VRM、什么是CNA、什么是存储多路径而不是仅仅会点鼠标。我现在那两套V100R003C00还在稳定跑着每个季度做一次备份检查每半年做一次存储空间梳理。平时几乎没人想起来动它们但我心里清楚只要数据库备份在、多路径配置在、NTP不出问题它们就能一直稳下去。对于一套2016年上线的虚拟化平台来说这种被遗忘的状态大概就是运维最高的赞誉了。最后再分享一个小技巧低版本环境里建议把VRM虚拟机的系统盘改成每次启动前自动备份的配置项配合外部存储目录做定期拷贝基本可以杜绝因VRM损坏导致的管理面瘫痪。这一点很多实施工程师不会主动做但真到故障那天你会感谢当初这个不起眼的决定。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →