VMware vSphere提供了多种可用性功能,帮助在基础设施故障期间保持虚拟化工作负载的运行。其中,VMware HA是生产环境中处理ESXi主机故障最常用的选项。

在设计稳定的虚拟化平台时,了解VMware HA的工作原理及其适用场景非常重要。这些背景知识有助于管理员在可用性、恢复预期和集群设计方面做出切实可行的决策

什么是VMware vSphere HA

VMware vSphere HA是VMware的高可用性功能,帮助在故障发生后保持虚拟机的运行。它监控VMware集群中的ESXi主机和虚拟机。当主机发生故障时,HA会在其他主机上重新启动受影响的虚拟机。

恢复时间目标(RTO)定义了系统在故障后可以不可用的时长。较低的RTO意味着服务能够更快地恢复运行。VMware HA通过自动化虚拟机重启而不是依赖人工干预,帮助降低RTO。

ESXi主机故障在生产环境中很常见。典型原因包括:

  • 硬件或电源故障
  • 网络中断
  • Hypervisor或管理服务崩溃

VMware vSphere HA通过自动响应这些故障来减少停机时间。在VM重启期间仍会发生一些中断,但恢复更快且更可预测。

vmware vsphere ha高可用性架构示意图

VMware HA:集群如何检测故障

VMware HA持续监控ESXi主机,以快速可靠地检测故障。此检测过程依赖于VMware集群中多个协同工作的组件。

1. VMware集群中的FDM代理

VMware HA依赖于故障域管理器(FDM)代理来监控主机和虚拟机的健康状态。

FDM代理运行在启用了VMware vSphere HA的VMware集群中的每台ESXi主机上。它使主机能够交换状态信息并协调HA操作。

2. Leader选举与主机监控

当VMware HA启用时,一台ESXi主机被自动选举为Leader。Leader在检测故障和协调恢复操作中扮演核心角色。

这种选举确保了整个VMware集群中监控和决策的一致性。

HA Leader负责:

  • 监控所有主机的检测信号状态
  • 检测ESXi主机故障和隔离事件
  • 在故障确认后启动虚拟机重启

3. VMware HA中的检测信号机制

VMware HA使用多种检测信号机制来准确检测故障并避免误报。这种分层方法有助于区分真正的主机故障和临时通信问题。

  • 网络检测信号

ESXi主机通过管理网络定期交换检测信号。如果一台主机停止接收来自另一台主机的网络检测信号,VMware HA会怀疑发生故障,但不会立即采取行动。

  • 检测信号使用管理VMkernel接口
  • 检测信号丢失会触发进一步的验证检查
  • 数据存储检测信号

当网络通信中断时,数据存储检测信号提供了额外的验证路径。每台主机定期向共享数据存储写入数据,使VMware HA能够确认主机是否仍在运行。

  • 帮助区分主机隔离与主机故障
  • 防止不必要的虚拟机重启

4. ESXi主机故障后的重启逻辑

一旦VMware HA确认ESXi主机发生故障,它就会开始恢复过程。在故障主机上运行的VM被标记为在幸存主机上重启。实际重启取决于VMware集群中的可用资源。

重启过程遵循以下步骤:

  1. HA识别故障主机上受影响的虚拟机
  2. 评估剩余主机的资源可用性
  3. 虚拟机根据重启优先级依次重启

VMware HA的优缺点

VMware HA为虚拟化工作负载提供基础设施级别的保护,但也存在明显的权衡。了解正反两面有助于管理员设计与实际运维需求相匹配的VMware高可用性策略。

VMware HA的优点

以下优势突出了VMware HA在生产环境中最具价值的方面。

  • 经济高效的可用性:VMware HA无需专用硬件或复杂配置即可提高可用性。它包含在vSphere许可证中,使其适用于许多环境。
  • 无差别保护:VMware HA保护虚拟机,无论其操作系统或应用类型如何。这使得它适用于同一集群中的混合工作负载。
  • 自动化恢复:主机故障后虚拟机自动重启。这减少了人工干预,并缩短了基础设施故障期间的恢复时间。
  • 硬件独立性:VMware HA可在集群中的标准ESXi主机上运行。它不依赖于相同的硬件型号或供应商特定的故障切换机制。

VMware HA的缺点

以下局限性定义了VMware HA在哪些方面可能无法满足更高的可用性或应用级要求。

  • 停机时间不为零:虚拟机在故障后必须重启,这会导致服务中断。对于延迟敏感或关键任务应用,这种停机时间可能是不可接受的。
  • 对应用无感知:VMware HA监控基础设施健康状态,而非应用状态。如果应用在运行中的VM内部发生故障,HA不会检测或修复该问题。
  • 资源开销:故障后重启虚拟机需要有足够的空闲容量。这降低了较小集群中的整体资源利用效率。
  • 依赖共享存储:VMware HA需要共享数据存储才能在其他主机上重启虚拟机。因此,存储故障可能限制或阻止恢复。

VMware高可用性 vs Fault Tolerance

VMware HA和VMware FT从不同的技术角度解决可用性问题。在为生产工作负载选择其中之一之前,了解每种机制如何响应故障至关重要。

VMware HA与FT的主要区别

VMware高可用性侧重于故障检测后的基于重启的恢复。当ESXi主机发生故障时,受影响的虚拟机在集群中的其他主机上重启。这种方法在重启过程中会接受短暂的停机时间。

VMware Fault Tolerance使用持续的虚拟机镜像同步来处理故障。辅助VM与主VM在不同主机上以锁步方式运行。当故障发生时,辅助VM立即接管,无数据丢失。

VMware HA与FT的主要区别在于停机时间的预期。VMware HA允许短暂的服务中断,而VMware Fault Tolerance专为零停机时间设计。这一差异对设计复杂度和资源使用有直接影响。

何时使用VMware HA vs FT

在VMware HA和FT之间做出选择取决于工作负载的关键性、对停机时间的容忍度以及运维开销。两种功能都解决可用性问题,但针对不同的风险级别和业务需求。

何时选择VMware HA

  • 大多数可以容忍短暂重启的生产工作负载
  • 资源或预算有限的环境
  • 优先考虑简单性和日常运维便利性的集群

何时选择VMware FT

  • 不能容忍任何停机时间的关键任务工作负载
  • 具有严格正常运行时间或事务一致性要求的应用
  • 可接受较高资源开销的小规模VM集合

结论

在实际环境中,VMware HA及相关vSphere可用性功能构成了基础设施韧性的基础,但它们并不能覆盖所有故障场景。主机级保护、基于重启的恢复以及有限的容错能力,仍需要由数据和应用程序保护策略来补充。

在完整的设计方案中,可以结合使用i2Backup等解决方案来提供无代理VM备份以及跨物理、虚拟和云工作负载的统一保护,同时i2Availability可以应对需要实时复制或应用级高可用性的场景。与VMware原生能力相结合,这些工具有助于构建更全面、运维上更均衡的可用性架构。

博客分类底部

准备好构建企业数据韧性了吗?

立即开启 60 天免费试用,或预约产品演示,了解英方软件如何为您的核心业务提供「零中断、零丢失」的数据保护。

请先完成图形验证

验  证  码:

英方官网验证码
第三方二维码 第三方二维码
英方公告铃铛图标
英方公告铃铛图标

公告

英方侧边栏向右箭头
英方高亮提示圆点
英方软件公告
各位求职者、合作伙伴:
近期有第三方冒用英方名义发布虚假招聘、不实业务信息。我司正规招聘全程零收费,非官网渠道信息均不作数。
信息核验热线:400-0078-655
遇诈骗请保留证据,及时联系我们并报警
英方软件
2026 年 6 月 23 日
英方邮件咨询图标
英方邮件咨询图标

邮件

英方销售支持图标
英方销售支持图标

销售

英方侧边栏向右箭头
联系销售:400-0078-655 转 1