VMware无法从ISO引导:完整故障排查指南
2026-08-31
2026-08-31
2026-08-31
2026-08-31
VMware中的GPU访问并非自动启用。如果没有正确的主机配置、许可和VM设置,客户操作系统将无法识别您的物理显卡。无论您需要启用VMware ESXi中的GPU直通,还是设置跨多个VM的共享访问,正确的方法取决于您的hypervisor和工作负载需求。
本指南介绍了在VMware环境中启用GPU访问的三种方法:
每种方法都有不同的硬件要求、许可影响和适用场景,以下各节将详细介绍。
默认情况下,VMware ESXi和Workstation依赖软件仿真的SVGA驱动。物理显卡不会自动暴露给虚拟机。如果您需要VM处理GPU密集型任务,必须明确配置访问权限。
VMware支持三种不同的方法,每种方法适用于不同的环境和需求。
GPU直通 vs. NVIDIA vGPU vs. Workstation 3D加速
下表总结了主要区别。
| 直通(DirectPath I/O) | NVIDIA vGPU | Workstation 3D | |
|---|---|---|---|
| 平台 | ESXi / vSphere | ESXi + NVIDIA许可 | VMware Workstation |
| 每VM的GPU | 1:1专用 | 1张GPU,多个VM | 虚拟(共享主机) |
| CUDA / AI工作负载 | 完全支持 | 仅C系列配置文件 | 不支持 |
| VDI / 多用户 | 否 | 是 | 否 |
| 在线VM迁移 | 不支持 | 支持 | 不适用 |
| 成本 | 低(仅硬件) | 高(需许可) | 低 |
| 最适合 | AI/ML、渲染、HPC | 企业VDI、远程办公 | 开发、测试、轻量3D |
在修改虚拟化环境之前,请验证您的硬件、主机BIOS、hypervisor版本和许可是否都满足必要的要求。跳过这些检查是GPU虚拟化配置失败最常见的原因。
要在VM中启用GPU访问,您的主机CPU和主板需要支持硬件辅助的定向I/O。
在VMware与GPU交互之前,配置您的主机固件:
不同版本的VMware处理PCIe直通的方式不同:
NVIDIA和AMD将其产品线分为消费级和企业级层级,这决定了虚拟化支持:
NVIDIA vGPU除了硬件之外还需要基于订阅的许可。主要选项包括:
一旦硬件和许可确认完毕,您就可以开始配置hypervisor了。
GPU直通(VMDirectPath I/O)为VM提供对物理PCIe GPU的直接、独占访问,完全绕过hypervisor的转换层。客户操作系统将显卡视为裸机,使其适用于AI/ML、渲染和CUDA工作负载。
按照以下四个步骤在ESXi主机上配置直通并将GPU分配给VM。
在VM可以使用GPU之前,ESXi需要释放对PCIe设备的控制。



NVIDIA GeForce驱动可以检测到它们是否在VM内部运行并拒绝初始化,导致客户操作系统中出现“Code 43”错误。添加此参数可屏蔽hypervisor的存在并防止该错误。
lspci | grep -i nvidia
一旦GPU正常显示,您的VM就可以用于GPU加速工作负载了。
与直通不同,NVIDIA vGPU允许多个VM同时共享单个物理GPU。这使得它适用于VDI部署、工程集群和AI流水线——在这些场景中为每个用户分配专用显卡是不现实的。
1. 登录vSphere Client并选择您的ESXi主机。
2. 转到配置选项卡,展开硬件,然后选择图形。
3. 在主机图形下,单击编辑并将默认图形类型设置为共享直通。
4. 在主机上启用SSH并通过安全Shell客户端连接。
5. 将主机置于维护模式:
esxcli system maintenanceMode set --enable true
6. 将vGPU主机驱动VIB包复制到主机可访问的数据存储。
7. 使用VIB文件的绝对路径安装驱动:
esxcli software vib install -v /vmfs/volumes/your-datastore/NVIDIA-VMware_ESXi_Driver.vib
esxcli software vib install已被弃用。请改用esxcli software component apply。请参阅NVIDIA vGPU发行说明以获取确切的命令语法。8. 重启主机,退出维护模式,并运行以下命令确认驱动已加载:
nvidia-smi
理解NVIDIA vGPU配置文件名称
NVIDIA配置文件遵循标准化的命名约定。例如,NVIDIA A40-4Q的含义如下:
选择正确的工作负载类别
nvidia-smi
输出应显示分配的虚拟配置文件、其VRAM分配和任何活动进程。
VMware Workstation运行在主机操作系统之上,而不是直接在硬件上运行。这意味着GPU访问的工作方式与ESXi不同——在配置任何内容之前理解这种差异很重要。
Workstation不支持PCIe直通。这是宿主型hypervisor的架构限制,而非配置缺陷。
相反,Workstation使用虚拟化转换API来提供图形加速:
nvidia-smi不会有任何输出。


以下是一些常见问题及修复方法:
双GPU笔记本上的Vulkan渲染器冲突
在同时配备Intel集成GPU和NVIDIA独立显卡的笔记本上,VM可能崩溃或显示黑屏。将以下参数添加到VM的.vmx文件中以禁用Vulkan渲染:
mks.enableVulkanRenderer = "FALSE"
Workstation更新后的图形损坏
Workstation更新后出现窗口闪烁或光标错位,通常意味着客户机中的SVGA驱动与新的主机版本不同步。从客户OS中卸载VMware Tools,重新启动,然后重新安装更新后的VMware Tools包。
3D加速选项为灰色
确认主机BIOS/UEFI中已启用硬件虚拟化扩展(Intel VT-x或AMD-V)。如果没有这些CPU功能处于活动状态,Workstation无法提供硬件加速图形。
GPU虚拟化涉及主机硬件、hypervisor、客户操作系统和驱动栈之间的紧密协调。以下错误涵盖了最常见的故障及其解决方法。
1. “在主机重新启动之前无法启用直通”(重启后状态仍为“需要重新启动”)
这通常意味着ESXi内核仍将GPU用于其自身的控制台输出,尚未将其释放给直通层。
修复方法: 重启主机,返回PCI设备,关闭直通再重新打开。如果状态仍然没有变为活动,通过SSH连接并运行:
esxcli system settings kernel set -s vga -v FALSE
运行命令后再次重启主机并验证直通状态。
2. “模块’DevicePowerOn’启动失败”(添加PCI设备后VM无法启动)
PCIe直通设备需要其内存始终固定在原位。默认情况下,ESXi可以将VM内存交换到磁盘,这与直接设备分配不兼容。
修复方法: 打开VM的编辑设置,展开内存,勾选预留所有客户机内存(全部锁定)。保存并启动VM。
3. 未检测到GPU驱动 / Windows设备管理器显示“Code 43”
消费级GPU(如NVIDIA GeForce显卡)可以检测到它们是否在VM内运行并故意禁用自身。
修复方法: 将以下参数添加到VM配置中,以屏蔽客户操作系统的hypervisor签名:
转到编辑设置 > VM选项 > 高级 > 配置参数 > 编辑配置,然后添加:
hypervisor.cpuid.v0 = FALSE
保存设置,启动VM,并在客户操作系统内重新安装GPU驱动。
4. “模块’MKS’启动失败”
此错误通常出现在为同时启用了VMware虚拟3D加速(vSGA)的VM设置NVIDIA vGPU时。两者在虚拟显示层发生冲突。
修复方法:
一旦vSGA被禁用,NVIDIA客户驱动直接处理3D加速。
5. 在VMware Workstation中nvidia-smi返回“未找到设备”
这是预期行为。VMware Workstation不会将物理GPU暴露给客户操作系统。VM使用虚拟的VMware SVGA 3D适配器,这意味着nvidia-smi、CUDA和其他GPU计算工具在客户机内无法工作。
对于CUDA或计算工作负载,请改用带有GPU直通或NVIDIA vGPU的ESXi。
GPU直通会阻止vSphere在线迁移(vMotion)。当VM直接分配了物理PCIe设备时,标准的迁移路径不可用。这在硬件升级、主机退役或数据中心整合期间成为一个实际问题——这些VM仍然需要移动。
迁移GPU直通VM通常需要关闭它、移除PCI设备分配、迁移VM,然后在新主机上重新配置直通。对于运行多个GPU加速工作负载的环境,大规模手动执行此操作既耗时又容易出错。
i2Move正是为这类复杂迁移场景而构建的。它使用混合块级和文件级复制支持无中断的整机迁移,因此在传输过程中生产工作负载保持运行。迁移完成后,可以在目标主机上重新配置GPU直通,系统已经就位。
对于在GPU工作负载旁同时运行VMware HA配置的团队,将i2Migration与i2Availability配对使用可以提供更完整的方案:i2Migration处理一次性迁移,而i2Availability维护实时复制和自动故障转移,用于持续的高可用性保护。
在VMware中启用GPU访问最终归结为根据您的环境匹配正确的方法。直通为单个VM提供完整的硬件性能。NVIDIA vGPU在多个用户之间共享该硬件。Workstation 3D加速覆盖开发和测试场景,无需专用硬件。
当直通VM最终需要迁移时,请提前规划。像英方软件的i2Move这样的工具可以处理迁移已配置GPU的工作负载跨主机和环境的复杂性,而不会中断生产。
公告
邮件
销售