DPM Hyper-V 备份:设置、恢复与局限性指南
2026-07-17
2026-07-17
2026-07-16
2026-07-14
vCenter 上的“日志磁盘耗尽”告警会快速升级。如果放任不管,它将导致您的整个 vSphere 管理平面不可用。本指南涵盖所有根本原因、2 种经过验证的修复方法,以及针对 vCenter 6.x、7.x 和 8.x 的版本特定解决方案。
“日志磁盘耗尽”告警意味着您的 vCenter Server Appliance (VCSA) 上的 /storage/log 分区已接近满载,通常超过 75% 的容量。此分区存储所有核心 vCenter 服务的日志,包括 SSO、VMware Directory Service 和 vpxd。
一旦该分区完全写满,vCenter 将停止写入日志并关闭关键服务以防止数据损坏。在释放空间或扩展分区之前,您将无法访问 vSphere Client,也无法管理您的 ESXi 主机。

找出日志膨胀的来源是永久修复的第一步。以下是 vCenter 存储日志被填满的六个最常见原因:
vCenter 7.0 和 8.0 中的一个已知问题涉及 VMware Authentication Framework Daemon (vmafdd)。
注册表不匹配会导致该服务忽略日志轮转规则,从而导致单个巨大的日志文件可能耗尽整个分区。
在 Update 3 之前的 vCenter 8.0 版本中,为故障排查生成的支持包有时不会被自动清除。这些支持包是体积较大的压缩文件,如果多个支持包累积,可能快速触发 VCSA 的日志磁盘耗尽。
在早于 Update 3c 的 vCenter 7.0 环境中,证书验证失败可能触发失控的日志循环。系统会重复生成 pod-startup.log 文件,迅速用冗余的错误消息填满磁盘。
高流量环境或频繁进行 API 调用的环境,可能会看到 localhost_access.log 和 catalina.log 文件的大幅增长。
这些文件位于单点登录 (SSO) 和查找服务目录中,在较旧的 6.x 和 7.x 版本中可能无法正确轮转。
/storage/log 默认的 10 GB 分配对于拥有数百台主机或数千台虚拟机的大型环境来说通常是不够的。高日志详细程度或快速的对象更替可能导致使用量比预期更快地超过限制。
vCenter 使用嵌入式 PostgreSQL 数据库来存储清单和配置数据。遵循 STIG 加固的环境可能会为此数据库启用 pgaudit。
如果配置错误,每个数据库事务都会被记录,从而很快填满日志分区。
在删除文件或扩展磁盘之前,先准确识别哪些文件占用了空间。在没有明确诊断的情况下操作,可能导致删除关键系统数据或遗漏潜在的重复性问题。

在执行任何磁盘操作或文件删除之前,请对 VCSA 拍摄 VM 级别快照或进行全新备份。在没有安全措施的情况下调整磁盘大小可能导致分区表损坏并使 VCSA 无法启动。如果 vCenter 是链接模式组的一部分,请在进行操作前查看恢复的影响。
如果 UI 仍然可访问,请登录 vCenter Appliance Management Interface (VAMI),地址为 https://<vcenter-fqdn>:5480。
/storage/log 的分区。健康状态为严重或使用率超过 75% 即确认该告警。如果 VAMI 无响应,请以 root 用户身份通过 SSH 登录 VCSA。如果进入 Appliance Shell,请键入 shell 切换到 Bash 界面。
运行以下命令以可读格式查看磁盘使用情况:
df -h
要筛选已超过 78% 使用率的分区,请运行:
df -h | awk '0+$5 >= 78 {print}'
确认 /storage/log 是问题所在后,运行以下命令列出 20 个最大的文件和目录:
du -ah /storage/log/ | sort -h -r | head -n 20
查找异常大的文件(数 GB)或大量小型重复日志文件。
sort 中的 -h 标志可能并非在所有 VCSA 版本上都受支持。如果命令返回错误,请改用 sort -r 并比较原始字节值。即使有空闲空间,分区也可能表现出已满的行为。当分区耗尽 inode(文件系统用于跟踪单个文件的索引节点)时会发生这种情况。数百万个小日志文件可能耗尽 inode 而不会按大小填满磁盘。
使用以下命令检查 inode 使用情况:
df -i
如果 /storage/log 的 IUse% 达到或接近 100%,则 inode 耗尽可能是原因。
如果步骤 4 显示 inode 使用率较高,请运行此命令查找哪个目录包含的文件最多:
find /storage/log -type d -exec sh -c "echo -n '{}: '; ls -1 '{}' | wc -l" \; | sort -n -k 2
找到原因后,您可以通过清除不必要的日志数据或增加可用存储空间来解决该问题。根据诊断结果选择适合的方法。
vCenter 7 和 8 中的一些日志磁盘耗尽案例是由软件错误引起的,这些错误阻止日志正确轮转或压缩。请先查看下表——如果您的版本与已知问题匹配,请先应用相应的修复方法。
| vCenter 版本 | 已知问题 | 修复方法 |
|---|---|---|
| vCenter 6.0 U3 之前 | cloudvm-ram-size.log 轮转故障 | 升级到最新的 6.0/6.5 版本 |
| vCenter 7.0 U1 之前 | SSO 日志未被压缩 | 升级到 7.0 U1 或更高版本 |
| vCenter 7.0 U3c 之前 | pod-startup.log 失控 | KB 解决方案或升级到 7.0 U3c |
| vCenter 7.0 / 8.0 U1 之前 | vmafdd.log 注册表不匹配 | 注册表修复(KB 318575) |
| vCenter 8.0 U3 之前 | 支持包未自动删除 | 手动清理或升级到 8.0 U3 |
此方法通过删除旧的、已轮转的日志归档文件来提供即时缓解。仅删除压缩文件或带编号的归档文件(以 .gz、.zip 或 .log.1 结尾)。请勿删除以 .log 结尾的活动日志文件。
find /storage/log -name "*.gz" -mtime +7 -type f -delete

du 输出显示 /storage/log/vc-support-bundles/ 下有大型文件,请使用以下命令删除它们:rm -rf /storage/log/vc-support-bundles/*

service-control --stop --all && service-control --start --all

.gz 文件直到使用率降至 95% 以下,然后重试。如果环境已超出默认的 10 GB 分配空间,扩展虚拟磁盘是更可持续的修复方案。
/storage/log,但在进行任何更改之前,请在 VAMI 中或在 shell 中运行 lsblk 进行验证。/usr/lib/applmgmt/support/scripts/autogrow.shdf -h 以确认 /storage/log 反映新的大小。
VM 级别快照是一个好的起点,但它不能替代正确的备份。快照与 VCSA 存储在同一个数据存储上,并且可能因您正试图解决的相同存储问题而失效。对于生产 vCenter 环境,在您触碰任何磁盘或文件之前,专用备份解决方案可以为您提供可靠、独立的恢复点。
i2Backup 是一款企业级备份解决方案,支持使用原生虚拟化 API 进行无代理 VMware VM 备份,无需在 VCSA 本身上安装任何代理。
操作之前
在调整任何磁盘或删除任何文件之前,请使用英方软件的 i2Backup 对 VCSA 进行完整备份。如果在修复过程中出现问题,干净的恢复点将决定是快速恢复还是完全重建 vCenter。
问 1:删除 /storage/log 中的文件是否安全?
这取决于您删除哪些文件。以 .gz、.zip 或 .log.1 结尾的压缩归档文件可以安全删除。以 .log 结尾的活动日志文件不应触碰——删除它们可能会中断正在运行的服务或导致 vCenter 出现意外行为。
问 2:没有 SSH 访问权限可以修复日志磁盘耗尽吗?
在大多数情况下,不可以。VAMI 提供磁盘使用情况的可见性,但不提供直接删除日志文件或调整分区大小的工具。
本指南中的清理和扩展步骤需要 SSH 访问权限。如果 SSH 已禁用,请在 VAMI 中通过 Access > Edit 临时启用,然后再继续操作。
问 3:日志磁盘耗尽和 SEAT 磁盘耗尽有什么区别?
/storage/log 分区存储 vCenter 组件生成的服务日志。SEAT(Statistics, Events, Alarms, and Tasks)磁盘通常为 /storage/seat,存储历史性能数据和事件记录。
两者都可能独立填满。症状类似,但修复针对的是不同的分区和不同的文件集。
问 4:为什么 /storage/archive 总是 100%?这正常吗?
是的。/storage/archive 分区被设计为在接近或达到 100% 容量下运行。vCenter 将其用作日志归档的中转区,系统会自动管理其内容。已满的 /storage/archive 不是告警条件,不需要任何操作。
问 5:扩展磁盘会导致停机吗?
VCSA 支持热磁盘扩展,因此您可以在不关闭设备的情况下增加虚拟磁盘大小。但是,如果分区已经完全写满且服务已停止,仍可能发生停机。
在这种情况下,请先使用方法 1 清理出足够的空间,然后再尝试扩展。
问 6:如果 vCenter 已经无法访问(503 错误)怎么办?
如果 vSphere Client 返回 503 错误且 SSH 无响应,则设备可能因磁盘已满而停止了大部分服务。通过将 vSphere Client 直接连接到 ESXi 主机 IP,通过 ESXi 中的 VM 控制台直接访问 VCSA(不经过 vCenter)。
通过控制台登录,删除 .gz 文件释放空间,然后使用 service-control –start –all 重启服务。如果磁盘已满到无法写入任何内容,您可能需要先从 ESXi 主机级别扩展 VMDK,然后设备才能恢复。
vCenter 上的日志磁盘耗尽是一个可以恢复的问题,但需要快速处理。已满的 /storage/log 分区将导致您的管理平面离线,即使您的虚拟机继续运行也是如此。
修复遵循一个直接的顺序:进行备份、诊断哪些文件占用了空间、检查您的环境是否适用某个已知的版本特定 Bug,然后清理日志文件或扩展分区。对于已超出默认 10 GB 分配空间的环境,扩展磁盘是更长久的解决方案。
问题解决后,请考虑使用像 i2Backup 这样的专用工具为 VCSA 设置定期备份计划,以确保在下次维护窗口之前您始终拥有一个干净的恢复点。
公告
邮件
销售