KVM宿主机内存OOM,虚拟机内存超配风险

KVM宿主机内存OOM通常是因为虚拟机内存超配过度,物理内存不足以分配给所有虚拟机时,内核OOM Killer会强制杀掉占用内存较高的进程,严重时连虚拟机进程也会被误杀。
解决方向有三条:控制超配比例、开启并优化KSM内核同页合并、合理设置swap和cgroup限制。
本文按零基础可操作的顺序,讲清排查步骤、KSM调参方法和长期避坑措施。

先搞懂内存超配和OOM的关系

KVM默认允许内存超配,即所有虚拟机配置的内存总和可以大于宿主机物理内存。
超配依赖的是虚拟机实际使用量通常小于配置值,一旦多台虚拟机同时内存紧张,宿主机内存就会被耗尽,触发OOM。

先确认宿主机当前内存状态:

free -h

再查看是否有OOM记录:

dmesg -T | grep -i oom
journalctl -k -b | grep -i kvm

如果看到类似 Out of memory: Killed process 的日志,说明已经发生过OOM。
此时先重启被杀掉的虚拟机,再按下面的步骤调整。

立刻能用的缓解操作

在调整参数前,先做两件事降低紧急风险:

  1. 给宿主机增加1-2GB swap,作为临时缓冲。
fallocate -l 2G /swapfile
chmod 600 /swapfile
mkswap /swapfile
swapon /swapfile
  1. 查看当前虚拟机内存配置,找出占用大户:
virsh list --all
virsh dominfo VM名称 | grep -E 'Max memory|Used memory'

注意:swap只能延缓OOM,不能彻底解决问题,重点还是要做下面的调优。

KSM调参具体步骤

KSM(Kernel Samepage Merging)能把虚拟机中内容相同的内存页合并成一份,释放物理内存。
对于运行大量同系统、同应用模板的虚拟机效果明显。

开启KSM

echo 1 > /sys/kernel/mm/ksm/run

验证是否开启:

cat /sys/kernel/mm/ksm/run

输出 1 表示已开启。

调整扫描速度和间隔

KSM有两个关键参数:pages_to_scan 控制每轮扫描多少页,sleep_millisecs 控制每轮扫描后的休眠毫秒数。
值越大扫描越快,但CPU占用也会上升。

当前默认值先看一下:

cat /sys/kernel/mm/ksm/pages_to_scan
cat /sys/kernel/mm/ksm/sleep_millisecs

适合测试环境的调整示例:

echo 1500 > /sys/kernel/mm/ksm/pages_to_scan
echo 20 > /sys/kernel/mm/ksm/sleep_millisecs

设置开机自动生效

推荐通过 systemd 服务实现,避免每次重启后手动设置。
创建 /etc/systemd/system/ksm-tune.service

[Unit]
Description=KSM Tune
After=multi-user.target

[Service]
Type=oneshot
ExecStart=/bin/sh -c 'echo 1500 > /sys/kernel/mm/ksm/pages_to_scan; echo 20 > /sys/kernel/mm/ksm/sleep_millisecs'
RemainAfterExit=yes

[Install]
WantedBy=multi-user.target

启用并启动:

systemctl daemon-reload
systemctl enable ksm-tune.service
systemctl start ksm-tune.service

长期避免OOM的避坑建议

只调KSM还不够,下面几项必须结合环境一起做:

  • 控制超配比例:同配置虚拟机数量多时,建议把总配置内存控制在物理内存的1.5倍以内,并预留20%给宿主机系统。
  • 给虚拟机设置内存上限:用 virsh memtune 限制硬上限,避免单台虚拟机吃光内存。
virsh memtune VM名称 --hard-limit 4G --live --config
  • 不要盲目调大 pages_to_scan:普通环境建议500-2000之间,超过5000可能造成CPU明显波动。
  • KSM只对内容完全相同的内存页有效:如果每台虚拟机都跑不同负载,合并收益很小,此时靠降低超配比例更可靠。
  • 定期检查OOM日志:内存问题往往不是一次性的,建议把 dmesg -T | grep -i oom 加入定时任务观察。

验证并确认调参效果

KSM合并了多少页,可以通过以下文件查看:

cat /sys/kernel/mm/ksm/pages_sharing
cat /sys/kernel/mm/ksm/pages_shared

pages_sharing 表示合并后节省的物理页数(每页4KB),如果这个数在持续增大,说明KSM正在生效。
内存占用变化再次用 free -h 观察。

保存调参后建议连续运行几天,期间执行 dmesg -T | grep -i oom,确认没有新增OOM记录。
如果虚拟机负载变化很大,再回到KSM参数上微调,不要追求一次成型。

如果你正在处理KVM宿主机内存OOM、虚拟机内存超配风险和KSM调参问题,建议先按以上步骤完整操作一遍,再根据实际负载调整参数;
遇到内存仍在上涨时,优先检查虚拟机内存配置和超配比例,不要只靠KSM兜底。

分享到:
上一篇
Linux KVM Zapscape虚拟机逃逸漏洞
下一篇
Nginx大量TIME_WAIT/CLOSE_WAIT
1
系统公告

机房迁移升级通知

尊敬的用户: IP 段 103.23.148.x、156.224.29.x 原香港一区线路波动、攻击频繁,平台定于 7 月 5 日凌晨分批迁移至香港 GIA 机房,硬件升级 AMD 铂金机型。 迁移均在凌晨操作,最大程度降低业务影响,迁移期间服务器临时关机; 升级后配置不降低、费用不涨价,数据默认同步迁移; 迁移后 IP 全部更换,请及时修改域名解析、防火墙白名单; 建议提前备份重要数据,有问题可联系在线客服。 感谢理解与支持! 泽御云科技 2026.06.30
服务中心
客服
在线客服
24小时为您服务
咨询
联系我们
联系我们,为您的业务提供专属服务。
24/7 技术支持
如果您遇到寻求进一步的帮助,请过工单与我们进行联系。
24/7 即时支持
泽御云
售前客服
泽御云
泽御云
售后客服
泽御云
技术支持
评价
您对当前页面的整体感受是否满意?
😞
非常不满意
😕
不满意
😐
一般
🙂
满意
😊
非常满意