登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  文章 >  linux

Linux vmstat 的 r 与 b 怎么看:运行队列、不可中断睡眠和负载误判

来源:17golang原创

时间:2026-08-25 19:39:04 222浏览 收藏

线上 Linux 主机突然变慢时,vmstat 1 往往比一眼看 CPU 百分比更快给出方向。重点不是某一行的数字有多大,而是把 rb、CPU 的 us/sy/wa 和内存交换列放在同一个时间窗口里看:r 高通常指向可运行任务排队,b 高则更像任务卡在不可中断等待,两者都可能让人误以为“CPU 不够”。

要点速览

  • r 是可运行任务数,不等于 CPU 使用率;要和逻辑 CPU 数量、us/sy 一起比较。
  • b 是阻塞在不可中断睡眠的任务数,常见关联是块设备、NFS 或其他内核 I/O 等待。
  • wa 高只能说明 CPU 在等 I/O,不能单凭这一列断定具体设备;还要用 iostat、进程状态和日志交叉验证。
  • 先保留一段连续样本,再按“运行队列、I/O 等待、内存回收”分支排查,避免直接改调度或缓存参数。

先把 vmstat 的三组证据分开

执行下面的命令保留 10 个采样点,第一行通常是自开机以来的平均值,排查现场时不要拿它和后面的瞬时值混看。

vmstat 1 10
nproc
uptime

重点看三处。procs.r 是等待运行或正在运行的任务数,procs.b 是处于不可中断睡眠的任务数;cpu.uscpu.sy 反映用户态、内核态时间,cpu.wa 反映等待 I/O 的时间。它们描述的是不同层次,不能把 r=8 直接翻译成“CPU 使用率 800%”。

vmstat 中运行队列 r 与阻塞队列 b 的 Linux 性能排查示意图
先区分可运行队列与不可中断等待,再决定看 CPU 还是 I/O 证据。

r 持续高:先比较逻辑 CPU,再看谁在排队

如果 r 连续多个采样点明显高于逻辑 CPU 数量,同时 ussy 接近饱和,方向通常是 CPU 争用。这里的“明显高”要结合服务基线,而不是套一个对所有机器都有效的固定阈值。4 核主机短时出现 r=5 未必是故障;如果 4 核主机连续几十秒保持 r=20,并且请求延迟同步上升,就值得继续定位。

nproc
ps -eo pid,stat,psr,pcpu,comm --sort=-pcpu | head -15
pidstat -u -p ALL 1 5

psr 可以帮助发现线程是否集中在少数 CPU 上,pidstat 则能把瞬时的高负载和具体进程对应起来。若只有一个进程的用户态 CPU 很高,优先检查该进程的请求量、线程数和最近配置变更;若内核态占比更高,再看系统调用、网络软中断或频繁上下文切换。

b 持续高:不要把它当成“磁盘满了”

b 高说明有任务在等待内核完成不可中断操作,常见方向包括本地块设备、网络文件系统和设备驱动。它不等同于磁盘容量不足,也不等同于所有 I/O 都慢。先找出这些任务,再判断它们等待的对象。

ps -eo pid,stat,wchan:32,comm,args | awk '$2 ~ /D/ {print}'
iostat -xz 1 5
df -hT

如果大量进程的状态包含 Dwchan 又集中在同一类等待点,配合 iostat 的设备利用率、平均等待时间和队列深度看。NFS 场景还要把挂载点、网络连通性和服务端日志放进证据链;不要因为 df -hT 显示空间充足,就排除远端存储故障。

Linux b 阻塞任务通过 D 状态与 iostat 交叉验证的示意图
b 高只是入口信号,D 状态、等待点和设备指标共同决定 I/O 分支是否成立。

r 和 b 同时高时,按时间线排除误判

两列同时升高并不意味着 CPU 和磁盘同时坏了。一个常见场景是 I/O 变慢后,大量请求线程先进入等待,超时和重试又制造更多可运行任务;另一个场景是 CPU 紧张导致 I/O 处理线程得不到调度,两个指标互相放大。

把采样输出和业务日志按秒对齐,重点问三个问题:高峰先出现的是 r 还是 bwa 是随 b 一起上升,还是 CPU 已经接近满载?恢复时哪一列先下降?这比只截一张 top 图片更容易找到因果顺序。

内存列只作第三条分支

如果 siso 持续非零,同时可用内存下降、回收活动增加,才把内存压力纳入主线。不要看到一次 si=1 就立即扩大 swap;短时换入换出可能只是后台任务的正常波动。

free -h
vmstat 1 10
cat /proc/pressure/memory

内存压力和 r/b 的关系要靠时间线确认:回收导致 I/O 变多时,b 可能随后升高;但这仍需要设备和进程证据支持。调整参数前先记录原值、变更时间和回滚命令。

常见问题

vmstat 的 r 等于 CPU 核心数就一定异常吗?

不一定。它表示可运行任务数量,短时等于或略高于逻辑 CPU 很常见。是否异常要看持续时间、业务延迟和 CPU 使用率。

b 为 0 是否代表磁盘没有问题?

不能。b 只反映采样时处于不可中断睡眠的任务数,瞬时 I/O 延迟、吞吐下降或单个请求变慢仍可能存在,应结合 iostat 和业务指标。

为什么 wa 高但 b 不高?

wa 是 CPU 时间分类,表示 CPU 有一部分时间在等待 I/O;b 是任务数量。少量任务也可能产生明显等待,二者不是同一个计数器。

排查时可以直接 kill D 状态进程吗?

通常不应把 kill 当成第一步。D 状态进程可能暂时无法响应信号,先确认挂载、设备或远端服务的根因,并评估强制重启带来的数据风险。

最小验收清单

一次完整判断至少保留:vmstat 1 10、逻辑 CPU 数量、异常进程状态、iostat -xz 1 5 和同时间段业务延迟。最后把结论写成可复核的一句话,例如“4 核主机 r 持续 18、us 92%,最高 CPU 进程为订单 worker,b 与 wa 未上升”,而不是笼统记录“Linux 负载高”。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>