Redis LATENCY DOCTOR 怎么判断延迟来源
来源:17golang原创
时间:2026-09-27 21:22:31 169浏览 收藏
LATENCY DOCTOR 不是读取“平均响应时间”的命令,而是分析 Redis 延迟监控器已经记录的事件。正确顺序是先设置阈值,让 Redis 按 command、fork、aof-write、expire-cycle 等事件分别保存尖峰,再用 LATEST 找事件、用 HISTORY 看时间分布,最后让 DOCTOR 汇总峰值次数、间隔和针对性建议。
官方文档:https://redis.io/docs/latest/operate/oss_and_stack/management/optimization/latency-monitor/
- 延迟监控默认关闭,
latency-monitor-threshold为 0 时不会积累事件。 - 阈值单位是毫秒,只记录超过业务可接受上限的尖峰。
- 每种事件有独立的 160 条时间序列,同一秒内多个尖峰只保留最大值。
DOCTOR给出人类可读建议,真正定位仍要回到对应事件的原始证据。
先设置一个有业务含义的阈值
阈值太高会漏掉用户已经感知的抖动,太低则会让每种事件都堆满样本。最小写法是把阈值设为业务能接受的服务端阻塞时间。例如接口要求 Redis 内部操作尽量不超过 100ms,可先记录达到或超过这个量级的事件:
# 查看当前阈值;返回 0 表示延迟监控未启用 redis-cli CONFIG GET latency-monitor-threshold # 以毫秒为单位记录超过 100ms 的服务端延迟事件 redis-cli CONFIG SET latency-monitor-threshold 100
这个阈值不是 SLA,也不是客户端总耗时。它决定哪些 Redis 内部代码路径会被当成延迟尖峰记录,因此要结合客户端 p95/p99 和业务超时线设置。
从事件名缩小延迟来源
先执行 LATENCY LATEST,它会返回已出现事件的最近时间、最近延迟和历史最大延迟。事件名本身就是第一层分类:command 指向常规命令执行,fast-command 指向本应较快的 O(1) 或 O(log N) 命令,fork 对应创建子进程,aof-* 指向 AOF 写入或同步,而 expire-cycle、eviction-cycle 与过期、内存淘汰相关。
# 列出所有已经记录到尖峰的事件及最近、最大延迟 redis-cli LATENCY LATEST # 针对 command 事件查看时间戳与毫秒值组成的历史样本 redis-cli LATENCY HISTORY command # 用 ASCII 图快速观察 command 事件的峰值形态 redis-cli LATENCY GRAPH command

时间序列最多保留 160 个元素,每个元素是 Unix 时间戳与毫秒延迟。同一事件在同一秒出现多次时只保留最大值,所以它适合看“尖峰何时集中出现”,不适合计算完整请求分布。
用 DOCTOR 读统计摘要,不直接照抄结论
LATENCY DOCTOR 会根据已有事件生成可读报告,可能包含尖峰次数、平均出现周期、中位偏差、历史最坏延迟,以及某些事件特有的信息。例如 fork 事件会给出与系统创建子进程相关的分析;command 事件通常会建议继续查看 Slow Log。
# 基于已经积累的事件生成诊断摘要和建议 redis-cli LATENCY DOCTOR # command 类事件出现时,用慢日志查看具体命令执行时间 redis-cli SLOWLOG GET 20
如果 DOCTOR 没有可分析内容,先检查阈值是否仍为 0,或观察窗口内是否真的出现过超过阈值的事件。它不是主动压测工具,也不会因为执行一次命令就回溯过去没有采集的数据。
把事件映射到下一份证据
| 事件 | 优先证据 | 常见方向 |
|---|---|---|
command | SLOWLOG GET、命令复杂度、键大小 | O(N) 命令、大对象删除或一次返回过多数据 |
fast-command | CPU、宿主机调度、事件历史 | 本应快速的命令仍阻塞,可能不是数据复杂度本身 |
fork | 持久化任务、内存规模、宿主机基线 | RDB/AOF 重写创建子进程耗时 |
aof-write / aof-* | 磁盘 I/O、fsync 策略、后台重写状态 | 写盘或同步等待 |
expire-cycle | 过期键分布、同一时刻集中到期情况 | 大量键在相近时间过期 |
eviction-cycle / eviction-del | 内存使用、maxmemory 策略、大键 | 内存压力下淘汰与删除开销 |

最关键的区别是:Slow Log 聚焦命令在 Redis 内部的执行时间,延迟监控还覆盖 fork、AOF、过期和淘汰等非普通命令路径。如果 command 没有尖峰而 fork 很突出,就不应继续只优化命令;如果所有服务端事件都平静,但客户端 p99 仍然很高,则应转向网络、连接池、排队和客户端运行时。
保留诊断窗口并避免三个误区
- 不要只执行
LATENCY DOCTOR:先用LATEST确认事件,再查看对应HISTORY。 - 不要用单个平均值代替尖峰:同一秒只保留最大样本,DOCTOR 描述的是已记录尖峰的统计特征。
- 不要立即
LATENCY RESET:重置会清空时间序列,先保存需要的事件历史和诊断报告。 - 不要把服务端事件当成端到端结论:客户端、代理、网络和连接池延迟需要独立指标。
# 修复完成并留存证据后,只重置已处理的 command 事件 redis-cli LATENCY RESET command # 重新观察时再次确认新样本是否出现 redis-cli LATENCY LATEST
LATENCY DOCTOR 和 SLOWLOG 应该先看哪个?
先看 LATEST 与 DOCTOR 判断是否属于 command 事件;若是,再用 Slow Log 找具体命令。若是 fork 或 aof-*,Slow Log 不是第一证据。
阈值应该设成 1ms 还是 100ms?
没有统一答案。它应接近业务能容忍的服务端阻塞上限,并避免低到持续产生噪声。先用业务 p99 和超时线定初值,再按样本密度调整。
DOCTOR 没报告是否代表 Redis 没有延迟?
不代表。可能是监控未启用、阈值过高、观察窗口没有样本,或延迟发生在 Redis 外部。要同时检查配置、事件历史与客户端指标。
-
244 收藏
-
177 收藏
-
313 收藏
-
411 收藏
-
193 收藏
-
222 收藏
-
109 收藏
-
369 收藏
-
422 收藏
-
116 收藏
-
108 收藏
-
461 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 立即学习 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 立即学习 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 立即学习 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 立即学习 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 立即学习 485次学习