运维排查
已收录文章:15篇
-
数据库 · Redis | 1个月前 | Redis · 缓存 · 运维排查 · redis TTL 过期事件 keyspace notification notify-keyspace-eventsRedis 监听过期事件时,最常见的问题不是订阅代码,而是 notify-keyspace-events 没有打开 K 或 E、x 标志选错,或者把过期时间归零误当成事件已经发出。本文从配置、频道、TTL 验收和可靠性边界逐步排查。477 收藏
-
Linux 服务管理器的 RuntimeMaxSec 可以给服务设置最长运行时间,但它不是普通的请求超时。本文用一次性数据同步服务说明如何配置运行时限、从服务状态命令和 journalctl 判断超时结果,并区分正常退出、失败重启与限时后的恢复边界。474 收藏
-
文章 · linux | 1个月前 | 内存 · Linux · 运维排查 · Linux OOM cgroup v2 memory.events memory.current memory.max memory.highLinux cgroup v2 出现内存告警时,不要只盯着 memory.current。本文用 memory.events、memory.events.local、memory.high 和 memory.max 组成证据链,区分回收压力、硬限额命中与 OOM,并给出可复查的命令顺序。456 收藏
-
Linux 开机慢时,不要只盯着启动分析工具的耗时排名第一行。本文从总启动时间、并行单元耗时、关键依赖链和网络等待四个角度,给出一套可复查的定位与调整路径。442 收藏
-
Linux 服务管理器的 RuntimeMaxSec 可以给服务设置最长运行时间,但它不是普通的请求超时。本文用一次性数据同步服务说明如何配置运行时限、从服务状态命令和 journalctl 判断超时结果,并区分正常退出、失败重启与限时后的恢复边界。389 收藏
-
Linux 机器重启后服务迟迟不能用,先别盯着单个进程猜原因。本文用关键依赖链命令拆出启动耗时和真正的等待点,再结合服务状态与 journalctl 验证是服务本身慢、依赖未就绪,还是启动顺序配置造成的延迟。382 收藏
-
Redis 大 Key 不只是内存占用高,还可能放大删除阻塞、网络响应和主从复制压力。本文从识别、分级、拆分、清理与复查五个环节,给出一套可在生产灰度执行的治理方法。349 收藏
-
同一条脚本在终端能正常显示,放进服务托管任务却出现乱码,通常不是脚本突然改了编码,而是 LANG、LC_ALL、LC_CTYPE 和服务环境不一致。本文按证据顺序核对 locale、服务属性和日志,给出稳妥的修复与回滚方法。345 收藏
-
Linux 临时目录里能创建文件却删除失败,通常要区分文件自身权限、父目录写入权限和 sticky bit 规则。本文用 /tmp 与专用工作目录说明 stat、namei、umask 和 tmpfiles.d 的检查顺序。331 收藏
-
Linux 服务崩溃后,先用 coredumpctl 确认现场是否被记录,再检查保留策略、权限和调试符号,最后导出 core 文件交给 gdb 回溯。本文给出一套可复查的命令顺序。256 收藏
-
容器或 unshare 环境里的挂载偶尔会出现在宿主机,根因常是 mount propagation 而不是命名空间失效。本文用 findmnt、/proc/self/mountinfo 和三种传播类型复现 shared、slave、private 的差异,给出安全验证与回滚顺序。252 收藏
-
Linux 用 tar 解包到已有目录时,默认行为可能覆盖同名文件。本文用 --keep-old-files 与 --skip-old-files 区分硬失败和跳过策略,再配合目标目录快照、返回码与抽样校验,建立可回退的解包流程。252 收藏