运维排查
已收录文章:20篇
-
Linux 用 tar 解包到已有目录时,默认行为可能覆盖同名文件。本文用 --keep-old-files 与 --skip-old-files 区分硬失败和跳过策略,再配合目标目录快照、返回码与抽样校验,建立可回退的解包流程。252 收藏
-
同一条脚本在终端能正常显示,放进服务托管任务却出现乱码,通常不是脚本突然改了编码,而是 LANG、LC_ALL、LC_CTYPE 和服务环境不一致。本文按证据顺序核对 locale、服务属性和日志,给出稳妥的修复与回滚方法。345 收藏
-
tmpfs 挂载点明明还有空间,应用却可能报 No space left on device。本文按容量、inode 和内存回收三个维度,用 df、df -i、findmnt 与内核回收指标定位真正的限制,并给出可回滚的调整顺序。158 收藏
-
Redis 大 Key 不只是内存占用高,还可能放大删除阻塞、网络响应和主从复制压力。本文从识别、分级、拆分、清理与复查五个环节,给出一套可在生产灰度执行的治理方法。349 收藏
-
Linux 服务崩溃后,先用 coredumpctl 确认现场是否被记录,再检查保留策略、权限和调试符号,最后导出 core 文件交给 gdb 回溯。本文给出一套可复查的命令顺序。256 收藏
-
数据库 · Redis | 3星期前 | Redis · 缓存 · 运维排查 · redis TTL 过期事件 keyspace notification notify-keyspace-eventsRedis 监听过期事件时,最常见的问题不是订阅代码,而是 notify-keyspace-events 没有打开 K 或 E、x 标志选错,或者把过期时间归零误当成事件已经发出。本文从配置、频道、TTL 验收和可靠性边界逐步排查。477 收藏
-
数据库 · Redis | 1个月前 | Redis · 缓存 · 运维排查 · redis Pub/Sub Keyspace Notifications 过期通知 notify-keyspace-eventsRedis 的过期通知适合做观测和轻量联动,却不能天然当成可靠消息。本文从过期事件漏收现场出发,核对 notify-keyspace-events、订阅连接和 expired 事件边界,再用补偿扫描与幂等处理收住通知丢失风险。226 收藏
-
Linux 机器重启后服务迟迟不能用,先别盯着单个进程猜原因。本文用关键依赖链命令拆出启动耗时和真正的等待点,再结合服务状态与 journalctl 验证是服务本身慢、依赖未就绪,还是启动顺序配置造成的延迟。113 收藏
-
Linux 机器重启后服务迟迟不能用,先别盯着单个进程猜原因。本文用关键依赖链命令拆出启动耗时和真正的等待点,再结合服务状态与 journalctl 验证是服务本身慢、依赖未就绪,还是启动顺序配置造成的延迟。382 收藏
-
容器或 unshare 环境里的挂载偶尔会出现在宿主机,根因常是 mount propagation 而不是命名空间失效。本文用 findmnt、/proc/self/mountinfo 和三种传播类型复现 shared、slave、private 的差异,给出安全验证与回滚顺序。252 收藏
-
文章 · linux | 1个月前 | 内存 · Linux · 运维排查 · Linux OOM cgroup v2 memory.events memory.current memory.max memory.highLinux cgroup v2 出现内存告警时,不要只盯着 memory.current。本文用 memory.events、memory.events.local、memory.high 和 memory.max 组成证据链,区分回收压力、硬限额命中与 OOM,并给出可复查的命令顺序。456 收藏
-
Linux 服务管理器的 RuntimeMaxSec 可以给服务设置最长运行时间,但它不是普通的请求超时。本文用一次性数据同步服务说明如何配置运行时限、从服务状态命令和 journalctl 判断超时结果,并区分正常退出、失败重启与限时后的恢复边界。389 收藏