运维排查
已收录文章:24篇
-
本文整理一套 Linux 文件句柄耗尽排查工作流,从 too many open files 报错、进程 fd 数量、系统限制、服务单元限制到回归验证,帮助你把临时止血和长期修复串起来。482 收藏
-
数据库 · Redis | 3星期前 | Redis · 缓存 · 运维排查 · redis TTL 过期事件 keyspace notification notify-keyspace-eventsRedis 监听过期事件时,最常见的问题不是订阅代码,而是 notify-keyspace-events 没有打开 K 或 E、x 标志选错,或者把过期时间归零误当成事件已经发出。本文从配置、频道、TTL 验收和可靠性边界逐步排查。477 收藏
-
Linux 服务管理器的 RuntimeMaxSec 可以给服务设置最长运行时间,但它不是普通的请求超时。本文用一次性数据同步服务说明如何配置运行时限、从服务状态命令和 journalctl 判断超时结果,并区分正常退出、失败重启与限时后的恢复边界。474 收藏
-
Linux 上 df 显示磁盘满了,但 du 找不到大文件,常见原因是文件已经被删除却仍被进程占用。排查时先确认挂载点,再对比 df 和 du,最后用 lsof +L1 找 deleted 文件和 PID,按服务重启、日志切割或释放句柄恢复空间。470 收藏
-
文章 · linux | 1个月前 | 内存 · Linux · 运维排查 · Linux OOM cgroup v2 memory.events memory.current memory.max memory.highLinux cgroup v2 出现内存告警时,不要只盯着 memory.current。本文用 memory.events、memory.events.local、memory.high 和 memory.max 组成证据链,区分回收压力、硬限额命中与 OOM,并给出可复查的命令顺序。456 收藏
-
Linux 开机慢时,不要只盯着启动分析工具的耗时排名第一行。本文从总启动时间、并行单元耗时、关键依赖链和网络等待四个角度,给出一套可复查的定位与调整路径。442 收藏
-
普通用户能找到命令,sudo 后却提示 command not found,多半是 sudo 使用了更受限的 PATH 或 secure_path。先用 command -v 找真实路径,再用 sudo -V、visudo 和绝对路径验证。440 收藏
-
本文从 crontab 定时任务没有按时运行的现象出发,按触发记录、PATH、工作目录、权限、日志和并发锁逐步排查,给出一套可复查的修复写法。422 收藏
-
Linux 服务管理器的 RuntimeMaxSec 可以给服务设置最长运行时间,但它不是普通的请求超时。本文用一次性数据同步服务说明如何配置运行时限、从服务状态命令和 journalctl 判断超时结果,并区分正常退出、失败重启与限时后的恢复边界。389 收藏
-
Linux 机器重启后服务迟迟不能用,先别盯着单个进程猜原因。本文用关键依赖链命令拆出启动耗时和真正的等待点,再结合服务状态与 journalctl 验证是服务本身慢、依赖未就绪,还是启动顺序配置造成的延迟。382 收藏
-
本文从页面突然出现 Nginx 502 Bad Gateway 的现场出发,带你按错误日志、upstream、应用端口、反向代理配置和服务状态逐步定位,并给出修复与复查清单。369 收藏
-
Redis 大 Key 不只是内存占用高,还可能放大删除阻塞、网络响应和主从复制压力。本文从识别、分级、拆分、清理与复查五个环节,给出一套可在生产灰度执行的治理方法。349 收藏