运维
已收录文章:43篇
-
Linux 主机磁盘告警不一定来自应用数据,journal 日志也可能持续增长。本文用 journalctl 核对实际占用,区分临时清理和长期保留策略,并给出清理后的复测方法。397 收藏
-
服务明明重启成功,配置却像没有生效?用 cat-config 展开主配置与 drop-in 的最终合并结果,再结合 cat、delta 和 daemon-reload 完成来源定位、修改验证与安全回滚。365 收藏
-
Kubernetes 官方页面显示 1.34 将于 2026 年 8 月 27 日进入维护模式、10 月 27 日结束生命周期。本文从版本偏差、补丁支持和升级门禁三个角度,给出一套在窗口期前核对集群的实用流程。363 收藏
-
Redis 设置了 EXPIRE,业务却发现旧缓存没有在整点消失,通常不是 TTL 失效,而是过期判定、删除时机和监控口径混在了一起。本文从过期键残留现场出发,拆解惰性删除与定期扫描的边界,给出可复查的命令、通知配置和生产处理建议。331 收藏
-
Linux 的 page cache 占用高不等于内存泄漏,本文从 free、top、slab 和回收验证入手,区分缓存、进程匿名内存与内核对象的边界。331 收藏
-
服务突然退出且日志只有 Killed,不要先盯着应用异常。用内核日志确认 OOM 受害进程,再区分主机内存压力与 cgroup 上限,最后通过峰值、限额和回归压测闭环。316 收藏
-
Go 服务把日志写到固定文件后,文件会持续变大,直接删除又可能让进程继续写入已删除文件。本文从一个小型 Go 日志服务开始,配置 logrotate 的轮转、保留、压缩和 copytruncate,再用状态文件与实际文件大小验证配置是否真的生效。310 收藏
-
Linux 文件监控收到 IN_Q_OVERFLOW,不只是把 max_queued_events 调大就结束了。本文从队列溢出的含义、内核参数、消费者处理速度和恢复流程入手,给出可核对的排查命令与重建监控状态的方法。305 收藏
-
日志归档不应只是一条 tar 命令。本文给出一个 Bash 最小脚本:固定来源路径、按天生成压缩包和 SHA-256 清单、校验后清理过期归档,并说明失败时如何保留原日志。297 收藏
-
非 root 进程绑定 80 端口,不只取决于 setcap 是否出现,还要核对内核低端口范围、文件能力、解释器启动方式和实际进程能力。本文用一组可复现命令把判断链串起来。295 收藏
-
Linux 的 load average 不只统计正在抢 CPU 的任务,也会计入等待 I/O 的不可中断任务。遇到负载高而 CPU 看似空闲时,先对齐 uptime、/proc/loadavg、vmstat 和进程状态,再确认具体等待点与磁盘或网络存储的时间关系,避免一上来扩容或杀进程。292 收藏
-
清理 MySQL 大表历史数据时,直接 DELETE 大范围记录容易造成锁等待和事务膨胀。本文用主键游标、固定批次、执行计划和可暂停的回滚窗口,搭出一套可观察的分批清理方案。273 收藏