linux技术文章
-
文章 · linux | 1星期前 | Linux · 性能监控 · 系统排查 · 资源压力 · Linux 性能排查 PSI Pressure Stall Information /proc/pressure
Linux load 高并不一定能说明业务正在等待什么资源。本文用 PSI(Pressure Stall Information)读取 /proc/pressure/cpu、memory、io,解释 some 与 full、avg10/avg60/avg300 的含义,并给出从判断压力类型到设置 poll 阈值的排查和告警方法。461 收藏 -
Linux 服务器的 swap 使用量升高,不等于内存已经泄漏或必须立刻关闭交换。本文用 vmstat 的 si/so、free 的可用内存、磁盘 I/O 和 /proc/sys/vm/swappiness 组成证据链,区分偶发换出、持续抖动与真实内存压力,并给出可回滚的处理顺序。458 收藏 -
文章 · linux | 1星期前 | oom · 内存 · Linux · 运维排查 · cgroup · Linux OOM cgroup v2 memory.events memory.current memory.max memory.high
Linux cgroup v2 出现内存告警时,不要只盯着 memory.current。本文用 memory.events、memory.events.local、memory.high 和 memory.max 组成证据链,区分回收压力、硬限额命中与 OOM,并给出可复查的命令顺序。456 收藏 -
Linux 批处理拖慢线上服务时,可以用 cgroup v2 的 io.max 对指定块设备做读写字节或 IOPS 限流,再用 io.stat 对比限流前后的服务时延。本文给出设备映射、配置、观测和安全回滚步骤。453 收藏 -
服务访问 /srv/app/data/config.yml 返回 Permission denied 时,ls -l 只看文件本身往往不够。本文用 namei -l 逐级检查路径权限、符号链接和父目录执行位,再给出不扩大权限面的修复与复查方法。453 收藏 -
文章 · linux | 1星期前 | Linux · psi · 服务治理 · system · 内存压力 · Linux PSI systemd-oomd ManagedOOMMemoryPressure oomctl
主机内存压力突然升高时,systemd-oomd 可以利用 PSI 在内核 OOM 之前处理低优先级服务。本文用 ManagedOOMMemoryPressure、ManagedOOMPreference 和 oomctl 组成一条可回滚的配置与验收路径,说明 systemd-oomd 的候选 cgroup、swap 前提和误杀边界。452 收藏 -
Linux 服务显示 active (running),应用却仍读取旧环境变量,常见原因不是程序没有重启,而是 EnvironmentFile 路径、变量格式、服务管理器缓存和实际进程环境不一致。本文按现场症状、配置加载、进程核对和回滚顺序拆解一次排查。450 收藏 -
用 udevadm 读取稳定属性,编写按序列号或 WWN 匹配的规则,验证规则优先级、热插拔事件和符号链接结果,避免把 /dev/sdX 当作永久设备名。450 收藏 -
Linux 局域网偶发断连不一定是交换机故障,也可能是内核邻居表达到阈值。本文用 ip neigh、统计文件和 gc_thresh 逐层确认原因,给出临时恢复、持久配置和回滚验收方法。450 收藏 -
rsync 复制后看到的文件时间不对,通常要先区分修改时间、访问时间和时区显示,再检查是否使用 --times 以及目标文件系统的时间精度。本文给出可复现的复制、核对和修复命令。446 收藏 -
文章 · linux | 1星期前 | Linux · 故障排查 · 文件系统 · inotify · 事件队列 · Linux inotify IN_Q_OVERFLOW max_queued_events 文件变更监听
从 IN_Q_OVERFLOW 这条证据入手,区分 inotify 事件队列溢出、watch 数量耗尽和应用消费过慢,再给出 max_queued_events、max_user_watches 的核对、修复与恢复流程。428 收藏 -
服务突然报 too many open files,先别急着把进程上限调大。本文从进程软硬上限、打开句柄类型和监听连接三个证据面定位文件描述符耗尽,再用一个可复测的恢复顺序判断问题是泄漏、突发流量还是配置边界。428 收藏 -
Linux 上的服务管理器反复重启,常见原因不是 Restart= 配错这么简单,而是进程真实退出原因、启动限流和 journal 时间窗没有对齐。本文从一个 api-worker.service 持续重启的场景出发,按服务状态、退出结果、启动限流和日志证据逐层核对,给出可回滚的修复顺序。428 收藏 -
一个服务只需要绑定低端口时,不必长期以 root 身份运行。本文用 Linux capabilities、setcap/getcap 和服务管理器的能力边界配置,做一条可复查的最小权限方案,并说明文件能力的边界与回滚方式。422 收藏 -
Linux 上看到默认路由并不等于应用一定会从这张网卡发包。本文用 ip route get 对照目的地址、源地址、fwmark 和实际连通性,定位策略路由与多出口主机的出站选择。421 收藏