linux技术文章
-
容器被杀掉时,单看宿主机 free -h 很容易误判。本文以 cgroups v2 为例,逐项核对 memory.current、memory.high、memory.max 和 memory.events,区分限流、硬上限与 OOM,并给出可复查的验证顺序。304 收藏 -
Linux 主机端口还没耗尽却偶发新连接超时,不能只盯着 ss 数量。本文从 conntrack 表使用率、网卡丢包计数和回收参数入手,拆出证据链、处理顺序与复测边界。301 收藏 -
非 root 进程绑定 80 端口,不只取决于 setcap 是否出现,还要核对内核低端口范围、文件能力、解释器启动方式和实际进程能力。本文用一组可复现命令把判断链串起来。295 收藏 -
Shell 脚本明明执行失败却返回 0,或者 set -e 没有按预期中断,常见原因是管道只返回最后一项的状态、条件命令被豁免,或脚本覆盖了前一个退出码。本文从日志检查脚本的故障现场出发,解释 set -e、set -o pipefail 和 PIPESTATUS 的适用边界,并给出可复查的修正方式。293 收藏 -
用 list-timers、status 和 journalctl 三步确认 Linux 定时器是否按时触发,并区分未到时间、服务失败与日志缺失。277 收藏 -
用 inotifywait 监控目录时,-e create、-m 和 --format 的组合决定了你收到的是新增事件还是一堆无关通知。本文以 /var/app/inbox 为例,拆开递归范围、重复事件和停止条件,给出可复查的过滤命令。262 收藏 -
文章 · linux | 5天前 | Linux · 运维排查 · 崩溃分析 · core dump · 调试回溯 · Linux GDB 崩溃排查 coredumpctl core dump 崩溃收集
Linux 服务崩溃后,先用 coredumpctl 确认现场是否被记录,再检查保留策略、权限和调试符号,最后导出 core 文件交给 gdb 回溯。本文给出一套可复查的命令顺序。256 收藏 -
Linux 用 tar 解包到已有目录时,默认行为可能覆盖同名文件。本文用 --keep-old-files 与 --skip-old-files 区分硬失败和跳过策略,再配合目标目录快照、返回码与抽样校验,建立可回退的解包流程。252 收藏 -
用 pidstat 对同一个进程做连续采样,结合 CPU 时间、I/O 延迟和上下文切换判断到底是计算繁忙还是资源等待,并给出复测与回滚边界。252 收藏 -
Linux 上用 tar 归档时,普通权限能恢复不代表 ACL 和扩展属性也在。本文给出保留 ACL、xattr 的打包与恢复命令,并用 getfacl、getfattr 做可复核验收。243 收藏 -
iptables 规则看起来正确,却可能因为链顺序或匹配条件没有命中。本文用 iptables -L 的 pkts、bytes 计数器核对真实流量,给出清零、复现、定位和回滚的最小排查流程。235 收藏 -
SSH 还没有进入密码或密钥认证就卡住时,先用 ssh -vvv 判断连接、密钥协商和认证分别停在哪一层,再结合 sshd 服务端日志做最小修改与复测。227 收藏 -
进程的 rchar、wchar 很大,不代表磁盘真的读写了同样多的数据。本文用 /proc/PID/io 拆开用户态读写、实际块设备读写和取消写入,给出一套可复查的 Linux I/O 排查方法。224 收藏 -
Linux 7.2 已进入主线发布阶段,但 mainline、stable 与长期支持版本承担的风险不同。本文按生产升级的判断顺序,说明如何核对版本来源、准备回滚、做最小验证,再决定是否采用。222 收藏 -
vmstat 输出里的 r 和 b 经常被误读成 CPU 使用率。本文从运行队列、不可中断睡眠和 load average 的关系入手,给出一套从现象到证据的 Linux 性能排查方法。222 收藏