linux技术文章
-
非 root 进程绑定 80 端口,不只取决于 setcap 是否出现,还要核对内核低端口范围、文件能力、解释器启动方式和实际进程能力。本文用一组可复现命令把判断链串起来。295 收藏 -
Linux 服务器的 swap 使用量升高,不等于内存已经泄漏或必须立刻关闭交换。本文用 vmstat 的 si/so、free 的可用内存、磁盘 I/O 和 /proc/sys/vm/swappiness 组成证据链,区分偶发换出、持续抖动与真实内存压力,并给出可回滚的处理顺序。458 收藏 -
Linux 上的服务管理器反复重启,常见原因不是 Restart= 配错这么简单,而是进程真实退出原因、启动限流和 journal 时间窗没有对齐。本文从一个 api-worker.service 持续重启的场景出发,按服务状态、退出结果、启动限流和日志证据逐层核对,给出可回滚的修复顺序。428 收藏 -
服务突然报 too many open files,先别急着把进程上限调大。本文从进程软硬上限、打开句柄类型和监听连接三个证据面定位文件描述符耗尽,再用一个可复测的恢复顺序判断问题是泄漏、突发流量还是配置边界。428 收藏 -
tmpfs 挂载点明明还有空间,应用却可能报 No space left on device。本文按容量、inode 和内存回收三个维度,用 df、df -i、findmnt 与内核回收指标定位真正的限制,并给出可回滚的调整顺序。158 收藏 -
Linux 的 page cache 占用高不等于内存泄漏,本文从 free、top、slab 和回收验证入手,区分缓存、进程匿名内存与内核对象的边界。331 收藏 -
日志轮转后磁盘空间没有下降、旧日志文件仍在增长,常见原因是服务进程还握着旧文件句柄。本文用 copytruncate 与重新打开日志两条路径解释现象,给出安全配置、验证顺序和回滚判断。174 收藏 -
容器里的 DNS 偶发失败时,不要只反复改 nameserver。先核对 resolv.conf,再比较 getent 与 nslookup 的结果,最后用 ip route get 和 NSS 顺序确认请求到底走哪条路径,区分配置、路由和解析库问题。326 收藏 -
Linux 服务启动慢时,不要先盲目增加超时或删掉依赖。先用服务管理器的启动分析命令和 journalctl 对齐时间线,再区分依赖等待、网络就绪和进程自身初始化,最后用 After、Requires 与启动目标做最小修改和复测。484 收藏 -
单个服务文件句柄持续上涨时,不要只修改全局 limits.conf。用 prlimit 可以先查看并调整目标 PID 的 RLIMIT_NOFILE,再用服务管理器的 LimitNOFILE 和 /proc/PID/limits 做启动后验收,区分软上限、硬上限与实际打开数量。304 收藏 -
NFS 挂载目录突然卡住时,先用进程状态、挂载参数和服务端可达性判断阻塞位置,再区分 hard 与 soft 的风险边界,最后用小范围读写和恢复测试验收。115 收藏 -
文章 · linux | 3天前 | Linux · 运维排查 · 崩溃分析 · core dump · 调试回溯 · Linux GDB 崩溃排查 coredumpctl core dump 崩溃收集
Linux 服务崩溃后,先用 coredumpctl 确认现场是否被记录,再检查保留策略、权限和调试符号,最后导出 core 文件交给 gdb 回溯。本文给出一套可复查的命令顺序。256 收藏 -
Linux 上用 tar 归档时,普通权限能恢复不代表 ACL 和扩展属性也在。本文给出保留 ACL、xattr 的打包与恢复命令,并用 getfacl、getfattr 做可复核验收。243 收藏 -
Linux 文件监控收到 IN_Q_OVERFLOW,不只是把 max_queued_events 调大就结束了。本文从队列溢出的含义、内核参数、消费者处理速度和恢复流程入手,给出可核对的排查命令与重建监控状态的方法。305 收藏 -
Linux 主机磁盘告警不一定来自应用数据,journal 日志也可能持续增长。本文用 journalctl 核对实际占用,区分临时清理和长期保留策略,并给出清理后的复测方法。397 收藏