Kubernetes v1.37 Node Lifecycle Conditions 怎么读节点状态
来源:17golang原创
时间:2026-09-13 04:27:16 380浏览 收藏
Kubernetes v1.37 的 Node Lifecycle Conditions 解决的是“节点现在处于什么生命周期阶段”这个沟通问题。它新增了 DrainInProgress、Drained、MaintenancePlanned、MaintenanceInProgress 和 GracefulNodeShutdownInProgress 五个约定条件。
官方地址:https://kubernetes.io/
读节点状态时,先看.status.conditions中的type、status、reason和message;这些字段说明“发生了什么”,但不会自动完成cordon、drain或 taint。v1.37 仍要把观察信号和实际运维动作分开判断。
- 五个新条件描述排空、维护计划、维护进行中和优雅关机等生命周期事实。
True表示当前观察到状态,False表示未观察到,Unknown表示写入方无法判断。- 真正改变调度和驱逐行为的仍是
kubectl cordon、kubectl drain、taints 与 workload 控制器。
v1.37 的五个条件分别说明什么
过去,值班人员往往要把 Ready、taint、Pod 终止状态、标签和云厂商维护接口拼在一起,才能猜出节点是否正在下线。新条件提供了一个统一的 Node 状态位置,但它们首先是观察结果,不是新的调度指令。
| 条件 | 读到 True 时的含义 | 判断重点 |
|---|---|---|
DrainInProgress | 节点正在按管理员选定的标准排空 | 排空动作已经开始 |
Drained | 节点已经达到选定的排空标准 | 不能只看 Pod 数量,要看团队定义的标准 |
MaintenancePlanned | 未来预计会发生节点变更 | 这是计划信号,不代表维护已经开始 |
MaintenanceInProgress | 节点正在维护 | 可能是硬件、软件、修复或下线工作 |
GracefulNodeShutdownInProgress | 节点正在进行优雅关机 | 结合 kubelet 和工作负载状态继续判断 |

每个条件都有 status、reason 和 message。其中 reason 应保持稳定、适合机器读取,message 则补充人能看懂的细节。看到 Unknown 时,不要直接推断“节点坏了”,它只说明当前写入方不能确定状态。
用 kubectl 读出节点的完整条件
先用完整视图确认上下文,尤其要同时看 Ready、生命周期条件、节点是否被标记为不可调度,以及最近的心跳时间:
# 先看 Node 的完整状态,确认条件、不可调度标记和时间字段 kubectl describe node# 只列出条件类型、状态和稳定原因,便于值班记录或脚本读取 kubectl get node \ -o jsonpath='{range .status.conditions[*]}{.type}{"\t"}{.status}{"\t"}{.reason}{"\n"}{end}'
第一条命令适合人工判断,第二条命令适合看板或自动化采集。若结果中出现 MaintenancePlanned=True,它只能证明维护计划已被发布;还要结合维护窗口、授权写入方和 MaintenanceInProgress 判断是否已经动工。
传统条件也不能跳过:Ready=False 说明节点不健康或不接受 Pod,MemoryPressure、DiskPressure 和 PIDPressure 分别提示资源压力。它们回答的是健康和资源问题,与“是否计划维护”不是同一个维度。

为什么设置条件不等于节点已经排空
v1.37 的生命周期条件允许管理员或获得授权的控制器发布共同信号,但 Kubernetes 不替你定义独占写入、锁定或交接机制。生产集群应给每个条件指定唯一维护者,并约定状态结束时写 False 或删除条件,避免多个控制器互相覆盖。
| 你要完成的事情 | 继续使用的机制 | 生命周期条件的作用 |
|---|---|---|
| 停止普通调度 | kubectl cordon 或 .spec.unschedulable | 说明节点为什么进入这个阶段 |
| 安全驱逐 Pod | kubectl drain、PDB 和工作负载策略 | 报告排空是否正在进行或已达到标准 |
| 控制调度与驱逐 | taints、tolerations 和控制器策略 | 给看板、告警和外部运维系统提供统一上下文 |
因此,看到 DrainInProgress=True 后,仍要检查 Pod 是否按预期减少;看到 Drained=True 后,也要确认团队定义的排空标准,而不是把它简单等同于“节点上没有任何对象”。
升级到 v1.37 后的检查清单
- 先确认集群实际运行的 Kubernetes 版本,再按当前版本文档确认
NodeLifecycleConditions的特性门状态。v1.37 首次提供这组约定条件,文档和发布博客对早期能力边界的表述可能随补丁版本继续更新。 - 为每个生命周期条件登记写入方、
reason取值和清除规则,避免人工命令与自动化控制器同时改写。 - 把条件读取接入看板或值班记录,但告警动作仍以 Ready、taint、Pod 终止状态和 drain 结果为证据。
- 在灰度节点上验证“计划维护—开始维护—排空完成—维护结束”的状态变化,再推广到整组节点。
官方资料入口:https://kubernetes.io/blog/2026/09/09/kubernetes-v1-37-node-lifecycle-conditions/;https://kubernetes.io/docs/reference/node/node-lifecycle-conditions/。如果你的集群仍处在混合版本阶段,先以实际控制面和 kubelet 版本对应的文档为准。
常见问题
Node Lifecycle Conditions 会自动阻止 Pod 调度吗?
不会。它们是状态观察信号;阻止调度要继续使用 cordon、unschedulable 或 taints。
Drained=True 是否代表节点完全没有 Pod?
不一定。它代表管理员选定的排空标准已达到,标准可能允许 DaemonSet 或其他明确保留的对象存在。
看到 Unknown 应该立刻重启 kubelet 吗?
不应直接重启。先确认条件写入方、Node status 更新、Lease 和相关控制器日志,再判断是暂时无法观察还是节点本身异常。
-
501 收藏
-
501 收藏
-
501 收藏
-
501 收藏
-
501 收藏
-
120 收藏
-
科技周边 · 业界新闻 | 3小时前 | 云原生 · 监控 · prometheus · kubernetes · prometheus Kubernetes NativeHistograms 原生直方图122 收藏
-
407 收藏
-
484 收藏
-
194 收藏
-
科技周边 · 业界新闻 | 8小时前 | opentelemetry · 可观测性 · CNCF · 语义约定 · 指标日志链路 · OpenTelemetry毕业 OpenTelemetry语义约定 指标日志链路统一命名 Semantic Conventions 可观测性字段规范146 收藏
-
238 收藏
-
科技周边 · 业界新闻 | 10小时前 | 依赖管理 · gitHub actions · 业界新闻 · 持续集成 · 项目依赖 GitHub Actions runner images 镜像更新 CI兼容性152 收藏
-
351 收藏
-
487 收藏
-
457 收藏
-
301 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 立即学习 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 立即学习 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 立即学习 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 立即学习 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 立即学习 485次学习