Kubernetes v1.35 (Timbernetes):为什么本次发布生产与AI工作负荷的实际事项

2026年9月9日1 次浏览来源:Dev.to阅读原文

AI的工作量正在爆炸。

企业目前正在扩大数百个GPU的分布式培训,同时与平板排程和不断重启的Pod竞争。

AI基础设施的无情发展已经使Kubernetes变成了一个对任务至关重要的战场——在那里,零下调时间的缩放和可靠的帮派排队安排使得或打破了生产SLA.

Kubernetes v1.35 (Timbernetes) 提供准确的这一点。

这种放出舰只60个增强部分侧重于安全性,可伸缩性,并使用后遗症编码来强化现实世界的云土化操作.

重点很清楚:业务成熟。

从现场Pod再缩放到AI聚焦的日程安排和无情的贬值,这些功能直接解决了生产中SREs所面对的疼痛点.

如果你运行状态系统,分配AI工作,或者在Kubernetes上长期运行的服务,这是近年来最实用的发布之一.

Kubernetes v1.35 Production Game-Changers In-place Pod Resources CPU和内存缩放中的新内容现在是GA.

这对数据库,AI培训工作,以及无法容忍干扰的状态服务都是至关重要的.

你可以在交通高峰期间实时调用资源——不需要重新部署。

Pod Generation Track Stable和Pod中的字段,当kubelet应用了光谱变化时提供可靠的信号.

这对于监测就地调整规模的生产至关重要。

地形管理器 NUMA 增强 这个选项稳定了对8个NUMA节点以外的服务器的支持——解锁通常用于AI和HPC工作量的大型多GPU系统.

具有自动旋转功能的自建 mTLS 操作成熟度改进本地 Pod 证书可以消除外部证书管理器和侧车的需求.

这简化了零信任环境中的工作量特性。

StatefulSet"max Unceptable" 同步推出 StatefulSet 更新,同时使用数字或百分比,同时仍然保持可用 SLA.

在Pods内部运行作为根的容器,同时将容器映射到主机上的无特权用户——在多租户集群中,戏剧性地减少特权升级风险。

机会取舍 调度员使用排程签名批出相同的Pods,减少了AI大工作暴发期间的延迟.

原生存储版本移取存储版本移取现为树上,β并默认启用,通过去除外部工具依赖性来降低长寿命集群的升级风险.

AI 基础设施集团日程安排的未来 新的工作负荷API, 并且能够为分配的AI和HPC工作安排真正的全能或一无所有的时间表, 从而消除部分放置僵局, 集装箱一级重新开放政策 每个容器定义独立的重启规则。

侧行车故障不再引发Pod全面重启——ML管线的理想.

节点宣布的地物节点现在可以通过.

来广告能力,允许调度器自动避免不相容的放置.

扩展的容忍操作员 数字纹章比较可以使 SLA-aware 调度基于节点可靠性分数.

关键平台 突破变化 折旧和移除 改变影响 行动 要求 cgroup v1 移除 旧 Linux 节点失败 kubelet 启动 升级所有节点为 cgroup v2 容器 d v1.x 最后发布 支持 遗留的 CRI Migrate 到容器 2.0+ IPVS kube- proxy 折旧警告日志, nftables 建议 计划 nftables 迁移 NGINX Retired Best-efferent 支持到 2026 年3 月 这些贬值是蓄意的。

Kubernetes v1.35执行现代化,而不是推进遗留风险。

安全和身份增强 Kubernetes v1.35 引入了消除常见多租户脆弱性的生产级安全原始: 用户名空间 (Beta):在不重写应用程序的情况下降低特权级升级风险.

Kubelet Cached图像验证(Beta):甚至对缓存的图像执行图像拉权限——对共享的GPU集群至关重要.

基督教团结国际 键

分享