登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  科技周边 >  业界新闻

Google Cloud Next 2026 的第八代 TPU 面向哪些 AI 工作负载

来源:17golang原创

时间:2026-09-08 04:04:44 358浏览 收藏

Google Cloud Next 2026 公布的第八代 TPU 不是一颗“全面替代旧硬件”的通用芯片,而是把训练和推理拆成了两条更明确的路线:TPU 8t 面向大规模、计算密集型训练,TPU 8i 面向低延迟推理和多智能体协作。团队选型时,先看工作负载,再看型号。

如果项目主要在训练更大的模型、追求集群吞吐和扩展能力,应重点关注 TPU 8t;如果项目已经进入在线服务,需要大量短链路推理、模型协作和稳定延迟,则 TPU 8i 更匹配。两者都计划在 2026 年晚些时候普遍可用,当前更适合做兼容性和指标准备。
要点速览
  • TPU 8t 的核心方向是训练吞吐、共享内存和超大规模集群。
  • TPU 8i 的核心方向是推理延迟、内存带宽和多智能体协作。
  • Google 公布的性能数字属于官方口径,落地前仍要用自己的模型和请求分布验证。

TPU 8t 和 TPU 8i 的分工,先看工作负载而不是型号

Google 的发布说明把两颗芯片放在同一个 AI Hypercomputer 体系中,但它们的优化目标不同。TPU 8t 提高计算吞吐、共享内存和芯片间带宽,服务对象是大模型训练、模型开发和需要持续扩展的训练集群。TPU 8i 则把重点放在内存带宽、片上 SRAM 和低延迟通信,适合模型已经上线后,多个智能体反复推理、规划和调用工具的场景。

TPU 8t 大规模训练集群与 TPU 8i 低延迟推理服务的工作负载分工示意图
图1:第八代 TPU 用两条专用路径承接训练与推理,选型首先看工作负载。
判断维度更偏向 TPU 8t更偏向 TPU 8i
主要任务训练、微调、模型开发在线推理、智能体协作
关键指标吞吐、扩展、goodput延迟、带宽、性能/成本
典型瓶颈计算量、参数规模、集群通信KV cache、请求抖动、交互等待

TPU 8t 适合哪些训练型 AI 项目

需要训练超大模型,或者训练过程经常被集群扩展、数据搬运和故障恢复拖慢的团队,可以把 TPU 8t 放进候选清单。Google 公布的方案支持单个 superpod 扩展到 9,600 颗芯片、2 PB 共享高带宽内存,并给出了 121 ExaFlops 和相较上一代接近 3 倍 pod 计算性能等数字。这些数字说明它的目标是规模化训练,不等于每个模型都能得到同样收益。

更值得关注的是 goodput:公告把目标放在超过 97% 的有效生产计算时间,并提到遥测、故障链路重路由和无需人工介入的硬件重配置。对训练团队来说,减少一次长时间停顿可能比单次峰值 FLOPS 更有价值。评估时应记录检查点恢复、数据输入等待和有效训练时间,而不是只比较理论算力。

TPU 8i 解决的是推理链路里的等待

多智能体应用会把一次用户请求拆成多轮推理、规划和工具调用,任何一段等待都会被放大。TPU 8i 通过更高内存带宽、384 MB 片上 SRAM、面向 MoE 的互联设计以及集合通信加速,试图减少模型权重、KV cache 和跨芯片协作带来的停顿。Google 公布的结果包括相较上一代最高 80% 的性能/美元提升,但仍应理解为官方测试口径。

这类硬件更适合在线问答、智能客服、代码代理和需要多个专用 agent 协同的服务。判断是否值得迁移时,先画出请求链路:首 token 延迟、完整响应时间、并发峰值、上下文长度和工具调用次数,至少要分开记录。只看平均吞吐,很容易掩盖尾延迟。

开发团队现在该怎样评估第八代 TPU

第八代 TPU 的适配重点不只在芯片。官方说明列出了 JAX、MaxText、PyTorch、SGLang 和 vLLM 等软件栈,并提供 bare metal 访问。现有项目可以按下面的顺序做预评估:

  1. 框架:确认训练脚本、模型并行和推理引擎是否落在已支持的路径上,先找出自定义算子。
  2. 通信:记录参数同步、MoE 路由和 KV cache 交换占用的时间,判断瓶颈是在计算还是互联。
  3. 服务:分别测首 token、尾延迟、吞吐和并发,不要用离线 batch 结果代表在线体验。
  4. 成本:用每个训练步、每百万 token 或每次完整任务的成本比较,而不是只看芯片报价。
  5. 时间:普遍可用前,把数据管线、检查点格式、监控和回滚方案准备好,避免上线时才开始迁移。
评估第八代 TPU 时核对框架通信延迟成本和可用时间的原创说明图
图2:评估第八代 TPU 时,把框架、通信、延迟、成本和可用时间一起核对。

相关问题

TPU 8t 能不能做推理?

可以。官方明确表示两颗芯片都能运行多种工作负载,只是 TPU 8t 的主要优化方向是大规模训练,在线低延迟推理应重点比较 TPU 8i 的指标。

现在是否应该立即迁移到第八代 TPU?

如果产品还没有稳定的模型、请求分布和成本基线,不建议只因发布消息迁移。先完成框架兼容、链路指标和回滚设计,再等待实际可用条件更稳妥。

这些性能数字能直接和 GPU 对比吗?

不能直接横比。公告数字有明确的硬件、软件、模型和测试条件,团队应使用自己的模型规模、并发和数据管线做同口径测试。

官方资料

产品背景可参考 Google Cloud Next ’26 总览TPU 8t 与 TPU 8i 发布说明第八代 TPU 技术说明。实际采用前,还需要以 Google Cloud 后续公布的可用区域、产品规格和价格为准。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>