
谷歌的AI产品覆盖其内部系统与云服务双线布局。目前,谷歌数据中心处理的AI Token数量已是去年同期的七倍。为跟上这一增速,谷歌正在加快数据中心软硬件技术的升级迭代,并计划投入800亿美元用于新建数据中心。
Network World就此采访了谷歌AI与计算业务副总裁兼总经理马克·洛迈尔(Mark Lohmeyer),探讨谷歌基础设施如何应对AI需求的快速增长。
基础设施需求的核心转变
Network World:基础设施需求最核心的变化是什么?
马克·洛迈尔:我们看到智能体及智能体化应用场景正在快速崛起。几年前,主流模式是对话阶段——提问、得到答案。现在我们已进入智能体时代:用户表达意图后,智能体会派生出多个子智能体,并行运作、保持状态。这对基础设施提出了根本性的新要求——要快、要划算、要安全、要可靠。我们正在构建专为智能体时代优化的基础设施。
基础设施建设目标与成本控制
Network World:基础设施扩建的目标是什么?客户在成本方面能期待什么?
马克·洛迈尔:最终目标是让客户以规模化、具有成本竞争力的方式使用前沿能力和模型。引入智能体后,推理事务量相比非智能体负载增加了50到100倍。我们正在以指数级速度压低单次事务的成本。在最新平台上,相同工作量的成本降低了近一半。客户可以用相同的费用服务两倍的用户,直接提升盈利能力。
能源效率的提升策略
Network World:你们如何应对能源效率问题?
马克·洛迈尔:能源是关键资源,谷歌在这方面已深耕多年。我们在数据中心和计算硬件的设计上持续优化PUE(电源使用效率)。液体冷却技术是我们五年前就已引入的,最新系统全部采用液冷方案。面对智能体负载,CPU的作用愈发突出——负责智能体编排、工具调用以及强化学习中的评估循环。我们最新推出的基于Axion架构的N4A CPU平台,在能效表现上显著优于上一代产品及同类x86方案。
Token效率的构建逻辑
Network World:在系统建设中,你们如何看待Token效率?
马克·洛迈尔:性能和效率的提升,源于模型与基础设施的协同设计。Gemini在TPU上完成训练,主要也在TPU上进行推理服务,具备强大的前沿模型能力,同时在Token消耗和成本控制上表现出色。这一切来自贯穿整个技术栈的协同设计。
如何提前规划基础设施需求
Network World:你们如何预测未来数年的基础设施需求?
马克·洛迈尔:硬件更新周期大约每年一代,但设计周期往往需要提前两年以上启动。我们打通了从DeepMind核心研究、应用团队模型落地、数十亿用户需求,到我们团队基础设施建设的完整链条。我们提前与DeepMind和应用团队对齐,了解技术走向。智能体在外部还没被广泛讨论时,内部已经洞察到其所需的能力。这些洞察直接体现在硬件设计中。我们把握住了时间节点——这些平台正是为智能体而生。
第八代TPU平台
Network World:第八代TPU平台有哪些突破?
马克·洛迈尔:我们每年都会推出新平台,而几年前发布的平台至今利用率接近100%,足见市场对AI优化计算的旺盛需求。第八代TPU是首个同时提供两套完整系统的平台——从芯片到网络、存储直至软件,实现全栈优化。
其中,TPU-8t专为训练优化,TPU-8i专为推理优化。TPU-8i将芯片上的SRAM提升至384MB,是上一代的三倍,HBM也增加了50%。
GPU与TPU的兼容策略
Network World:你们如何处理GPU与TPU的兼容问题?
马克·洛迈尔:在单个集群内,GPU和TPU不会混合使用。我们根据具体负载需求提供两种选择。在TPU侧,我们持续投入,使客户熟悉的GPU软件框架也能在TPU上运行,例如PyTorch和vLLM。客户可以同时维护GPU和TPU资源池,在统一的vLLM层上运行工作负载。任务从TPU启动,若TPU资源池满载,可自动溢出至GPU,反之亦然。这一切得益于两者共享同一兼容软件层。
智能体时代的编排平台演进
Network World:智能体的编排平台发生了哪些变化?
马克·洛迈尔:Kubernetes正在成为AI编排的主流平台。谷歌正在将GKE(Google Kubernetes Engine)打造成原生支持智能体的编排方案。当用户向智能体表达意图,智能体派生出多个子智能体时,TPU或GPU算力必须迅速拉起,避免长时间等待,任务完成后再快速释放。我们正在对GKE各层进行优化:大幅压缩节点启动时间,加快容器的启停速度。Lovable正是基于GKE实现了这一能力——在其平台上为实时编程会话并行启动数百个沙箱,做到按需付费。
网络与存储基础设施的角色
Network World:网络和存储基础设施在其中扮演什么角色?
马克·洛迈尔:网络对AI至关重要。这需要构建大规模GPU或TPU集群,并确保它们之间的高性能通信。为此我们创建了Virgo网络——一种折叠式网络架构,在数据中心内实现无阻塞,多个Pod或NVLink72域可互联互通。
在TPU-8t中,借助Virgo可将超过一百万个TPU连接在一起,形成大规模、高性能、高可靠的集群,加速创新迭代。存储同样不可忽视。在大规模集群中,故障随时可能发生,能够创建快照并回滚至检查点至关重要。
我们推出了Managed Lustre 10T,提供每秒10TB的带宽,单集群支持18PB存储容量,速度比去年提升10倍,比竞争对手快20倍。此外,我们还推出了Rapid Bucket——基于谷歌存储系统的低延迟存储服务。两者在大规模训练环境中均发挥着重要作用。
KV缓存策略:训练与推理的差异
Network World:训练与推理在KV缓存策略上有何不同?
马克·洛迈尔:TPU-8i将片上SRAM提升至384MB,是上一代的三倍,HBM也增加了50%。将KV缓存直接存储在芯片内存中,可以以更快的速度、更低的成本响应推理请求,无需依赖外部系统。对于推理负载而言,尽可能多地将KV缓存保留在片上是关键所在。
我们还引入了一套专用KV缓存存储子系统,可同时跨GPU和TPU工作。随着KV缓存规模不断扩大,能够回落至这一专用子系统变得愈发重要。此外,在加速器频繁切换模型的动态推理环境中,快速加载模型权重同样是重中之重。
Q&A
Q1:谷歌第八代TPU平台TPU-8i和TPU-8t有什么区别?
A:TPU-8t专为模型训练优化,TPU-8i则专为推理优化。TPU-8i将片上SRAM提升至384MB,是上一代的三倍,HBM容量也增加了50%,能更快速、更低成本地响应推理请求。这是谷歌首个同时提供两套从芯片到网络、存储全栈优化完整系统的TPU平台。
Q2:谷歌Virgo网络是什么,有什么作用?
A:Virgo是谷歌为大规模AI集群设计的一种折叠式网络架构,在数据中心内实现无阻塞通信,支持多个Pod或NVLink72域互联。借助Virgo,TPU-8t平台可将超过一百万个TPU连接在一起,构建大规模、高性能、高可靠的训练集群,有效缩短创新迭代周期。
Q3:谷歌如何在GPU和TPU之间实现兼容和灵活调度?
A:谷歌通过统一的软件兼容层(支持PyTorch、vLLM等框架)实现GPU与TPU的互通。客户可同时维护两种资源池,工作负载默认在TPU上运行,若TPU资源耗尽则自动溢出至GPU,反之亦然,从而实现灵活调度、提高资源利用率。
同创优配提示:文章来自网络,不代表本站观点。