Google为什么不用GPU跑AI?深度拆解TPU诞生背后的“算账逻辑”和系统野心
摘要本文深入解析Google自研TPU张量处理器的完整历程从2011年Google Brain项目启动、2013年算力经济账的算起到TPU v1到Ironwood、TPU 8t/8i的代际演进。文章揭示TPU并非为了挑战GPU而是围绕AI Workload进行专用计算与系统级优化的战略选择并探讨其对今天大模型时代AI芯片、算力基础设施和TCO的深刻启示。今天谈AI算力GPU几乎是绕不开的话题。但一个有意思的问题是既然GPU已经能够很好地运行AIGoogle为什么十几年前还要投入大量资源自己研发TPUTensor Processing Unit张量处理器这背后其实是一笔关于AI算力成本、数据中心功耗与规模化效率的长期账。要理解TPU的起源得先回到Google与机器学习、深度学习的发展历史。本文将从Google的算力困境出发梳理TPU从一颗专用芯片走向完整AI计算系统的演进路径并分析其对今天AI芯片产业和大模型算力基础设施的启示。一、Google为什么做TPU先从一笔“算力账”说起2000年代机器学习已经逐渐成为Google核心业务背后的重要技术。从搜索排序、在线广告到图像识别、语音识别和翻译随着Google业务规模不断扩大机器学习开始进入越来越多的产品。真正改变Google算力需求的是随后兴起的深度学习Deep Learning。2011年前后Google Brain项目启动。Andrew Ng、Jeff Dean等人在Google内部推动大规模深度学习研究。他们想验证一个当时还相当激进的问题如果把神经网络、数据规模和计算规模同时放大会发生什么很快他们发现效果确实会变好。2012年Google Brain团队利用约1.6万个CPU核心训练了一个大规模神经网络并通过大量YouTube视频数据进行无监督学习。后来广为人知的“猫脸识别”实验让外界直观地看到当数据、模型和计算规模同时扩大神经网络可以学习出过去很难通过人工规则定义的特征。但更重要的变化发生在实验室之外。深度学习开始进入Google的真实业务。语音识别就是其中最典型的场景之一。模型效果越来越好但另一个问题也越来越突出AI效果上去了算力账单也跟着上去了。2013年前后Google内部算了那笔后来被反复提及的“经济账”。如果数亿用户每天只使用3分钟语音搜索而背后的语音识别全面采用深度神经网络仅新增的计算需求就可能让Google需要大幅扩张数据中心基础设施。这件事改变了Google看待AI的方式。此前深度学习更多还是一个模型问题怎么让模型效果更好但当AI真正进入Search、Voice、Translate等亿级用户产品之后它同时变成了一个基础设施问题这么大的AI Workload到底应该用什么计算架构来承载如果只是偶尔跑几个模型直接使用CPU或GPU当然最方便。但Google面对的已经不是“偶尔运行AI”而是数以亿计的用户持续触发大量结构相似的神经网络计算。深度神经网络中存在大量重复的矩阵乘法和张量计算Tensor Computation。于是Google开始思考既然未来大量AI Workload都在反复执行这些计算为什么不直接为它们设计一颗专用芯片TPUTensor Processing Unit张量处理器的故事由此开始。Google研发TPU最初并不是为了“挑战GPU”。它面对的是一个更现实的问题如何在有限的数据中心空间、功耗和成本预算里支撑快速增长的AI计算需求所以从一开始TPU算的就是一笔基础设施经济账。不是因为CPU和GPU不能跑AI而是当AI Workload大到Google这个规模以后“能不能跑”已经不是最重要的问题“能不能高效、经济地规模化运行”才是。二、TPU要解决的如何让AI算得更有效率如果一颗芯片从一开始就不是为了“什么都能算”而是为了高效运行神经网络它还能不能重新设计TPU的答案是可以。这也是理解TPU和专用AI芯片的一条重要逻辑不是追求所有任务都能做而是在目标Workload足够明确的情况下把最重要的任务做得更高效。因此理解TPU不能只看“峰值算力有多高”。更应该看的是面对真实AI模型有多少理论算力最终能够转化成有效算力而这件事很快就不再只与芯片有关。数据怎么流动、内存怎么访问、芯片之间怎么通信、软件如何把模型映射到硬件……都会影响最终效率。这也推动TPU从一颗专用AI芯片逐渐走向一套完整的AI计算系统。三、从TPU v1到今天从Chip走向SystemGoogle在2013年前后正式启动TPU项目。2015年第一代TPUTPU v1已经开始在Google内部投入使用主要承担搜索、语音、翻译等业务中的神经网络推理。v1首先验证了一件事当AI Workload足够大、计算模式相对稳定时围绕特定计算设计专用芯片这条路是可以跑通的。但Google很快遇到了下一个问题推理可以高效运行了越来越复杂的模型怎么训练2017年第二代TPUTPU v2面世。v2不仅把TPU从推理扩展到了训练还有一个更值得关注的变化Google开始从集群的角度设计TPU。与TPU v2同时出现的还有TPU Pod。Google通过定制高速互联将64个第二代TPU设备连接起来组成一套可以共同训练大型机器学习模型的系统整体算力达到11.5 PFLOPS。当时Google直接把它称为一台“机器学习超级计算机”。从这里开始Google面对的问题逐渐从“一颗芯片怎么把AI算得更快”。变成“怎么让很多颗芯片像一台机器一样高效完成一个更大的AI任务”此后的TPU基本延续了这条路线。我们正好也来看下谷歌TPU的代际变化。Google TPU代际核心矛盾解决方案标志进展TPU v12015深度学习推理规模迅速增长数据中心算力/功耗成本压力上升面向神经网络矩阵乘法设计专用ASIC聚焦推理效率支撑搜索、翻译等亿级业务TPU v2 (2017)模型没法训练单颗芯片能力不足引入训练能力 Pod互联64颗TPU设备组成约11.5 PFLOPS的机器学习超级计算机TPU从Chip走向SystemTPU v3 (2018)模型持续变大训练计算密度和散热压力进一步提高提升计算性能并强化Pod级扩展与液冷能力TPU Pod成为更成熟的大规模训练基础设施Cloud TPU开始更广泛开放给外部开发者TPU v42021大模型进入数十亿/万亿参数时代系统扩展效率和芯间通信成为关键瓶颈4096颗芯片组成Pod引入自研光路交换OCS等高速互联技术单个TPU v4系统进入ExaFLOPS级ML计算系统扩展性能相比v3出现大幅跃升互联正式成为TPU核心竞争力之一TPU v5e2023生成式AI不仅要训练更要低成本规模化推理客户开始更关注TCO针对训练推理做更高性价比设计支持灵活Pod/VM形态相较v4LLM训练和推理的**Performance/$**明显提升TPU开始从“性能优先”走向“性能经济性”TPU v5p2023百亿/千亿参数模型训练规模进一步放大单个Pod需要承载更大的模型和更高带宽8,960颗芯片更高带宽ICI3D Torus互联并强化HBM单Pod达到8,960颗芯片成为当时Google最强、最可扩展TPUAI Hypercomputer体系同步推出Trillium2024基础模型训练与推理同时增长能效、HBM和互联继续成为约束大幅提高单芯片性能翻倍HBM容量/带宽和ICI带宽并强化SparseCore单芯片峰值性能较v5e提升4.7倍能效提高67%可通过Multislice扩展到数万颗芯片进一步走向building-scale supercomputerIronwood2025AI从训练进一步走向大规模推理、Reasoning和RL推理基础设施成为新瓶颈面向训练、推理和Reasoning做系统级优化强化液冷、HBM和超大规模Pod单Pod9,216颗芯片、42.5 ExaFLOPSGoogle开始更明确把TPU定位为大规模AI推理/Reasoning基础设施TPU 8t / 8i同一种TPU难以同时把超大规模预训练和低时延推理都做到最优Agent时代Workload进一步分化首次采用两种不同架构8t专攻训练8i专攻推理/后训练/RL8t单Superpod可扩展到9,600颗TPU、约2PB共享HBM8i单Pod 1,152颗强调低延迟和Performance。所以从v1到今天TPU的演进并不只是Chip越来越快。更像是先围绕AI Workload造了一颗专用芯片然后又围绕它逐渐造出了一台越来越大的“AI计算机”。演进路线Chip → Memory → Interconnect → Network → Software → ClusterAI算力的竞争单位也由单颗Chip逐渐走向整个System。四、Google的TPU故事对今天意味着什么如果只把TPU理解成Google的一款自研AI芯片其实会错过这个故事更值得关注的部分。过去十多年TPU的演进实际上对应着AI计算问题的一次次变化最开始要解决的是有没有足够的算力后来要解决一颗芯片能不能算得更高效模型继续扩大又变成成百上千颗芯片能不能高效协同到了今天问题进一步变成整个计算系统能不能以更低的成本持续提供更多有效算力所以今天讨论AI芯片只比较单颗芯片的峰值FLOPS已经越来越不够。芯片效率、HBM、互联、集群扩展、软件栈、能耗乃至TCO最终都会影响真实AI Workload的运行效率。而大模型又把这个问题进一步放大了。模型越来越大、Token数量越来越多、集群规模越来越大训练和推理正在成为一笔越来越昂贵的基础设施账单。于是整个行业又开始面对Google十多年前曾经面对过的那个问题当一种AI Workload足够庞大我们究竟应该一直让Workload适应已有的计算架构还是让计算架构开始围绕Workload重新设计这也是TPU故事今天依然值得研究的原因。它并不是一个突然出现、为了“替代GPU”而存在的概念。它背后代表的是另一种计算思路当Workload规模足够大围绕Workload进行专用计算和系统级优化的价值就会越来越高。十多年前Google因为搜索、语音、翻译等业务开始计算这笔账。今天大模型让更多公司重新开始计算这笔账。Google只是更早开始的人。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →