Nvidia主导AI计算,但Google、Meta、Amazon以及其他超大规模云服务商正越来越多地为自身AI工作负载打造专用处理器。
关键差别在于专门化。
Nvidia的GPU旨在处理范围广泛的加速计算任务;而定制AI加速器则可以去掉公司不需要的能力,把更多硅片面积、内存带宽和功耗分配给更窄的一组计算。
Google的TPU架构展示了这种做法。TPU 8t面向大规模模型训练,而TPU 8i则针对推理进行了优化,在每美元性能上优于Google上一代推理产品。
Nvidia在灵活性上占优
Nvidia的优势远不止芯片原始性能。
它的GPU既能训练前沿模型,也能运行推理、支持科学计算,还能处理数据中心建成时甚至还不存在的新工作负载。
这种灵活性很重要,因为AI软件变化很快。拥有数千套Nvidia系统的云服务商,可以随着需求变化重新分配这些GPU,而不会被锁定在某一种狭窄工作负载上。
Nvidia还拥有CUDA、网络产品以及成熟的开发者生态系统。这些软件优势让GPU更容易在不同模型和客户之间部署。
这也是为什么即便在开发自有芯片的公司,仍然会购买Nvidia硬件。即便是Google的基础设施,也是在TPU之外同时搭配Nvidia GPU,而不是把其中一种视为另一种的完全替代品。
我们的AI芯片股票解读文章展示了,即使替代性硅片不断扩张,Nvidia仍然居于核心地位。
当规模让效率更重要时,定制芯片会胜出
当同一工作负载被执行数百万次甚至数十亿次时,经济性就会改变。
推理是最典型的例子。如果Google知道Gemini请求将如何被处理,它就可以围绕这些计算优化硬件,而不是为自己很少使用的灵活性付费。
这可以降低功耗和每次查询成本,同时提高利用率。
Meta也采取类似策略,使用MTIA;Amazon则为其云基础设施开发Trainium和Inferentia。
这也是为什么Broadcom和Nvidia都能从AI支出增长中受益。Nvidia提供灵活的加速器,而Broadcom帮助超大规模云服务商设计针对特定工作负载优化的芯片。
超大规模云服务商仍然需要外部芯片专家
设计定制加速器并不意味着把每个组件都内部制造。
云公司通常会与Broadcom和Marvell等专家合作,处理物理设计、网络、接口和生产。
Marvell与Google扩大后的合作关系涵盖定制推理加速器、网络控制器,以及连接到Google TPU生态系统的近存计算。
这也解释了为什么AI基础设施交易的范围会超出GPU制造商本身。
定制芯片不太可能完全取代Nvidia
更可能出现的结果是混合架构。
一家公司可能用Nvidia GPU训练大模型,用自有加速器处理高频推理,并使用独立定制芯片处理网络或内存搬运。
定制芯片通过在工作负载可预测时变得更便宜、更高效来竞争;Nvidia则通过在几乎所有场景中都保持有用来竞争。
随着AI基础设施支出增长,这两种路径更可能同时扩张,而不是一种完全消灭另一种。










