英伟达提出的“AI Grid”愿景:通信企业是否应该买单?
在最近的GTC大会上,英伟达提出了一个名为“AI Grid”的战略愿景,旨在将全球电信网络重构为AI基础设施的一部分。
AI Grid 是一个由多个互联的AI基础设施节点组成的技术网络,涵盖AI工厂、区域接入点、核心机房、移动交换中心和基站站点。这些节点配备了完整的AI堆栈基础设施,并通过高带宽、低延迟和安全的网络连接,实现数据、模型、智能体和工作负载的高效流动。整个系统运行如同一个统一的分布式AI系统。
图源:英伟达官网
目前,包括T-Mobile US、Comcast 和 SoftBank 在内的多家电信运营商正在探索这一方向。英伟达强调,运营商现有的基础设施——如铁塔、光纤和频谱——使其具备天然优势,适合作为分布式推理平台的承载者。然而,问题在于,若这一愿景代表未来趋势,运营商是否应该现在就投入巨资建设分布式AI基础设施?
针对这一问题,ABI Research 发布了一份深入分析,为运营商梳理了AI Grid部署中的关键挑战。报告涵盖边缘GPU部署、网络延迟限制以及总体拥有成本(TCO),试图厘清这一愿景是否具备现实可行性,抑或只是对未来的昂贵押注。
延迟优化是否足够说服力?
在边缘部署GPU的一个核心论点是减少延迟。对于需要实时响应的应用而言,推理服务器距离终端设备越近,响应速度越高。
然而,ABI 的研究指出,对于当前主流的AI工作负载,这一优势并不显著。尤其是在生成式AI中,首字延迟(TTFT)才是影响用户体验的关键指标,而网络延迟并非主要瓶颈。DNS解析、隧道建立,以及计算密集型的预填充和解码阶段,其耗时远远超过网络传输的节省。
以1000个token的查询为例,预填充阶段就需约160毫秒,解码可能耗时数秒。这意味着,即便将推理服务器部署到离用户更近的位置,对于典型对话型AI的体验提升也微乎其微。
Latitude 首席执行官 Guilherme Soubihe 指出:“数据中心级GPU资源大多被用于大模型训练和微调,而这些工作对边缘部署的收益非常有限,因为它们对延迟并不敏感。”
尽管如此,AI Grid 在并发处理场景中仍展现出一定优势。英伟达在GTC上的演示显示,边缘部署可将聊天机器人的往返延迟从2000毫秒降低至400毫秒。Personal AI 创始人 Suman Kanuganti 认为,AI Grid 的优化目标并非单次请求的响应时间,而是大规模并发交互的质量保障。
在P99突发负载下,一个四节点AI Grid系统可将语音延迟控制在500毫秒以内,同时吞吐量提升80%。而集中式部署在同一负载下则可能出现性能下降。这意味着,边缘部署的价值在于支持海量并发交互,而非单个用户延迟的微小优化。
物理AI场景推动边缘部署的必然性
真正对延迟有刚性需求的领域是物理AI应用,例如自动驾驶、配送机器人、视频监控、AR/VR和智能眼镜。这些系统要求几乎实时的处理能力,云端推理难以满足。
ABI 举例指出,在100毫秒的延迟下,一辆以100公里/小时行驶的自动驾驶汽车将有2.8米的“盲区”。在安全关键型应用中,远程云端推理无法满足要求。
爱立信美洲思想领袖 Peter Linder 强调,边缘部署的驱动力应来自网络效率提升与未来商业潜力的结合。相比之下,Kanuganti 则认为,语音AI、视频智能和企业级AI服务已在当前市场中占据一席之地,若物理AI应用在未来几年内迅速崛起,基础设施建设就必须提前布局。
建设成本是否值得?
即便延迟优势和应用场景逐渐明确,AI Grid 的建设成本仍是一道难以逾越的门槛。ABI 的分析表明,在未来两到三年内,大规模边缘服务器部署在财务上并不可行。
基站部署尤其面临单位经济效益低的问题,每个站点服务的用户有限,覆盖范围狭窄,除了高价值区域外,大多数站点难以实现盈利。
以美国运营商T-Mobile为例,若为其约13,000个屋顶基站站点部署AI-RAN服务器(采用英伟达 ARC-1 服务器,单价6万美元,每台支持三个基站),预计到2035年完成部署,总投资成本将达到37亿美元。
图:T-Mobile US 在其所有屋顶站点逐步部署 GPU 服务器的年度总体拥有成本
若将投资分摊到九年,成本压力将有所缓解。尽管37亿美元对英伟达而言不算沉重,但对运营商和投资者来说,仍需一个稳固的商业模型来支撑。
此外,基础设施的现实问题也加剧了成本压力。Kanuganti 指出:“通信塔并非为高密度计算设备而设计。”这也解释了为何运营商更倾向于从具备冗余供电、冷却和安防措施的有线近边缘设施开始部署。
边缘部署的关键取决于硬件和架构革新
综合各方观点,远端边缘的可行性依赖于三个关键因素:硬件能效的提升、专为边缘AI优化的硬件形态,以及AI-RAN 架构的发展,使无线处理与AI推理共享计算平台。
ABI 预测,初期AI推理部署将集中于核心网络节点(通常一个国家少于10个),随后随着低延迟需求上升和成本下降,逐步扩展至基站层级。许多新兴应用——如视频监控、自动驾驶、配送机器人、AR/VR等——将使边缘计算成为系统设计的必然选择。
“AI Grid”究竟是机会还是泡沫?
英伟达提出AI Grid愿景,旨在通过统一的分布式AI架构,实现计算任务的智能调度,以优化成本、性能和用户体验。
在赋能实时AI应用方面,AI Grid 可通过边缘部署,将AI计算任务置于用户和设备附近,以满足对话助手、AR/VR、在线游戏和工业机器人等对延迟敏感场景的需求。
在大规模生成任务中,Token 数量可达到传统文本模型的100倍,显著增加网络传输成本。AI Grid 通过本地化部署,将此类高消耗任务置于最具成本效益的节点,降低带宽和数据出口成本。
在地理弹性和投资回报方面,AI Grid 可运行多种AI和网络工作负载,提升基础设施利用率,降低运营成本,并通过共享资源提升系统的容错性和可扩展性。
数据主权和合规性方面,AI Grid 允许用户控制模型和数据的运行位置,使其符合不同地区的法规要求。
从上述分析来看,英伟达正在构建一个将电信运营商置于AI基础设施核心的叙事框架。但不可忽视的是,这一战略对英伟达而言意味着设备销售、软件授权和生态绑定的多重收益,而对于运营商,回报的确定性远未清晰。
在“AI超级周期”的浪潮中,先行者或许更多是在为未来布局,但数十亿美元的资本投入是否值得,仍需时间给出答案。
参考资料:ABI on AI infra | AI grid may be the next telecoms arms race (Analyst Angle)——RCRWirelessNvidia’s AI grid and the telco dilemma——RCRWirelessWhat Is an AI Grid?——英伟达官网英伟达的电信雄心:重塑2万亿美元网络产业——C114通信网黄仁勋的物理AI野望:将5G网络转变为分布式AI计算机!——物联网智库