训练一次大模型要耗多少电?本文拆解 AI 能耗的完整构成——训练、推理与数据中心基础设施,介绍业界常见的效率改进方向与衡量指标,并讨论总量难以简单估算的原因,以及普通人如何理解这些数字。

核心要点

  • AI 能耗来自芯片、数据中心制冷与电力传输等多个环节
  • 推理阶段长期累计的用电量,可能超过单次训练
  • 效率提升与用能增长同时发生,净效应难以简单判断

电都花在哪了

谈 AI 的能耗,最容易想到的是训练大模型时成千上万块加速卡日夜运转。但完整账目不止于此:数据中心里服务器之外还有制冷、供电转换与备用电源等开销,通常用电源使用效率(PUE)来衡量这部分占比。此外还有芯片制造、设备更新与数据中心建设所消耗的隐含能源。

另一个常被忽略的部分是推理。单次推理的耗电远小于训练,但一个被广泛使用的服务每天要响应海量请求,长期累计的用电量可能相当可观。随着 AI 功能被嵌入搜索、办公、图像等高频应用,推理侧在总能耗中的比重被普遍认为会持续上升。

怎么衡量,数字怎么说

公开的估算通常依赖若干假设,比如模型参数量、训练时长、硬件能效与数据中心的碳强度,因此不同来源给出的数字差异较大,很难直接比较。研究者因此呼吁披露更细的测量口径,包括总用电量、用水量与所用电力来源,而不是只给出一个笼统的估算值。

需要客观指出的是,关于 AI 整体能耗占全球用电比例的说法,各方估计并不一致,且统计口径差异明显。较为稳妥的表述是:AI 相关用电增长较快,是数据中心用电增长的重要因素之一,但具体规模的量化仍存在不确定性,不宜引用未经核实的单一数字。

在做什么改进

改进沿三条路径展开。硬件层面,新一代加速卡在单位功耗下的算力持续提升,液冷等散热方案降低了制冷开销。算法与工程层面,模型压缩、量化、蒸馏与更高效的注意力实现,都在用更少的计算资源达到接近的效果,一些稀疏结构也减少了单次推理的激活量。

第三是运营层面,包括选择低碳电力、把训练安排在电网负荷较低的时段、回收余热用于供暖,以及提高服务器利用率。需要说明的是,效率提升与用量增长往往同时发生:单位算力更省电了,但应用场景变多又推高了总量,因此净效应不能简单判断。

常见问题

我用一次 AI 聊天,会消耗很多电吗?

单次请求的耗电量很小,通常远低于日常家电的一次使用。真正的总量来自海量请求的累计,以及数据中心的整体运行。对普通人来说,更有意义的是了解这项服务的整体用能情况,而不是为一次提问感到焦虑。

本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。