新闻里常说的算力到底指什么?本文从 CPU 的串行处理讲起,解释并行计算为什么能支撑 AI,介绍智算中心的构成,并说明为什么互联与存储同样是决定效率的瓶颈,以及算力通常如何被交付使用。
核心要点
- 算力是对计算能力的综合度量,不只是芯片数量
- AI 依赖大规模并行计算,而非单个核心跑得更快
- 智算中心的关键往往在互联、存储与散热等配套
从一个人干活到一群人协作
CPU 擅长处理逻辑复杂、分支繁多的任务,像一位能力全面的工程师,能把一件复杂的事从头到尾处理清楚。但深度学习的核心运算是把大量数字做重复性的乘加,这类工作不需要复杂判断,只需要在极短时间内完成海量重复动作,更适合交给成千上万个简单单元一起做。
这就是并行计算的思路:与其让一个核心跑得更快,不如让许多核心同时工作。AI 训练之所以高度依赖并行,是因为模型参数与训练数据规模庞大,单卡往往需要数周甚至更久。把任务拆分到成百上千张加速卡上协同完成,才使大规模训练在可行时间内完成。
算力不只看芯片
把算力等同于有多少张卡是常见的误解。完整的能力由几部分共同决定:单卡的算力与其利用率、卡之间的互联带宽、存储系统能否及时供给数据、集群调度能否把任务合理分配,以及散热供电能否支撑长时间满载运行。任何一环成为短板,整体效率都会下降。
这也解释了为什么大规模训练强调有效算力,即真正被用在计算上的比例。卡越多,卡间通信与同步的开销越大,故障概率也越高,因此集群需要检查点保存与任务恢复机制。衡量一个集群好不好用,实际跑通一个完整训练任务所需的时间,往往比理论峰值更有说服力。
智算中心在做什么
智算中心可以理解为专门为 AI 负载设计的数据中心集群。除了大量加速卡服务器,它还包括高速互联网络、分布式存储、制冷与供电系统,以及调度平台与开发工具。近年来液冷、余热回收、就近接入低碳电力等做法被越来越多地采用,用于应对高密度机柜带来的散热与能耗压力。
对使用者来说,智算中心通常以算力服务的形式提供:按卡时或按任务计费,配套训练框架与环境。理解这一点有助于看清产业分工——有的机构负责建设与运营,有的负责模型研发,有的负责把能力包装成应用。算力本身是一种基础设施,而非最终产品。
常见问题
为什么大家都在说算力不够用?
因为需求增长速度很快:模型规模、用户量与应用场景同时扩张,而芯片产能、数据中心建设周期与电力配套都需要时间。此外,算力并非均匀可用,高端加速卡与高速互联资源更紧张。这是产业扩张期的常见现象,具体紧张程度随时间变化。
本文为 AI 科普内容,仅用于知识普及,不构成任何技术选型、投资或职业决策建议。