“边缘”已不再仅仅是延迟的问题
人工智能工作负载正在重塑 边缘数据中心 这种需求在五年前是我们始料未及的。过去很简单:在用户附近放置一个小型机柜,降低延迟,就搞定了。但如今,随着人工智能推理在边缘端的应用,局面已经发生了变化。 您不再只是提供缓存视频或物联网遥测数据,而是在用户所在的位置,直接运行那些需要强大计算能力、高功率和高效散热的模型。.



以典型的AI推理节点为例。单台GPU服务器功耗可达10–20千瓦,而一整排这样的服务器轻松就能达到30–50千瓦。相比之下,传统边缘机架的功耗仅为5–10千瓦。这意味着功耗密度提高了五倍,而且这一趋势不会逆转。 随着模型规模不断扩大、功能日益强大,边缘设施面临的压力只会与日俱增。.
究竟是什么在推动需求?
人们很想把一切都归咎于ChatGPT。但实际情况远不止于此。边缘端的AI工作负载可分为三类,每类都有其独特的需求。.
- 实时推理:自动驾驶汽车、工业机器人、AR/VR。这些应用需要单个位数的毫秒级响应时间,因此计算节点必须部署在接近实际操作的位置。.
- 数据预处理:原始传感器数据在发送至中央云端之前,会经过过滤、压缩和标注。这一过程计算量大且对带宽需求高,但通常以突发方式进行。.
- 联邦学习:模型更新在边缘设备或小型集群上进行本地训练,然后将结果发回云端。这虽然分散了计算负载,但仍需要稳定的供电和散热。.
实际上,如今大多数边缘节点主要负责推理和预处理。训练工作仍主要在超大规模数据中心进行,但这一情况也开始发生变化。一些公司正在针对专用模型尝试'边缘训练',这将进一步推高功耗上限。.
功耗与散热:真正的瓶颈
简而言之,功率密度已成为新的竞争焦点。过去,标准的边缘数据中心可能按每机架5千瓦进行设计。如今,每机架20至30千瓦已成为基本标准,而某些针对人工智能优化的机架功率甚至超过50千瓦。这将彻底改变下游的各个环节:配电、UPS选型以及 制冷量.
我们来快速算一笔账。一个20 kW的机架在240V单相电源下大约会消耗83安培的电流。对于典型的边缘供电系统来说,这已经是个不小的负担。 您可能需要三相供电、更高额定值的断路器,以及能够应对 GPU 启动时涌流的 UPS。此外,别忘了散热问题。当每机架功耗超过 15–20 kW 时,风冷就难以胜任了。您需要考虑液冷方案,或者至少要配备后门式热交换器。.
温度也很重要。GPU 运行时会发热,如果温度过高,就会降频。 通常将进气温度控制在18–27°C(64–80°F)之间,但需要处理热通道排气,其温度可能达到40°C甚至更高。这需要散发大量热量,尤其是在占地面积较小的机房中。.
冗余与正常运行时间:新的计算方式
冗余功能过去在边缘计算中只是锦上添花。但当人工智能工作负载需要进行实时决策时——例如用于自动驾驶班车或远程手术机器人——系统停机就不仅仅是不便那么简单了。 更是极其危险的。因此,我们在边缘设备设计中正见证着从“N+1”向“2N”的转变,特别是在供电和散热方面。.
话虽如此,你不能简单地复制一种超大规模设计并将其缩小。边缘站点受空间限制,而且往往位于电网供电不太可靠的地区。 在人口稠密的城市地区,甚至可能无法安装发电机。因此,最终只能采用电池备份的UPS系统,其供电时间约为15至30分钟,如果空间允许,还会配备一台快速启动的发电机。.
| 参数 | 传统优势 | AI-Edge Now |
|---|---|---|
| 机架密度 | 5–10 千瓦 | 20–50 千瓦 |
| 冷却方法 | 空气,CRAC | 纯软件或混合型 |
| 动力传动 | 单相 | 三相 |
| 冗余 | N+1 | 2N 或 2N+1 |
| 典型PUE值 | 1.3–1.5 | 1.1–1.2(带液冷) |
这种PUE的改善值得注意。液体冷却不仅能应对更高的密度,而且效率更高。PUE可以降至1.1甚至更低,这不仅能降低运营成本,还有助于实现可持续发展目标。但这也会增加系统复杂性:需要铺设管道、安装冷却液分配单元,并配备泄漏检测装置。.
选址越来越难了
这不仅仅关乎建筑内部的供电和散热问题。外部的电网同样至关重要。边缘端的AI工作负载需要更多的电力,而这些电力必须从某处获取。在许多地区,电网已经不堪重负。我曾见过一些项目仅仅因为等待电力设施升级,就被推迟了好几个月。.
值得关注的是:当地公用事业容量、可再生能源的可用性,甚至站点的物理安全。边缘站点通常位于安全性较低的地点——如零售店、移动通信基站、停车场等。您需要考虑物理安全、消防和监控等问题,同时还要确保占地面积尽可能小。.
这对您的下一次部署意味着什么
如果您计划将 AI 工作负载部署到边缘,请从功耗预算入手。 不要仅仅根据当前的 GPU 来确定规模——还要考虑下一代产品。一个 20 kW 的机架目前可能还够用,但当下一代 GPU 的功耗翻倍时又该如何应对?在电气设计中预留余量,并考虑采用模块化方案以实现弹性扩展。.
散热是另一个重要方面。如果每机架功耗超过 15 kW,就该开始考虑液冷方案了。这其实并没有听起来那么可怕,而且能切实提升能效。VERHI 提供可应对高密度边缘计算环境的精密空调和散热解决方案,其中包括将风冷与液冷相结合的混合系统。.
最后,从项目启动之初就要考虑冗余设计。在初期就构建2N容量的系统,比日后进行改造更为经济。此外,别忘了不间断电源(UPS)——AI工作负载对电源质量非常敏感,因此您需要一台能够承受该负载并提供纯净、稳定电源的UPS。.
结论
AI 工作负载不仅在增加边缘数据中心的需求,更从根本上改变了边缘站点的外观。更高密度、更大功耗、更强散热以及更高冗余度。这既是一项挑战,也是一种机遇。 只要设计得当,您就能提供延迟仅为个位数毫秒、高可用性且效率合理的AI服务。.
作为一个行业,我们仍在不断学习。但有一点是明确的:边缘计算已不再是可有可无的次要考虑因素。它是人工智能基础设施中至关重要的一环,理应像任何超大规模数据中心一样,得到同样严谨的工程设计。.
常见问题解答
对于运行人工智能工作负载的边缘数据中心而言,最大的挑战是什么?
功率密度是最大的挑战。AI服务器的功耗远高于传统的边缘设备,通常每机架为20至50千瓦。这需要升级电力基础设施、更强大的冷却系统,并且通常需要三相电源,而许多现有的边缘站点在设计时并未考虑到这些需求。.
液冷技术如何助力边缘端的AI工作负载?
与风冷相比,液冷能更高效地应对更高的热密度。即使每机架功耗高达50千瓦,它也能将GPU温度控制在安全范围内,并且通常能将PUE降至约1.1-1.2,从而降低能源成本并减少对环境的影响。.
在人工智能边缘数据中心中,我应该规划什么样的冗余级别?
对于关键的AI工作负载,2N冗余正变得越来越普遍。这意味着需要两套独立的供电路径和冷却系统。虽然成本更高,但停机造成的损失——尤其是对于实时AI应用而言——往往要高得多。.
现有的边缘站点能否升级以支持人工智能工作负载?
Sometimes, but it depends on the existing infrastructure. If you have enough power capacity and space, you can add cooling and upgrade the UPS. But if the site is limited to single-phase power or has low ceiling height, a retrofit might not be feasible. It's often easier to build new.
How does VERHI support AI edge data centers?
VERHI provides precision air conditioning, UPS power supplies, and micro-module data center solutions designed for high-density edge environments. We can help you plan a scalable, efficient cooling and power architecture that meets the demands of AI workloads.
Planning an AI edge deployment? Talk to VERHI about power and cooling solutions that can handle the density.
