液冷式冷卻:2026 年機房散熱革命

液冷式冷卻:2026 年機房散熱革命

液冷式冷卻:2026 年機房散熱革命

過去二十年,機房散熱主戰場一直是「把冷空氣吹到機櫃前、把熱空氣從後門排走」。這套風冷在 6–15 kW 的傳統機櫃上運作良好,但當 NVIDIA H100、B200 的單晶片 TDP 衝上 700W 甚至 1000W,機櫃密度從 15 kW 攀升到 50–140 kW 時,空氣的物理極限就到了底——空氣熱導率約 0.024 W/m·K,水約 0.6 W/m·K,相差 23 倍。風冷已不是「能不能做好」,而是「物理上撐不撐得住」。

正因如此,液冷在 2026 年已從「高端選項」變成「高功率密度機櫃的標準配備」。Google 如今已跨出 1 GW 液冷規模、遍布約 20 座機房,機架可用性約 99.999%;Microsoft 的 Fairwater 採用閉環液冷、每機櫃 140 kW;Meta 的 Catalina Pod 以「氣輔助液冷」把 GB200 塞進既有機房。對台灣企業而言:機房若要承接 AI 訓練與高算力推理,散熱規劃必須現在就重新計算。

三種液冷技術比較

液冷並非單一技術,而是依機櫃密度而分的光譜。主流有三種路線:

1. 機櫃後門換熱器(Rear-Door Heat Exchanger,RDHx)

RDHx 是在既有機櫃後門加裝水冷冷排,伺服器排出的熱氣先被冷排吸收再進入機房,伺服器仍以內部風扇運轉,液冷只「輔助」而非「取代」風冷。好處是改造門檻最低——不需修改伺服器與機櫃,適合現有機房把密度從 15–20 kW 提升到 25–35 kW。散熱上限約 20–35 kW/機櫃,PUE 改善約 0.1–0.2,是現有機房升級的橋樑技術,但撐不住 50 kW 以上的 GPU 集群。

2. 直達晶片冷板(Direct-to-Chip,DTC / DLC)

DTC 是把微通道冷板直接裝在 CPU/GPU 晶片上,由 CDU(冷卻液分配單元)將 75% 去離子水+25% 乙二醇循環送入機架,經快插接頭與分液箱連接。它能移除機櫃 70–90% 的熱量,把冷卻「源頭」從機房風扇負載大幅削減,典型 PUE 落在 1.10–1.25,是 50–100 kW 機櫃(H100、B200 集群)的主流方案。Google 的 Project Deschutes CDU 與 Microsoft 的 HXU 開放規格皆屬此類。改造中等——需液冷 ready 的伺服器與機櫃管路,但可分階段、逐機櫃推進。

3. 浸沒式冷卻(Immersion Cooling)

浸沒式把整支伺服器或 GPU 機架完全浸入不導電的介電液中,熱量由液體直接帶走,PUE 可壓到 1.02–1.10,搭配乾式冷卻器幾乎零耗水。單相浸沒支援 100–150 kW/機櫃當量,兩相浸沒(液體在晶片表面沸騰、罐頂冷凝回流)可達 150–250+ kW/機櫃,PUE 低至 1.01–1.03。但浸沒式需把機櫃重新設計為浸沒槽、伺服器無轉動硬碟、介面須耐液體,介電液成本高、維護需將元件提出液體瀝乾約 30 分鐘,較適合新建機房或極高密度 HPC。Meta 已表示近期不採用浸沒式,原因即在于此。

真實部署案例:超大規模機房如何落地液冷

Google:1 GW 液冷、99.999% 機架可用性。Google 自 2018 年 TPU v3 導入液冷,历经四代至 Ironwood,如今已跨出 1 GW 液冷規模、遍布約 20 座機房,機架可用性長期約 99.999%。關鍵是機架內置冗餘 CDU(Project Deschutes,泵與熱交換器皆備援、以 UPS 供電),把機架液冷迴路與機房迴路隔離,並將第五代規格貢獻給 OCP 推動標準化。Google 機房整艦(fleet)的 PUE 持續落在 1.09 左右(2025 TTM)。

Microsoft Fairwater:閉環液冷、每機櫃 140 kW、近零耗水。2025 年 Wisconsin 的 Fairwater 是 Microsoft 迄今最大、最複雜的 AI 資料中心,315 英畝、三棟建築,內部以單一平面網路串接數十萬顆 NVIDIA GB200 GPU。散熱採閉環液冷:冷液直接進入伺服器機架,熱液抽出到機房外的冷卻鰭片(172 台 20 呎風扇)冷卻後回流,全程零蒸發、近零耗水。每機櫃約 140 kW、每機列約 1,360 kW。自 2024 年 8 月起,所有新機房設計全面採用此晶片級冷卻。Microsoft 在 Nature 的 lifecycle 研究亦指出:把風冷換成冷板(DTC)可在全生命週期減少約 15% 的能耗與溫室氣體、並減少 30–50% 的耗水。

Meta Catalina Pod:氣輔助液冷把 GB200 塞進既有機房。Meta 的 Catalina AI 系統以 NVIDIA GB200 NVL72 為基礎,改用 NVL36×2 配置並符合 Open Rack v3。關鍵是兩側的大型 ALC(Air-Assisted Liquid Cooling)裝置,讓 Meta 能把液冷、高功率機架部署進「既有的」美國與全球機房。機櫃配備 RMC 持續監測漏液、洩漏時自動關閥。Meta 已棄用浸沒式與「瀑布式」冷卻實驗,轉向更可規模化的 DTC,並稱新一代機房設計較舊設計「便宜 31%、建設時間縮短一半」。

這三案的共同經驗:液冷不是單點設備採購,而是 CDU 冗餘設計、冷卻液品質管理、漏液偵測與機房既有架構整合的一整套工程。PUE 從 1.5 降到 1.1 並非「換台冷卻機」就能達成,而是 CDU 規格、管路規劃、冷卻液循環與熱排拒系統共同作用的结果。

建置要點:洩漏偵測、冷卻液選擇與維護

液冷把「水」帶進機櫃,也帶來新的風險面。Uptime Institute 資料顯示,「水與液體侵入」長期位列全球非计划停機(unplanned outage)的根因前五,2022 年 60% 的停機成本超過 10 萬美元、超過百萬美元的停機比例從 11% 升至 15%。ASHRAE TC 9.9 與 OCP 都已把「冷卻液品質監測+自動漏液偵測」列為 DTC 部署的基線要求,而非可選加分項。實務上須注意:

  • 漏液偵測:在每個快插接頭、CDU 底緣、管路接點部署點式感測器,並以纜線式感測覆蓋機架內與機架上方;訊號接進 BMS/DCIM,設計成「即時自動警報」而非定期目視。OCP 建議把漏液偵測納入機架冷卻架構本身,ASHRAE 2024《冷板部署韌性指引》強調偵測後要維持熱慣性與主動冗餘,讓系統在回應期間仍可持续運轉。
  • 冷卻液選擇:DTC 常用 75% 去離子水+25% 乙二醇(PG25),需監測 pH(低於 7.5 即為警訊)、電導率與污染度;浸沒式則使用介電液——單相多為礦物油/酯類(每升約 NT$ 數千),兩相則為氟碳(PFAS,每升成本高 3–5 倍,且受 EU/US 法規監管,2030 年前後恐收緊)。Dow 等業者已推出「染成螢光黃」的 DOWFROST LC,方便快速定位漏點。冷卻液劣化會直接降低換熱效率、推高能耗,屬於「效能也是成本」的項目。
  • 維護與冷卻液管理:「灌滿就忘了」是最大誤區。需定期測試、過濾、化學投加與污染控制;ASHRAE 指出冷卻液清潔度是 DTC 可靠運行的關鍵要求,輕微品質問題就可能引發熱節流、設備劣化與非计划停機。Schneider 研究顯示冷卻液汙垢可讓冷卻效率降達 30%、壓差升高、能耗上升。維護節奏應從「風管救火」轉為「迴路管理與程序化保養」。
  • 管路與熱排拒:管路設計要避免氣塞,用 CFD 模擬避免管路阻擋風道;抬地板機房尤須注意。熱排拒(chiller、乾冷卻器、冷卻塔)要依規模、冷卻液種類與地理位置量身——既有的冷卻塔或乾冷卻器可再利用,但可能需要加裝絕熱輔助(adiabatic assist)以維持液冷所需的低供水溫度。

建議與有實績的冷卻設備廠(Schneider、Vertiv、Stulz、MoEn 等)與機房整合商合作規劃,從 CFD、PUE/WUE 與 TCO 建模、BOM 清單開始,避免自行設計造成風險。

成本分析:液冷 vs 風冷(5 年 TCO)

液冷的資本支出(capex)高於風冷,但 PUE 的落差會在 5 年內大幅回補。以下以一個 2 MW IT 負載機房、5 年生命週期、電價 NT$ 7.5/kWh 為例,比較三種架構的散熱基礎設施成本與電費(僅算「冷卻附加負載」,即 PUE−1 的電力,為可比的決策變量):

2 MW 機房 5 年散熱成本比較(電價 NT$ 7.5/kWh)
架構 PUE 年冷卻電量 年電費 5 年散熱 capex* 5 年 TCO**
風冷(含冷通道) 1.50 8.76 GWh NT$ 6.57 億 NT$ 6,000 萬 NT$ 39.45 億
DTC 冷板 1.15 2.63 GWh NT$ 1.97 億 NT$ 9,000 萬 NT$ 10.75 億
浸沒式 1.05 0.88 GWh NT$ 0.66 億 NT$ 1.3 億 NT$ 4.64 億

* 5 年散熱 capex 含 CDU、管路、機櫃改造/更換與冷卻液,為示意性區間(實際依機櫃數與密度浮動)。** TCO=5 年冷卻電費+散熱 capex;未計 IT 設備本身電費(三者相同)。

由表可知,DTC 5 年 TCO 較風冷省約 NT$ 2.2 億(≈23%),浸沒式省約 NT$ 2.9 億(≈30%),皆在 3 年內回本。PUE 從 1.5 降到 1.15,對 2 MW 機房即每年省約 NT$ 4.6 億冷卻電費;PUE 每降 0.1,1 MW 機房即每年省 NT$ 650 萬。國際數據亦佐證:64 機架 AI 集群 10 年 TCO,風冷約 US$ 42M、DTC 約 US$ 31M、單相浸沒約 US$ 28M,差異主要由 PUE(1.45–1.60 vs 1.03–1.08)與 60–75% 的用地縮減驅動。另 Supermicro 基準測試顯示,液冷 H100 節點持續壓測下吞吐率高 17%、每節點功耗低 1 kW(16%)——這部分「效能紅利」未計入上述 TCO,實際投資報酬通常更好。

決策錨點:機櫃密度 <20 kW 且短期不會提升,風冷+RDHx 仍具成本優勢;20–50 kW 進入 DTC 區間(ASHRAE TC 9.9 建議 20 kW 以上採 DTC);>50 kW 且電價偏高時,浸沒式的長期 TCO 優勢最明顯,但需配合機櫃與硬體重新設計。

讓散熱規劃跑在 GPU 前面

液冷不再是「未來選項」,而是 2026 年高算力機房的基礎設施前置條件。華盈科技提供從散熱現況稽核、PUE/WUE 與 TCO 建模、液冷方案比選,到建置與後續維護的一站式服務,協助您的機房在 GPU 密度持續攀升時,把散熱從瓶頸變為競爭優勢。

諮詢液冷散熱方案

聯絡華盈科技,取得免費機房散熱現況評估:

📞 02-7730-7729 | ✉️ service@hytechtw.com

服務時間 9:00–18:00|台北/新北/台中/高雄皆可現場勘查