Planowanie chłodzenia cieczą zaczyna się przed zamówieniem serwerów. Systemy AI o dużej gęstości łączą obliczenia, sieć, dostarczanie energii i zarządzanie ciepłem tak ściśle, że obiekt może mieć wystarczającą powierzchnię, a mimo to nie być zdolny do eksploatacji sprzętu. Użyteczne pytanie planistyczne nie brzmi więc, czy ciecz przenosi ciepło lepiej niż powietrze. Brzmi: czy cała droga od krzemu do zewnętrznego odprowadzania ciepła może bezpiecznie, nieprzerwanie i serwisowalnie przenieść zamierzone obciążenie.

Wiarygodny plan łączy pięć decyzji: obciążenie cieplne szafy, architekturę chłodzenia, mechaniczne i elektryczne ograniczenia budynku, model niezawodności oraz dowody wymagane przed rozszerzeniem wdrożenia. Traktowanie którejkolwiek z nich jako osobnego zakupu tworzy ryzyko integracyjne.

Przełóż plan obliczeniowy na budżet cieplny

Niemal cała energia elektryczna zużywana przez szafę ostatecznie staje się ciepłem. Zacznij od oczekiwanej konfiguracji szafy i zakresu mocy, w tym akceleratorów, CPU, przełączników, modułów optycznych, pamięci masowej i strat konwersji mocy. Nie planuj wyłącznie wokół reklamowanej wartości znamionowej układu. Czołowe akceleratory mogą przekraczać jeden kilowat, a kompletne systemy w skali szafy mogą osiągać setki kilowatów. Gęstość zamienia ciepło komponentów w problem obiektu.

Modeluj co najmniej trzy warunki: normalną pracę ciągłą, najwyższe wiarygodne obciążenie oraz pogorszony stan chłodzenia. Uwzględnij rozwój, jeśli późniejszy sprzęt może zajmować ten sam rząd lub obieg. Celem nie jest tylko usunięcie średniego ciepła, lecz utrzymanie temperatur, przepływu i ciśnienia w zatwierdzonych zakresach, gdy obciążenia się zmieniają lub jedna część systemu jest niedostępna.

Oddziel także ciepło przechwycone przez ciecz od ciepła resztkowego oddawanego do powietrza. Konstrukcje direct-to-chip mogą chłodzić procesory i wybrane komponenty sieciowe, podczas gdy pamięć, storage, sprzęt zasilający lub elementy pomocnicze nadal ogrzewają pomieszczenie. Niektóre nowsze konstrukcje szaf rozciągają połączenia cieczowe na tace obliczeniowe i przełączające, ale nie oznacza to automatycznego zniknięcia potrzeb zarządzania powietrzem w hali danych. Podział powinny określać dokumenty konstrukcyjne każdego rzeczywistego systemu.

Ten budżet cieplny staje się wspólnym wejściem dla układu szaf, wymiarowania rur, wyboru CDU, dystrybucji energii, sterowania i urządzeń zewnętrznych. Jeśli zespoły używają różnych założeń, lokalizacja może przejść pojedyncze przeglądy projektu, a mimo to zawieść jako system zintegrowany.

Wybieraj architekturę według granicy, nie etykiety

„Chłodzenie cieczą” opisuje kilka architektur, a nie jeden zamienny produkt. Chłodzenie direct-to-chip umieszcza płyty chłodzące przy urządzeniach wytwarzających ciepło. Pętla po stronie serwera przenosi ciepło przez węże i kolektory do jednostki dystrybucji chłodziwa, czyli CDU. CDU zarządza przepływem, ciśnieniem, temperaturą i rozdzieleniem obiegu sprzętu od obiegu obiektu. Obieg budynku przenosi następnie ciepło do suchej chłodnicy, wieży chłodniczej, chillera lub innego systemu odprowadzania.

Chłodzenie immersyjne umieszcza natomiast sprzęt w płynie dielektrycznym. Jego płyn, procedury serwisowe, kompatybilność komponentów i względy środowiskowe różnią się od wodnej pętli z płytami chłodzącymi. Prognoza rynku lub twierdzenie dostawcy o „chłodzeniu cieczą” są niepełne, jeśli nie wskazują architektury.

Dla każdej opcji narysuj pełny łańcuch cieplny i oznacz odpowiedzialność na każdej granicy. Ustal, kto specyfikuje chłodziwo, kto utrzymuje jego chemię, kto dostarcza sterowanie CDU, kto może odizolować szafę i kto odpowiada za wyciek lub zanieczyszczenie. Niejednoznaczna odpowiedzialność jest szczególnie niebezpieczna na styku sprzętu IT i systemów obiektu.

Opublikowane platformy mogą dostarczać przydatnych odniesień projektowych, nie stając się uniwersalnymi wzorcami. System NVIDIA GB200 NVL72 łączy 36 CPU Grace i 72 GPU Blackwell w chłodzonej cieczą konstrukcji rack-scale. Firma udostępniła też mechanikę szafy i specyfikacje chłodzenia poprzez wkład do otwartego sprzętu. Przykłady te mogą zmniejszyć niepewność interfejsów, ale każdy wybrany serwer, obiekt i środowisko pracy nadal wymagają walidacji.

Przetestuj budynek przed wyborem komponentów

CDU jest mostem, a nie substytutem możliwości obiektu. Lokalizacja musi przyjąć dopływające ciepło i odrzucić je na zewnątrz. Zbadaj dostępne trasy rur, obciążenie podłogi, przestrzenie serwisowe, zasilanie elektryczne, zasilanie zapasowe, integrację sterowania oraz wydajność istniejących urządzeń mechanicznych. Modernizacja hali chłodzonej powietrzem może wymagać zmian znacznie wykraczających poza dodanie rur obok szafy.

Temperatura zasilania wpływa na projekt obiektu. Projekt dostawcy, który akceptuje chłodziwo wchodzące o temperaturze do 45 stopni Celsjusza, może tworzyć możliwości odprowadzania ciepła bez chillera za pomocą suchych chłodnic. NVIDIA opisuje to podejście z ciepłą wodą, lecz jest to możliwość, a nie wynik mający zastosowanie wszędzie. Klimat, pogoda sezonowa, temperatury zbliżenia, obciążenie i istniejące wyposażenie określają, czy chillery lub wieże chłodnicze pozostają konieczne.

Oceniaj twierdzenia o wodzie i energii na granicy całego obiektu. Zamknięta pętla może ograniczyć bezpośrednie użycie wody, zwłaszcza połączona z suchymi chłodnicami, lecz wynik zależy od lokalizacji i projektu. Uwzględnij pompy, wentylatory, chillery, uzdatnianie i resztkowe chłodzenie pomieszczenia. Porównywanie sprawności odizolowanych komponentów może ukryć energię przeniesioną w inne miejsce systemu.

Możliwości elektryczne i cieplne muszą zostać uruchomione razem. Gęste szafy mogą potrzebować większych przyłączy, szyn zbiorczych, urządzeń dystrybucyjnych i systemów zapasowych. Projekt chłodzenia gotowy na miesiące przed systemem elektrycznym nie tworzy użytecznej mocy obliczeniowej i odwrotnie jest tak samo.

Zaprojektuj ograniczanie awarii i utrzymanie

Ciecz wprowadza do modelu dostępności pompy, uszczelnienia, złącza, zawory, czujniki i jakość płynu. Celem nie jest twierdzenie, że wycieki nigdy się nie zdarzają; jest nim powstrzymanie rozprzestrzeniania się pojedynczej usterki i wykrycie nietypowych warunków, zanim sprzęt zostanie uszkodzony.

Zdefiniuj redundancję CDU i pomp na podstawie domeny awarii. Ustal, czy jedno CDU obsługuje szafę, rząd czy większą grupę, a następnie modeluj, co dzieje się podczas utrzymania i awarii. Uwzględnij zawory odcinające, ścieżki obejściowe, zapasową wydajność oraz zachowanie sterowania po utracie zasilania lub komunikacji. Nominalna etykieta N+1 nie wystarcza, jeśli kilka komponentów współdzieli ten sam kontroler, zasilanie elektryczne lub pętlę obiektu.

Ultraszybkie rozłączniki powinny ograniczać uwalnianie płynu podczas instalacji i serwisu, ale ich dowody muszą obejmować powtarzane łączenie, zmiany temperatury, wibracje, zmiany ciśnienia i długie okresy pracy. Procedury utrzymania powinny zapobiegać przedostawaniu się cząstek i uwięzionego powietrza do małych kanałów. Technicy potrzebują określonych kroków opróżniania, ponownego łączenia, odpowietrzania, weryfikacji przepływu i przywracania sprzętu do pracy.

Monitorowanie powinno obejmować temperaturę zasilania i powrotu, przepływ, ciśnienie, stan pompy oraz, gdzie to właściwe, sygnały wilgoci lub wycieku. Ustal progi alertów i automatyczne reakcje przed produkcją. Wykonaną czynność utrzymaniową należy zweryfikować zarówno przez telemetrię chłodzenia, jak i przywrócone zdrowie systemu, a nie jedynie zamknięte zlecenie pracy.

Traktuj materiały jako decyzję o kompatybilności na poziomie systemu

Płyty chłodzące, złącza, węże, kolektory, uszczelnienia i chłodziwo muszą zachować kompatybilność przez oczekiwany zakres temperatury, ciśnienia i okresu eksploatacji. Wydajność płyty chłodzącej zależy od geometrii kanałów, jakości łączenia, spadku ciśnienia, styku powierzchni i powtarzalności produkcji. Konstrukcje mikrokanałowe mogą poprawiać przenoszenie ciepła przy urządzeniu, lecz wąskie kanały zwiększają wrażliwość na cząstki, korozję, wady łączenia i nierówny przepływ.

Poproś dostawców o kwalifikowany zestaw materiałów, zamiast zatwierdzać każdy komponent niezależnie. Specyfikacja płynu powinna obejmować czystość, kontrolę korozji, stabilność cieplną, obsługę i interwały wymiany. Zmiany chłodziwa lub materiału zwilżanego powinny uruchamiać przegląd kompatybilności, ponieważ lokalnie dopuszczalna zamiana może wpłynąć na uszczelnienia, metale lub osady w innym miejscu pętli.

Oddziel ryzyka direct-to-chip i płynów immersyjnych. Chłodziwa na bazie wody są powszechne w systemach z płytami chłodzącymi. Niektóre systemy immersyjne używały fluorowanych płynów dielektrycznych. 3M zakończyła wyjście z produkcji PFAS pod koniec 2025 r., co ma znaczenie dla dotkniętych łańcuchów dostaw płynów, ale nie oznacza, że każda szafa chłodzona cieczą zależy od tych płynów. Zakupy powinny dokumentować skład płynu, dostępność, postępowanie środowiskowe i plany końca życia dla wybranej architektury.

Żądaj dowodów wdrożeniowych, nie tylko deklaracji mocy

Duże wolumeny zamówień pokazują zainteresowanie, nie niezawodność działania. Gotowość komponentu przechodzi przez projekt, próbki, testy wydajności, testy produkcyjne, kwalifikację klienta, powtarzalną produkcję i pracę w terenie. Tych etapów nie należy łączyć w jedno twierdzenie o dostępności. Kwalifikacja części precyzyjnych może trwać znacznie dłużej niż zwiększenie zdolności montażowej.

Żądaj dowodów z mianownikami i kontekstem pracy. Użyteczne miary obejmują uzysk produkcyjny, wyniki testów szczelności, trwałość pomp, cykle łączenia złączy, zakresy ciśnienia i temperatury, utrzymanie chłodziwa, incydenty terenowe, czas naprawy i wydajność w różnych porach roku. Odróżniaj wysyłki małych partii od kwalifikowanego wolumenu i uznanych przychodów.

Prognozy wymagają podobnej dyscypliny. TrendForce przewidywał w swoim przeglądzie rynku, że penetracja chłodzenia cieczą wśród układów AI wzrośnie z około 33% w 2025 r. do 53% w 2026 r. i zbliży się do 60% w 2027 r. Liczby te opisują prognozę dla układów AI, a nie zaobserwowane wdrożenie we wszystkich serwerach lub centrach danych. Używaj projekcji do planowania scenariuszy, a następnie dobieraj zobowiązania do rzeczywistych harmonogramów platform, gotowości budowy i wyników kwalifikacji.

Prowadź pilotaż w najmniejszej znaczącej domenie awarii. Uruchom reprezentatywne obciążenia, procedury utrzymania, zdarzenia przełączenia awaryjnego i testy nietypowych warunków. Udana demonstracja cieplna dowodzi transferu ciepła w swoich warunkach testowych; nie ustanawia dostępności przez wiele sezonów, serwisowalności ani ciągłości dostaw.

Lista kontrolna wdrożenia

Przed zatwierdzeniem projektu lub rozszerzeniem pilota potwierdź poniższe:

  • Obciążenie cieplne: Moc szafy, warunki szczytowe, resztkowe obciążenie powietrza, wzrost i założenia stanu pogorszonego współdzielą jeden udokumentowany model.
  • Architektura: Pętla serwera, CDU, pętla obiektu i ścieżka odprowadzania ciepła są narysowane od początku do końca, z określonymi płynami i zakresami pracy.
  • Dopasowanie obiektu: Zbadano trasy rur, obciążenie podłogi, dystrybucję energii, zasilanie zapasowe, sterowanie, prześwity, klimat, wodę i urządzenia zewnętrzne.
  • Domeny awarii: Zmapowano zależności CDU, pompy, kontrolera, zasilania i pętli obiektu; izolacja i redundancja działają podczas planowanego utrzymania.
  • Materiały: Chłodziwo, metale, uszczelnienia, węże, złącza i płyty chłodzące zakwalifikowano jako zestaw, z kontrolą zanieczyszczeń i korozji.
  • Serwis: Personel może łączyć, izolować, opróżniać, odpowietrzać, sprawdzać i przywracać sprzęt, używając udokumentowanych procedur i dostępnych części zapasowych.
  • Monitorowanie: Sygnały temperatury, przepływu, ciśnienia, pompy i wycieku mają progi, właścicieli, ścieżki eskalacji i przetestowane reakcje.
  • Dowody: Twierdzenia dostawcy wskazują warunki testu, wielkość próbki, awarie, etap produkcji, status kwalifikacji i czas pracy w terenie.
  • Uruchomienie: Obciążenie cieplne, failover, utrata energii, alarmy, utrzymanie i odzyskanie są testowane wspólnie przez zespoły obliczeniowe i obiektowe.
  • Zasada rozszerzania: Skalowanie zależy od dowodów dostępności, incydentów, utrzymania, energii, wody i mocy, a nie wyłącznie od dostawy szaf.

Solidny program chłodzenia cieczą traktuje szafę i budynek jak jeden system operacyjny. Gęstość ustanawia problem ciepła; architektura określa granice; inżynieria obiektu przenosi obciążenie; materiały chronią pętlę; a zmierzone wyniki wdrożeń określają, kiedy skalować. Ta sekwencja zmienia chłodzenie z późnego dodatku mechanicznego w kontrolowaną decyzję infrastrukturalną.

Jak pracuje redakcja

Łączymy źródła pierwotne, dokumentację produktów i rzeczywiste scenariusze użycia, aby ułatwić Ci ocenę, czy dane narzędzie pasuje do Twojego sposobu pracy.

Źródła

Przeglądaj katalog narzędzi