با مقیاسپذیری مدلهای زبانی بزرگ (LLM) به تریلیونها پارامتر، سختافزارهای پشتیبان آنها دستخوش تحولی رادیکال میشوند. معماری رک خنکشونده با هوا که دههها صنعت دیتاسنتر را خدمت کرده است، به محدودیتهای فیزیکی خود میرسد. با تولید تراکمهای حرارتی بیش از ۱۰۰۰ وات بر تراشه توسط GPUs مدرن مانند NVIDIA H100 و B200، مدیریت خروجی حرارت دیگر تنها یک نگرانی نگهداری نیست—بلکه یک تصمیم معماری حیاتی است که بر هزینه، عملکرد و سرعت استقرار تأثیر میگذارد.
برای مهندسان زیرساخت و تیمهای عملیات هوش مصنوعی (AI Ops)، درک مبادلهها (trade-offs) بین سیستمهای خنکشونده با هوا و مایع برای ساخت خوشههای استنتاج با تراکم بالا و کارآمد ضروری است. این پست به بررسی واقعیتهای فنی، پیامدهای عملکردی و راهبردهای عملی برای هر رویکرد میپردازد.
سقف خنکسازی با هوا
خنکسازی با هوا به جریان هوای حجیم تولید شده توسط فنها برای اتلاف حرارت از هیتسینکهای متصل به GPUs و CPUs متکی است. اگرچه این روش آشنا و مقیاسپذیر است، اما با افزایش تراکم توان، بازدهی آن کاهش مییابد.
در یک رک ۴۲U معمولی، ممکن است ۸ تا ۱۶ نود GPU جا دهید. با این حال، اگر هر GPU ۷۰۰ وات مصرف کند، تراکم رک به ۱۰-۱۴ کیلووات نزدیک میشود. در این سطوح، هوا به گلوگاه تبدیل میشود. شما به توان فن بسیار زیادی برای جابجایی هوا نیاز دارید که خود آن حرارت تولید میکند (گرمایش ژول)، و این امر یک حلقه بازخورد ایجاد میکند که کارایی کلی را کاهش میدهد. علاوه بر این، هوا ظرفیت گرمایی ویژه کمتری نسبت به مایعات دارد، به این معنی که نمیتواند حرارت را به همان اندازه که مایعات انجام میدهند، از منبع جذب و دور کند.
ورود خنکسازی با مایع: غوطهوری و مستقیم به تراشه
راهکارهای خنکسازی با مایع رسانایی حرارتی بسیار بالاتری ارائه میدهند. دو پیادهسازی اصلی وجود دارد:
- مستقیم به تراشه (صفحه سرد): مایع از طریق صفحاتی که مستقیماً به داغترین اجزا (GPU/CPU) متصل هستند گردش میکند، در حالی که بقیه سیستم با هوا خنک میشود یا از رویکرد ترکیبی استفاده میکند.
- خنکسازی غوطهوری: کل سرور در یک سیال دیالکتریک غوطهور میشود. این کار شکافهای هوایی را حذف کرده و امکان بستهبندی بسیار فشرده سختافزار را فراهم میکند.
مزیت اصلی، اثربخشی مصرف انرژی (PUE) است. دیتاسنترهای خنکشونده با مایع میتوانند به PUEهای نزدیک به ۱.۰۱-۱.۰۵ دست یابند، در حالی که تأسیسات خنکشونده با هوا اغلب برای ماندن زیر ۱.۵-۱.۶ struggle میکنند. برای یک خوشه هوش مصنوعی که ۲۴ ساعته در ۷ روز هفته فعال است، صرفهجویی انرژی ناشی از خنکسازی میتواند قابل توجه باشد.
پیکربندی عملی: پایش تروتلینگ حرارتی
صرفنظر از روش خنکسازی، پایش فضای مانور حرارتی در طول استنتاج LLM حیاتی است. در زیر یک قطعه کد Python با استفاده از کتابخانه `pynvml` برای پایش دمای GPU و تنظیم پویای اندازه دستههای استنتاج برای جلوگیری از تروتلینگ آورده شده است.
import pynvml
import time
def monitor_thermal_headroom(gpu_index, max_temp_threshold=85):
pynvml.nvmlInit()
handle = pynvml.nvmlDeviceGetHandleByIndex(gpu_index)
while True:
temp = pynvml.nvmlDeviceGetTemperature(handle, pynvml.NVML_TEMPERATURE_GPU)
power_draw = pynvml.nvmlDeviceGetPowerUsage(handle) / 1000.0 # تبدیل به وات
if temp > max_temp_threshold:
print(f"⚠️ هشدار: GPU {gpu_index} در دمای {temp} درجه سانتیگراد است. کاهش بار.")
# منطق برای کاهش درخواستهای استنتاج همزمان یا اندازه دسته
break
else:
print(f"✅ GPU {gpu_index}: {temp} درجه سانتیگراد | توان: {power_draw:.2f} وات")
time.sleep(5)
# monitor_thermal_headroom(0)
هزینه و پیچیدگی عملیاتی
در حالی که خنکسازی با مایع عملکرد حرارتی برتری ارائه میدهد، پیچیدگی عملیاتی را نیز وارد میکند. نشتیها، علیرغم ویژگیهای ایمنی مدرن، همچنان یک عامل خطر هستند. مخازن غوطهوری به روشهای نگهداری تخصصی نیاز دارند و سیال دیالکتریک برای تعویض گران است. در مقابل، سیستمهای خنکشونده با هوا ماژولار، تعمیر آسان و از زنجیرههای تأمین موجود برای قطعات یدکی بهره میبرند.
با این حال، برای استنتاج LLM با تراکم بالا—جایی که نیاز دارید حداکثر محاسبات را در حداقل فضای اشغال شده برای کاهش تأخیر شبکه و پیچیدگی کابلکشی بگنجانید—خنکسازی با مایع به استاندارد تبدیل میشود. تحلیل هزینه کل مالکیت (TCO) اغلب پس از ۳ تا ۵ سال به دلیل صرفهجویی در انرژی و تراکم سختافزاری بالاتر، به نفع خنکسازی با مایع است.
نتیجهگیری
انتخاب بین خنکسازی با هوا و مایع دوگانه نیست، بلکه موقعیتی است. اگر در حال استقرار یک خوشه آزمایشی در مقیاس کوچک هستید، خنکسازی با هوا همچنان کافی و مقرونبهصرفه است. با این حال، برای خوشههای استنتاج LLM با تراکم بالا و درجه تولید که به دنبال حداکثر بهرهوری و کارایی انرژی هستند، خنکسازی با مایع (به ویژه صفحات سرد مستقیم به تراشه) به سرعت به استاندارد ضروری تبدیل میشود. با ادامه رشد مدلهای هوش مصنوعی، محدودیتهای حرارتی هوا سختتر خواهد شد و پذیرش زودهنگام راهبردهای حرارتی پیشرفته به یک مزیت رقابتی تبدیل میشود.