AI Infrastructure

تسلط بر دینامیک حرارتی: سرورهای GPU خنک‌شونده با هوا در مقایسه با خنک‌شونده با مایع برای خوشه‌های مدل‌های زبانی بزرگ

با مقیاس‌پذیری مدل‌های زبانی بزرگ (LLM) به تریلیون‌ها پارامتر، سخت‌افزارهای پشتیبان آن‌ها دستخوش تحولی رادیکال می‌شوند. معماری رک خنک‌شونده با هوا که دهه‌ها صنعت دیتاسنتر را خدمت کرده است، به محدودیت‌های فیزیکی خود می‌رسد. با تولید تراکم‌های حرارتی بیش از ۱۰۰۰ وات بر تراشه توسط GPUs مدرن مانند NVIDIA H100 و B200، مدیریت خروجی حرارت دیگر تنها یک نگرانی نگهداری نیست—بلکه یک تصمیم معماری حیاتی است که بر هزینه، عملکرد و سرعت استقرار تأثیر می‌گذارد.

برای مهندسان زیرساخت و تیم‌های عملیات هوش مصنوعی (AI Ops)، درک مبادله‌ها (trade-offs) بین سیستم‌های خنک‌شونده با هوا و مایع برای ساخت خوشه‌های استنتاج با تراکم بالا و کارآمد ضروری است. این پست به بررسی واقعیت‌های فنی، پیامدهای عملکردی و راهبردهای عملی برای هر رویکرد می‌پردازد.

سقف خنک‌سازی با هوا

خنک‌سازی با هوا به جریان هوای حجیم تولید شده توسط فن‌ها برای اتلاف حرارت از هیت‌سینک‌های متصل به GPUs و CPUs متکی است. اگرچه این روش آشنا و مقیاس‌پذیر است، اما با افزایش تراکم توان، بازدهی آن کاهش می‌یابد.

در یک رک ۴۲U معمولی، ممکن است ۸ تا ۱۶ نود GPU جا دهید. با این حال، اگر هر GPU ۷۰۰ وات مصرف کند، تراکم رک به ۱۰-۱۴ کیلووات نزدیک می‌شود. در این سطوح، هوا به گلوگاه تبدیل می‌شود. شما به توان فن بسیار زیادی برای جابجایی هوا نیاز دارید که خود آن حرارت تولید می‌کند (گرمایش ژول)، و این امر یک حلقه بازخورد ایجاد می‌کند که کارایی کلی را کاهش می‌دهد. علاوه بر این، هوا ظرفیت گرمایی ویژه کمتری نسبت به مایعات دارد، به این معنی که نمی‌تواند حرارت را به همان اندازه که مایعات انجام می‌دهند، از منبع جذب و دور کند.

ورود خنک‌سازی با مایع: غوطه‌وری و مستقیم به تراشه

راهکارهای خنک‌سازی با مایع رسانایی حرارتی بسیار بالاتری ارائه می‌دهند. دو پیاده‌سازی اصلی وجود دارد:

  1. مستقیم به تراشه (صفحه سرد): مایع از طریق صفحاتی که مستقیماً به داغ‌ترین اجزا (GPU/CPU) متصل هستند گردش می‌کند، در حالی که بقیه سیستم با هوا خنک می‌شود یا از رویکرد ترکیبی استفاده می‌کند.
  2. خنک‌سازی غوطه‌وری: کل سرور در یک سیال دی‌الکتریک غوطه‌ور می‌شود. این کار شکاف‌های هوایی را حذف کرده و امکان بسته‌بندی بسیار فشرده سخت‌افزار را فراهم می‌کند.

مزیت اصلی، اثربخشی مصرف انرژی (PUE) است. دیتاسنترهای خنک‌شونده با مایع می‌توانند به PUEهای نزدیک به ۱.۰۱-۱.۰۵ دست یابند، در حالی که تأسیسات خنک‌شونده با هوا اغلب برای ماندن زیر ۱.۵-۱.۶ struggle می‌کنند. برای یک خوشه هوش مصنوعی که ۲۴ ساعته در ۷ روز هفته فعال است، صرفه‌جویی انرژی ناشی از خنک‌سازی می‌تواند قابل توجه باشد.

پیکربندی عملی: پایش تروتلینگ حرارتی

صرف‌نظر از روش خنک‌سازی، پایش فضای مانور حرارتی در طول استنتاج LLM حیاتی است. در زیر یک قطعه کد Python با استفاده از کتابخانه `pynvml` برای پایش دمای GPU و تنظیم پویای اندازه دسته‌های استنتاج برای جلوگیری از تروتلینگ آورده شده است.

import pynvml
import time

def monitor_thermal_headroom(gpu_index, max_temp_threshold=85):
    pynvml.nvmlInit()
    handle = pynvml.nvmlDeviceGetHandleByIndex(gpu_index)
    
    while True:
        temp = pynvml.nvmlDeviceGetTemperature(handle, pynvml.NVML_TEMPERATURE_GPU)
        power_draw = pynvml.nvmlDeviceGetPowerUsage(handle) / 1000.0  # تبدیل به وات
        
        if temp > max_temp_threshold:
            print(f"⚠️  هشدار: GPU {gpu_index} در دمای {temp} درجه سانتی‌گراد است. کاهش بار.")
            # منطق برای کاهش درخواست‌های استنتاج همزمان یا اندازه دسته
            break
        else:
            print(f"✅  GPU {gpu_index}: {temp} درجه سانتی‌گراد | توان: {power_draw:.2f} وات")
            
        time.sleep(5)

# monitor_thermal_headroom(0)

هزینه و پیچیدگی عملیاتی

در حالی که خنک‌سازی با مایع عملکرد حرارتی برتری ارائه می‌دهد، پیچیدگی عملیاتی را نیز وارد می‌کند. نشتی‌ها، علی‌رغم ویژگی‌های ایمنی مدرن، همچنان یک عامل خطر هستند. مخازن غوطه‌وری به روش‌های نگهداری تخصصی نیاز دارند و سیال دی‌الکتریک برای تعویض گران است. در مقابل، سیستم‌های خنک‌شونده با هوا ماژولار، تعمیر آسان و از زنجیره‌های تأمین موجود برای قطعات یدکی بهره می‌برند.

با این حال، برای استنتاج LLM با تراکم بالا—جایی که نیاز دارید حداکثر محاسبات را در حداقل فضای اشغال شده برای کاهش تأخیر شبکه و پیچیدگی کابل‌کشی بگنجانید—خنک‌سازی با مایع به استاندارد تبدیل می‌شود. تحلیل هزینه کل مالکیت (TCO) اغلب پس از ۳ تا ۵ سال به دلیل صرفه‌جویی در انرژی و تراکم سخت‌افزاری بالاتر، به نفع خنک‌سازی با مایع است.

نتیجه‌گیری

انتخاب بین خنک‌سازی با هوا و مایع دوگانه نیست، بلکه موقعیتی است. اگر در حال استقرار یک خوشه آزمایشی در مقیاس کوچک هستید، خنک‌سازی با هوا همچنان کافی و مقرون‌به‌صرفه است. با این حال، برای خوشه‌های استنتاج LLM با تراکم بالا و درجه تولید که به دنبال حداکثر بهره‌وری و کارایی انرژی هستند، خنک‌سازی با مایع (به ویژه صفحات سرد مستقیم به تراشه) به سرعت به استاندارد ضروری تبدیل می‌شود. با ادامه رشد مدل‌های هوش مصنوعی، محدودیت‌های حرارتی هوا سخت‌تر خواهد شد و پذیرش زودهنگام راهبردهای حرارتی پیشرفته به یک مزیت رقابتی تبدیل می‌شود.

Share: