AI Infrastructure

AI Ağ Yığını: LLM Çıkarımı ve Eğitim Yükleri İçin TCP, UDP ve RDMA Karşılaştırması

Büyük Dil Modelleri (LLM'ler) yüzlerce milyar parametreye ulaştıkça darboğaz, hesaplamadan iletişime kayar. AI altyapısı dünyasında ağ gecikmesi ve bant genişliği artık sadece metrikler değil; eğitim süresi ve çıkarım süresini belirleyen faktörlerdir. GPU kümelerini optimize eden mühendisler için doğru protokol yığını seçmek, doğru transformer mimarisi seçmek kadar kritik öneme sahiptir. Bu yazı, yüksek performanslı ağın üç temel direği olan TCP, UDP ve RDMA'yı incelemekte ve modern AI yükleri için uygunluklarını değerlendirmektedir.

Temel Çizgiyi Anlamak: TCP ve UDP

Onlarca yıldır İnternet Protokolü Yığını, İletişim Kontrol Protokolü (TCP) ve Kullanıcı Veri Grubu Protokolü (UDP)'ye dayanmaktadır. Her yerde bulunmalarına rağmen, varsayılan yapılandırmaları dağıtık eğitim tarafından gereken devasa veri aktarım hızıyla başa çıkmakta zorlanabilir.

TCP (İletişim Kontrol Protokolü) teslimatı ve sıralamayı garanti eder. Bu güvenilirlik bir bedel gerektirir: "sıra başı engelleme" etkisi ve çekirdek bağlam değiştirme işlemleri nedeniyle önemli ölçüde CPU aşırı yükü. LLM eğitiminde, gradyan senkronizasyonu saniyede milyonlarca kez gerçekleştiğinden, TCP'nin güvenilirlik özellikleri GPU hatlarını durdurabilecek titremeye (jitter) neden olabilir.

UDP (Kullanıcı Veri Grubu Protokolü) bağlantısızdır ve hafiftir. Düşük gecikme sunar ancak hata düzeltme özelliğine sahip değildir. Bazı AI çerçeveleri, aşırı yükü azalttığı için kontrol düzlemleri veya belirli tüm-azaltma (all-reduce) işlemleri için UDP kullanır; ancak paket kaybını yönetmek için karmaşık uygulama katmanı mantığı gerektirir ki bu, ölçeklendirildiğinde doğru bir şekilde uygulamak zordur.

Oyunu Değiştiren: Birleşik Ethernet Üzerinde RDMA (RoCE)

RDMA (Uzaktan Doğrudan Bellek Erişimi), bir ağ arayüz kartının (NIC) veriyi işletim sistemi çekirdeğini tamamen atlayarak bir makinenin belleği ile diğerinin belleği arasında doğrudan değiştirmesine olanak tanıyarak veri merkezi ağlarını devrim niteliğinde değiştirir. Çekirdek Atlama (Kernel Bypass) olarak bilinen bu teknik, CPU kullanımını ve gecikmeyi önemli ölçüde azaltır.

LLM bağlamında RoCE (Birleşik Ethernet Üzerinde RDMA) şunları sağlar:

  • Mikrosaniye Gecikmesi: Kullanıcı deneyimi için her milisaniyenin önemli olduğu çıkarım işlemleri için kritik öneme sahiptir.
  • Sıfır-Kopya Veri Aktarımı: Çekirdek ve kullanıcı alanı arasındaki veri kopyalamayı ortadan kaldırarak model yürütmesi için CPU döngülerini korur.
  • Yüksek Aktarım Hızı: Dağıtık eğitim sırasında gereken terabaytlarca gradyan verisini verimli bir şekilde taşır.

RDMA İçin Pratik Yapılandırma

RDMA'nın uygulanması belirli donanımları (InfiniBand veya RoCE destekli NIC'ler) ve dikkatli yapılandırmayı gerektirir. Aşağıda, Linux düğümünde bir RDMA cihazının durumunu kontrol eden bir örnek verilmiştir; bu, AI ağ sorunlarını halletmede önemli bir ilk adımdır.

# Mevcut RDMA cihazlarını listele
ibstatus

# Belirli arayüzde RoCE'nin etkin olup olmadığını kontrol et
ethtool -k eth0 | grep rdma

# Örnek çıktı şu şekilde görünebilir:
# RDMA VLAN offload: on

Kümenizi yapılandırırken, ibdev2netdev eşlemelerinizin doğru olduğundan ve Kalite Hizmeti (QoS) ayarlarının yoğun ağlarda paket kaybını önlemek için RDMA trafiğini önceliklendirdiğinden emin olun.

Doğru Protokolü Seçmek: Eğitim vs. Çıkarım

Protokol seçimi büyük ölçüde yükün aşamasına bağlıdır:

Eğitim Yükleri

Dağıtık eğitim, devasa kolektif iletişimler (All-Reduce, All-Gather) içerir. Burada bant genişliği kraldır. RDMA/RoCE, büyük ölçekli eğitim kümeleri (örneğin, 70B+ parametreli bir modelin eğitimi) için üstün bir seçenektir. "İletişim engeli"ni en aza indirerek GPU'ların daha fazla zaman hesaplamaya ve daha az zaman veri beklemeye harcamasını sağlar. Küçük modellerde veya tek düğüm ince ayarında, kurulum karmaşıklığı faydadan fazla olduğunda TCP kullanılabilir.

Çıkarım Yükleri

Çıkarım genellikle istek odaklıdır ve büyük ölçüde değişkenlik gösterir. RDMA en düşük gecikmeyi sağlasa da, her çıkarım isteği için RDMA bağlantıları kurmanın aşırı yükü, bağlantı havuzu kullanılmadıkça veya belirli donanım yükü devri yapılmadıkça caydırıcı olabilir. Birçok çıkarım senaryosu için, optimize edilmiş çekirdek ayarları (örneğin net.core.somaxconn değerinin artırılması) ve donanım yükü devri (TCP segmentasyonu yükü devri) ile TCP, önemli ölçüde daha düşük operasyonel karmaşıklıkla yeterli performans sağlar.

Sonuç

AI modelleri büyüdükçe, altta yatan ağ yığınının karmaşıklığı da artar. TCP, genel hesaplama için güvenilir bir varsayılan olmaya devam ederken ve UDP hızı karmaşıklıkla sunar, RDMA yüksek performanslı AI altyapısı için gerekli bir evrim olarak öne çıkar. Yüzlerce GPU'ya ölçeklenen organizasyonlar için RDMA uyumlu donanıma yatırım yapmak ve ağ yığınınu optimize etmek sadece bir seçenek değil; verimli model geliştirme ve dağıtımı için bir ön koşuldur.

Share: