AI Infrastructure

اختيار بنية خادم GPU المناسبة: الموازنة بين ذاكرة الفيديو وعرض النطاق الترددي والتكلفة لاستدعاء نماذج اللغات الكبيرة

لم يعد نشر نماذج اللغات الكبيرة (LLMs) مجرد تحدي في هندسة البرمجيات؛ إنه في جوهره مشكلة في البنية التحتية. مع نمو أحجام النماذج من مليارات إلى مئات المليارات من المعاملات، انتقل الاختناق من قدرة الحوسبة إلى قيود الذاكرة. بالنسبة للمطورين من المستوى المتوسط إلى المتقدم، يعد قرار اختيار بنية خادم GPU لشراءها أو استئجارها أمرًا بالغ الأهمية. يمكن أن يؤدي عدم التطابق في سعة ذاكرة الفيديو (VRAM) أو عرض النطاق الترددي للذاكرة إلى فشل عمليات النشر، أو زيادة زمن الاستجابة بشكل مفرط، أو ارتفاع تكاليف السحابة بشكل غير متحكم فيه.

قيد ذاكرة الفيديو (VRAM): لماذا يهم الحجم أكثر من السرعة

أعقوبة فورية في استدعاء نماذج اللغات الكبيرة هي القدرة على تحميل أوزان النموذج في ذاكرة GPU. على عكس التدريب، حيث يمكنك تحسين أحجام الدُفعات (batch sizes) لتناسب الذاكرة، يتطلب الاستدعاء وجود النموذج بأكمله داخل ذاكرة الفيديو (VRAM) لتوليد الرموز (tokens). المعادلة بسيطة نسبيًا: يتطلب النموذج الذي تم ضغطه بتقنية 16-bit حوالي 2 بايت لكل معامل. وبالتالي، يتطلب نموذج بحجم 70 مليار معامل حوالي 140 جيجابايت من ذاكرة الفيديو للأوزان فقط، باستثناء مخازن مؤقتة لنافذة السياق (context window) ومخزن KV (KV cache).

لهذا السبب، غالبًا ما تكون خوادم GPU ذات البطاقة الواحدة التي تحتوي على 24 جيجابايت أو 48 جيجابايت من ذاكرة الفيديو غير كافية للنماذج الحديثة ذات الحالة المتقدمة (state-of-the-art). يجب على المهندسين المعماريين النظر في التكوينات متعددة GPUs. ومع ذلك، فإن مجرد تكديس وحدات GPU لا يحل المشكلة إذا كان عرض النطاق الترددي للربط بين البطاقات منخفضًا. تخلق روابط PCIe Gen4 أو Gen5 اختناقًا عندما تحتاج عدة وحدات GPU إلى مشاركة مساحة الذاكرة لتوازي النموذج (model parallelism).

عرض النطاق الترددي: البطل الصامت لزمن الاستجابة

بينما تحدد ذاكرة الفيديو (VRAM) ما إذا كان النموذج سيعمل أم لا، فإن عرض النطاق الترددي للذاكرة يحدد سرعة تشغيله. يعتمد استدعاء نماذج اللغات الكبيرة بشكل كبير على الذاكرة (memory-bound). يرتبط زمن الوصول إلى الرمز الأول (TTFT) ومعدل إنتاج الرموز اللاحقة ارتباطًا مباشرًا بسرعة نقل البيانات من ذاكرة الفيديو إلى المعالجات المتعددة التدفق (streaming multiprocessors).

قارن بين NVIDIA A100 (HBM2e) و A6000. يحتوي A6000 على ذاكرة فيديو أكبر من A100، لكن عرضه الترددي للذاكرة أقل بشكل ملحوظ. بالنسبة لنماذج اللغات الكبيرة، غالبًا ما يتفوق A100 على A6000 في معدل الإنتاجية لأنه يستطيع نقل مصفوفات الأوزان الثقيلة بشكل أسرع. عند اختيار الأجهزة، قارن دائمًا معدل نقل البيانات بالجيجابايت في الثانية (GB/s)، وليس فقط السعة الإجمالية. بالنسبة للنشر المؤسسي، تعد تقنية NVLink من NVIDIA ضرورية، حيث توفر مئات الجيجابايتات في الثانية من عرض النطاق الترددي بين وحدات GPU، وهو أسرع بمئات المرات من PCIe.

استراتيجيات تحسين التكلفة

يتضمن الموازنة بين التكلفة فهم التكلفة الإجمالية للملكية (TCO). تقدم مثيلات السحابة مرونة ولكنها تأتي بسعر مرتفع. بالنسبة لبيئات الإنتاج عالية الإنتاجية، يمكن لخوادم المؤسسات المحلية المزودة بوحدات GPU من فئة المستهلك أو فئة مراكز البيانات تقليل التكاليف بنسبة تصل إلى 70% مقارنة بمزودي خدمات السحابة.

فكر في نهج الدقة المختلطة. يمكنك استخدام ذاكرة HBM2e/HBM3 عالية العرض الترددي للطبقات النشطة من النموذج، ونقل المكونات الأقل أهمية إلى ذاكرة الوصول العشوائي للوحدة المركزية (CPU RAM) أو ذاكرة GPU ذات العرض الترددي المنخفض باستخدام أطر عمل مثل vLLM أو TensorRT-LLM. إليك مثال عملي حول كيفية تحديد توازي المصفوفات (tensor parallelism) في سطر تشغيل لإعداد متعدد GPUs:

# تشغيل نموذج بحجم 70 مليار معامل عبر 8 وحدات GPU باستخدام vLLM
# يضمن توزيع توازي النموذج عبر NVLink عالي العرض الترددي

python -m vllm.entrypoints.api_server \
    --model meta-llama/Llama-2-70b-chat-hf \
    --tensor-parallel-size 8 \
    --gpu-memory-utilization 0.95 \
    --max-model-len 4096 \
    --dtype float16

في هذا المثال، يضمن --tensor-parallel-size 8 تقسيم النموذج عبر ثماني وحدات GPU. يؤدي استخدام --gpu-memory-utilization 0.95 إلى تعظيم استخدام ذاكرة الفيديو المتاحة لمخزن KV، وهو أمر بالغ الأهمية للتعامل مع نوافذ السياق الطويلة بكفاءة.

الخاتمة

يتطلب اختيار بنية خادم GPU المناسبة لاستدعاء نماذج اللغات الكبيرة نظرة شاملة لسعة ذاكرة الفيديو (VRAM)، وعرض النطاق الترددي للذاكرة، وسرعة الربط بين البطاقات. لا تضحي بعرض النطاق الترددي من أجل السعة، لأن ذلك سيضعف سرعة الاستدعاء. وبالمثل، تأكد من أن بنية الشبكة الخاصة بك (NVLink، InfiniBand) تتطابق مع قوة الحوسبة. من خلال الموازنة الدقيقة بين هذه العوامل، يمكن للمطورين نشر بنية ذكاء اصطناعي قابلة للتوسع، وفعالة من حيث التكلفة، وعالية الأداء تلبي متطلبات نماذج اللغات الكبيرة الحديثة.

Share: