دموکراتیک شدن مدلهای زبانی بزرگ (LLM) به نقطه عطفی رسیده است. در حالی که راهکارهای سازمانی روایت را در دست دارند، جامعه علاقهمندان به هوش مصنوعی محلی مرزهای امکانپذیر را بر روی کارتهای گرافیک مصرفکننده پیش میبرند. اجرای مدلهایی مانند Llama-3، Mistral یا Qwen بر روی یک کارت RTX 3090 یا 4070 Ti تنها با دانلود یک چکپوینت امکانپذیر نیست؛ بلکه نیازمند درک دقیق از معماری حافظه و بهینهسازی استنتاج است.
این راهنما تکنیکهای عملی برای حداکثر کردن سرعت استنتاج و اندازه مدل بر روی سختافزار محدود را بررسی میکند و بر تعامل بین کوانتیزاسیون، نگاشت دستگاه و offloading حافظه تمرکز دارد.
درک گلوگاه حافظه
قبل از بهینهسازی، باید محدودیت را کمیسازی کنیم. یک مدل استاندارد با ۷ میلیارد پارامتر (7B) با دقت کامل (FP16) تنها برای وزنها به حدود ۱۴ گیگابایت VRAM نیاز دارد. وقتی کش کلید-مقدار (KV cache) را در نظر بگیرید که به صورت خطی با طول زمینه رشد میکند و همچنین سربار موتور اجرا، حتی کارتهای گرافیک رده بالا بدون کوانتیزاسیون با زمینههای طولانی مشکل دارند.
کوانتیزاسیون دقت وزنهای مدل را از ۱۶ بیتی به ۸ بیتی، ۴ بیتی یا حتی کمتر کاهش میدهد. به عنوان مثال، یک مدل 7B در کوانتیزاسیون ۴ بیتی (Q4_K_M) به حدود ۴-۵ گیگابایت کاهش مییابد. این کار فضای قابل توجهی از VRAM را برای کش KV آزاد میکند و امکان پنجرههای زمینه طولانیتر و نرخ انتقال بالاتر را فراهم میسازد.
نگاشت استراتژیک دستگاه و offloading
یکی از موثرترین روشها برای مدیریت حافظه، نگاشت هوشمندانه دستگاه است. به جای مجبور کردن کل مدل به GPU (که ممکن است در صورت عدم کافی بودن VRAM باعث کرش شود) یا نگه داشتن آن کاملاً روی CPU (که کند است)، میتوانیم لایهها را بین دستگاههای موجود توزیع کنیم.
با استفاده از کتابخانه `transformers` هگینگ فِیس (Hugging Face)، میتوانید کنترل کنید که چند لایه به GPU اختصاص داده شود و چند لایه روی CPU باقی بمانند. این تکنیک که به عنوان offloading جزئی شناخته میشود، به شما اجازه میدهد مدلهای بزرگتر را با بهرهگیری از RAM سیستم به عنوان امتداد حافظه GPU، در مخازن VRAM کوچکتر جای دهید.
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "microsoft/Phi-3-mini-4k-instruct"
# Load model with specific quantization
model = AutoModelForCausalLM.from_pretrained(
model_name,
device_map="auto", # Automatically determines best split
load_in_4bit=True, # Enables 4-bit quantization
bnb_4bit_compute_dtype="float16",
bnb_4bit_quant_type="nf4", # NormalFloat 4 for better precision
bnb_4bit_use_double_quant=True
)
tokenizer = AutoTokenizer.from_pretrained(model_name)
در کد بالا، `device_map="auto"` به کتابخانه دستور میدهد تا لایههای مدل را به صورت خودکار بین GPUهای موجود تقسیم کند. اگر چندین GPU دارید، بار را متعادل میکند. اگر VRAM محدودی دارید، لایههای سنگینتر را به CPU منتقل میکند. برای کنترل دقیقتر، میتوانید به صورت دستی `device_map={"": 0}` را برای GPU 0 مشخص کنید و بقیه را در پایتون مدیریت نمایید.
بهینهسازی اندازه دسته و طول زمینه
حتی با کوانتیزاسیون، کش KV مصرفکننده اصلی حافظه پویا است. برای حفظ محدودیتهای VRAM، باید پارامتر `max_length` را در حین استنتاج با دقت تنظیم کنید. تولید پاسخهای بسیار طولانی میتواند به سرعت حافظه موجود را تخلیه کرده و منجر به خطاهای Out-Of-Memory (OOM) شود.
علاوه بر این، کاهش اندازه دسته یک مرحله بهینهسازی حیاتی است. هنگام پردازش چندین ورودی به صورت همزمان، هر درخواست به فضای اشغال شده توسط کش KV اضافه میشود. اگر یک سرور API محلی مانند Ollama یا vLLM اجرا میکنید، تنظیم حداکثر اندازه دسته روی ۱ یا ۲ میتواند فشار حافظه را به طور چشمگیری کاهش دهد و در عین حال تأخیر معقولی را حفظ کند.
استفاده از موتورهای استنتاج تخصصی
در حالی که کتابخانه استاندارد `transformers` برای آزمایشها عالی است، موتورهای استنتاج تخصصی مدیریت حافظه برتری ارائه میدهند. ابزارهایی مانند llama.cpp و MLC LLM از هستههای (kernels) بسیار بهینهشده استفاده میکنند که سربار تخصیص حافظه را به حداقل میرسانند. آنها از تکنیکهایی مانند توجه صفحهای (paged attention) استفاده میکنند که کش KV را در بلوکهای حافظه غیرپیوسته مدیریت میکند، مشابه حافظه مجازی در یک سیستم عامل، که از تکهتکه شدن حافظه جلوگیری کرده و حداکثر استفاده از VRAM را ممکن میسازد.
نتیجهگیری
اجرای LLMهای کوانتیزه شده بر روی سختافزار مصرفکننده تنها به خرید یک GPU قدرتمند مربوط نمیشود؛ بلکه به نوشتن کدهای کارآمدی است که محدودیتهای سختافزاری را رعایت کند. با ترکیب کوانتیزاسیون ۴ بیتی، نگاشت استراتژیک دستگاه و موتورهای استنتاج بهینهشده، میتوانید مدلهای هوش مصنوعی پیچیده را بر روی سختافزاری که قبلاً ناکافی تلقی میشد، اجرا کنید. با بلوغ اکوسیستم هوش مصنوعی محلی، این تکنیکها به یک رویه استاندارد برای توسعهدهندگانی تبدیل خواهند شد که هدفشان استقرار راهکارهای هوش مصنوعی مقرونبهصرفه و حفظ حریم خصوصی است.