AI

بهینه‌سازی تأخیر سرویس‌دهی LLM برای RAG

خطوط لوله بازیابی-تولید تقویت‌شده (RAG) سازمانی اغلب با یک گلوگاه حیاتی مواجه هستند: تأخیر استنتاج. اگرچه بازیابی سریع است، اما تولید پاسخ از مدل‌های زبانی بزرگ (LLM) می‌تواند تأخیرهای غیرقابل قبولی برای کاربران نهایی ایجاد کند. برای توسعه‌دهندگانی که برنامه‌های هوش مصنوعی در سطح تولید می‌سازند، بهینه‌سازی این تأخیر تنها یک تنظیم عملکردی نیست؛ بلکه الزامی برای رضایت کاربر و کارایی هزینه است. این پست به بررسی سه استراتژی با تأثیر بالا می‌پردازد: کم‌بیت‌سازی مدل، کش‌گذاری هوشمند و تنظیم اندازه دسته.

1. کم‌بیت‌سازی (Quantization): کاهش ردپای حافظه

کم‌بیت‌سازی دقت عددی وزن‌های مدل را از نقطه شناور ۳۲ بیتی (FP32) به بیت‌های کمتر، مانند ۱۶ بیتی (FP16)، ۸ بیتی (INT8) یا حتی ۴ بیتی (INT4) کاهش می‌دهد. مزیت اصلی، کاهش قابل توجه استفاده از حافظه و افزایش نرخ گذر (throughput) است، زیرا داده‌های کمتری باید بین حافظه و GPU جابجا شوند. برای سیستم‌های RAG، جایی که مدل‌ها اغلب بزرگ هستند، این امکان می‌دهد تا نمونه‌های بیشتری میزبانی شوند یا پنجره‌های زمینه (context) بزرگ‌تری مدیریت شوند.

ابزاری مانند کتابخانه Optimum هابینگ فیس (Hugging Face) این فرآیند را در دسترس می‌کند. در اینجا نحوه اعمال کم‌بیت‌سازی پویا بر روی یک مدل هابینگ فیس ترانسفورمرز آورده شده است:

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_name = "mistralai/Mistral-7B-v0.1"
tokenizer = AutoTokenizer.from_pretrained(model_name)

# Load model with quantization
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    load_in_8bit=True,  # Uses bitsandbytes for 8-bit quantization
    device_map="auto"
)

# Inference remains the same, but faster
inputs = tokenizer("Explain RAG", return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=50)

در حالی که کم‌بیت‌سازی ۸ بیتی تعادل خوبی بین سرعت و دقت ارائه می‌دهد، کم‌بیت‌سازی ۴ بیتی (QLoRA) می‌تواند نیازهای حافظه را تا ۷۵٪ بیشتر کاهش دهد، هرچند ممکن است کمی بر کیفیت خروجی تأثیر بگذارد. همیشه مورد استفاده خاص خود را ارزیابی کنید تا پایین‌ترین دقت قابل قبول را تعیین نمایید.

2. استراتژی‌های کش‌گذاری هوشمند

در خطوط لوله RAG، بخش قابل توجهی از هزینه تولید به پردازش زمینه بازیابی‌شده و پرامپت اختصاص دارد. کش‌گذاری نتایج پرس‌وجوهای قبلی می‌تواند تأخیر را برای درخواست‌های تکراری یا مشابه به شدت کاهش دهد. دو لایه کش‌گذاری مؤثر عبارتند از:

  1. کش امبدینگ (Embedding Cache): امبدینگ‌های برداری برای اسناد بازیابی‌شده را ذخیره کنید. اگر یک پرس‌وجوی جدید همان k سند برتر را تولید کند، جستجوی برداری را نادیده بگیرید.
  2. کش پاسخ LLM: از تطبیق دقیق رشته یا تطبیق تقریبی برای کش‌گذاری خروجی‌های LLM استفاده کنید. ابزارهایی مانند InMemoryCache لانگ‌چین (LangChain) یا کش‌های مبتنی بر ردیس (Redis) می‌توانند جفت‌های کلید-مقدار (پرامپت، پاسخ) را ذخیره کنند.

پیاده‌سازی یک کش مبتنی بر ردیس ساده در پایتون ممکن است به این شکل باشد:

import redis
import hashlib
import json

r = redis.Redis(host='localhost', port=6379, db=0)

def get_cached_response(prompt):
    # Create a hash of the prompt
    prompt_hash = hashlib.sha256(prompt.encode()).hexdigest()
    
    # Check cache
    cached = r.get(prompt_hash)
    if cached:
        return json.loads(cached)
    
    # Generate new response (pseudo-code)
    response = generate_llm_response(prompt)
    
    # Store in cache with TTL (e.g., 1 hour)
    r.setex(prompt_hash, 3600, json.dumps(response))
    return response

3. تنظیم اندازه دسته (Batch Size)

اندازه دسته به تعداد درخواست‌هایی اشاره دارد که به طور همزمان توسط GPU پردازش می‌شوند. افزایش اندازه دسته با استفاده بهتر از موازی‌سازی GPU، نرخ گذر را بهبود می‌بخشد، اما می‌تواند تأخیر را برای هر درخواست به دلیل زمان‌های صف‌بندی طولانی‌تر افزایش دهد. هدف یافتن "نقطه شیرین" است که در آن نرخ گذر بدون ایجاد تأخیرهای غیرقابل قبول برای کاربران فردی، به حداکثر می‌رسد.

برای برنامه‌های RAG بلادرنگ، اندازه دسته‌های کوچک (مثلاً ۱-۴) ممکن است برای تأخیر کم ترجیح داده شود. با این حال، برای پردازش آفلاین یا وظایف ناهمگام، دسته‌های بزرگ‌تر (مثلاً ۱۶-۶۴) می‌توانند نرخ گذر را به طور قابل توجهی بهبود بخشند. ابزارهای مانیتورینگ مانند Prometheus و Grafana می‌توانند به تجسم مبادله بین تأخیر و نرخ گذر هنگام تنظیم پارامترهای دسته کمک کنند.

نتیجه‌گیری

بهینه‌سازی تأخیر سرویس‌دهی LLM نیازمند رویکردی کل‌نگر است. با ترکیب کم‌بیت‌سازی برای کاهش اندازه مدل، کش‌گذاری برای اجتناب از محاسبات تکراری و تنظیم اندازه دسته برای تعادل بین نرخ گذر و تأخیر، توسعه‌دهندگان می‌توانند خطوط لوله RAG بسازند که هم سریع و هم از نظر هزینه مقرون‌به‌صرفه باشند. با کم‌بیت‌سازی شروع کنید، زیرا اغلب سریع‌ترین بهبود عملکرد را با حداقل تغییرات کد ارائه می‌دهد، سپس کش‌گذاری و دسته‌بندی را برای بهینه‌سازی بیشتر لایه‌بندی کنید.

Share: