AI Infrastructure

استراتژی‌های کش چندلایه هوش مصنوعی

ساخت برنامه‌های سطح تولید برای مدل‌های زبانی بزرگ (LLM) فراتر از ارسال ساده پرس‌وجوها به یک API است. با افزایش مقیاس استفاده، هزینه‌ها به شدت افزایش یافته و تأخیر بیشتر می‌شود. برای حل این مشکل، معماران در حال اتخاذ استراتژی‌های کش چندلایه هستند. با ترکیب بازیابی معنایی با کش پاسخ‌های قطعی، می‌توانید مصرف توکن‌ها را به شدت کاهش دهید و در عین حال در دسترس بودن بالا را حفظ کنید.

معماری سه لایه

زیرساخت هوش مصنوعی مقاوم معمولاً از سه لایه کش مجزا استفاده می‌کند که هر کدام هدف خاصی را در چرخه درخواست بر عهده دارند. درک این لایه‌ها به شما امکان می‌دهد درخواست‌ها را قبل از برخورد با منابع محاسباتی پرهزینه متوقف کنید.

1. کش پاسخ LLM (تطبیق دقیق)

لایه اول، مقرون‌به‌صرفه‌ترین است. این روش شامل ذخیره خروجی دقیق یک LLM برای یک پرس‌وجو و پیکربندی سیستم خاص است. اگر کاربر سوالی را بپرسد که قبلاً پرسیده شده است، سیستم نتیجه کش شده را به سرعت باز می‌گرداند. این روش برای تعاملات سبک FAQ یا وظایف تولید کد قطعی ایده‌آل است.

2. کش امبدینگ (شباهت معنایی)

کاربران به ندرت پرس‌وجوها را به یک شکل بیان می‌کنند. ممکن است یک کاربر بپرسد: «چگونه رمز عبور خود را بازنشانی کنم؟» در حالی که کاربر دیگری می‌پرسد: «رویه بازیابی رمز عبور چیست؟» یک کش امبدینگ از امبدینگ‌های برداری برای یافتن پرس‌وجوهای گذشته با معنای مشابه استفاده می‌کند. اگر فاصله معنایی زیر یک آستانه خاص باشد، سیستم پاسخ اصلی را بازیابی کرده و از تماس‌های API غیرضروری جلوگیری می‌کند.

3. بازیابی پایگاه داده برداری (RAG)

برای برنامه‌های پیچیده و با زمینه‌محوریت بالا، از یک پایگاه داده برداری برای بازیابی اسناد زمینه‌ای مرتبط استفاده می‌کنید. اگرچه این روش *پاسخ* را کش نمی‌کند، اما *ورودی* به LLM را بهینه می‌سازد. با دریافت فقط قطعات مرتبط‌ترین اسناد به جای بارگذاری اسناد کامل، تعداد توکن‌های پرس‌وجو را کاهش می‌دهید که منجر به هزینه‌های کمتر و استنتاج سریع‌تر می‌شود.

پیاده‌سازی استراتژی با پایتون

در زیر یک مثال عملی از نحوه ساختاردهی یک لایه کش با استفاده از پایتون آورده شده است. این مثال نشان می‌دهد چگونه قبل از پرس‌وجو از یک LLM، به دنبال تطبیق‌های دقیق و شباهت‌های معنایی بگردید.

import hashlib
from typing import Optional

# سرویس‌های مجازی برای نمایش
def get_llm_response(prompt: str) -> str:
    # در محیط تولید، این تابع به OpenAI، Anthropic و غیره تماس می‌گیرد
    return f"AI Generated Answer for: {prompt}"

def get_embedding(text: str) -> list:
    # جایگزین برای مدل امبدینگ (مثلاً OpenAI، SentenceTransformers)
    return [0.1, 0.2, 0.3] 

def cosine_similarity(v1: list, v2: list) -> float:
    # نرمال‌سازی ضرب داخلی ساده برای نمایش
    return 0.95 

# ذخایر در حافظه
exact_cache = {}
embedding_cache = {}  # امبدینگ‌ها و متون مرتبط را ذخیره می‌کند
SIMILARITY_THRESHOLD = 0.85

def process_query(query: str) -> str:
    # لایه 1: تطبیق دقیق
    if query in exact_cache:
        return exact_cache[query]
    
    # لایه 2: تطبیق معنایی
    query_embedding = get_embedding(query)
    for cached_text, cached_embedding in embedding_cache.items():
        sim = cosine_similarity(query_embedding, cached_embedding)
        if sim >= SIMILARITY_THRESHOLD:
            # برخورد کش از طریق شباهت معنایی
            exact_cache[query] = exact_cache.get(cached_text, "Cached Response")
            return exact_cache.get(cached_text, "Response found via similarity")
    
    # لایه 3: بدون برخورد کش، تماس با LLM
    response = get_llm_response(query)
    
    # به‌روزرسانی کش‌ها
    exact_cache[query] = response
    embedding_cache[query] = query_embedding
    
    return response

# مثال استفاده
print(process_query("What is the capital of France?"))
print(process_query("Where is the capital of France located?"))

ملاحظات کلیدی برای پیاده‌سازی

  • سیاست‌های حذف: پایگاه‌های داده برداری می‌توانند بزرگ شوند. برای مدیریت حافظه، سیاست‌های حذف زمان انقضا (TTL) یا کمترین استفاده اخیر (LRU) را پیاده‌سازی کنید.
  • یکپارچگی: برای داده‌های حساس به زمان، مطمئن شوید که استراتژی بی‌اعتبارسازی کش شما مقاوم است. پاسخ‌های قدیمی می‌توانند منجر به توهم یا اطلاعات منسوخ شوند.
  • تحلیل هزینه: مبادله بین هزینه‌های ذخیره‌سازی و صرفه‌جویی‌های API را محاسبه کنید. تولید امبدینگ هزینه دارد، بنابراین مطمئن شوید که صرفه‌جویی API بر هزینه محاسباتی تولید امبدینگ‌ها غلبه دارد.

نتیجه‌گیری

کش چندلایه تنها یک بهینه‌سازی عملکرد نیست؛ بلکه یک ضرورت مالی برای برنامه‌های هوش مصنوعی مقیاس‌پذیر است. با ترکیب هوشمندانه تطبیق‌های دقیق، شباهت معنایی و بازیابی برداری، می‌توانید سیستم‌هایی بسازید که سریع‌تر، ارزان‌تر و واکنش‌گراتر باشند. با کش تطبیق دقیق به صورت کوچک شروع کنید، سپس با رشد پایه کاربران و افزایش تنوع پرس‌وجوها، بازیابی معنایی را به لایه‌های بعدی اضافه کنید.

Share: