Retrieval-Augmented Generation (RAG)

بهینه‌سازی RAG: استراتژی‌های پیشرفته تکه‌تکه کردن و پنجره زمینه برای مدل‌های زبانی بزرگ با عملکرد بالا

تولید تقویت‌شده با بازیابی (RAG) از یک مفهوم نوآورانه به ستون فقرات برنامه‌های هوش مصنوعی سازمانی تبدیل شده است. با این حال، با پیشروی توسعه‌دهندگان فراتر از پیاده‌سازی‌های نمونه ساده، آن‌ها سریعاً با الگوی «ورودی بی‌کیفیت، خروجی بی‌کیفیت» مواجه می‌شوند. کیفیت تولید شما به شدت به کیفیت بازیابی وابسته است. این بررسی عمیق به مکانیک‌های حیاتی معماری RAG می‌پردازد و بر استراتژی‌های پیچیده تکه‌تکه کردن و بهینه‌سازی پنجره زمینه برای کاهش توهمات و حداکثر کردن ارتباط تمرکز دارد.

پایه و اساس: فراتر از تکه‌تکه کردن با اندازه ثابت

رایج‌ترین اشتباه در پیاده‌سازی RAG، تقسیم ساده‌لوحانه متن به تکه‌هایی با اندازه ثابت (مثلاً هر ۵۰۰ کاراکتر) است. این رویکرد اغلب معنای معنایی را می‌شکند، جملات را نصف کرده یا مفاهیم مرتبط را از هم جدا می‌کند. برای توسعه‌دهندگان متوسط تا پیشرفته، حرکت به سمت تکه‌تکه کردن آگاه از معنی حیاتی است.

تکه‌تکه کردن معنایی از مدل‌های جاسازی (Embedding) برای شناسایی شکستگی‌های طبیعی در معنا استفاده می‌کند. به جای شمارش کاراکترهای دلخواه، الگوریتم متن را زمانی تقسیم می‌کند که شباهت کسینوسی بین جاسازی‌های متوالی به زیر یک آستانه خاص کاهش یابد. این امر تضمین می‌کند که هر تکه یکپارچگی زمینه‌ای خود را حفظ کند و دقت بازیابی را به طور قابل توجهی بهبود بخشد.


from langchain_text_splitters import SemanticChunker
from langchain_openai import OpenAIEmbeddings

# Initialize the embedding model
embeddings = OpenAIEmbeddings(model="text-embedding-ada-002")

# Create a semantic chunker that groups text by meaning
chunker = SemanticChunker(
    embeddings=embeddings,
    breakpoint_threshold_type="percentile", # or "standard_deviation"
    breakpoint_threshold_amount=0.85
)

# Split text while preserving semantic boundaries
document_text = "Your large document text goes here..."
chunks = chunker.create_documents([document_text])

print(f"Generated {len(chunks)} semantically coherent chunks.")

بهینه‌سازی پنجره زمینه

پس از بازیابی تکه‌ها، تغذیه آن‌ها در مدل زبانی بزرگ (LLM) نیازمند مدیریت دقیق پنجره زمینه است. پنجره زمینه یک منبع محدود است؛ پر شدن بیش از حد آن باعث بریدگی (Truncation) می‌شود و استفاده ناکافی از آن بودت توکن‌های گران‌قیمت را هدر می‌دهد و تأخیر را افزایش می‌دهد. بهینه‌سازی مؤثر شامل دو استراتژی اصلی است: بازیابی سلسله‌مراتبی و هرس زمینه.

بازیابی سلسله‌مراتبی

بازیابی سلسله‌مراتبی، یا سبک بازیابی «نقشه-کاهش» (Map-Reduce)، شامل خلاصه‌سازی اسناد بزرگ به بردارهای متراکم‌تر و کوچک‌تر قبل از نمایه‌سازی است. وقتی یک پرس‌وجو وارد می‌شود، سیستم ابتدا این خلاصه‌های سطح بالا را بازیابی می‌کند. اگر بخش خاصی مرتبط باشد، سیستم سپس به تکه‌های جزئیات اصلی نفوذ می‌کند. این رویکرد نویز را کاهش می‌دهد و پنجره زمینه را بر اطلاعات با سیگنال بالا متمرکز نگه می‌دارد.

هرس زمینه و رتبه‌بندی مجدد

همه اسناد بازیابی شده به یک اندازه مرتبط نیستند. یک پایپ‌لاین RAG قوی باید شامل یک مرحله رتبه‌بندی مجدد باشد. با استفاده از یک مدل متقاطع-انکودر (Cross-Encoder) (که از نظر محاسباتی سنگین‌تر اما دقیق‌تر از دوقلوسازها است) برای امتیازدهی به تکه‌های بازیابی شده نسبت به پرس‌وجو، می‌توانید داده‌های غیرمرتبط را قبل از رسیدن به LLM حذف کنید. این کار به طور چشمگیری بار ارسالی به مدل را کاهش می‌دهد و تضمین می‌کند که در حدود محدودیت‌های زمینه باقی بمانید در حالی که دقت بالا را حفظ می‌کنید.


# Conceptual flow for re-ranking
def optimize_context(retrieved_chunks, query, llm):
    scored_chunks = []
    for chunk in retrieved_chunks:
        # Use a cross-encoder or LLM-as-a-judge to score relevance
        score = calculate_relevance(chunk.content, query)
        if score > THRESHOLD:
            scored_chunks.append(chunk)
    
    # Sort by relevance and trim to fit context window
    optimized_context = [c.content for c in scored_chunks[:MAX_CHUNKS]]
    return join_context(optimized_context)

نتیجه‌گیری

ساخت یک سیستم RAG در سطح تولید، بیشتر مهندسی پایپ‌لاین داده است تا یافتن مدل مناسب. با پیاده‌سازی تکه‌تکه کردن معنایی، جریان روایی داده‌های خود را حفظ می‌کنید. با بهینه‌سازی پنجره زمینه از طریق رتبه‌بندی مجدد و استراتژی‌های سلسله‌مراتبی، تضمین می‌کنید که LLM تنها اطلاعات مرتبط‌ترین را دریافت می‌کند. با ادامه تحول در منظر هوش مصنوعی، تسلط بر این ظرافت‌های معماری، تفاوت بین یک چت‌بات که دچار توهم می‌شود و یک دستیار که واقعاً درک می‌کند، خواهد بود.

Share: