Retrieval-Augmented Generation (RAG)

تکه‌تکه‌سازی سلسله‌مراتبی در RAG

در چشم‌انداز سریعاً در حال تحول Retrieval-Augmented Generation (RAG)، کیفیت پایپلاین جذب داده اغلب عامل تعیین‌کننده بین یک چت‌بات توهم‌زا و یک دستیار فنی قابل اعتماد است. تکه‌تکه‌سازی معنایی استاندارد، اگرچه ساده است، اما اغلب هنگام کار با مستندات پیچیده فنی که زمینه در چندین صفحه گسترده است یا به روابط ساختاری بین بخش‌ها وابسته است، شکست می‌خورد.

این پست به بررسی دو تکنیک پیشرفته—تکه‌تکه‌سازی سلسله‌مراتبی و تکه‌تکه‌سازی آگاه از متادیتا—برای بهینه‌سازی حفظ زمینه می‌پردازد. این روش‌ها تضمین می‌کنند که بازیابی‌های پایگاه داده برداری، یکپارچگی معنایی مورد نیاز برای پاسخ‌های دقیق مدل‌های زبانی بزرگ (LLM) را حفظ می‌کنند.

مشکل تکه‌تکه‌سازی تخت

پیاده‌سازی‌های سنتی RAG معمولاً اسناد را به تکه‌هایی با اندازه ثابت (مثلاً ۵۰۰ توکن) بر اساس تعداد کاراکتر یا فاصله‌های سفید ساده تقسیم می‌کنند. این رویکرد دارای یک نقص حیاتی است: ساختار سند را نادیده می‌گیرد. وقتی یک تکه ایجاد می‌شود، اغلب یک فکر را در میانه قطع می‌کند یا یک بلوک کد را از توضیحات آن جدا می‌سازد. در نتیجه، نمایش برداری، زمینه اطراف را از دست می‌دهد که منجر به بازیابی‌های نامرتبط می‌شود.

تکه‌تکه‌سازی سلسله‌مراتبی

تکه‌تکه‌سازی سلسله‌مراتبی با حفظ ساختار فهرست مطالب سند، این مشکل را برطرف می‌کند. به جای یک لیست تخت از بردارها، این روش یک ساختار درختی ایجاد می‌کند که در آن تکه‌های والد، خلاصه‌ای از تکه‌های فرزند را در خود دارند. وقتی یک پرس‌وجو دریافت می‌شود، سیستم ابتدا سطح والد را برای یک موضوع کلی جستجو می‌کند. اگر والد مرتبط باشد، به تکه‌های فرزند خاص نفوذ می‌کند. این جستجوی چندسطحی تضمین می‌کند که فرآیند بازیابی، جریان منطقی مستندات را رعایت می‌کند.

پیاده‌سازی استراتژی‌های آگاه از متادیتا

تکه‌تکه‌سازی آگاه از متادیتا این رویکرد را با غنی‌سازی هر تکه با متادیتای ساختاری صریح، بهبود می‌بخشد. برای مستندات پایتون، این بدان معناست که نه تنها متن، بلکه امضای تابع، کلاسی که به آن تعلق دارد و مسیر فایل نیز ذخیره می‌شود. این متادیتا به عنوان فیلترهای قدرتمندی در طول بازیابی عمل می‌کند و به شما امکان می‌دهد نتایج را حتی قبل از محاسبه شباهت کسینوسی محدود کنید.

پیاده‌سازی عملی پایتون

بیایید به یک مثال ساده‌شده با استفاده از یک استراتژی تکه‌تکه‌سازی سفارشی که سرصفحه‌های تابع را در فایل‌های پایتون حفظ می‌کند، نگاه کنیم. ما از کتابخانه langchain برای نشان دادن نحوه اتصال متادیتا به تکه‌ها استفاده می‌کنیم.

from langchain.text_splitter import RecursiveCharacterTextSplitter

def create_metadata_aware_chunks(doc_text, metadata_map):
    # تعریف نقاط تقسیم بر اساس ساختار کد
    splitter = RecursiveCharacterTextSplitter(
        chunk_size=500,
        chunk_overlap=50,
        separators=["\n\nclass ", "\n\ndef ", "\n\n#"]
    )
    
    chunks = splitter.split_text(doc_text)
    enriched_chunks = []
    
    for chunk in chunks:
        # اتصال متادیتای ساختاری
        enriched_chunks.append({
            "text": chunk,
            "metadata": {
                "type": "code_section",
                "parent_module": metadata_map.get(chunk, "Unknown")
            }
        })
        
    return enriched_chunks

در این مثال، تقسیم‌کننده از جداکننده‌های خاص مرتبط با کد استفاده می‌کند تا اطمینان حاصل شود که تعاریف تابع به صورت سلیقه‌ای قطع نمی‌شوند. با اتصال کلید parent_module به متادیتا، سیستم بازیابی می‌تواند نتایج را به راحتی فیلتر کند تا تنها آن تکه‌هایی که به کتابخانه یا ماژول خاصی که کاربر درباره آن پرس‌وجو می‌کند تعلق دارند، باقی بمانند.

مزایا برای مستندات فنی

پذیرش این تکنیک‌ها چندین مزیت متمایز برای برنامه‌های RAG فنی ارائه می‌دهد. اول، این کار نویز را در نتایج بازیابی به طور قابل توجهی کاهش می‌دهد. با بهره‌گیری از متادیتا، می‌توانید تکه‌های نامرتبط را که ممکن است در غیر این صورت به دلیل شباهت‌های معنایی در اصطلاحات رایج مانند "روش" یا "کلاس" ظاهر شوند، حذف کنید. دوم، انسجام پاسخ‌های تولید شده را بهبود می‌بخشد. وقتی یک LLM زمینه‌ای را دریافت می‌کند که شامل بلوک‌های کد اطراف یا امضاهای تابع مرتبط است، می‌تواند راه‌حل‌های جامع‌تر و دقیق‌تری ارائه دهد.

علاوه بر این، ساختارهای سلسله‌مراتبی امکان ذخیره‌سازی و پرس‌وجوی کارآمدتری را فراهم می‌کنند. ذخیره خلاصه‌ها در سطوح بالاتر سلسله‌مراتب می‌تواند جستجوی اولیه گسترده را سرعت بخشد و بار محاسباتی را قبل از محدود کردن جزئیات فنی خاص کاهش دهد. این کارایی هنگام کار با پایگاه‌های کد بزرگ یا مجموعه‌های مستندات گسترده حیاتی است.

نتیجه‌گیری

بهینه‌سازی حفظ زمینه در سیستم‌های RAG نیازمند حرکت فراتر از تقسیم‌بندی ساده متن است. با پیاده‌سازی استراتژی‌های تکه‌تکه‌سازی سلسله‌مراتبی و آگاه از متادیتا، توسعه‌دهندگان می‌توانند سیستم‌هایی بسازند که ساختار و روابط درون مستندات فنی را درک می‌کنند. این تکنیک‌ها نه تنها دقت بازیابی‌ها را بهبود می‌بخشند، بلکه با ارائه پاسخ‌های مرتبط‌تر و منسجم‌تر، تجربه کاربری کلی را نیز ارتقا می‌دهند. با پیچیده‌تر شدن برنامه‌های RAG، سرمایه‌گذاری در پایپلاین‌های جذب داده پیچیده‌تر، همچنان یک تمایزدهنده کلیدی برای پیاده‌سازی‌های موفق هوش مصنوعی باقی خواهد ماند.

Share: