Knowledge Bases

ساخت پایپ‌لاین‌های RAG مقاوم

تولید تقویت‌شده با بازیابی (RAG) به استاندارد تبدیل شده است تا به مدل‌های زبانی بزرگ (LLMs) امکان استدلال بر روی داده‌های اختصاصی را بدهد. با این حال، کیفیت سیستم RAG شما به شدت به کیفیت پایگاه دانش آن وابسته است. هنگام کار با اسناد غیرساختاریافته مانند PDFهای اسکن‌شده یا فاکتورهای پیچیده، صرفاً ریختن متن در یک مخزن برداری منجر به نتایج بازیابی ضعیف می‌شود. برای پر کردن این شکاف، توسعه‌دهندگان باید یک پایپ‌لاین جامع پردازش سند از ابتدا تا انتها را هماهنگ کنند که شامل تشخیص نوری کاراکتر (OCR)، تحلیل پیشرفته چیدمان و استراتژی‌های تکه‌تکه کردن هوشمند است.

مرحله ۱: OCR دقیق و تحلیل چیدمان

اولین مانع در پردازش اسناد، استخراج دقیق متن است. موتورهای استاندارد OCR اغلب در کار با چیدمان‌های پیچیده، مانند مقالات چند ستونه، جداول یا سربرگ‌ها، مشکل دارند. برای حل این مشکل، باید فراتر از استخراج متن ساده حرکت کنیم و از OCR آگاه از چیدمان استفاده کنیم. این کار شامل استفاده از ابزارهایی مانند AWS Textract، Google Document AI یا راه‌حل‌های متن‌باز مانند PaddleOCR برای تشخیص عناصر ساختاری است.

تحلیل چیدمان به سیستم اجازه می‌دهد سلسله‌مراتب سند را درک کند. برای مثال، یک سربرگ نباید بلافاصله با متن بدنه زیر آن تکه‌تکه شود، اگر آن‌ها مفاهیم متفاوتی را نشان می‌دهند. با استخراج جعبه‌های محدود (bounding boxes) و ترتیب خواندن، ما رابطه معنایی بین بخش‌های مختلف سند را حفظ می‌کنیم.

مرحله ۲: استراتژی‌های تکه‌تکه کردن معنایی

پس از استخراج متن، روش تکه‌تکه کردن تعیین می‌کند که داده‌ها چقدر خوب با پرس‌وجوهای کاربر همسو می‌شوند. تکه‌تکه کردن ثابت با اندازه مشخص (مثلاً تقسیم هر ۵۰۰ کاراکتر) اغلب جملات را می‌شکند یا مفاهیم مرتبط را از هم جدا می‌کند. رویکرد کارآمدتری، تکه‌تکه کردن معنایی یا ساختاری است.

تکه‌تکه کردن ساختاری از سرتیترها و پاراگراف‌هایی که در طول تحلیل چیدمان شناسایی شده‌اند برای ایجاد تکه‌های غنی از زمینه استفاده می‌کند. به عنوان جایگزین، می‌توان از تقسیم کاراکتری بازگشتی با یک آستانه اندازه حداقل تکه استفاده کرد تا از کامل بودن اطمینان حاصل شود. در اینجا یک مثال عملی با استفاده از پایتون و کتابخانه LangChain برای پیاده‌سازی یک استراتژی تکه‌تکه کردن مقاوم آورده شده است:

from langchain.text_splitter import RecursiveCharacterTextSplitter

def create_smart_chunks(text, chunk_size=800, chunk_overlap=200):
    """
    متن را با استفاده از تقسیم کاراکتری بازگشتی تقسیم می‌کند تا
    یکپارچگی معنایی را بهتر از تقسیم‌های طول ثابت حفظ کند.
    """
    splitter = RecursiveCharacterTextSplitter(
        chunk_size=chunk_size,
        chunk_overlap=chunk_overlap,
        length_function=len,
        is_separator_regex=False,
    )
    return splitter.create_documents([text])

# مثال استفاده با خروجی OCR
raw_ocr_text = "Invoice #123\\nDate: 2023-10-01\\nTotal: $500"
chunks = create_smart_chunks(raw_ocr_text)
for chunk in chunks:
    print(chunk.page_content)

مرحله ۳: غنی‌سازی متاداده برای فیلتر کردن بهتر

یک جزء حیاتی یک سیستم RAG با عملکرد بالا، فیلتر کردن متاداده است. هر تکه باید با متاداده‌ای که از تحلیل چیدمان مشتق شده است، غنی شود، مانند نام فایل منبع، شماره صفحه و سرتیترهای بخش تشخیص داده شده. این امکان فیلتر کردن پیش‌دستانه را در طول بازیابی فراهم می‌کند. برای مثال، اگر کاربر درباره «قیمت‌گذاری» بپرسد، سیستم می‌تواند تکه‌ها را به آن‌هایی که با بخش‌های مالی برچسب‌گذاری شده‌اند محدود کند و این کار نویز را به شدت کاهش می‌دهد.

نتیجه‌گیری

هماهنگ‌سازی پردازش سند از ابتدا تا انتها تنها درباره استخراج متن نیست؛ بلکه درباره حفظ زمینه است. با یکپارچه‌سازی OCR دقیق، درک چیدمان سند و به کارگیری استراتژی‌های تکه‌تکه کردن هوشمند، توسعه‌دهندگان می‌توانند دقت و قابلیت اطمینان برنامه‌های RAG خود را به طور قابل توجهی افزایش دهند. این رویکرد چندمرحله‌ای داده‌های خام و غیرساختاریافته را به یک پایگاه دانش قابل پرس‌وجو و غنی از نظر معنایی تبدیل می‌کند و پتانسیل واقعی LLMها را در محیط‌های سازمانی آزاد می‌سازد.

Share: