AI APIs

بناء خطوط أنابيب RAG متعددة الوسائط باستخدام واجهة برمجة تطبيقات Google Gemini وVertex AI

أصبحت عملية التوليد المعزز بالاسترجاع (RAG) هي البنية القياسية للشركات التي تسعى إلى ربط نماذج اللغات الكبيرة (LLMs) ببياناتها الخاصة. ومع ذلك، تعتمد أنظمة RAG التقليدية بشكل أساسي على تضمينات النصوص، مما يحد من قدرتها على فهم البيانات الغنية وغير المهيكلة مثل الصور والرسوم البيانية ووثائق PDF الممسوحة ضوئيًا. ومن خلال دمج واجهة برمجة تطبيقات Gemini من Google مع Vertex AI، يمكن للمطورين بناء خطوط أنابيب RAG متعددة الوسائط متطورة تعالج ليس فقط النصوص، ولكن أي شكل من أشكال البيانات المدعومة من عائلة نماذج Gemini.

لماذا نتجاوز RAG القائم على النص فقط؟

في العديد من الصناعات، مثل القانونية والطبية والهندسية، غالبًا ما تكون المعلومات الحرجة مقفلة في تنسيقات بصرية. يحتوي مخطط واحد في تقرير ربع سنوي أو مخطط تخطيطي في دليل هندسي على معلومات دلالية كثيفة قد تفشل أدوات استخراج النص (مثل التعرف الضوئي على الحروف OCR) في التقاطها بدقة. تعتمد خطوط أنابيب البحث المتجهي التقليدية على تضمين النص المنسوخ فقط، مما يؤدي إلى فقدان الدقة السياقية التي يوفرها المكون البصري. ويعالج RAG متعدد الوسائط هذه الفجوة من خلال السماح لنظام الاسترجاع بالنظر في كل من الإشارات البصرية والنصية، مما يؤدي إلى توليد أكثر دقة وتفصيلاً.

بنية خط الأنابيب متعدد الوسائط

يتكون خط أنابيب RAG متعدد الوسائط القوي من ثلاث مراحل متميزة: الاستيعاب، والاسترجاع، والتوليد. في مرحلة الاستيعاب، تتم معالجة البيانات الخام (ملفات PDF والصور ومقاطع الفيديو). وعلى عكس RAG القياسي حيث نقوم بتقسيم النص، هنا يجب علينا استخراج النص وتضمين الصور أو مقاطع الفيديو في متجر متجهي موحد. يوفر Vertex AI Vector Search البنية التحتية القابلة للتوسع لتخزين هذه المتجهات عالية الأبعاد والاستعلام عنها.

تتضمن مرحلة الاسترجاع تضمين استعلام المستخدم. والأهم من ذلك، إذا كان الاستعلام نصيًا، فإننا لا نزال نستخدم نماذج تضمين متعددة الوسائط التي يمكنها ربط النص بنفس الفضاء المتجهي الخاص بالصور. في مرحلة التوليد، يتم تمرير السياق المسترجع—والذي يتكون من مقاطع نصية ووسائط مرتبطة بها—إلى نموذج Gemini، الذي يمتلك قدرات فهم متعددة الوسائط أصلية.

تنفيذ خط الأنابيب باستخدام Google Cloud SDK

يتطلب إعداد البيئة المصادقة مع Vertex AI واستخدام مكتبة `generative-ai` بلغة Python. فيما يلي مثال عملي لكيفية تهيئة نموذج Gemini وإعداد استعلام متعدد الوسائط.

from vertexai.generative_models import GenerativeModel, Part

# Initialize the multimodal model
model = GenerativeModel("gemini-pro-vision")

# Load local images and text for context
image_path = "financial_report_q3.png"
with open(image_path, "rb") as f:
    img = Part.from_data(f.read(), mime_type="image/png")

system_instruction = """You are an expert financial analyst. 
Analyze the provided chart and answer the user's question based on the visual data."""

# Construct the multimodal request
response = model.generate_content(
    [
        "What were the key revenue drivers in Q3?",
        img,
        {"text": system_instruction}
    ],
    generation_config={"temperature": 0.2}
)

print(response.text)

في هذا المثال، تتيح لنا طريقة `Part.from_data` تمرير بيانات الصورة الثنائية مباشرةً إلى طلب التوليد. وعند دمجها مع طبقة بحث متجهي، يتيح هذا النهج للمطورين استرداد صفحات محددة من ملف PDF مكون من 500 صفحة تحتوي على رسوم بيانية ذات صلة، ثم تغذية كل من النص من تلك الصفحات والصور الفعلية للرسوم البيانية إلى Gemini للتوليد النهائي.

أفضل الممارسات للإنتاج

عند توسيع نطاق هذه البنية، ضع في اعتبارك الآثار المترتبة على التكلفة الخاصة بالاستدلال متعدد الوسائط. إن معالجة الصور عالية الدقة أكثر تكلفة بشكل كبير من معالجة النصوص فقط. قم بتنفيذ استراتيجية متدرجة: استخدم التعرف الضوئي الخفيف على الحروف وتضمينات النصوص للاسترجاع الواسع الأولي، ثم قم فقط بتمرير الصور عالية الدقة إلى Gemini عندما تتجاوز درجة الصلة عتبة معينة. بالإضافة إلى ذلك، استفد من خدمات التأسيس في Vertex AI لضمان التزام الاستجابات المولدة بشكل صارم بالسياق متعدد الوسائط المسترجع، مما يقلل من مخاطر الهلوسة.

الخاتمة

يؤدي بناء خطوط أنابيب RAG متعددة الوسائط باستخدام واجهة برمجة تطبيقات Google Gemini وVertex AI إلى فتح مستوى جديد من الذكاء لتطبيقات المؤسسات. ومن خلال تجاوز النصوص، يمكن للمطورين بناء أنظمة تفهم العالم حقًا كما يفعله المستخدمون—من خلال مزيج من الكلمات والمرئيات. ومع استمرار تطور النماذج متعددة الوسائط، ستصبح القدرة على دمج هذه الأنواع المتنوعة من البيانات بسلاسة ميزة تنافسية في مشهد الذكاء الاصطناعي.

Share: