Evaluation

حماية الاسترجاع: استراتيجيات متقدمة لكشف الهلوسة الخاصة بـ RAG

أصبحت التوليد المعزز بالاسترجاع (RAG) المعيار الذهبي لتطبيقات نماذج اللغة الكبيرة (LLM) في المؤسسات، حيث تقدم حلاً لمشكلة هلوسة النماذج المزمنة من خلال ربط الردود بمصادر بيانات خارجية موثقة. ومع ذلك، لا يزال هناك سوء فهم حاسم: أن RAG يضمن دقة الحقائق تلقائياً. في الواقع، تقدم خطوط أنابيب RAG فئة فريدة من الهلوسة تُعرف بـ "الهلوسة السياقية" أو "هلوسة النسب"، حيث يقوم النموذج بتوليد معلومات تبدو معقولة ولكنها غير صحيحة، على الرغم من وصوله إلى الحقائق الصحيحة في السياق المسترجع.

بالنسبة للمطورين من المستوى المتوسط إلى المتقدم، يعد الانتقال إلى ما هو أبعد من مقاييس الدقة البسيطة أمراً ضرورياً. يجب علينا تقييم ليس فقط ما إذا كانت الإجابة صحيحة، بل ما إذا كانت الإجابة مؤسَّسة على البيانات المسترجعة وما إذا كانت آلية الاسترجاع نفسها تؤدي وظيفتها بشكل صحيح. يستكشف هذا المنشور الدقائق التقنية لتقييم صحة الحقائق في خطوط أنابيب RAG.

تشريح هلوسة RAG

لكشف الهلوسة بفعالية، يجب علينا أولاً تصنيفها. في خط أنابيب RAG القياسي، توجد طريقتان رئيسيتان للفشل:

  1. فشل الاسترجاع: يفشل النظام في جلب جزء المستند ذي الصلة، مما يدفع نموذج LLM للاعتماد على بيانات التدريب المسبقة الخاصة به (هلوسة المصدر).
  2. فشل التوليد: يتم استرجاع السياق الصحيح، لكن نموذج LAM يتجاهله، أو يتناقض معه، أو يهلوس بتفاصيل غير موجودة في المصدر (هلوسة التوليد).

يتطلب تقييم هذه الحالات نهجاً متعدد الأوجه. لا يمكننا الاعتماد حصراً على مقاييس المطابقة التامة. بدلاً من ذلك، نستخدم التشابه الدلالي ودرجات الموثوقية لقياس مدى توافق المخرجات المولدة مع الحقيقة الأساسية والسياق المسترجع.

مقاييس التقييم الرئيسية للصدق

تستخدم أطر عمل تقييم RAG الحديثة، مثل RAGAS أو DeepEval، ثلاثة مقاييس أساسية لتقييم الصدق:

  • الموثوقية (Faithfulness): تقيس ما إذا كان يمكن استنتاج الإجابة المولدة من السياق المقدم. وهذا هو الدفاع الأساسي ضد هلوسة التوليد.
  • صلة السياق: تقيم ما إذا كان السياق المسترجع يحتوي فعلياً على المعلومات اللازمة للإجابة على السؤال.
  • صلة الإجابة: تتحقق مما إذا كانت الإجابة المولدة تتناول استعلام المستخدم مباشرة.

من خلال الجمع بين هذه المقاييس، يمكننا عزل ما إذا كان الخطأ نشأ في خطوة الاسترجاع أم في خطوة التوليد.

تنفيذ فحوصات الصدق باستخدام الكود

لننظر في كيفية تنفيذ فحص عملي للموثوقية باستخدام إطار عمل تقييم افتراضي. فيما يلي مثال بلغة Python يوضح كيفية هيكلة نص تقييم يتحقق مما إذا كانت الإجابة المولدة مدعومة بالسياق المسترجع.

from ragas import evaluate
from ragas.metrics import faithfulness, context_precision
from datasets import Dataset

# افترض أن هذه المتغيرات تم ملؤها بواسطة خط أنابيب RAG الخاص بك
question = "ما كانت إيرادات الربع الثالث؟"
retrieved_contexts = ["أبلغت الشركة عن إيرادات بقيمة 5 ملايين دولار في الربع الثالث.", "كان ميزانية التسويق 10 آلاف دولار."]
generated_answer = "كانت الإيرادات في الربع الثالث 5 ملايين دولار."

# بناء مجموعة البيانات للتقييم
data = Dataset.from_dict({
    "question": [question],
    "retrieved_contexts": [retrieved_contexts],
    "answer": [generated_answer]
})

# التقييم ضد مقياس 'الموثوقية'
# تقيس الموثوقية مدى تأصيل الإجابة في السياق
results = evaluate(
    data,
    metrics=[faithfulness, context_precision],
    llm=your_llm_instance,
    embeddings=your_embedding_model
)

print(results)
# تتضمن المخرجات درجة موثوقية تتراوح بين 0 و 1

في الكود أعلاه، يعمل مقياس الموثوقية عادةً عن طريق تقسيم الإجابة المولدة إلى ادعاءات والتحقق مما إذا كان كل ادعاء مدعوماً بالسياق. إذا ذكر النموذج أن الإيرادات كانت 5 ملايين دولار، لكن السياق يقول 6 ملايين دولار، فسوف تنخفض درجة الموثوقية بشكل كبير، مما يشير إلى وجود هلوسة.

توصيات عملية للمطورين

للتخفيف من هلوسة RAG المحددة، ضع في الاعتبار أفضل الممارسات التالية:

  1. فرض التأسيس: قم بتكوين أوامر نموذج LLM الخاص بك لتوجيه النموذج صراحةً لاستخدام فقط السياق المقدم. إذا لم يحتوي السياق على الإجابة، وجه النموذج إلى القول "لا أعرف" بدلاً من التخمين.
  2. التحقق ما بعد التوليد: استخدم استدعاءً آخر لنموذج LLM للتحقق من المخرجات مقابل السياق المسترجع. يُعد نهج "LLM كحكم" فعالاً للغاية في اكتشاف الهلوسة الدقيقة.
  3. إعادة الترتيب: نفذ مُعيد ترتيب من نوع cross-encoder بعد البحث المتجهي الأولي لضمان تغذية أكثر الأجزاء صلة بنموذج LLM، مما يقلل من احتمالية فشل الاسترجاع.

الخاتمة

لا يُعد RAG حلاً سحرياً؛ إنه إطار عمل ينقل عبء الدقة من أوزان النموذج إلى بنية الاسترجاع. من خلال تنفيذ خطوط أنابيب تقييم صارمة وموجهة بالمقاييس التي تستهدف بشكل محدد الموثوقية وصلة السياق، يمكن للمطورين اكتشاف ومنع الهلوسة قبل وصولها إلى المستخدمين النهائيين. مع تطور هياكل RAG، يجب أن تتطور استراتيجيات التقييم لدينا أيضاً، للانتقال من فحوصات الدقة البسيطة إلى التقييمات الدقيقة متعددة الأبعاد للصدق والتأسيس.

Share: