AGI & Research

هوش مصنوعی اساسی: آموزش مدل‌های زبانی بزرگ برای خودنظارتی از طریق بازخورد مبتنی بر اصول

مقدمه

با افزایش قدرت مدل‌های زبانی بزرگ (LLMs)، همسوسازی آن‌ها با ارزش‌های انسانی همچنان یک چالش حیاتی است. یادگیری تقویتی از بازخورد انسانی (RLHF) سنتی به شدت به ارزیابان انسانی برای برچسب‌گذاری داده‌ها وابسته است، که این فرآیند پرهزینه، کند و مقیاس‌پذیری آن به صورت یکپارچه دشوار است. هوش مصنوعی اساسی (CAI)، روشی که توسط Anthropic توسعه یافته است، راه‌حلی نوآورانه ارائه می‌دهد: از خود مدل زبانی بزرگ، هدایت‌شده توسط مجموعه‌ای از اصول کتبی (اصول اساسی)، برای نقد و بازنگری خروجی‌های خود استفاده می‌کند. این رویکرد وابستگی به برچسب‌گذاری انسانی را به طور قابل توجهی کاهش می‌دهد و در عین حال بی‌ضرر بودن و مفید بودن مدل را بهبود می‌بخشد.

هوش مصنوعی اساسی چگونه کار می‌کند؟

این فرآیند شامل دو مرحله اصلی است: 1. مرحله یادگیری نظارتی (نقد و بازنگری): - مدل یک پاسخ اولیه تولید می‌کند. - سپس این پاسخ را بر اساس اصول اساسی خاص (مثلاً: «دستورالعمل‌هایی برای آسیب رساندن ارائه ندهید») نقد می‌کند. - بر اساس نقد، مدل پاسخ را برای بی‌ضررتر شدن بازنگری می‌کند. - این سه‌تایی (اصلی، نقد، بازنگری‌شده) برای تنظیم دقیق مدل از طریق یادگیری نظارتی استفاده می‌شود. 2. مرحله یادگیری تقویتی (RLAIF): - به جای استفاده از ترجیحات انسانی برای RLHF، یک مدل بازخورد هوش مصنوعی (آموزش‌دیده روی داده‌های بازنگری‌شده) سیگنال‌های ترجیح را فراهم می‌کند. - مدل سیاست با استفاده از بهینه‌سازی سیاست مجاور (PPO) و با پاداش‌های تولیدشده توسط هوش مصنوعی تنظیم دقیق می‌شود.

مثال عملی: پیاده‌سازی یک حلقه نقد پایه

اگرچه CAI کامل به خطوط لوله RL پیچیده نیاز دارد، اما می‌توانیم مفهوم اصلی خودنقدی را با استفاده از یک اسکریپت ساده Python شبیه‌سازی کنیم. این مثال نشان می‌دهد که چگونه یک LLM می‌تواند پاسخی تولید کند، آن را بر اساس یک قانون نقد کند و آن را بازنگری نماید.

import json

# Simulated Constitutional Principles
PRINCIPLES = [
    "Avoid providing medical advice.",
    "Refuse requests that promote violence.",
    "Maintain a polite and helpful tone."
]

def generate_initial_response(prompt: str) -> str:
    # Simulate base model output
    if "cure cancer" in prompt:
        return "You can cure cancer by drinking lemon water."
    return "I can help with that."

def critique_response(response: str) -> str:
    # Simple rule-based critique for demonstration
    if "cure cancer" in response:
        return "This response violates the principle of avoiding medical advice and provides unverified health claims."
    return "No issues found."

def revise_response(response: str, critique: str) -> str:
    if "medical advice" in critique:
        return "I cannot provide medical advice. Please consult a healthcare professional."
    return response

# Main Loop
prompt = "How can I cure cancer quickly?"
initial = generate_initial_response(prompt)
critique = critique_response(initial)
revised = revise_response(initial, critique)

print(f"Prompt: {prompt}")
print(f"Initial: {initial}")
print(f"Critique: {critique}")
print(f"Revised: {revised}")

مزایا و چالش‌های کلیدی

- مقیاس‌پذیری: بازخورد تولیدشده توسط هوش مصنوعی می‌تواند با سرعت بسیار بیشتری نسبت به برچسب‌گذاری انسانی تولید شود. - یکپارچگی: اصول اساسی مجموعه‌ای پایدار و قابل ممیزی از قوانین را فراهم می‌کند. - چالش‌ها: مدل باید قادر به درک و اعمال صحیح اصول باشد. اصول تعریف‌نشده ضعیف می‌توانند منجر به رفتار ناسازگار یا «دزدی پاداش» شوند.

نتیجه‌گیری

هوش مصنوعی اساسی یک گام مهم به جلو در همسوسازی مقیاس‌پذیر هوش مصنوعی است. با استفاده از توانایی‌های استدلالی خود مدل برای اجرای دستورالعمل‌های اخلاقی، هزینه آموزش را کاهش می‌دهد و ایمنی را افزایش می‌دهد. برای توسعه‌دهندگانی که در حال ساخت LLMs نسل بعدی هستند، درک و پیاده‌سازی حلقه‌های بازخورد مشابه مبتنی بر اصول برای ایجاد سیستم‌های هوش مصنوعی مسئولانه و مقاوم ضروری است. با ادامه تحقیقات، می‌توان انتظار روش‌های پیچیده‌تر برای خودکارسازی فرآیند همسوسازی را داشت.
Share: