AGI & Research

هوش مصنوعی اساسی: بازتعریف همسویی بدون بازخورد انسانی

با تکامل منظر هوش مصنوعی عمومی (AGI)، چالش همسوسازی مدل‌های زبانی بزرگ (LLMs) با ارزش‌های انسانی به امری حیاتی تبدیل شده است. در حالی که یادگیری تقویتی از بازخورد انسانی (RLHF) سال‌هاست که استاندارد صنعت است، اما با موانع قابل توجهی در مقیاس‌پذیری و هزینه مواجه است. هوش مصنوعی اساسی (CAI) که پارادایمی معرفی شده توسط آنتروپیک (Anthropic) است، راهکاری را ارائه می‌دهد که در آن مدل‌ها با استفاده از مجموعه‌ای از اصول و قواعد پایه‌ای همسو می‌شوند، به جای تکیه شدید بر داده‌های ترجیح انسانی که پرهزینه هستند. این پست به بررسی زیرساخت‌های فنی هوش مصنوعی اساسی، اهمیت آن برای ایمنی AGI و نحوه پیاده‌سازی مکانیسم‌های خودتصحیح مشابه توسط توسعه‌دهندگان می‌پردازد.

محدودیت‌های RLHF سنتی

RLHF سنتی شامل آموزش مدلی است تا پاسخ‌ها را تولید کند، جمع‌آوری بازخورد انسانی برای رتبه‌بندی آن پاسخ‌ها، و سپس آموزش یک مدل پاداش بر اساس آن ترجیحات است. اگرچه این فرآیند مؤثر است، اما نیروی کار زیادی می‌طلبد و مقیاس‌پذیری آن دشوار است. علاوه بر این، می‌تواند به طور ناخواسته سوگیری‌های داوران انسانی خاصی که در مجموعه داده استفاده شده‌اند را در مدل نهفته کند. هوش مصنوعی اساسی با جایگزین کردن بازخورد انسانی با یک «اساسنامه» – لیستی از اصول راهنما که مدل باید از آن‌ها پیروی کند – این مشکلات را برطرف می‌سازد.

نحوه عملکرد هوش مصنوعی اساسی

نوآوری اصلی هوش مصنوعی اساسی در استفاده از مکانیسم خودانتقادی آن نهفته است. به جای اینکه از انسان‌ها خواسته شود تا خروجی را قضاوت کنند، از مدل خواسته می‌شود تا خروجی خود را بر اساس مجموعه‌ای از قوانین از پیش تعریف شده نقد کند. این فرآیند معمولاً مراحل زیر را دنبال می‌کند:

  1. تنظیم دقیق نظارتی (SFT) با خودانتقادی: مدل یک پاسخ اولیه تولید می‌کند. سپس این پاسخ را بر اساس اساسنامه نقد می‌کند. در نهایت، پاسخ اصلاح‌شده‌ای را که نقد را در بر دارد، تولید می‌کند.
  2. آموزش بر اساس بازنگری‌ها: مدل بر روی پاسخ‌های اصلاح‌شده تنظیم دقیق می‌شود تا به مدل بیاموزد که به طور خودکار با اصول اساسنامه همسو شود.
  3. بهینه‌سازی ترجیحات: مشابه RLHF، یک مدل ترجیح آموزش می‌بیند تا بین پاسخ‌های خوب و بد تمایز قائل شود، اما داده‌ها از طریق این حلقه خودبهبودی به جای برچسب‌گذاری انسانی تولید می‌شوند.

پیاده‌سازی حلقه‌های خودانتقادی

برای توسعه‌دهندگانی که به دنبال نمونه‌سازی اولیه مفاهیم هوش مصنوعی اساسی هستند، پیاده‌سازی یک حلقه خودانتقادی در دسترس‌ترین نقطه ورود است. در زیر یک مثال ساده پایتون آورده شده است که نشان می‌دهد چگونه می‌توان یک پرامپت را ساخت که مدل را مجبور می‌کند تا قبل از نهایی کردن پاسخ، خروجی خود را بر اساس دستورالعمل‌های ایمنی خاص ارزیابی کند.

import openai

def constitutional_ai_loop(user_prompt, constitution_rules):
    # Step 1: Initial Generation
    initial_response = openai.ChatCompletion.create(
        model="gpt-4",
        messages=[{"role": "user", "content": user_prompt}]
    ).choices[0].message.content

    # Step 2: Generate Critique
    critique_prompt = f"""
    Evaluate the following response against these constitutional rules:
    {constitution_rules}
    
    Response: {initial_response}
    
    Provide a critique pointing out any violations.
    """
    critique = openai.ChatCompletion.create(
        model="gpt-4",
        messages=[{"role": "user", "content": critique_prompt}]
    ).choices[0].message.content

    # Step 3: Revise based on Critique
    revision_prompt = f"""
    Revise the following response to address the critique.
    
    Critique: {critique}
    Original Response: {initial_response}
    
    Revised Response:
    """
    revised_response = openai.ChatCompletion.create(
        model="gpt-4",
        messages=[{"role": "user", "content": revision_prompt}]
    ).choices[0].message.content

    return revised_response

# Example Usage
rules = "- Do not provide instructions for illegal activities.\n- Be polite and respectful."
final_output = constitutional_ai_loop("How do I hack a bank account?", rules)
print(final_output)

پیامدهای عملی برای تحقیقات AGI

هوش مصنوعی اساسی مسیر مقیاس‌پذیرتری برای همسویی ارائه می‌دهد. با خودکارسازی حلقه بازخورد، محققان می‌توانند بدون مداخله انسانی، حجم عظیمی از داده‌های آموزشی تولید کنند. این موضوع برای تحقیقات AGI حیاتی است، جایی که سیستم‌ها باید به طور مستقل در محیط‌های پیچیده و تعریف‌نشده عمل کنند. علاوه بر این، CAI امکان همسویی شفاف‌تری را فراهم می‌کند؛ «اساسنامه» به عنوان یک ردیف حسابرسی عمل می‌کند و ردیابی دلیل تصمیم خاص مدل را آسان‌تر می‌سازد.

با این حال، چالش‌هایی باقی مانده است. کیفیت خروجی به شدت به کیفیت اساسنامه وابسته است. قوانین به خوبی تعریف نشده می‌توانند منجر به رفتارهای خشک یا غیرمنطقی شوند. علاوه بر این، مدل‌ها ممکن است یاد بگیرند که اگر قوانین مبهم باشند، سیستم نقد را «فریب» دهند.

نتیجه‌گیری

هوش مصنوعی اساسی نشان‌دهنده تغییر قابل توجهی در نحوه رویکرد ما به همسویی ماشین است. با بهره‌گیری از خودانتقادی و مجموعه‌های قواعد اصولی، این روش جایگزینی مقیاس‌پذیر، شفاف و بالقوه قوی‌تر برای روش‌های سنتی مبتنی بر بازخورد انسانی ارائه می‌دهد. با نزدیک‌تر شدن ما به دستیابی به AGI، تکنیک‌هایی مانند CAI به احتمال زیاد بنیادی خواهند شد و اطمینان حاصل می‌کنند که قدرتمندترین سیستم‌های هوش مصنوعی ما ایمن، مفید و همسو با ارزش‌های انسانی باقی بمانند. هم توسعه‌دهندگان و هم محققان باید به این پارادایم توجه ویژه‌ای داشته باشند، زیرا این پارادایم ممکن است نسل بعدی توسعه هوش مصنوعی ایمن را تعریف کند.

Share: