AGI & Research

زنجیره تفکر در مقابل سیستم ۲: ارزیابی معماری‌های استدلال تأملی برای هوش عمومی مصنوعی

مسیر رسیدن به هوش عمومی مصنوعی (AGI) تنها در مقیاس‌بندی پارامترهای مدل نیست؛ بلکه اساساً درباره تغییر نحوه پردازش اطلاعات توسط مدل‌هاست. برای سال‌ها، مدل‌های زبانی بزرگ (LLMs) عمدتاً بر اساس تفکر سیستم ۱ عمل می‌کردند—تفکری سریع، شهودی و وابسته به همبستگی. با این حال، همان‌طور که از آن‌ها استدلال منطقی پیچیده‌تر، اثبات ریاضی و برنامه‌ریزی چندمرحله‌ای را طلب می‌کنیم، محدودیت‌های تولید صرفاً خودتوالی‌وار (auto-regressive) آشکار می‌شوند. این مقاله تغییر معماری به سمت استدلال سیستم ۲ را ارزیابی کرده و آن را با پارادایم به‌طور گسترده پذیرفته‌شده زنجیره تفکر (CoT) مقایسه می‌کند.

درک تغییر پارادایم

تفکر سیستم ۱، همان‌طور که توسط دانیل کانمن توصیف شده است، با سرعت و تلاش شناختی پایین مشخص می‌شود. در اصطلاح هوش مصنوعی، این مورد متناظر با پیش‌بینی توکن بعدی است که برای روان‌کلامی بهینه شده است. پرامپت‌دهی زنجیره تفکر (Chain-of-Thought) تلاش می‌کند با درخواست از مدل برای «نشان دادن کار خود»، تفکر کندتر را شبیه‌سازی کند. اگرچه این روش برای وظایف منطقی ساده مؤثر است، اما CoT همچنان یک فرآیند تولید یک‌بارگذر (single-pass) باقی می‌ماند. مدل یک فکر را تولید می‌کند، سپس فکر بعدی را، بدون توانایی بازتاب، عقب‌نشینی یا تأیید منطق خود قبل از نهایی کردن پاسخ.

استدلال سیستم ۲، در مقابل، تأمل را معرفی می‌کند. این شامل یک فاز متمایز از پردازش کند و تحلیلی است که در آن مدل می‌تواند مراحل میانی را ارزیابی، خطاها را اصلاح و فرضیه خود را قبل از خروجی نهایی بهبود بخشد. این نه تنها یک تکنیک پرامپت‌دهی است، بلکه یک تغییر ساختاری در حلقه استنتاج است که اغلب نیاز به یک مدل ناظر (critic) جداگانه یا یک مکانیسم بازخورد دارد.

پیاده‌سازی معماری: از دیدگاه کدنویسی

پیاده‌سازی یک رویکرد سیستم ۲ نیازمند انحراف از فراخوانی استاندارد model.generate() است. به جای آن، به یک حلقه کنترلی نیاز داریم که تولید را از تأیید جدا کند. در زیر ساختار شبه‌کد پایتون ساده‌شده‌ای آمده است که نشان می‌دهد یک معماری تأملی چگونه ممکن است در مقایسه با یک پیاده‌سازی استاندارد CoT عمل کند.

# پیاده‌سازی استاندارد زنجیره تفکر
def generate_cot(model, query):
    prompt = f"Let's think step by step. {query}"
    # تولید یک‌بارگذر: سریع، اما مستعد توهم
    response = model.generate(prompt, max_tokens=500)
    return response

# پیاده‌سازی سیستم ۲ تأملی
def generate_system2(model, verifier, query):
    thoughts = []
    current_hypothesis = None
    
    for step in range(max_steps):
        # مرحله ۱: تولید یک مرحله استدلال یا پاسخ احتمالی
        if not current_hypothesis:
            current_hypothesis = model.generate_step(query, thoughts)
        
        # مرحله ۲: ارزیابی انتقادی (بررسی «سیستم ۲»)
        is_valid = verifier.evaluate(current_hypothesis, query)
        
        if is_valid:
            return current_hypothesis
        else:
            # مرحله ۳: خوداصلاحی یا اندیشه مجدد
            thoughts.append(f"Rejected: {current_hypothesis}")
            current_hypothesis = None
            
    return "Failed to derive a valid answer within step limit"

در کد بالا، تابع verifier.evaluate حیاتی است. این تابع به عنوان گلوگاهی عمل می‌کند که سیستم را مجبور به کند شدن می‌کند. برخلاف CoT که توکن‌ها را صرف‌نظر از سازگاری منطقی به جلو می‌راند، معماری‌های سیستم ۲ یک دروازه کیفیت را اعمال می‌کنند.

تعادل‌ها: تأخیر در برابر دقت

عیب اصلی معماری‌های سیستم ۲، تأخیر است. با معرفی یک حلقه تأیید، زمان استنتاج می‌تواند به طور قابل توجهی افزایش یابد—گاهی تا یک مرتبه بزرگی. با این حال، برای کاربردهای با ریسک بالا مانند تشخیص پزشکی، تحلیل حقوقی یا رباتیک خودمختار، این تعادل توجیه‌پذیر است. تحقیقات نشان می‌دهند که در حالی که CoT دقت را نسبت به روش‌های بدون نمونه (zero-shot) بهبود می‌بخشد، استدلال تأملی سیستم ۲ نرخ خطا را در وظایف استدلال چندمرحله‌ای تا ۴۰٪ نسبت به CoT استاندارد کاهش می‌دهد.

نتیجه‌گیری

همان‌طور که به سمت سیستم‌های AGI توانمندتر حرکت می‌کنیم، تمایز بین سیستم ۱ و سیستم ۲ باید به یک ویژگی معماری تبدیل شود، نه صرفاً یک استراتژی پرامپت‌دهی. در حالی که زنجیره تفکر همچنان ابزاری ارزشمند برای اکتشافات سریع است، استدلال تأملی واقعی به ساختارهایی نیاز دارد که امکان بازتاب، تأیید و اصلاح را فراهم کنند. توسعه‌دهندگان باید در نظر بگیرند که مدل‌های ترکیبی را پیاده‌سازی کنند که از سیستم ۱ برای وظایف سریع و کم‌ریسک استفاده کرده و حلقه‌های استدلال سیستم ۲ را برای تصمیم‌گیری‌های پیچیده و با ریسک بالا فراخوانی کنند.

Share: