AGI & Research

فراتر از هوش مصنوعی اساسی: ارزیابی مکانیسم‌های نظارت مقیاس‌پذیر و مناظره برای هم‌راستایی AGI

با پیشرفت سریع حوزه هوش مصنوعی به سمت هوش مصنوعی عمومی (AGI)، مسئله هم‌راستایی از یک کنجکاوی نظری به یک اولویت وجودی تبدیل شده است. برای سال‌ها، پارادایم غالب بر روش‌هایی مانند یادگیری تقویتی از بازخورد انسانی (RLHF) و چارچوب جدیدتر هوش مصنوعی اساسی استوار بوده است، جایی که مدل‌ها بر اساس مجموعه‌ای ثابت از اصول آموزش می‌بینند.

با این حال، با افزایش قابلیت‌های مدل‌ها، بررسی انسانی به گلوگاه اصلی تبدیل می‌شود. ما نمی‌توانیم میلیاردها تعامل را برچسب‌گذاری کنیم و همچنین انسان‌ها نمی‌توانند رفتارهای پیچیده و فریبکارانه را در فضاهای پارامتری با ابعاد بالا به طور قابل اعتماد تشخیص دهند. این پست وبلاگ به بررسی مرز بعدی می‌پردازد: مکانیسم‌های نظارت مقیاس‌پذیر و مناظره که به ما اجازه می‌دهند سیستم‌های فراتر از انسان را تنها با استفاده از هوش متواضع انسانی نظارت کنیم.

گلوگاه نظارت مستقیم

هوش مصنوعی اساسی با این ایده کار می‌کند که یک هوش مصنوعی بر اساس یک اساسنامه از پیش تعریف شده، هوش مصنوعی دیگر را نقد کند. اگرچه این روش برای کاهش خروجی‌های مضر موثر است، اما فرض می‌کند که اساسنامه کامل است و ناقد هوشمندتر یا هم‌سطح مدل مورد نقد است. در یک رژیم فراتر از انسان، این فرضیه شکست می‌خورد. ما به مکانیسم‌هایی نیاز داریم که در آن‌ها یک ناظر ضعیف همچنان بتواند صحت یک عامل قوی را تأیید کند.

اینجاست که یادگیری تقویتی معکوس مشارکتی (CIRL) و مناظره وارد عمل می‌شوند. این رویکردها از محاسبات برای پر کردن شکاف بین قضاوت انسانی و قابلیت ماشین استفاده می‌کنند.

همکاری خصمانه: پروتکل مناظره

کار جیم بوش و پل کریستیانو در مورد مناظره پارادایمی را پیشنهاد می‌کند که در آن دو عامل هوش مصنوعی بر سر یک سوال بحث می‌کنند و یک داور انسانی برنده را انتخاب می‌کند. نکته کلیدی این است که اگر حقیقت تمایزپذیرتر از دروغ‌ها باشد، عاملی که از حقیقت دفاع می‌کند مزیت ساختاری خواهد داشت. با شکستن تدریجی سوالات پیچیده به زیرسوالات ساده‌تر، حتی یک داور غیرمتخصص نیز می‌تواند در نهایت مرحله نهایی را تأیید کند.

پیاده‌سازی این روش نیازمند یک حلقه ارزیابی خاص است. در زیر یک نمونه شبه‌کد از نحوه ساختاردهی یک دور مناظره در یک شبیه‌سازی مبتنی بر پایتون آورده شده است:

class DebateRound:
    def __init__(self, question, agents, judge):
        self.question = question
        self.agents = [agents[0], agents[1]] # Agent A and Agent B
        self.judge = judge
        self.turns = 0
        self.max_turns = 5

    def run_simulation(self):
        print(f"Starting debate on: {self.question}")
        while self.turns < self.max_turns:
            # Each agent generates an argument based on the state
            arguments = [agent.generate_argument(self.question) for agent in self.agents]
            
            # Judge evaluates which argument is more truthful/convincing
            winner_index = self.judge.evaluate(arguments)
            
            # The winning argument advances; the other side must rebut
            print(f"Turn {self.turns + 1}: Agent {winner_index} wins this segment.")
            self.turns += 1
            
        # Final verdict based on accumulated evidence
        return self.judge.final_verdict(arguments)

# Example Usage
judge = HumanJudgmentModel()
debate = DebateRound("Is the proposed climate policy economically viable?", 
                     [AgentA, AgentB], judge)
result = debate.run_simulation()

نظارت مقیاس‌پذیر از طریق تأیید صحت

یک مکانیسم حیاتی دیگر تأیید صحت است. اگر بتوانیم یک راه‌حل را سریع‌تر از آنکه بتوانیم آن را پیدا کنیم، تأیید صحت کنیم، می‌توانیم از هوش مصنوعی برای یافتن راه‌حل‌ها و از انسان‌ها برای تأیید آن‌ها استفاده کنیم. این موضوع در اثبات قضایای ریاضی رایج است. برای AGI، این بدان معناست که سیستم‌هایی را طراحی کنیم که در آن‌ها اثبات ایمنی یک اقدام، از نظر محاسباتی ارزان‌تر برای بررسی باشد تا خود اقدام برای انجام.

کاربرد عملی شامل پیاده‌سازی خطوط لوله اعتبارسنجی خصمانه است. به جای اینکه از انسان بپرسیم «آیا این خوب است؟»، از آن‌ها می‌پرسیم «آیا این بد است؟» در ابعاد خاص و با ریسک بالا. این بار شناختی را کاهش می‌دهد و امکان مقیاس‌پذیری نظارت را در سراسر میلیون‌ها خروجی فراهم می‌کند.

نتیجه‌گیری

با نزدیک شدن به AGI، تکیه صرف بر قوانین اساسی ایستا کافی نیست. ما باید مکانیسم‌های نظارتی پویا، خصمانه و قابل تأیید را بپذیریم. مناظره به ما اجازه می‌دهد پیچیدگی را تجزیه کنیم، در حالی که نظارت مقیاس‌پذیر به ما امکان می‌دهد از قضاوت انسانی در مقیاس ماشین استفاده کنیم. آینده ایمنی هوش مصنوعی نه تنها در آنچه به هوش مصنوعی می‌گوییم انجام دهد، بلکه در نحوه معماری سیستم‌هایی است که به ما اجازه می‌دهند به آن‌ها اعتماد کنیم.

Share: