برای دههها، پارادایم غالب در یادگیری ماشین واکنشی بوده است. سیستمهایی مانند مدلهای زبانی بزرگ (LLM) یا طبقهبندهای تصویر، ورودیها را پردازش و خروجی تولید میکنند و بر اساس الگوهای ایستا یافتشده در دادههای آموزشی عمل مینمایند. با این حال، هوش مصنوعی عمومی (AGI) واقعی فراتر از تطبیق الگو نیاز دارد؛ این هوش به درک نیازمند است. برای درک جهان، یک عامل باید بتواند پیشبینی کند که چه اتفاقی بعداً رخ میدهد. این قابلیت، پایه و اساس مدلهای جهان است.
در این پست، ما معماری فنی پشت مدلهای جهان را بررسی خواهیم کرد، تفاوت آنها با عاملهای استاندارد یادگیری تقویتی را نشان میدهیم و دلیل اینکه چرا آنها یک جهش حیاتی به سمت هوش مصنوعی متجسم (Embodied AI) محسوب میشوند را توضیح میدهیم.
مدل جهان چیست؟
یک مدل جهان، یک نمایش درونی فشرده از محیط است که به یک عامل اجازه میدهد حالتها و پیامدهای آینده را شبیهسازی کند. به جای تعامل مستقیم با جهان فیزیکی یا دیجیتال برای هر تصمیم، عامل اقدامات خود را درون شبیهسازی درونی خود اجرا میکند. این امر پیچیدگی نمونهبرداری را کاهش داده و امکان استدلال «شبهواقعگرایانه» (Counterfactual) را فراهم میآورد—یعنی پرسیدن «چه میشد اگر...؟» بدون عواقب دنیای واقعی.
این مفهوم بهطور مشهور توسط دپمایند (DeepMind) در مقالاتی مانند عاملهای تقویتشده عمیق با تخیل افزوده (Imagination-Augmented Agents for Deep Reinforcement Learning) در سال ۲۰۱۸ محبوبیت یافت. بینش اصلی این است که با یادگیری یک مدل پویایی، یک عامل میتواند در فضای پنهان (Latent Space) برنامهریزی کند که هزینه محاسباتی جستجو را به شدت کاهش میدهد.
اجزای معماری
ساخت یک مدل جهان قوی معمولاً شامل سه جزء اصلی شبکه عصبی است:
- کدگذار (Encoder): مشاهدات با ابعاد بالا (مانند تصاویر یا دادههای حسگر) را به یک بردار پنهان فشرده میکند.
- مدل پویایی (Dynamics Model): حالت پنهان بعدی را با توجه به حالت پنهان فعلی و اقدام انجامشده پیشبینی میکند.
- کدگشای (Decoder): مشاهده را از حالت پنهان بازسازی میکند تا یک سیگنال آموزشی (خطای بازسازی) ارائه دهد.
با حداقل کردن خطای بازسازی، کدگذار یاد میگیرد که تنها اطلاعات مرتبط با پیشبینی آینده را حفظ کند و نویز را دور بریزد.
پیادهسازی یک مدل جهان پایه در PyTorch
در زیر یک پیادهسازی سادهشده از لایه دینامیک مدل جهان در PyTorch آورده شده است. در این مثال، از یک پرسپترون چندلایه (MLP) ساده برای پیشبینی حالت بعدی در یک جهان شبکهای گسسته استفاده میکنیم.
import torch
import torch.nn as nn
class WorldModelDynamics(nn.Module):
def __init__(self, input_dim, hidden_dim, output_dim):
super(WorldModelDynamics, self).__init__()
# مدل دینامیک حالت پنهان بعدی را پیشبینی میکند
self.net = nn.Sequential(
nn.Linear(input_dim, hidden_dim),
nn.ReLU(),
nn.Linear(hidden_dim, hidden_dim),
nn.ReLU(),
nn.Linear(hidden_dim, output_dim)
)
def forward(self, latent_state, action):
"""
Args:
latent_state: نمایش حالت فعلی [batch_size, latent_dim]
action: اقدام انجامشده [batch_size, action_dim]
Returns:
predicted_next_state: پیشبینی حالت بعدی [batch_size, output_dim]
"""
# حالت و اقدام را برای پیشبینی انتقال کنار هم قرار میدهیم
input_tensor = torch.cat((latent_state, action), dim=-1)
return self.net(input_tensor)
# مثال استفاده
# فرض بر این است که فضای پنهان ۶۴ بعدی، اقدامات ۴ بعدی و حالت بعدی ۶۴ بعدی باشد
model = WorldModelDynamics(input_dim=68, hidden_dim=128, output_dim=64)
current_state = torch.randn(32, 64)
action = torch.randint(0, 4, (32, 4)).float()
predicted_next = model(current_state, action)
چرا این موضوع برای AGI مهم است؟
الگوریتمهای سنتی یادگیری تقویتی مانند PPO یا DQN اغلب به میلیونها مرحله برای یادگیری یک وظیفه ساده نیاز دارند، زیرا باید مکرراً با محیط تعامل کنند. مدلهای جهان به عاملها اجازه میدهند تا بر اساس تجربیات تخیلی خود آموزش ببینند. این امر شبیه به این است که یک استاد بزرگ شطرنج هزاران بازی را در ذهن خود بدون لمس صفحه شطرنج انجام دهد.
علاوه بر این، مدلهای جهان یادگیری با نمونههای کم (Few-shot learning) را امکانپذیر میسازند. اگر یک عامل فیزیک و قوانین یک محیط جدید را از طریق مدل درونی خود درک کند، میتواند بسیار سریعتر از مدلی که از صفر و از طریق آزمون و خطا یاد میگیرد، سازگار شود.
نتیجهگیری
مدلهای جهان نشاندهنده همگرایی ادراک، پیشبینی و برنامهریزی هستند. با انتقال بار استدلال از مجموعههای قوانین صریح به شبیهسازیهای درونی یادگرفتهشده، ما به سیستمهای هوش مصنوعی نزدیکتر میشویم که میتوانند تعمیم دهند، استدلال کنند و در محیطهای باز عمل نمایند. با پیشرفت پژوهشها، انتظار میرود مدلهای جهان نه تنها در رباتیک، بلکه در خود مدلهای زبانی بزرگ (LLM) نیز ادغام شوند تا آنها بتوانند پیش از پاسخ دادن، پیامدهای فیزیکی و منطقی را شبیهسازی کنند.