Local AI

باز کردن قفل هوش مصنوعی محلی با عملکرد بالا: نگاهی عمیق به SGLang

با افزایش تقاضا برای استقرار مدل‌های زبانی بزرگ (LLM) به صورت محلی، توسعه‌دهندگان با محدودیت موتورهای استنتاج سنتی مواجه می‌شوند. در حالی که چارچوب‌هایی مانند vLLM در فضای سمت سرور تسلط دارند، بخش استقرار محلی و لبه اغلب با راه‌حل‌های کندتر و کمتر بهینه روبرو بوده است. اینجا SGLang (زبان تولید ساختاریافته) وارد می‌شود؛ یک کتابخانه متن‌باز جدید که وعده پر کردن این شکاف را با ارائه قابلیت‌های تولید ساختاریافته با عملکرد بالا می‌دهد که برای جریان‌های کاری هوش مصنوعی مدرن طراحی شده‌اند.

SGLang صرفاً یک بسته استنتاج دیگر نیست؛ بلکه یک سیستم جامع است که برای بهینه‌سازی خط لوله از بارگذاری مدل تا تجزیه خروجی طراحی شده است. برای توسعه‌دهندگان متوسط و پیشرفته‌ای که می‌خواهند LLMها را بدون تکیه بر APIهای ابری به صورت محلی اجرا کنند، درک SGLang به یک ضرورت تبدیل شده است.

چرا SGLang؟ مزایای اصلی

چالش اصلی در استقرار LLM محلی، تعادل بین سرعت و نیاز به خروجی‌های ساختاریافته (مانند JSON) بدون قربانی کردن نرخ پردازش است. SGLang این موضوع را از طریق چندین نوآوری معماری کلیدی حل می‌کند:

  1. توجه رادیکسی (Radix Attention): SGLang یک حافظه پنهان KV مبتنی بر درخت رادیکسی معرفی می‌کند. این امکان را به سیستم می‌دهد تا پیشوندهای مشترک در زمینه را ذخیره و دوباره استفاده کند که به طور قابل توجهی استفاده از حافظه را کاهش داده و تأخیر را هنگام کار با دسته‌ای از پرامپت‌های مشابه بهبود می‌بخشد.
  2. تولید ساختاریافته: برخلاف بسیاری از موتورهایی که برای اصلاح JSON نامعتبر به پردازش پس‌زمینه نیاز دارند، SGLang طرح‌های خروجی را در طول فرآیند تولید اعمال می‌کند. این تضمین می‌کند که خروجی همیشه مطابق با گرامر یا طرح JSON تعریف شده معتبر است و نیاز به حلقه‌های تلاش مجدد را از بین می‌برد.
  3. اجرای سریع: با بهینه‌سازی عملیات هسته برای توجه و محاسبات، SGLang به سرعت‌هایی می‌رسد که با بسیاری از جایگزین‌های محبوب رقابت می‌کند یا از آن‌ها پیشی می‌گیرد و آن را برای برنامه‌های کاربردی بلادرنگ مناسب می‌سازد.

شروع به کار: نصب و راه‌اندازی

نصب SGLang ساده است، اما به یک محیط سازگار با پشتیبانی از PyTorch و CUDA نیاز دارد. قبل از ادامه، مطمئن شوید که Python 3.8 یا بالاتر را نصب کرده‌اید.

ابتدا، کتابخانه اصلی را با استفاده از pip نصب کنید:

pip install sglang

برای کسانی که می‌خواهند از شتاب GPU استفاده کنند، ممکن است نیاز به نصب کتابخانه‌های بک‌اند خاص داشته باشند. به عنوان مثال، اگر از سرور زمان اجرای SGLang استفاده می‌کنید:

pip install sglang[all]
python -m sglang.launch_server --model-path meta-llama/Llama-2-7b-chat-hf --port 30000

این دستور یک سرور استنتاج محلی را راه‌اندازی می‌کند و مدل را از طریق یک API REST در دسترس قرار می‌دهد. سپس می‌توانید با استفاده از درخواست‌های Python یا کتابخانه‌های مشتری ارائه شده با آن تعامل داشته باشید.

پیاده‌سازی تولید ساختاریافته

ویژگی برجسته SGLang توانایی آن در محدود کردن خروجی است. بیایید به یک مثال عملی نگاه کنیم که در آن فیلدهای داده خاصی را از یک ورودی متنی با استفاده از یک طرح مشابه Pydantic استخراج می‌کنیم.

import sglang as sgl
import json

# تعریف یک طرح ساده برای استخراج
class PersonInfo(sgl.StructuredOutput):
    name: str
    age: int
    occupation: str

@sgl.function
def extract_person_info(s, text):
    s += "Text: " + text + "\n"
    s += "Extracted Info:" + sgl.gen(
        "info", 
        max_tokens=100, 
        stop="\n",
        regex=r'{"name": "\w+", "age": \d+, "occupation": "\w+"}'
    )

# راه‌اندازی مدل
llm = sgl.Engine(model_path="meta-llama/Llama-2-7b-chat-hf")

# اجرای تابع
state = extract_person_info.run(
    "John Doe is a 30-year-old software engineer living in NYC.",
    engine=llm
)

# دسترسی به خروجی ساختاریافته
print(state["info"])

در این مثال، پارامتر regex در sgl.gen مدل را مجبور می‌کند خروجی تولید کند که به شدت با الگوی JSON مطابقت دارد. این روش بسیار مقاوم‌تر از تکیه بر مدل برای "تلاش" جهت خروجی JSON معتبر است که اغلب منجر به خطاهای نحو می‌شود.

موارد استفاده عملی

SGLang به ویژه در سناریوهایی مفید است که قالب‌های خروجی سخت‌گیرانه غیرقابل مذاکره هستند. موارد استفاده رایج شامل موارد زیر است:

  • استخراج اطلاعات: کشیدن داده‌های ساختاریافته از اسناد غیرساختاریافته برای ورود به پایگاه داده.
  • تولید کد: اطمینان از اینکه قطعات کد تولید شده از نظر نحوی صحیح هستند و با امضاهای API خاص مطابقت دارند.
  • سیستم‌های چندعاملی: هماهنگ‌سازی خروجی‌ها بین چندین عامل LLM که در آن‌ها انتقال پیام نیاز به قالب‌بندی دقیق دارد.

نتیجه‌گیری

SGLang گام بزرگی برای استقرار هوش مصنوعی محلی محسوب می‌شود. با ترکیب موتورهای استنتاج با عملکرد بالا و قابلیت‌های تولید ساختاریافته مقاوم، به توسعه‌دهندگان اجازه می‌دهد تا برنامه‌های کاربردی هوش مصنوعی محلی قابل اعتمادتر، سریع‌تر و کارآمدتر بسازند. اگرچه اکوسیستم هنوز در حال بلوغ است، اما تمرکز آن بر کاهش تأخیر و بهبود قابلیت اطمینان خروجی، آن را به گزینه‌ای جذاب برای توسعه‌دهندگانی تبدیل می‌کند که از نمونه‌های اولیه چت‌بات ساده فراتر رفته و به سمت سیستم‌های هوش مصنوعی محلی در سطح تولید حرکت می‌کنند. با ادامه سفر خود با LLMهای محلی، نگه داشتن SGLang در جعبه ابزارتان یک حرکت استراتژیک به سمت مهندسی هوش مصنوعی مقاوم‌تر و مقیاس‌پذیرتر است.

Share: