AI APIs

ساخت برنامه‌های چت بلادرنگ با استفاده از API ماسترال و پاسخ‌های استریمینگ

در چشم‌انداز به‌سرعت در حال تحول برنامه‌های مدل زبانی بزرگ (LLM)، تجربه کاربری اغلب با تأخیر تعریف می‌شود. در حالی که تماس‌های API سنتی پس از یک انتظار طولانی ممکن است پاسخ کامل را بازگردانند، برنامه‌های مدرن فوریت را طلب می‌کنند. اینجاست که پاسخ‌های استریمینگ وارد عمل می‌شوند. در این راهنما، ما بررسی می‌کنیم که چگونه می‌توان یک رابط چت بلادرنگ و پاسخگو با استفاده از API ماسترال ساخت، با تمرکز بر تولید کارآمد توکن و رندرینگ سمت کلاینت.

چرا استریمینگ برای تجربه کاربری چت مهم است

برای برنامه‌های چت، «زمان تا اولین توکن» (TTFB) یک معیار حیاتی است. یک درخواست غیر استریمینگ کلاینت را مجبور می‌کند تا منتظر بماند تا تمام دنباله توکن‌ها تولید، محاسبه و انتقال یابد قبل از اینکه چیزی به کاربر نمایش داده شود. با استریمینگ، توکن‌ها به محض تولید ارسال می‌شوند و افکت تایپ‌ماشینی ایجاد می‌کنند که به‌طور قابل توجهی سریع‌تر و تعاملی‌تر به نظر می‌رسد.

API ماسترال AI از پیش‌فرض از رویدادهای ارسالی سرور (SSE) پشتیبانی می‌کند هنگام استفاده از نقطه پایانی /chat/completions با stream=True. این به ما امکان می‌دهد پاسخ را در قطعات پردازش کنیم و تجربه کاربری روانی را حتی با پنجره‌های زمینه بزرگ‌تر حفظ کنیم.

پیاده‌سازی بک‌اند با پایتون

برای نشان دادن این موضوع، از SDK رسمی پایتون mistralai استفاده خواهیم کرد. منطق اصلی شامل تنظیم یک کلاینت، شروع یک جلسه چت و تکرار روی استریم است. برخلاف پاسخ‌های استاندارد، یک استریم یک تکرارگر (iterator) است که پاسخ‌های جزئی را تحویل می‌دهد.

در اینجا یک پیاده‌سازی مقاوم با استفاده از رویکرد چارچوب وب استاندارد (کد شبه برای زمینه Flask/FastAPI) آورده شده است:

from mistralai.client import MistralClient
from mistralai.models.chat_completion import ChatMessage

api_key = "YOUR_MISTRAL_API_KEY"
model = "mistral-small-latest"

client = MistralClient(api_key=api_key)

def stream_chat(user_message: str):
    """
    تابع تولیدکننده که توکن‌ها را از API ماسترال تحویل می‌دهد.
    """
    messages = [
        ChatMessage(role="user", content=user_message)
    ]
    
    # با تنظیم stream=True استریمینگ را فعال کنید
    stream = client.chat(
        model=model,
        messages=messages,
        stream=True
    )
    
    for chunk in stream:
        # بررسی کنید آیا انتخاب‌های دلتا در قطعه وجود دارد
        if chunk.data.choices:
            delta = chunk.data.choices[0].delta
            if delta.content:
                yield delta.content

در این قطعه کد، ما روی شیء stream تکرار می‌کنیم. هر تکرار یک قطعه داده ارائه می‌دهد. با بررسی delta.content، ما توکن متن واقعی را که باید نمایش داده شود استخراج می‌کنیم. این تابع تولیدکننده را می‌توان سپس به یک نقطه پایانی WebSocket یا رویداد ارسالی سرور در چارچوب بک‌اند خود متصل کرد.

مدیریت رندرینگ سمت کلاینت

در سمت کلاینت، شما باید قطعات داده ورودی را به‌طور کارآمد مدیریت کنید. اگر از جاوااسکریپت با EventSource یا یک اتصال WebSocket استفاده می‌کنید، این قطعات را انباشته خواهید کرد. یک دام رایج، رندرینگ بیش از حد مکرر است که می‌تواند باعث لرزش طرح‌بندی (layout thrashing) شود. بهترین شیوه این است که توکن‌ها را کمی بافر کنید یا از یک مکانیزم به‌روزرسانی با تأخیر (debounced) استفاده کنید.

علاوه بر این، اطمینان حاصل کنید که اختلالات احتمالی را مدیریت می‌کنید. اگر کاربر پیام جدیدی قبل از تکمیل استریم قبلی ارسال کند، باید استریم قبلی را لغو کنید. کلاینت ماسترال از لغو درخواست‌ها پشتیبانی می‌کند، اما شما باید این وضعیت را در منطق برنامه خود مدیریت کنید تا از نشت حافظه یا شرایط رقابتی جلوگیری کنید.

بهینه‌سازی استفاده از توکن و هزینه‌ها

در حالی که استریمینگ UX را بهبود می‌بخشد، ساختار هزینه زیرین را تغییر نمی‌دهد که معمولاً بر اساس تعداد کل توکن‌های پردازش شده (ورودی + خروجی) است. با این حال، استریمینگ اجازه می‌دهد مدیریت خطاها بهتر انجام شود. اگر یک درخواست زمان‌بر شود یا با محدودیت نرخ مواجه شود، می‌توانید استثنا را در میانه استریم بگیرید و فقط بخش ضروری را دوباره امتحان کنید، یا بلافاصله به کاربر اطلاع دهید بدون اینکه منتظر پیکربندی کامل بمانید.

نتیجه‌گیری

یکپارچه‌سازی پاسخ‌های استریمینگ با API ماسترال یک فرآیند ساده است که منافع قابل توجهی در مشارکت کاربر دارد. با بهره‌گیری از توابع تولیدکننده پایتون و SDK ماسترال، توسعه‌دهندگان می‌توانند به راحتی رابط‌های چتی ایجاد کنند که آنی به نظر می‌رسند. هنگامی که برنامه خود را گسترش می‌دهید، مکانیزم‌های فشار معکوس و بافرینگ پیشرفته را در نظر بگیرید تا پایداری و عملکرد تعاملات هوش مصنوعی بلادرنگ خود را بیشتر بهبود بخشید.

Share: