Category

Local AI

Ollama LM Studio Open WebUI vLLM llama.cpp SGLang TensorRT-LLM Text Generation Inference (TGI) Local RAG GPU Optimization

31 posts

باز کردن قفل هوش مصنوعی محلی با عملکرد بالا: نگاهی عمیق به SGLang

با افزایش تقاضا برای استقرار مدل‌های زبانی بزرگ (LLM) به صورت محلی، توسعه‌دهندگان با محدودیت موتورهای استنتاج سنتی مواجه می‌شوند. در حالی که چارچوب‌هایی مانند vLLM در فضای سمت سرور تسلط دارند، بخش استقرار محلی و لبه اغلب با راه‌حل‌های کندتر و کمتر بهینه روبرو بوده است...

ساخت یک پایپ‌لاین RAG محلی: یکپارچه‌سازی پایگاه‌های داده برداری با llama.cpp برای پرسش و پاسخ اسناد خصوصی

در عصری که حریم داده‌ها اولویت اصلی است، تکیه بر APIهای مدل‌های زبانی بزرگ شخص ثالث برای اطلاعات حساس، روز به روز غیرممکن‌تر می‌شود. توسعه‌دهندگان به سمت محیط‌های اجرای محلی روی می‌آورند که تضمین می‌کنند داده‌ها هرگز از دستگاه خارج نمی‌شوند. یکی از قدرتمندترین معماری‌ها برای این منظور...

تسلط بر استنتاج محلی: بررسی فنی llama.cpp

دموکراتیزه شدن مدل‌های زبانی بزرگ (LLMs) به سرعت از APIهای وابسته به ابر به استنتاج محلی و درون‌دستگاهی تغییر جهت داده است. در خط مقدم این حرکت، llama.cpp قرار دارد که یک پیاده‌سازی C/C++ است که در ابتدا برای اجرای مدل‌های LLaMA متا بر سیلیکون اپل طراحی شده بود. امروزه، این ابزار به عنوان استاندارد غیررسمی...

ساخت هوش مصنوعی خصوصی: بررسی عمیق LM Studio برای توسعه‌دهندگان

با گسترش مرزهای هوش مصنوعی مولد، تقاضا برای راه‌حل‌های استنتاج با تأخیر کم و اولویت‌دهی به حریم خصوصی هرگز به این اندازه بالا نبوده است. برای توسعه‌دهندگانی که به APIهای مبتنی بر ابر عادت دارند، انتقال به استنتاج محلی چالش‌های منحصر‌به‌فردی را در بهینه‌سازی سخت‌افزار و یکپارچه‌سازی گردش کار به همراه دارد. ورود LM St...

تسلط بر کوانتیزاسیون سفارشی: ساخت پایپ‌لاین GGUF با llama.cpp برای مدل‌های زبانی بزرگ (LLM) حوزه‌محور

مدل‌های زبانی بزرگ (LLM) توسعه نرم‌افزار را متحول کرده‌اند، اما استقرار آن‌ها به صورت محلی اغلب با محدودیت‌های حافظه مواجه می‌شود. در حالی که مدل‌هایی مانند Llama 3 یا Mistral قابلیت‌های چشمگیری ارائه می‌دهند، نمایش‌های استاندارد ۱۶-بیتی (FP16) آن‌ها اغلب برای سخت‌افزارهای مصرفی سنگین هستند...

باز کردن قفل LM Studio: مدیریت پیشرفته مدل و پیکربندی API برای کاربران حرفه‌ای

برای کاربر عادی، LM Studio راحتی گرافیکی ارائه می‌دهد که استنتاج مدل‌های زبانی بزرگ (LLM) محلی را ساده می‌کند. با این حال، برای توسعه‌دهندگان و دانشمندان داده، این برنامه یک بک‌اند قدرتمند را پنهان کرده است که قادر به ارکستراسیون پیچیده، بهینه‌سازی عملکرد دقیق و یکپارچه‌سازی بی‌نقص است...

باز کردن عملکرد اوج: راهنمای توسعه‌دهنده برای استنتاج LLM محلی با NVIDIA TensorRT-LLM

اجرای مدل‌های زبانی بزرگ (LLM) به صورت محلی از یک سرگرمی تخصصی برای علاقه‌مندان به یک نیاز حیاتی برای شرکت‌هایی تبدیل شده است که به حریم خصوصی داده‌ها و پاسخ‌های با تأخیر کم نیاز دارند. در حالی که چارچوب‌هایی مانند Ollama و vLLM هوش مصنوعی محلی را دموکراتیک کرده‌اند، NVIDIA TensorRT-LLM به عنوان استاندارد طلایی...