Category

Local AI

Ollama LM Studio Open WebUI vLLM llama.cpp SGLang TensorRT-LLM Text Generation Inference (TGI) Local RAG GPU Optimization

31 posts

تسلط بر استنتاج محلی LLM: راهنمای توسعه‌دهندگان برای llama.cpp

اجرای مدل‌های زبانی بزرگ بر زیرساخت ابری راحت است، اما با معضلات مهمی مانند تأخیر، هزینه و حریم خصوصی داده همراه است. برای توسعه‌دهندگانی که به دنبال کنترل بر استک هوش مصنوعی خود هستند، llama.cpp به عنوان استاندارد طلایی ظاهر شده است. این ابزار که در اصل یک پورت C++ از مدل LLaMA بود، تکامل یافته است ...

بهینه‌سازی llama.cpp برای Apple Silicon جهت افزایش سرعت

Apple Silicon چشم‌انداز استنتاج محلی مدل‌های زبانی بزرگ (LLM) را به‌طور بنیادین تغییر داده است. با بهره‌گیری از معماری حافظه یکپارچه در چیپ‌های M1، M2 و M3، توسعه‌دهندگان می‌توانند مدل‌های بزرگ را به‌صورت محلی اجرا کنند بدون اینکه با تأخیرهای (latency) معمول ناشی از انتقال داده بین CPU و...

باز کردن قفل حداکثر عملکرد: نگاهی عمیق به NVIDIA TensorRT-LLM

زمینه استقرار مدل‌های زبانی بزرگ (LLM) به سرعت در حال تغییر است. در حالی که آموزش همچنان از نظر محاسباتی پرهزینه است، گلوگاه برای بسیاری از سازمان‌ها و علاقه‌مندان، سرعت و هزینه استنتاج است. با TensorRT-LLM، کتابخانه متن‌باز انویدیا که به طور خاص برای شتاب‌بخشی به استنتاج LLM طراحی شده است، مواجه می‌شویم.

ساخت یک پایپ‌لاین RAG محلی با Milvus و Ollama برای جستجوی سازمانی با تراکم بالا

در چشم‌انداز به‌سرعت در حال تحول هوش مصنوعی، حریم خصوصی داده‌ها و کارایی هزینه برای پذیرش سازمانی حیاتی هستند. اگرچه مدل‌های زبانی بزرگ مبتنی بر ابر (LLMs) قابلیت‌های چشمگیری ارائه می‌دهند، اما اغلب با تأخیر قابل توجه و ریسک‌های انطباق همراه هستند. اینجاست که زیرساخت هوش مصنوعی محلی...

استراتژی‌های پیشرفته Offloading حافظه ویدیویی: بهینه‌سازی بارهای کاری چند GPU برای پنجره‌های زمینه بزرگ

با افزایش تقاضا برای اجرای مدل‌های زبانی بزرگ (LLM) به صورت محلی، محدودیت حافظه ویدیویی (VRAM) به اصلی‌ترین مانع برای توسعه‌دهندگان تبدیل شده است. در حالی که پیکربندی‌های تک GPU برای مدل‌های کوچکتر کافی هستند، مدیریت پنجره‌های زمینه بزرگ با مدل‌های بیش از 70 میلیارد پارامتر اغلب نیازمند هماهنگی پیچیده چند GPU است.

تسلط بر هوش مصنوعی محلی: راهنمای جامع LM Studio برای توسعه‌دهندگان

در منظره سریعاً در حال تحول هوش مصنوعی، توانایی اجرای مدل‌های زبانی بزرگ (LLMs) به صورت محلی، از یک علاقه تخصصی برای علاقه‌مندان به یک الزام حیاتی برای توسعه‌دهندگان سازمانی تبدیل شده است. با نگرانی‌های فزاینده درباره حریم خصوصی داده‌ها، تأخیر و وابستگی به ارائه‌دهندگان ابری شخص ثالث...

امن‌سازی Open WebUI با Keycloak و LDAP

مقدمه در حالی که Open WebUI نحوه تعامل توسعه‌دهندگان با مدل‌های زبانی بزرگ (LLM) محلی را متحول کرده است، استقرار آن برای یک تیم اغلب یک آسیب‌پذیری حیاتی را آشکار می‌کند: فقدان مدیریت هویت قوی. به‌طور پیش‌فرض، بسیاری از پیکربندی‌ها به فایل‌های رمز عبور ساده یا دسترسی باز تکیه دارند که...