Category

Local AI

Ollama LM Studio Open WebUI vLLM llama.cpp SGLang TensorRT-LLM Text Generation Inference (TGI) Local RAG GPU Optimization

31 posts

بهینه‌سازی عملی GPU: تعادل بین VRAM، سرعت و کیفیت برای کارت‌های گرافیک مصرفی

اجرای مدل‌های زبانی بزرگ (LLM) و مدل‌های دیفیوژن بر روی سخت‌افزارهای مصرفی از یک سرگرمی تخصصی به یک ضرورت عمومی تبدیل شده است. با این حال، توسعه‌دهندگان به سرعت با «دیوار VRAM» مواجه می‌شوند. یک کارت گرافیک مصرفی مانند RTX 3090 یا 4090، قدرت محاسباتی چشمگیری ارائه می‌دهد اما اغلب به دلیل محدودیت حافظه...

Ollama در محیط تولید: ارکستراسیون جریان‌های کاری چندمدلی و مقیاس‌پذیری API برای تیم‌های سازمانی

انتقال مدل‌های زبانی بزرگ (LLMs) از دفترچه‌های آزمایشی به برنامه‌های سازمانی در سطح تولید دیگر یک نگرانی تخصصی نیست، بلکه یک الزام عملیاتی استاندارد است. برای تیم‌هایی که به حاکمیت داده و استنتاج با تأخیر کم متعهد هستند، Ollama به عنوان یک راه‌حل برتر برای اجرای...

بیشینه‌سازی اندازه دسته‌های مدل‌های زبانی بزرگ محلی

استقرار مدل‌های زبانی بزرگ به صورت محلی بر روی کارت‌های گرافیک مصرفی چالش‌های منحصر‌به‌فردی ایجاد می‌کند. در حالی که شتاب‌دهنده‌های سطح بالا برای دیتاسنترها دارای حافظه‌های عظیم هستند، علاقه‌مندان معمولاً با محدودیت ۸ تا ۲۴ گیگابایت حافظه ویدیویی (VRAM) دست‌وپنج نرم می‌کنند. این محدودیت اغلب توسعه‌دهندگان را مجبور می‌کند تا بین سرعت استنتاج قابل قبول و اندازه دسته‌های قابل استفاده انتخاب کنند...

تسلط بر استنتاج تولید متن: استقرار مدل‌های زبانی بزرگ محلی با عملکرد بالا

با تکامل فضای مدل‌های زبانی بزرگ (LLM)، شکاف بین مدل‌های تحقیقاتی پیشرفته و استنتاج آماده برای تولید به طور قابل توجهی کاهش یافته است. برای توسعه‌دهندگان و دانشمندان داده، چالش دیگر تنها دسترسی به مدل‌ها نیست، بلکه ارائه آن‌ها به صورت کارآمد، امن و در مقیاس است. ...

ساخت پایپ‌لاین RAG محلی با LlamaIndex

در دنیای امروز که داده‌محور است، شرکت‌ها تمایل کمتری به ارسال اسناد حساس داخلی به APIهای مدل‌های زبانی بزرگ (LLM) عمومی دارند. راه حل چیست؟ یک پایپ‌لاین تولید تقویت‌شده با بازیابی (RAG) کاملاً محلی. با ترکیب LlamaIndex برای ساختاردهی داده‌ها و ChromaDB برای ذخیره‌سازی برداری...

پیکربندی پیشرفته Open WebUI: سفارشی‌سازی تم‌ها، افزونه‌ها و یکپارچه‌سازی API برای کاربران حرفه‌ای

Open WebUI به سرعت به رابط استاندارد برای مدل‌های زبانی بزرگ محلی تبدیل شده است. در حالی که نصب پیش‌فرض برای استفاده‌های پایه کافی است، کاربران حرفه‌ای اغلب به سفارشی‌سازی عمیق‌تری نیاز دارند. در این راهنما، ما...

ساخت یک پایپ‌لاین RAG محلی با Ollama و LangChain برای بازیابی دانش سازمانی در زمان واقعی

در عصری که حریم داده‌ها و تأخیر کم اهمیت‌ترین عوامل هستند، سازمان‌ها به‌طور فزاینده‌ای به دنبال دوری از مدل‌های زبانی بزرگ (LLM) وابسته به ابر هستند. با میزبانی مدل‌ها به صورت محلی با استفاده از Ollama و هماهنگ‌سازی آن‌ها با LangChain، توسعه‌دهندگان می‌توانند یک پایپ‌لاین تولید تقویت‌شده با بازیابی (RAG...