Category

Local AI

Ollama LM Studio Open WebUI vLLM llama.cpp SGLang TensorRT-LLM Text Generation Inference (TGI) Local RAG GPU Optimization

30 posts

تقنيات عملية لإدارة ذاكرة وحدة معالجة الرسومات لتشغيل نماذج لغوية كبيرة مُكمّمة على أجهزة المستهلك

وصلت ديمقراطية النماذج اللغوية الكبيرة (LLMs) إلى نقطة حرجة. بينما تهيمن الحلول المؤسسية على السرد، يدفع مجتمع عشاق الذكاء الاصطناعي المحلي حدود ما هو ممكن على بطاقات الرسومات المخصصة للمستهلكين. يتطلب تشغيل نماذج مثل Llama-3 وMistral أو Qw...

تسريع استنتاج النماذج اللغوية المحلية: غوص عميق في vLLM

مع نضج نظام النماذج اللغوية الكبيرة (LLMs)، انتقل الاختناق من تدريب النموذج إلى نشر الاستنتاج. للمطورين وعلماء البيانات الذين يبحثون عن تشغيل النماذج محلياً على وحدات معالجة الرسومات الاستهلاكية أو العتاد المؤسسي، غالباً ما تواجه أطر العمل التقليدية صعوبات في كفاءة الذاكرة...