CPU-Only Kenar Cihazları için LLM'leri Optimize Etme: Nicelleştirme ve Bilgi Distilasyonu Rehberi
Büyük Dil Modelleri'ni (LLM) kenar cihazlarda dağıtmak, benzersiz mühendislik zorlukları sunar. GPU'lar devasa paralel işlem gücü sunsa da, genellikle IoT ağ geçitleri, mobil telefonlar ve gömülü sistemlerde fazla güç tüketir, pahalıdır veya fiziksel olarak bulunmaz.