Open Models

Cihaz İçi Zekayı Açığa Çıkarma: Microsoft'un Phi-3 Modellerine Derinlemesine Bir Bakış

Büyük Dil Modelleri (LLM'ler) dünyası tarihsel olarak genellikle yüz milyarlarca parametre içeren devasa modellerle domine edilmiştir. Bu modeller etkileyici yetenekler sunarken, hesaplama maliyeti, gecikme süresi ve gizlilik endişeleri açısından önemli bir yük getirmektedir. Microsoft'un Phi serisi, özellikle en güncel Phi-3 modelleri ise Küçük Dil Modellerine (SLM'ler) doğru bir paradigm shift (kavram kayması) temsil etmektedir. Bu yazı, Phi-3'ün kaynakların yalnızca küçük bir kısmıyla nasıl yüksek performans elde ettiğini ve bu sayede kenar cihazlarda, mobil uygulamalarda ve kaynak kısıtlamalı ortamlarda dağıtım için ideal hale geldiğini incelemektedir.

Phi-3'ün Felsefesi: Nicelikten Çok Nitelik

Microsoft'un Phi modellerine yaklaşımı, "büyük olan her zaman daha iyidir" şeklindeki geleneksel kanıyı sorgulamaktadır. Model boyutunu büyütmek yerine, Phi ekibi eğitim verisi kalitesini artırmaya odaklanmıştır. Phi-3 modelleri "ders kitapları", "kitaplar" ve "hakemli makaleler" üzerinde eğitilmiş olup, bu da modellerin kendi ağırlık sınıfının çok ötesinde performans sergilemesini sağlamıştır. Yaklaşık 3,8 milyar parametreye sahip olan Phi-3-mini, standart mantık ve kodlama testlerinde 7 ila 13 milyar parametreli birçok açık kaynaklı modeli geride bırakmaktadır.

Bu verimlilik sadece bir pazarlama iddiası değildir; mimariye mühendislik açısından işlenmiştir. Eğitim veri karışımını optimize ederek ve daha büyük öğretmen modellerinden ileri düzey distilasyon (sıkıştırma/öğretme) teknikleri kullanarak Phi-3, önemli ölçüde daha az bellek ve hesaplama gücü gerektirirken en üst düzey mantık yetenekleri sunmaktadır.

Temel Özellikler ve Mimari Vurgular

Phi-3 modelleri çeşitli boyutlarda mevcuttur: Mini (3,8B), Küçük (7B) ve Orta (14B). 128K tokena kadar bir bağlam penceresini destekleyerek uzun belgeleri etkili bir şekilde işleyebilmelerini sağlarlar. Öne çıkan teknik özellikler şunlardır:

  • Yüksek Yoğunluklu Eğitim Verisi: Modeller, bilgi yoğunluğunu maksimize etmek üzere özenle hazırlanmış yüksek kaliteli, sentetik veriler üzerinde eğitilmiştir.
  • Verimli Dikkat Mekanizmaları: Çıkarımı hızlandırmak için gruplanmış-sorgu dikkati (GQA) kullanımı.
  • Doğal Hugging Face Desteği: Kolay yükleme ve ince ayar için Hugging Face ekosistemiyle sorunsuz entegrasyon.

Pratik Uygulama: Phi-3'ü CPU'da Yükleme

Phi-3'ün en çekici yönlerinden biri, yüksek uçlu GPU kümelerine erişimi olmayan geliştiriciler için erişilebilir hale getiren, tüketici sınıfı donanımlar, CPU'lar dahil olmak üzere bu cihazlarda çalışabilme yeteneğidir. Aşağıda, Hugging Face'in transformers kütüphanesini kullanarak Phi-3-mini modelini bir CPU'da yüklemek ve çalıştırmak için pratik bir örnek verilmiştir.


from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

# Model tanımlayıcısını tanımla
model_name = "microsoft/Phi-3-mini-4k-instruct"

# Tokenizer'ı yükle
tokenizer = AutoTokenizer.from_pretrained(model_name)

# Modeli bellek verimliliği için torch_dtype ile yükle
# 'auto' kullanımı, kütüphanenin donanımınız tarafından desteklenen en iyi dtype'ı seçmesini sağlar
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto"  # Katmanları kullanılabilir cihazlara (CPU/GPU) otomatik olarak atar
)

# İsteği hazırla
messages = [
    {"role": "system", "content": "Yararlı bir AI asistanısınız."},
    {"role": "user", "content": "Programlamada özyineleme (recursion) kavramını açıklayın."}
]

text = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True
)

# Girdiyi tokenize et
inputs = tokenizer(text, return_tensors="pt")

# Çıktı üret
outputs = model.generate(
    **inputs,
    max_new_tokens=256,
    temperature=0.7,
    top_p=0.95
)

# Üretilen tokenları çöz
response = outputs[0][inputs["input_ids"].shape[-1]:]
print(tokenizer.decode(response, skip_special_tokens=True))

Geliştiriciler Neden SLM'lere Önem Vermelidir?

Phi-3 gibi SLM'lerin yükselişi, modern AI geliştirme süreçlerindeki kritik sorunları gidermektedir. Birincisi, gecikme süresi (latency) dramatik şekilde azalır. Kısa sorgular için CPU üzerinde çıkarım neredeyse anlık olabilir ve bu da gerçek zamanlı etkileşimli uygulamaları mümkün kılar. İkincisi, maliyet minimize edilir. Çıkarımı yerel olarak veya daha ucuz bulut örneklerinde çalıştırmak, operasyonel giderleri önemli ölçüde düşürür. Son olarak, gizlilik artırılır. Model tamamen cihaz üzerinde çalışabileceğinden, hassas veriler asla kullanıcının ortamından ayrılmaz; bu da kurumsal ve sağlık uygulamaları için kritik bir faktördür.

Sonuç

Microsoft'un Phi-3 modelleri, yüksek kaliteli yapay zekanın erişilebilir hale getirilmesinde önemli bir sıçrama temsil etmektedir. Veri kalitesini ve mimari verimliliği önceliklendirerek Phi-3, küçük modellerin güçlü, hızlı ve çok yönlü olabileceğini kanıtlamaktadır. Maliyet etkin, gizlilik odaklı ve hızlı yanıt veren AI uygulamaları dağıtmak isteyen geliştiriciler için Phi-3, değerlendirme listenizin en üstünde yer almalıdır. Küçük Dil Modelleri ekosistemi olgunlaştıkça, yerel ve bulut tabanlı yapay zeka arasındaki çizgiyi daha da bulanıklaştıracak daha da sofistike SLM'ler görmemiz beklenmektedir.

Share: