Ollama ile Evde Dil Modeli Çalıştırmak: Donanım, Nicemleme ve İlk Kurulum

Verinizi dışarı göndermeden, abonelik ödemeden bir yapay zeka asistanına sahip olmak için gereken her şey: hangi bilgisayar yeter, hangi model seçilir, ilk on dakikada ne yapılır.

Yapay Zeka04 Eylül 20262 dk okuma
Ollama ile Evde Dil Modeli Çalıştırmak: Donanım, Nicemleme ve İlk Kurulum

Ollama, dil modellerini tek komutla indirip çalıştıran bir araç. Windows, macOS ve Linux'ta çalışır, arka planda bir sunucu açar ve hem komut satırından hem de diğer uygulamalardan kullanılabilir. Bulut servislerinden farkı açık: veri bilgisayarınızdan çıkmaz, kullanım başına ücret yoktur, internet gerekmez.

Hangi bilgisayar yeter

Belirleyici olan ekran kartı belleği ya da Mac'lerde birleşik bellek. Ekran kartı olmadan da çalışır ama işlemci üzerinde yavaş kalır; 7 milyarlık bir model işlemcide saniyede birkaç kelime üretirken, 8 GB bir ekran kartında bu hız birkaç kat artar. Apple Silicon Mac'ler birleşik bellek sayesinde 16 GB ile orta boy, 32 GB ile büyük modelleri rahat taşır. Windows tarafında 8 GB'lık bir NVIDIA kartı başlangıç için yeterli, 12-16 GB konforlu.

Kurulum

Resmî siteden yükleyici indirilir. Ardından bir terminal açıp tek satır yeterli:

ollama run qwen3:8b

Model ilk seferde indirilir (birkaç gigabayt), sonra anında açılır. Modeli değiştirmek için adı değiştirmek yeterli. Yüklü modelleri listelemek için ollama list, silmek için ollama rm kullanılır.

Nicemleme etiketleri ne anlama gelir

Model adlarının sonundaki q4_K_M, q8_0 gibi etiketler nicemleme düzeyini gösterir. q4 dört bit demektir: model dört kat küçülür, kalite biraz düşer. q8 sekiz bit: iki kat küçülür, kalite neredeyse aynı. Bellek yetiyorsa q8, yetmiyorsa q4_K_M dengeli seçenektir. Etiket yazmazsanız Ollama varsayılan olarak makul bir q4 sürüm indirir.

Bağlam penceresi

Varsayılan bağlam penceresi genellikle birkaç bin token'dır; uzun belgelerle çalışırken bu yetmez. Bir Modelfile ile ya da çalıştırma sırasında parametre vererek pencere büyütülebilir. Pencere büyüdükçe bellek kullanımı da artar; 32 bin token'lık pencere birkaç gigabayt ek bellek ister.

Türkçe için model seçimi

Türkçe'de en tutarlı sonuçları Qwen ailesi veriyor; 8 milyarlık sürüm günlük işler için yeterli, 14 ve 32 milyarlık sürümler daha akıcı yazıyor. Gemma orta boy sürümleri de kabul edilebilir. Llama küçük sürümleri Türkçe'de İngilizce kelime karıştırmaya eğilimli. Kod işleri için Qwen Coder sürümleri tercih edilir.

Arayüz ve entegrasyon

Komut satırı herkes için değil. Open WebUI gibi araçlar Ollama'ya bağlanıp tarayıcıda sohbet arayüzü sunar; belge yükleyip soru sormak, birden fazla modeli karşılaştırmak mümkün olur. Ollama'nın yerel API'si OpenAI uyumlu olduğundan, OpenAI ile çalışan çoğu uygulama küçük bir adres değişikliğiyle yerel modele bağlanabilir.

Sık yapılan hatalar

  • Belleğe sığmayan model seçmek: model işlemciye taşar ve on kat yavaşlar. Boyutu bellekten küçük tutun.
  • Aynı anda birden fazla büyük model açık bırakmak.
  • Uzun belge verip kısa bağlam penceresiyle çalışmak: model belgenin başını unutur.
  • Sıcaklık (temperature) ayarını hiç kurcalamamak: özet ve sınıflandırma için düşük, yaratıcı yazı için yüksek değer daha iyi sonuç verir.
#Ollama#yerel LLM#GGUF#kurulum#gizlilik

Sanalisci AI ile içerik, görsel ve video üretimini yapay zekaya bırakın. Ürünü keşfedin →

İlgili yazılar