Yapay zeka modellerini kullanmak için her zaman buluta bağlanmak zorunda değilsiniz. Ollama, büyük dil modellerini kendi bilgisayarınızda, internet bağlantısı gerektirmeden çalıştırmanızı sağlayan açık kaynaklı ve ücretsiz bir araçtır. Verilerinizin makinenizden hiç çıkmaması, API ücreti ödememeniz ve çevrimdışı çalışabilmeniz, Ollama ile yerel LLM çalıştırmayı hem geliştiriciler hem de gizliliğe önem veren kullanıcılar için cazip kılar. Bu rehberde kurulumdan model indirmeye ve donanım gereksinimlerine kadar tüm adımları ele alıyoruz.
Ollama Nedir ve Nasıl Çalışır?
Ollama, açık ağırlıklı modelleri (Llama, Mistral, Gemma, Phi, Qwen gibi) tek komutla indirip çalıştırmanızı sağlayan bir çalıştırma ortamıdır. Arka planda, modelleri verimli biçimde çalıştıran llama.cpp altyapısını kullanır ve modelleri GGUF formatında, çoğunlukla quantize edilmiş (sıkıştırılmış) halde sunar. Quantization, model ağırlıklarının hassasiyetini düşürerek bellek kullanımını ciddi oranda azaltır; kalite kaybı çoğu günlük kullanımda fark edilmeyecek düzeydedir. Bu sayede normalde sunucu gerektiren modeller sıradan bir dizüstü bilgisayarda çalışabilir.
Kurulum Adımları
Ollama; macOS, Linux ve Windows üzerinde çalışır. Resmi indirme sayfası ollama.com adresidir.
- Windows ve macOS: Siteden kurulum dosyasını indirip çalıştırmanız yeterlidir.
- Linux: Tek satırlık resmi kurulum betiği kullanılır:
curl -fsSL https://ollama.com/install.sh | sh
Kurulum tamamlandığında Ollama arka planda bir servis olarak çalışır. Doğrulamak için terminalde sürüm bilgisini kontrol edebilirsiniz:
ollama --version
İlk Modeli İndirme ve Çalıştırma
Bir modeli indirip sohbete başlamak tek komutla yapılır. Model diskte yoksa önce otomatik indirilir:
ollama run llama3
Komut tamamlandığında terminalde doğrudan modelle yazışabileceğiniz bir sohbet oturumu açılır. Oturumdan çıkmak için /bye yazmanız yeterlidir. Modeli yalnızca indirmek, çalıştırmadan diske almak isterseniz:
ollama pull mistral
Sık kullanılan diğer komutlar şunlardır:
ollama list — indirilen modelleri listelerollama rm modeladi — bir modeli diskten silerollama ps — bellekte yüklü modelleri gösterirollama serve — servisi elle başlatır (genellikle gerekmez)Ollama kütüphanesinde Meta'nın Llama serisi, Mistral, Google'ın Gemma'sı, Microsoft'un Phi'si, Alibaba'nın Qwen'i ve DeepSeek modelleri dahil çok sayıda açık model bulunur. Güncel model listesi ve her modelin mevcut boyut seçenekleri ollama.com üzerindeki kütüphane sayfasından incelenebilir. Modellerin farklı boyut varyantları iki nokta üst üste ile seçilir; örneğin ollama run llama3:70b aynı modelin büyük varyantını indirip çalıştırır.
Donanım Gereksinimleri
Yerel LLM çalıştırmanın en belirleyici kaynağı RAM (ve varsa ekran kartı belleği, yani VRAM) miktarıdır. Genel kural, quantize edilmiş bir modelin parametre sayısı büyüdükçe bellek ihtiyacının da artmasıdır:
ollama rm ile temizlemek iyi bir alışkanlıktır.Geliştiriciler İçin: Yerel API
Ollama'nın en güçlü yanlarından biri, çalışırken makinenizde bir REST API sunmasıdır. Varsayılan adres http://localhost:11434 olup, uygulamalarınızı bulut API'leri yerine bu uca bağlayabilirsiniz:
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "Merhaba, kendini tanıt."
}'
Ayrıca Ollama, OpenAI uyumlu bir API ucu da sağlar; böylece OpenAI istemci kütüphanesiyle yazılmış mevcut kodlar küçük bir adres değişikliğiyle yerel modele yönlendirilebilir. Python ve JavaScript için resmi istemci kütüphaneleri de mevcuttur.
Kendi Model Yapılandırmanızı Oluşturma
Modelfile adlı basit bir dosyayla mevcut bir modeli kendi sistem talimatınızla paketleyebilirsiniz:
FROM llama3
SYSTEM "Sen Türkçe yanıt veren, kısa ve net konuşan bir asistansın."
Ardından ollama create asistanim -f Modelfile komutuyla bu yapılandırma asistanim adıyla kaydedilir ve ollama run asistanim ile çalıştırılır.
Hangi Modelle Başlamalı?
Model seçimi kullanım amacına göre değişir. Genel sohbet, özetleme ve soru-cevap için Llama 3'ün 8 milyar parametreli varyantı dengeli bir başlangıçtır; Mistral'in 7B modeli de hız ve kalite dengesiyle bilinir. Donanımı kısıtlı makinelerde Microsoft'un Phi serisi veya Gemma'nın küçük varyantları boyutlarına göre şaşırtıcı derecede yeteneklidir. Kod ağırlıklı işler içinse Code Llama ve Qwen'in kod odaklı varyantları gibi özelleşmiş modeller bulunur. Türkçe performansı modelden modele belirgin farklılık gösterir; en sağlıklısı, kendi dilinizde birkaç örnek görev hazırlayıp iki-üç modeli kısa bir karşılaştırmadan geçirmektir.
Komut satırı yerine görsel bir arayüz isteyenler için topluluk tarafından geliştirilen Open WebUI gibi projeler, Ollama'nın yerel API'sine bağlanarak tarayıcıda ChatGPT benzeri bir sohbet deneyimi sunar. Böylece terminale aşina olmayan kullanıcılar da yerel modellerden rahatça yararlanabilir.
Sonuç
Ollama, yerel LLM dünyasına girişin en pratik kapısıdır: kurulum birkaç dakika sürer, ollama run llama3 gibi tek bir komutla modelle konuşmaya başlarsınız ve verileriniz bilgisayarınızdan çıkmaz. 8 GB RAM'li sıradan bir makinede bile 7-8 milyar parametreli modeller rahatlıkla denenebilir. Bulut modellerinin ham gücüne her senaryoda yetişemese de; gizlilik, maliyet ve çevrimdışı çalışma gereksinimlerinin öne çıktığı projelerde yerel modeller giderek daha güçlü bir alternatif haline gelmektedir.
Yorumlar (0)
Henüz yorum yapılmamış. İlk yorumu siz yapın!
Yorum Yazın