Ollama ile Bilgisayarında Yerel LLM Çalıştırma Rehberi

Ollama ile Bilgisayarında Yerel LLM Çalıştırma Rehberi

Yapay zeka modellerini kullanmak için her zaman buluta bağlanmak zorunda değilsiniz. Ollama, büyük dil modellerini kendi bilgisayarınızda, internet bağlantısı gerektirmeden çalıştırmanızı sağlayan açık kaynaklı ve ücretsiz bir araçtır. Verilerinizin makinenizden hiç çıkmaması, API ücreti ödememeniz ve çevrimdışı çalışabilmeniz, Ollama ile yerel LLM çalıştırmayı hem geliştiriciler hem de gizliliğe önem veren kullanıcılar için cazip kılar. Bu rehberde kurulumdan model indirmeye ve donanım gereksinimlerine kadar tüm adımları ele alıyoruz.

Ollama Nedir ve Nasıl Çalışır?

Ollama, açık ağırlıklı modelleri (Llama, Mistral, Gemma, Phi, Qwen gibi) tek komutla indirip çalıştırmanızı sağlayan bir çalıştırma ortamıdır. Arka planda, modelleri verimli biçimde çalıştıran llama.cpp altyapısını kullanır ve modelleri GGUF formatında, çoğunlukla quantize edilmiş (sıkıştırılmış) halde sunar. Quantization, model ağırlıklarının hassasiyetini düşürerek bellek kullanımını ciddi oranda azaltır; kalite kaybı çoğu günlük kullanımda fark edilmeyecek düzeydedir. Bu sayede normalde sunucu gerektiren modeller sıradan bir dizüstü bilgisayarda çalışabilir.

Kurulum Adımları

Ollama; macOS, Linux ve Windows üzerinde çalışır. Resmi indirme sayfası ollama.com adresidir.

  • Windows ve macOS: Siteden kurulum dosyasını indirip çalıştırmanız yeterlidir.
  • Linux: Tek satırlık resmi kurulum betiği kullanılır:
  • curl -fsSL https://ollama.com/install.sh | sh
    

    Kurulum tamamlandığında Ollama arka planda bir servis olarak çalışır. Doğrulamak için terminalde sürüm bilgisini kontrol edebilirsiniz:

    ollama --version
    

    İlk Modeli İndirme ve Çalıştırma

    Bir modeli indirip sohbete başlamak tek komutla yapılır. Model diskte yoksa önce otomatik indirilir:

    ollama run llama3
    

    Komut tamamlandığında terminalde doğrudan modelle yazışabileceğiniz bir sohbet oturumu açılır. Oturumdan çıkmak için /bye yazmanız yeterlidir. Modeli yalnızca indirmek, çalıştırmadan diske almak isterseniz:

    ollama pull mistral
    

    Sık kullanılan diğer komutlar şunlardır:

  • ollama list — indirilen modelleri listeler
  • ollama rm modeladi — bir modeli diskten siler
  • ollama ps — bellekte yüklü modelleri gösterir
  • ollama serve — servisi elle başlatır (genellikle gerekmez)
  • Ollama kütüphanesinde Meta'nın Llama serisi, Mistral, Google'ın Gemma'sı, Microsoft'un Phi'si, Alibaba'nın Qwen'i ve DeepSeek modelleri dahil çok sayıda açık model bulunur. Güncel model listesi ve her modelin mevcut boyut seçenekleri ollama.com üzerindeki kütüphane sayfasından incelenebilir. Modellerin farklı boyut varyantları iki nokta üst üste ile seçilir; örneğin ollama run llama3:70b aynı modelin büyük varyantını indirip çalıştırır.

    Donanım Gereksinimleri

    Yerel LLM çalıştırmanın en belirleyici kaynağı RAM (ve varsa ekran kartı belleği, yani VRAM) miktarıdır. Genel kural, quantize edilmiş bir modelin parametre sayısı büyüdükçe bellek ihtiyacının da artmasıdır:

  • 7-8 milyar parametreli modeller: En az 8 GB RAM ile çalışır; günlük kullanım için en dengeli sınıftır.
  • 13 milyar parametreli modeller: En az 16 GB RAM önerilir.
  • 70 milyar parametreli modeller: 64 GB ve üzeri bellek gerektirir; çoğu kişisel bilgisayar için pratik değildir.
Ekran kartı zorunlu değildir; Ollama yalnızca işlemciyle de çalışır, ancak NVIDIA (CUDA) veya Apple Silicon gibi hızlandırıcılar yanıt hızını büyük ölçüde artırır. Apple'ın M serisi çipleri, birleşik bellek mimarisi sayesinde yerel modeller için özellikle verimlidir. Yavaş kalan donanımlarda daha küçük modelleri (örneğin Phi veya Gemma'nın küçük varyantlarını) denemek mantıklı bir başlangıçtır. Disk alanını da hesaba katmak gerekir: quantize edilmiş 7-8 milyar parametreli bir model genellikle birkaç gigabaytlık yer kaplar; birden çok model indirdiğinizde alan hızla dolar, kullanmadıklarınızı ollama rm ile temizlemek iyi bir alışkanlıktır.

Geliştiriciler İçin: Yerel API

Ollama'nın en güçlü yanlarından biri, çalışırken makinenizde bir REST API sunmasıdır. Varsayılan adres http://localhost:11434 olup, uygulamalarınızı bulut API'leri yerine bu uca bağlayabilirsiniz:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3",
  "prompt": "Merhaba, kendini tanıt."
}'

Ayrıca Ollama, OpenAI uyumlu bir API ucu da sağlar; böylece OpenAI istemci kütüphanesiyle yazılmış mevcut kodlar küçük bir adres değişikliğiyle yerel modele yönlendirilebilir. Python ve JavaScript için resmi istemci kütüphaneleri de mevcuttur.

Kendi Model Yapılandırmanızı Oluşturma

Modelfile adlı basit bir dosyayla mevcut bir modeli kendi sistem talimatınızla paketleyebilirsiniz:

FROM llama3
SYSTEM "Sen Türkçe yanıt veren, kısa ve net konuşan bir asistansın."

Ardından ollama create asistanim -f Modelfile komutuyla bu yapılandırma asistanim adıyla kaydedilir ve ollama run asistanim ile çalıştırılır.

Hangi Modelle Başlamalı?

Model seçimi kullanım amacına göre değişir. Genel sohbet, özetleme ve soru-cevap için Llama 3'ün 8 milyar parametreli varyantı dengeli bir başlangıçtır; Mistral'in 7B modeli de hız ve kalite dengesiyle bilinir. Donanımı kısıtlı makinelerde Microsoft'un Phi serisi veya Gemma'nın küçük varyantları boyutlarına göre şaşırtıcı derecede yeteneklidir. Kod ağırlıklı işler içinse Code Llama ve Qwen'in kod odaklı varyantları gibi özelleşmiş modeller bulunur. Türkçe performansı modelden modele belirgin farklılık gösterir; en sağlıklısı, kendi dilinizde birkaç örnek görev hazırlayıp iki-üç modeli kısa bir karşılaştırmadan geçirmektir.

Komut satırı yerine görsel bir arayüz isteyenler için topluluk tarafından geliştirilen Open WebUI gibi projeler, Ollama'nın yerel API'sine bağlanarak tarayıcıda ChatGPT benzeri bir sohbet deneyimi sunar. Böylece terminale aşina olmayan kullanıcılar da yerel modellerden rahatça yararlanabilir.

Sonuç

Ollama, yerel LLM dünyasına girişin en pratik kapısıdır: kurulum birkaç dakika sürer, ollama run llama3 gibi tek bir komutla modelle konuşmaya başlarsınız ve verileriniz bilgisayarınızdan çıkmaz. 8 GB RAM'li sıradan bir makinede bile 7-8 milyar parametreli modeller rahatlıkla denenebilir. Bulut modellerinin ham gücüne her senaryoda yetişemese de; gizlilik, maliyet ve çevrimdışı çalışma gereksinimlerinin öne çıktığı projelerde yerel modeller giderek daha güçlü bir alternatif haline gelmektedir.

Sıkça Sorulan Sorular

Ollama ücretsiz mi?
Evet, Ollama açık kaynaklı ve ücretsiz bir araçtır. Modeller bilgisayarınızda çalıştığı için API veya kullanım ücreti de ödemezsiniz; tek maliyet kendi donanımınızdır.
Yerel LLM çalıştırmak için ne kadar RAM gerekir?
7-8 milyar parametreli quantize modeller için en az 8 GB, 13 milyar parametreli modeller için en az 16 GB RAM önerilir. 70 milyar parametreli modeller ise 64 GB ve üzeri bellek gerektirir.
Ollama internet olmadan çalışır mı?
Evet. Model bir kez indirildikten sonra tüm üretim tamamen yerel olarak, internet bağlantısı olmadan çalışır. Verileriniz bilgisayarınızdan dışarı çıkmaz.
WxDigitals
WxDigitals

WebTeknoloji.net editör ekibi; web geliştirme, SEO, hosting ve yapay zeka alanlarında üretilen içeriklerin araştırma, test ve yayın süreçlerini yürütür. Tüm incelemeler gerçek kullanım deneyimine, karşılaştırmalar ise resmi dokümantasyon ve güncel fiyatlandırma sayfalarına dayanır.

Bu içeriği faydalı bulduysanız…

Haftalık teknoloji & SEO rehberlerimize katılın, 38 maddelik Teknik SEO Kontrol Listesi PDF'ini hediye olarak hemen indirin.

Yorumlar (0)

Henüz yorum yapılmamış. İlk yorumu siz yapın!

Yorum Yazın