Ollama ile Kendi Bilgisayarında Yerel Yapay Zeka Çalıştırma
Ollama nedir, neden yerelde model çalıştıralım?
Ollama, açık ağırlıklı (open-weight) dil modellerini kendi bilgisayarınızda tek komutla indirip çalıştırmanızı sağlayan ücretsiz bir araç. Modeli bir kez indirdikten sonra internet olmadan çalışır, verileriniz makineden dışarı çıkmaz ve token başına ücret ödemezsiniz. Benim için üç kazanım net: gizlilik, çevrimdışı erişilebilirlik ve maliyet sıfır. Karşılığında donanımınızı kullanır — yani “bedava” değil, “elektrik + RAM/VRAM” maliyetiyle çalışıyor diyebiliriz. Somut bir örnek: geçen hafta uçuşta, internet yokken, bir yapılandırma dosyasını yerel modele okutup hatalı satırı buldurabildim; aynı işi bulut servisine yaptırmak o an mümkün değildi. İşte yerel model tam da bu boşluğu dolduruyor.
Kurulum: tek komutla başlıyoruz
Ollama; Linux, macOS ve Windows’ta çalışıyor. Ben çoğunlukla Linux tarafındayım, oradaki kurulum tek satır:
# Linux (resmî kurulum betiği)
curl -fsSL https://ollama.com/install.sh | sh
# Sürümü doğrula
ollama --version
macOS ve Windows için ollama.com/download adresindeki resmî yükleyiciyi indirmeniz yeterli; kurulumdan sonra Ollama bir arka plan servisi olarak çalışmaya başlıyor. Yazı sırasında güncel kararlı sürüm 0.33 serisiydi (2026); siz de ollama --version ile kontrol edin.
İlk modeli indirip çalıştırma
Mantık basit: pull ile indir, run ile konuş. Hafif bir modelle başlamanızı öneririm; makineyi yormadan her şeyin çalıştığını görürsünüz:
# Küçük ve hızlı bir modelle başla (~2.5 GB)
ollama run llama3.2:3b
# İlk çalıştırmada model otomatik iner, sonra sohbet açılır.
# Çıkmak için:
/bye
İndirdiğiniz modelleri ve çalışan oturumları şöyle yönetiyorum:
ollama list # indirilen modelleri listele
ollama ps # şu an bellekte çalışan modeller
ollama pull qwen3:8b # modeli önceden indir (çalıştırmadan)
ollama rm llama3.2:3b# diskten kaldır
Hangi model benim donanımıma uygun?
En sık aldığım soru bu. Kaba bir kural: model boyutu (parametre) arttıkça ihtiyaç duyulan RAM/VRAM de artar. Aşağıdaki tablo, kendi deneyimime ve güncel önerilere dayanan bir başlangıç rehberi (Q4 nicemleme varsayımıyla):
| Donanım | Önerilen model örneği | Yaklaşık ihtiyaç | Kullanım |
|---|---|---|---|
| 8 GB RAM, GPU yok | llama3.2:3b |
~2–3 GB | Hızlı deneme, basit sohbet/özet |
| 16 GB RAM / küçük GPU | deepseek-r1:7b, gemma3:4b |
~5–6 GB | Akıl yürütme, günlük işler, görsel (gemma) |
| 16 GB VRAM | gpt-oss:20b |
~16 GB | Dengeli genel amaçlı kullanım |
| 24 GB VRAM | qwen3:30b |
~18–24 GB | Kodlama ve daha ağır görevler |
Model etiketleri sık güncelleniyor; en güncel sürümleri her zaman ollama.com/library üzerinden doğrulamanızı öneririm. GPU şart değil — CPU + yeterli RAM ile de küçük modeller rahatça çalışıyor, sadece yanıt hızı düşüyor.
API olarak kullanma: kendi uygulamanıza bağlayın
Ollama’nın asıl güzel yanı, arka planda yerel bir REST API sunması (varsayılan port 11434). Yani modeli sadece terminalden değil, kendi scriptlerinizden de çağırabilirsiniz:
# Basit bir istek (curl ile)
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Linux disk kullanımını özetleyen bir komut yaz",
"stream": false
}'
Ayrıca OpenAI uyumlu bir uç nokta da var; mevcut OpenAI istemcinizi tek satır değiştirip yerele yönlendirebilirsiniz:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # yerelde önemli değil
)
yanit = client.chat.completions.create(
model="qwen3:8b",
messages=[{"role": "user", "content": "Merhaba, kısa bir test mesajı."}]
)
print(yanit.choices[0].message.content)
Özel model: kendi sistem talimatınızı gömün
Belirli bir rolü hep tekrar yazmak yerine, bir Modelfile ile kalıcı bir “karakter” oluşturuyorum. Örneğin bir sistem yöneticisi asistanı:
# Modelfile adında bir dosya oluştur:
FROM llama3.2:3b
PARAMETER temperature 0.3
SYSTEM "Sen deneyimli bir Linux ve Windows sistem yöneticisisin. Kısa, komut odaklı ve güvenli cevaplar ver."
# Modeli oluştur ve çalıştır
ollama create sysadmin -f Modelfile
ollama run sysadmin
İpucu: Homelab’da başka cihazlardan erişmek isterseniz servisi
OLLAMA_HOST=0.0.0.0:11434ile dinletebilirsiniz — ama bunu yalnızca güvendiğiniz bir ağ içinde yapın, API’de kimlik doğrulama yoktur.
Ollama gerçekten internetsiz çalışır mı?
Evet. Modeli bir kez indirdikten sonra tamamen çevrimdışı çalışır. İnternet yalnızca model indirme/güncelleme sırasında gerekir.
Verilerim buluta gider mi?
Hayır. Tüm işlem kendi makinenizde olur; istem ve yanıtlar dışarı gönderilmez. Zaten yerelde çalıştırmanın en büyük nedeni de bu.
GPU zorunlu mu?
Hayır. Küçük modeller (3B–8B) CPU ve yeterli RAM ile çalışır. GPU, özellikle büyük modellerde yanıt hızını belirgin şekilde artırır ama şart değil.
Bu modelleri ticari işte kullanabilir miyim?
Çoğu açık ağırlıklı model buna izin verir, ancak her modelin lisansı farklıdır. Üretimde kullanmadan önce ilgili modelin lisans koşullarını mutlaka okuyun.
Değerlendirme
Ollama, “yapay zekâyı kendi kontrolümde çalıştırmak istiyorum” diyen herkes için bugün en pratik giriş kapısı. Kurulumu tek komut, ilk modeli çalıştırmak bir satır; gerisi donanımınızın elverdiği ölçüde ölçekleniyor. Benim önerim: Önce llama3.2:3b gibi küçük bir modelle her şeyin çalıştığını doğrulayın, sonra donanımınıza uygun daha büyük bir modele geçin ve bir Modelfile ile kendi iş akışınıza göre özelleştirin. Hassas verilerle çalışan bir sistem mühendisi için yerel LLM, “güzel olurdu” değil, gerçekten işe yarayan bir araç haline geldi.
Share this content:

Bir yanıt yazın