Local LLM Nedir? Bilgisayarımda Hangi Yapay Zekâ Modelini Çalıştırabilirim?
Local LLM Nedir? Bilgisayarımda Hangi Yapay Zekâ Modelini Çalıştırabilirim?
ChatGPT, Claude veya Gemini gibi yapay zekâ servislerini kullandığınızda model sizin bilgisayarınızda çalışmaz. Sorunuz internet üzerinden uzak sunuculara gönderilir ve yapay zekâ modeli bu sunucularda çalışarak cevabı size iletir.
Local LLM yaklaşımında ise yapay zekâ modelini kendi bilgisayarınızda, iş istasyonunuzda veya şirketinizin kendi sunucusunda çalıştırabilirsiniz.
Örneğin Qwen, Llama, Gemma veya Phi gibi modellerden birini indirip kendi GPU'nuz üzerinde çalıştırabilir, daha sonra bu modeli kendi uygulamalarınıza API üzerinden bağlayabilirsiniz.
Local LLM Neden Kullanılır?
Local LLM kullanmanın amacı sadece "ChatGPT'yi ücretsiz kullanmak" değildir. Asıl avantaj, model ve veriler üzerindeki kontrolün önemli ölçüde size geçmesidir.
1. Verilerinizi kendi altyapınızda tutabilirsiniz
Şirketinizin kaynak kodlarını, sözleşmelerini, müşteri dokümanlarını veya teknik belgelerini bir yapay zekâ sistemine kullandırmak istediğinizi düşünün.
Model kendi altyapınızda çalışıyorsa bu verileri üçüncü taraf bir LLM API'sine göndermeden bir AI sistemi oluşturmanız mümkün olabilir.
2. Kendi AI API'nizi oluşturabilirsiniz
Local LLM sadece sohbet etmek için kullanılmaz. Kendi uygulamanızın arkasına bir yapay zekâ servisi koyabilirsiniz.
C# / Python / Web Application
↓
Local LLM API
↓
Ollama / llama.cpp / vLLM
↓
Qwen / Llama
↓
GPU
3. RAG sistemleri oluşturabilirsiniz
Local LLM'ler şirket dokümanlarıyla çalışan RAG sistemlerinde de kullanılabilir.
PDF
↓
Markdown / Text
↓
Chunk
↓
Embedding
↓
Vector Database
↓
Relevant Chunks
↓
Local LLM
↓
Answer
Burada önemli bir ayrım vardır: LLM ile RAG aynı şey değildir.
RAG sistemi doğru doküman parçalarını bulur. LLM ise kendisine verilen bağlamı kullanarak cevabı oluşturur.
Local LLM ile Open-Weight Aynı Şey mi?
Local LLM ve open-weight kavramları birbirine yakın olsa da aynı şeyi ifade etmez.
| Kavram | Ne Anlama Gelir? |
|---|---|
| Local LLM | Modelin sizin bilgisayarınızda veya kontrol ettiğiniz sunucuda çalıştırılması. |
| Open-Weight | Eğitilmiş model ağırlıklarının indirilebilir olması. |
| Open Source | Modelin kaynak kodu, lisansı, eğitim süreci ve diğer bileşenlerini de kapsayabilen daha geniş bir kavram. |
Bu nedenle indirilebilir ağırlıklara sahip olan her modelin teknik olarak tamamen "open source" olduğunu söylemek doğru değildir. Bu yüzden local AI dünyasında open-weight model ifadesiyle sık sık karşılaşabilirsiniz.
Bilgisayarım Hangi LLM'i Çalıştırabilir?
Local LLM seçerken ilk bakmanız gereken şey modelin kaç milyar parametreye sahip olduğu değildir.
İlk bakmanız gereken değerlerden biri GPU'nuzun VRAM kapasitesidir.
Çünkü model ağırlıklarının yanında context, KV cache, batch size ve runtime tarafından kullanılan ek bellek de GPU belleğine ihtiyaç duyabilir.
Parametre Sayısı Nedir?
LLM'lerin yanında genellikle şu ifadeleri görürsünüz:
| İfade | Anlamı |
|---|---|
| 1.7B | Yaklaşık 1,7 milyar parametre |
| 4B | Yaklaşık 4 milyar parametre |
| 8B | Yaklaşık 8 milyar parametre |
| 14B | Yaklaşık 14 milyar parametre |
| 32B | Yaklaşık 32 milyar parametre |
| 70B | Yaklaşık 70 milyar parametre |
Buradaki B, Billion yani milyar anlamına gelir.
Ancak "8B model = 8 GB RAM" şeklinde basit bir hesap yapmak doğru değildir. Modelin hangi precision veya quantization formatında çalıştığı da önemlidir.
Quantization Nedir?
Local LLM dünyasında en önemli kavramlardan biri de quantization'dır.
Quantization, model ağırlıklarının daha düşük hassasiyetli sayısal formatlarda temsil edilerek bellek kullanımının azaltılmasını sağlayan yöntemlerden biridir.
Bir model için örneğin şu varyasyonları görebilirsiniz:
| Format | Genel yaklaşım | Bellek ihtiyacı | Kalite |
|---|---|---|---|
| FP16 | Yüksek hassasiyet | Yüksek | Yüksek |
| Q8 | Düşük quantization | Yüksek | Çok yüksek |
| Q6 | Hafif quantization | Orta-Yüksek | Yüksek |
| Q5 | Dengeli quantization | Orta | Yüksek |
| Q4 | Güçlü quantization | Daha düşük | Genellikle iyi |
| Q3 / Q2 | Daha agresif quantization | Düşük | Daha fazla kayıp olabilir |
Örneğin aynı modelin Q4 versiyonu, FP16 versiyonuna göre çok daha az bellek kullanabilir. Bunun karşılığında belirli görevlerde kalite kaybı görülebilir.
Bu nedenle local LLM seçiminde yalnızca modelin parametre sayısına değil, hangi quantization ile çalıştırıldığına de bakmak gerekir.
VRAM'e Göre Hangi Model?
Aşağıdaki tablo kesin bir donanım gereksinimi değildir. Context uzunluğu, quantization, batch size, model mimarisi ve runtime gibi değişkenler gerçek bellek ihtiyacını değiştirebilir.
| GPU VRAM | Yaklaşık Model Sınıfı | Tipik Kullanım |
|---|---|---|
| 8 GB | Küçük modeller / 4B civarı | Öğrenme, deneme, basit AI uygulamaları |
| 12 GB | 4B–8B quantized | Günlük kullanım, küçük RAG sistemleri |
| 16 GB | 8B ve bazı 14B quantized | Geliştirici kullanımı, RAG, kodlama |
| 24 GB | 8B, 14B ve bazı daha büyük quantized modeller | RAG, development, local AI server |
| 48 GB | 30B–32B sınıfı modeller | Daha ciddi local inference ve serving |
| 80 GB+ | Büyük modeller | Production serving ve büyük model çalıştırma |
| Multi-GPU | 70B+ ve daha büyük modeller | Büyük model ve yüksek kapasiteli serving |
RAM Ne Kadar Önemli?
RAM de önemlidir ancak RAM ile VRAM aynı şey değildir.
| Bileşen | Görevi |
|---|---|
| RAM | CPU ve işletim sisteminin kullandığı ana bellek |
| VRAM | GPU'nun kendi belleği |
| SSD | Model dosyalarının ve uygulamaların depolandığı alan |
GPU üzerinde inference yaparken modelin mümkün olduğunca büyük bölümünü VRAM'de tutmak performans açısından önemlidir.
CPU üzerinde veya CPU+GPU hibrit şekilde de model çalıştırılabilir. Ancak çalıştırabilmek ile hızlı çalıştırabilmek aynı şey değildir.
Local LLM İçin Hangi Ekran Kartı?
Local AI için ekran kartı seçerken yalnızca GPU'nun ham işlem gücüne bakmak yeterli değildir.
Özellikle büyük modeller için VRAM kapasitesi kritik bir faktördür.
| Öncelik | Neye Bakılmalı? |
|---|---|
| 1 | VRAM kapasitesi |
| 2 | Model ve runtime uyumluluğu |
| 3 | GPU işlem performansı |
| 4 | Güç tüketimi ve soğutma |
| 5 | Fiyat |
Özellikle NVIDIA tarafında CUDA ekosistemi nedeniyle birçok AI framework'ü ve inference aracı yaygın şekilde kullanılmaktadır.
Ancak AMD veya farklı GPU seçenekleri de tamamen dışarıda değildir. Kullanacağınız runtime'ın ve framework'ün donanım desteğini ayrıca kontrol etmek gerekir.
Ollama, llama.cpp ve vLLM Nedir?
Burada sık yapılan bir hata vardır:
Qwen, Llama veya Gemma bir modeldir.
Ollama, llama.cpp ve vLLM ise modeli çalıştırmak veya servis etmek için kullanılan yazılım katmanlarıdır.
| Araç | Temel Amaç | Kimler İçin? |
|---|---|---|
| Ollama | Local model çalıştırmayı kolaylaştırmak | Başlangıç, geliştirici, hızlı test |
| llama.cpp | Modeli düşük seviyede ve esnek şekilde çalıştırmak | Kontrol isteyen geliştiriciler |
| vLLM | LLM inference ve yüksek performanslı serving | API ve production kullanım |
Ollama
Local LLM'e yeni başlayanların karşılaşacağı en kolay araçlardan biridir.
ollama run qwen3
Bu yaklaşımda amaç genellikle modeli hızlıca indirip çalıştırmak ve local AI dünyasını öğrenmektir.
llama.cpp
Daha fazla kontrol isteyen kullanıcılar için önemli bir seçenektir. Özellikle GGUF formatındaki quantized modellerle oldukça yaygın şekilde kullanılır.
llama-server
↓
OpenAI Compatible API
↓
Your Application
↓
Local Model
vLLM
Bir modeli sadece kendi bilgisayarınızda sohbet etmek için çalıştırmak ile modeli birden fazla kullanıcının eriştiği API olarak sunmak aynı problem değildir.
Çoklu istek ve yüksek throughput gerektiren serving senaryolarında vLLM gibi inference motorları daha anlamlı hale gelir.
Local LLM + RAG Nasıl Çalışır?
Örneğin şirketinizde binlerce PDF ve teknik doküman olduğunu düşünelim. Bunları doğrudan LLM'in içine yüklemek yerine bir RAG mimarisi oluşturabilirsiniz.
DOCUMENTS
│
▼
PDF / Word / HTML
│
▼
Chunking
│
▼
Embedding
│
▼
PostgreSQL + pgvector
│
│
User Question ────────┤
▼
Vector Search
│
▼
Relevant Chunks
│
▼
Local LLM
│
▼
Answer
Böyle bir sistemde Local LLM'in şirketinizin bütün dokümanlarını ezberlemesi gerekmez.
Sorgu geldiğinde ilgili içerikler bulunur ve modele bağlam olarak gönderilir.
Fine-Tuning Gerekli mi?
Local LLM kullananların sık yaptığı bir başka hata, her problemi fine-tuning ile çözmeye çalışmaktır.
Örneğin amacınız:
"Model şirketimin PDF'lerinden cevap versin."
ise ilk olarak fine-tuning yapmak yerine RAG yaklaşımını değerlendirmek daha doğrudan bir çözümdür.
| İhtiyaç | Yaklaşım |
|---|---|
| Model şirket dokümanlarından bilgi bulsun | RAG |
| Güncel verileri kullansın | RAG / Tool / API |
| Belirli cevap formatına uysun | Prompt / Structured Output / gerekirse Fine-Tuning |
| Belirli görevde davranışı değişsin | Fine-Tuning |
| Özel bilgi kaynağına erişsin | RAG |
Basit bir ifadeyle:
RAG → Modele bilgi sağlamak
Fine-Tuning → Modelin belirli davranışlarını veya görevlerdeki performansını değiştirmek
Ben Hangi Modeli Seçmeliyim?
"En iyi local LLM hangisi?" sorusunun tek bir cevabı yoktur.
Model seçerken şu sırayı takip etmek daha sağlıklıdır:
- Ne yapmak istediğinizi belirleyin.
- GPU'nuzun VRAM kapasitesini öğrenin.
- Model boyutunu belirleyin.
- Uygun quantization seçin.
- Runtime seçin.
- Gerçek kullanım senaryonuzla test edin.
| Kullanım Amacı | Başlangıç Model Sınıfı | Önerilen Yaklaşım |
|---|---|---|
| Local LLM öğrenmek | 4B–8B | Ollama |
| Günlük AI asistanı | 8B | Ollama / llama.cpp |
| Kodlama | 8B–14B+ | Model ve GPU'ya göre seçim |
| RAG | 8B–32B | Local LLM + Vector DB |
| Production API | İhtiyaca göre | vLLM / llama.cpp |
| Büyük modeller | 32B–70B+ | Yüksek VRAM / Multi-GPU |
Örneğin 24 GB VRAM'im Varsa?
24 GB VRAM, local LLM öğrenmek ve gerçek uygulamalar geliştirmek için oldukça kullanışlı bir kapasitedir.
Örneğin başlangıçta şöyle bir sistem kurulabilir:
24 GB NVIDIA GPU
│
▼
Qwen 8B
│
▼
Ollama
│
▼
Open WebUI
│
▼
Local Chat Interface
Daha sonra RAG ekleyebilirsiniz:
Qwen
│
├── Ollama
│
└── RAG
│
├── Embedding Model
├── PostgreSQL
└── pgvector
Sonrasında farklı modelleri aynı sorular üzerinde test ederek kendi kullanım senaryonuz için hangi modelin daha uygun olduğunu ölçebilirsiniz.
Local LLM İçin Nasıl Bir Bilgisayar Gerekir?
Tek bir minimum sistem gereksinimi yoktur. Kullanacağınız model büyüdükçe ihtiyaç duyulan donanım da değişir.
| Bileşen | Başlangıç Seviyesi | Daha Ciddi Kullanım |
|---|---|---|
| CPU | Modern 6–8 core | 8–16+ core |
| RAM | 32 GB | 64–128 GB+ |
| GPU | 12–16 GB VRAM | 24–80 GB+ VRAM |
| SSD | 500 GB+ NVMe | 1 TB+ NVMe |
| İşletim Sistemi | Windows / Linux | Özellikle Linux |
| Runtime | Ollama / llama.cpp | vLLM / llama.cpp |
Local LLM Kurarken Yapılan En Büyük Hata
Local AI dünyasına yeni girenlerin yaptığı en yaygın hatalardan biri şudur:
"En büyük modeli kurarsam en iyi sonucu alırım."
Gerçekte bir LLM sisteminin performansı yalnızca parametre sayısına bağlı değildir.
Model
+
Quantization
+
Context
+
Prompt
+
RAG
+
Embedding
+
Retriever
+
Hardware
+
Serving
=
Gerçek Sistem Performansı
Örneğin kötü bir RAG sistemiyle büyük bir model kullanmak yerine, doğru dokümanı bulan iyi tasarlanmış bir RAG sistemiyle daha küçük bir model bazı kullanım senaryolarında yeterli olabilir.
Local LLM'e Nereden Başlamalı?
Eğer local LLM dünyasına ilk kez giriyorsanız her şeyi aynı anda öğrenmeye çalışmak yerine aşağıdaki sırayı takip etmek daha kolaydır:
- GPU'nuzun VRAM kapasitesini öğrenin.
- Kullanım amacınızı belirleyin.
- Bu donanıma uygun bir model seçin.
- Uygun quantized modeli belirleyin.
- Ollama veya llama.cpp ile modeli çalıştırın.
- Modeli gerçek sorularla test edin.
- RAG gerekiyorsa Vector Database ekleyin.
- Modeli kendi uygulamanıza API üzerinden bağlayın.
- Çoklu kullanıcı ve yüksek throughput gerekiyorsa serving katmanını değerlendirin.
Hızlı Local LLM Karar Tablosu
| Elinizdeki Donanım | Başlangıç Noktası | Uygun Senaryolar |
|---|---|---|
| 8 GB VRAM | Küçük quantized modeller | Öğrenme ve deneme |
| 12 GB VRAM | 4B–8B | Günlük kullanım ve küçük RAG |
| 16 GB VRAM | 8B–14B quantized | Development ve RAG |
| 24 GB VRAM | 8B–32B quantized | RAG, coding, local AI server |
| 48 GB VRAM | 30B–32B sınıfı | Daha büyük local inference |
| 80 GB+ VRAM | Büyük modeller | Production serving |
| Multi-GPU | 70B+ modeller | Büyük modeller ve yüksek kapasiteli serving |
Sonuç
Local LLM dünyasına girerken aslında birbirinden farklı birkaç teknolojiyi birlikte görürsünüz:
| Teknoloji | Görevi |
|---|---|
| Qwen / Llama / Gemma / Phi | LLM modeli |
| Quantization | Modelin daha düşük bellekle çalıştırılmasını sağlamak |
| Ollama | Local model çalıştırmayı kolaylaştırmak |
| llama.cpp | Esnek ve düşük seviyeli model çalıştırma |
| vLLM | LLM inference ve serving |
| RAG | Dış bilgi kaynaklarını modele bağlamak |
| Vector Database | İlgili içerikleri aramak |
| Fine-Tuning | Modelin belirli görevlerdeki davranışını/performance'ını değiştirmek |
En kısa haliyle
Local LLM = Modeli kendi donanımınızda çalıştırmak.
Model = Qwen, Llama, Gemma, Phi gibi yapay zekâ modeli.
Quantization = Modeli daha az bellek kullanacak şekilde temsil etmek.
Ollama / llama.cpp / vLLM = Modeli çalıştıran veya servis eden yazılım katmanı.
RAG = Modelin dış bilgi kaynaklarından ilgili içeriği bulup kullanmasını sağlamak.
Fine-Tuning = Modelin belirli görevlerdeki davranışını değiştirmek için yeniden eğitmek.
Ve local LLM seçerken temel sıra: VRAM → kullanım amacı → model → quantization → runtime.
Bir Sonraki Adım
Local LLM'i teoride anlamak başka, kendi bilgisayarınızda çalıştırmak başka bir şeydir. İlk deneme için küçük bir modelle başlayıp daha sonra RAG ve API entegrasyonuna geçmek çok daha öğretici olacaktır.
Özellikle geliştiriciyseniz hedefiniz sadece "local chatbot çalıştırmak" olmamalı. Asıl değer, local modeli kendi uygulamalarınızın bir parçası haline getirmeye başladığınızda ortaya çıkar.