Yapay Zeka - AI

Local LLM Nedir? Bilgisayarımda Hangi Yapay Zekâ Modelini Çalıştırabilirim?

Ürfet Demirtaş 9 dk okuma

Local LLM Nedir? Bilgisayarımda Hangi Yapay Zekâ Modelini Çalıştırabilirim?

ChatGPT, Claude veya Gemini gibi yapay zekâ servislerini kullandığınızda model sizin bilgisayarınızda çalışmaz. Sorunuz internet üzerinden uzak sunuculara gönderilir ve yapay zekâ modeli bu sunucularda çalışarak cevabı size iletir.

Local LLM yaklaşımında ise yapay zekâ modelini kendi bilgisayarınızda, iş istasyonunuzda veya şirketinizin kendi sunucusunda çalıştırabilirsiniz.

Örneğin Qwen, Llama, Gemma veya Phi gibi modellerden birini indirip kendi GPU'nuz üzerinde çalıştırabilir, daha sonra bu modeli kendi uygulamalarınıza API üzerinden bağlayabilirsiniz.

Kısaca: Local LLM, büyük dil modelinin (LLM) uzak bir API yerine sizin kontrol ettiğiniz bilgisayar veya sunucu üzerinde çalıştırılmasıdır.

Local LLM Neden Kullanılır?

Local LLM kullanmanın amacı sadece "ChatGPT'yi ücretsiz kullanmak" değildir. Asıl avantaj, model ve veriler üzerindeki kontrolün önemli ölçüde size geçmesidir.

1. Verilerinizi kendi altyapınızda tutabilirsiniz

Şirketinizin kaynak kodlarını, sözleşmelerini, müşteri dokümanlarını veya teknik belgelerini bir yapay zekâ sistemine kullandırmak istediğinizi düşünün.

Model kendi altyapınızda çalışıyorsa bu verileri üçüncü taraf bir LLM API'sine göndermeden bir AI sistemi oluşturmanız mümkün olabilir.

2. Kendi AI API'nizi oluşturabilirsiniz

Local LLM sadece sohbet etmek için kullanılmaz. Kendi uygulamanızın arkasına bir yapay zekâ servisi koyabilirsiniz.

C# / Python / Web Application
            ↓
       Local LLM API
            ↓
   Ollama / llama.cpp / vLLM
            ↓
      Qwen / Llama
            ↓
           GPU

3. RAG sistemleri oluşturabilirsiniz

Local LLM'ler şirket dokümanlarıyla çalışan RAG sistemlerinde de kullanılabilir.

PDF
 ↓
Markdown / Text
 ↓
Chunk
 ↓
Embedding
 ↓
Vector Database
 ↓
Relevant Chunks
 ↓
Local LLM
 ↓
Answer

Burada önemli bir ayrım vardır: LLM ile RAG aynı şey değildir.

RAG sistemi doğru doküman parçalarını bulur. LLM ise kendisine verilen bağlamı kullanarak cevabı oluşturur.

Local LLM ile Open-Weight Aynı Şey mi?

Local LLM ve open-weight kavramları birbirine yakın olsa da aynı şeyi ifade etmez.

Kavram Ne Anlama Gelir?
Local LLM Modelin sizin bilgisayarınızda veya kontrol ettiğiniz sunucuda çalıştırılması.
Open-Weight Eğitilmiş model ağırlıklarının indirilebilir olması.
Open Source Modelin kaynak kodu, lisansı, eğitim süreci ve diğer bileşenlerini de kapsayabilen daha geniş bir kavram.

Bu nedenle indirilebilir ağırlıklara sahip olan her modelin teknik olarak tamamen "open source" olduğunu söylemek doğru değildir. Bu yüzden local AI dünyasında open-weight model ifadesiyle sık sık karşılaşabilirsiniz.

Bilgisayarım Hangi LLM'i Çalıştırabilir?

Local LLM seçerken ilk bakmanız gereken şey modelin kaç milyar parametreye sahip olduğu değildir.

İlk bakmanız gereken değerlerden biri GPU'nuzun VRAM kapasitesidir.

Çünkü model ağırlıklarının yanında context, KV cache, batch size ve runtime tarafından kullanılan ek bellek de GPU belleğine ihtiyaç duyabilir.

Önemli: 24 GB VRAM'e sahip olmanız, 24 GB boyutundaki herhangi bir modeli rahatça çalıştırabileceğiniz anlamına gelmez. Modelin çalışma sırasında ihtiyaç duyduğu ek bellek de hesaba katılmalıdır.

Parametre Sayısı Nedir?

LLM'lerin yanında genellikle şu ifadeleri görürsünüz:

İfade Anlamı
1.7B Yaklaşık 1,7 milyar parametre
4B Yaklaşık 4 milyar parametre
8B Yaklaşık 8 milyar parametre
14B Yaklaşık 14 milyar parametre
32B Yaklaşık 32 milyar parametre
70B Yaklaşık 70 milyar parametre

Buradaki B, Billion yani milyar anlamına gelir.

Ancak "8B model = 8 GB RAM" şeklinde basit bir hesap yapmak doğru değildir. Modelin hangi precision veya quantization formatında çalıştığı da önemlidir.

Quantization Nedir?

Local LLM dünyasında en önemli kavramlardan biri de quantization'dır.

Quantization, model ağırlıklarının daha düşük hassasiyetli sayısal formatlarda temsil edilerek bellek kullanımının azaltılmasını sağlayan yöntemlerden biridir.

Bir model için örneğin şu varyasyonları görebilirsiniz:

Format Genel yaklaşım Bellek ihtiyacı Kalite
FP16 Yüksek hassasiyet Yüksek Yüksek
Q8 Düşük quantization Yüksek Çok yüksek
Q6 Hafif quantization Orta-Yüksek Yüksek
Q5 Dengeli quantization Orta Yüksek
Q4 Güçlü quantization Daha düşük Genellikle iyi
Q3 / Q2 Daha agresif quantization Düşük Daha fazla kayıp olabilir

Örneğin aynı modelin Q4 versiyonu, FP16 versiyonuna göre çok daha az bellek kullanabilir. Bunun karşılığında belirli görevlerde kalite kaybı görülebilir.

Bu nedenle local LLM seçiminde yalnızca modelin parametre sayısına değil, hangi quantization ile çalıştırıldığına de bakmak gerekir.

VRAM'e Göre Hangi Model?

Aşağıdaki tablo kesin bir donanım gereksinimi değildir. Context uzunluğu, quantization, batch size, model mimarisi ve runtime gibi değişkenler gerçek bellek ihtiyacını değiştirebilir.

GPU VRAM Yaklaşık Model Sınıfı Tipik Kullanım
8 GB Küçük modeller / 4B civarı Öğrenme, deneme, basit AI uygulamaları
12 GB 4B–8B quantized Günlük kullanım, küçük RAG sistemleri
16 GB 8B ve bazı 14B quantized Geliştirici kullanımı, RAG, kodlama
24 GB 8B, 14B ve bazı daha büyük quantized modeller RAG, development, local AI server
48 GB 30B–32B sınıfı modeller Daha ciddi local inference ve serving
80 GB+ Büyük modeller Production serving ve büyük model çalıştırma
Multi-GPU 70B+ ve daha büyük modeller Büyük model ve yüksek kapasiteli serving
Unutmayın: Bu tablo "24 GB VRAM varsa kesin olarak 32B çalışır" anlamına gelmez. Model dosyasının boyutu ile gerçek inference sırasında gereken bellek aynı değildir.

RAM Ne Kadar Önemli?

RAM de önemlidir ancak RAM ile VRAM aynı şey değildir.

Bileşen Görevi
RAM CPU ve işletim sisteminin kullandığı ana bellek
VRAM GPU'nun kendi belleği
SSD Model dosyalarının ve uygulamaların depolandığı alan

GPU üzerinde inference yaparken modelin mümkün olduğunca büyük bölümünü VRAM'de tutmak performans açısından önemlidir.

CPU üzerinde veya CPU+GPU hibrit şekilde de model çalıştırılabilir. Ancak çalıştırabilmek ile hızlı çalıştırabilmek aynı şey değildir.

Local LLM İçin Hangi Ekran Kartı?

Local AI için ekran kartı seçerken yalnızca GPU'nun ham işlem gücüne bakmak yeterli değildir.

Özellikle büyük modeller için VRAM kapasitesi kritik bir faktördür.

Öncelik Neye Bakılmalı?
1 VRAM kapasitesi
2 Model ve runtime uyumluluğu
3 GPU işlem performansı
4 Güç tüketimi ve soğutma
5 Fiyat

Özellikle NVIDIA tarafında CUDA ekosistemi nedeniyle birçok AI framework'ü ve inference aracı yaygın şekilde kullanılmaktadır.

Ancak AMD veya farklı GPU seçenekleri de tamamen dışarıda değildir. Kullanacağınız runtime'ın ve framework'ün donanım desteğini ayrıca kontrol etmek gerekir.

Ollama, llama.cpp ve vLLM Nedir?

Burada sık yapılan bir hata vardır:

Qwen, Llama veya Gemma bir modeldir.

Ollama, llama.cpp ve vLLM ise modeli çalıştırmak veya servis etmek için kullanılan yazılım katmanlarıdır.

Araç Temel Amaç Kimler İçin?
Ollama Local model çalıştırmayı kolaylaştırmak Başlangıç, geliştirici, hızlı test
llama.cpp Modeli düşük seviyede ve esnek şekilde çalıştırmak Kontrol isteyen geliştiriciler
vLLM LLM inference ve yüksek performanslı serving API ve production kullanım

Ollama

Local LLM'e yeni başlayanların karşılaşacağı en kolay araçlardan biridir.

ollama run qwen3

Bu yaklaşımda amaç genellikle modeli hızlıca indirip çalıştırmak ve local AI dünyasını öğrenmektir.

llama.cpp

Daha fazla kontrol isteyen kullanıcılar için önemli bir seçenektir. Özellikle GGUF formatındaki quantized modellerle oldukça yaygın şekilde kullanılır.

llama-server
    ↓
OpenAI Compatible API
    ↓
Your Application
    ↓
Local Model

vLLM

Bir modeli sadece kendi bilgisayarınızda sohbet etmek için çalıştırmak ile modeli birden fazla kullanıcının eriştiği API olarak sunmak aynı problem değildir.

Çoklu istek ve yüksek throughput gerektiren serving senaryolarında vLLM gibi inference motorları daha anlamlı hale gelir.

Local LLM + RAG Nasıl Çalışır?

Örneğin şirketinizde binlerce PDF ve teknik doküman olduğunu düşünelim. Bunları doğrudan LLM'in içine yüklemek yerine bir RAG mimarisi oluşturabilirsiniz.

                  DOCUMENTS
                      │
                      ▼
              PDF / Word / HTML
                      │
                      ▼
                   Chunking
                      │
                      ▼
                  Embedding
                      │
                      ▼
             PostgreSQL + pgvector
                      │
                      │
User Question ────────┤
                      ▼
                 Vector Search
                      │
                      ▼
               Relevant Chunks
                      │
                      ▼
                 Local LLM
                      │
                      ▼
                    Answer

Böyle bir sistemde Local LLM'in şirketinizin bütün dokümanlarını ezberlemesi gerekmez.

Sorgu geldiğinde ilgili içerikler bulunur ve modele bağlam olarak gönderilir.

Fine-Tuning Gerekli mi?

Local LLM kullananların sık yaptığı bir başka hata, her problemi fine-tuning ile çözmeye çalışmaktır.

Örneğin amacınız:

"Model şirketimin PDF'lerinden cevap versin."

ise ilk olarak fine-tuning yapmak yerine RAG yaklaşımını değerlendirmek daha doğrudan bir çözümdür.

İhtiyaç Yaklaşım
Model şirket dokümanlarından bilgi bulsun RAG
Güncel verileri kullansın RAG / Tool / API
Belirli cevap formatına uysun Prompt / Structured Output / gerekirse Fine-Tuning
Belirli görevde davranışı değişsin Fine-Tuning
Özel bilgi kaynağına erişsin RAG

Basit bir ifadeyle:

RAG → Modele bilgi sağlamak

Fine-Tuning → Modelin belirli davranışlarını veya görevlerdeki performansını değiştirmek

Ben Hangi Modeli Seçmeliyim?

"En iyi local LLM hangisi?" sorusunun tek bir cevabı yoktur.

Model seçerken şu sırayı takip etmek daha sağlıklıdır:

  1. Ne yapmak istediğinizi belirleyin.
  2. GPU'nuzun VRAM kapasitesini öğrenin.
  3. Model boyutunu belirleyin.
  4. Uygun quantization seçin.
  5. Runtime seçin.
  6. Gerçek kullanım senaryonuzla test edin.
Kullanım Amacı Başlangıç Model Sınıfı Önerilen Yaklaşım
Local LLM öğrenmek 4B–8B Ollama
Günlük AI asistanı 8B Ollama / llama.cpp
Kodlama 8B–14B+ Model ve GPU'ya göre seçim
RAG 8B–32B Local LLM + Vector DB
Production API İhtiyaca göre vLLM / llama.cpp
Büyük modeller 32B–70B+ Yüksek VRAM / Multi-GPU

Örneğin 24 GB VRAM'im Varsa?

24 GB VRAM, local LLM öğrenmek ve gerçek uygulamalar geliştirmek için oldukça kullanışlı bir kapasitedir.

Örneğin başlangıçta şöyle bir sistem kurulabilir:

24 GB NVIDIA GPU
       │
       ▼
    Qwen 8B
       │
       ▼
     Ollama
       │
       ▼
    Open WebUI
       │
       ▼
 Local Chat Interface

Daha sonra RAG ekleyebilirsiniz:

Qwen
  │
  ├── Ollama
  │
  └── RAG
       │
       ├── Embedding Model
       ├── PostgreSQL
       └── pgvector

Sonrasında farklı modelleri aynı sorular üzerinde test ederek kendi kullanım senaryonuz için hangi modelin daha uygun olduğunu ölçebilirsiniz.

Local LLM İçin Nasıl Bir Bilgisayar Gerekir?

Tek bir minimum sistem gereksinimi yoktur. Kullanacağınız model büyüdükçe ihtiyaç duyulan donanım da değişir.

Bileşen Başlangıç Seviyesi Daha Ciddi Kullanım
CPU Modern 6–8 core 8–16+ core
RAM 32 GB 64–128 GB+
GPU 12–16 GB VRAM 24–80 GB+ VRAM
SSD 500 GB+ NVMe 1 TB+ NVMe
İşletim Sistemi Windows / Linux Özellikle Linux
Runtime Ollama / llama.cpp vLLM / llama.cpp

Local LLM Kurarken Yapılan En Büyük Hata

Local AI dünyasına yeni girenlerin yaptığı en yaygın hatalardan biri şudur:

"En büyük modeli kurarsam en iyi sonucu alırım."

Gerçekte bir LLM sisteminin performansı yalnızca parametre sayısına bağlı değildir.

Model
  +
Quantization
  +
Context
  +
Prompt
  +
RAG
  +
Embedding
  +
Retriever
  +
Hardware
  +
Serving
  =
Gerçek Sistem Performansı

Örneğin kötü bir RAG sistemiyle büyük bir model kullanmak yerine, doğru dokümanı bulan iyi tasarlanmış bir RAG sistemiyle daha küçük bir model bazı kullanım senaryolarında yeterli olabilir.

Local LLM'e Nereden Başlamalı?

Eğer local LLM dünyasına ilk kez giriyorsanız her şeyi aynı anda öğrenmeye çalışmak yerine aşağıdaki sırayı takip etmek daha kolaydır:

  1. GPU'nuzun VRAM kapasitesini öğrenin.
  2. Kullanım amacınızı belirleyin.
  3. Bu donanıma uygun bir model seçin.
  4. Uygun quantized modeli belirleyin.
  5. Ollama veya llama.cpp ile modeli çalıştırın.
  6. Modeli gerçek sorularla test edin.
  7. RAG gerekiyorsa Vector Database ekleyin.
  8. Modeli kendi uygulamanıza API üzerinden bağlayın.
  9. Çoklu kullanıcı ve yüksek throughput gerekiyorsa serving katmanını değerlendirin.

Hızlı Local LLM Karar Tablosu

Elinizdeki Donanım Başlangıç Noktası Uygun Senaryolar
8 GB VRAM Küçük quantized modeller Öğrenme ve deneme
12 GB VRAM 4B–8B Günlük kullanım ve küçük RAG
16 GB VRAM 8B–14B quantized Development ve RAG
24 GB VRAM 8B–32B quantized RAG, coding, local AI server
48 GB VRAM 30B–32B sınıfı Daha büyük local inference
80 GB+ VRAM Büyük modeller Production serving
Multi-GPU 70B+ modeller Büyük modeller ve yüksek kapasiteli serving

Sonuç

Local LLM dünyasına girerken aslında birbirinden farklı birkaç teknolojiyi birlikte görürsünüz:

Teknoloji Görevi
Qwen / Llama / Gemma / Phi LLM modeli
Quantization Modelin daha düşük bellekle çalıştırılmasını sağlamak
Ollama Local model çalıştırmayı kolaylaştırmak
llama.cpp Esnek ve düşük seviyeli model çalıştırma
vLLM LLM inference ve serving
RAG Dış bilgi kaynaklarını modele bağlamak
Vector Database İlgili içerikleri aramak
Fine-Tuning Modelin belirli görevlerdeki davranışını/performance'ını değiştirmek

En kısa haliyle

Local LLM = Modeli kendi donanımınızda çalıştırmak.

Model = Qwen, Llama, Gemma, Phi gibi yapay zekâ modeli.

Quantization = Modeli daha az bellek kullanacak şekilde temsil etmek.

Ollama / llama.cpp / vLLM = Modeli çalıştıran veya servis eden yazılım katmanı.

RAG = Modelin dış bilgi kaynaklarından ilgili içeriği bulup kullanmasını sağlamak.

Fine-Tuning = Modelin belirli görevlerdeki davranışını değiştirmek için yeniden eğitmek.

Ve local LLM seçerken temel sıra: VRAM → kullanım amacı → model → quantization → runtime.

Bir Sonraki Adım

Local LLM'i teoride anlamak başka, kendi bilgisayarınızda çalıştırmak başka bir şeydir. İlk deneme için küçük bir modelle başlayıp daha sonra RAG ve API entegrasyonuna geçmek çok daha öğretici olacaktır.

Özellikle geliştiriciyseniz hedefiniz sadece "local chatbot çalıştırmak" olmamalı. Asıl değer, local modeli kendi uygulamalarınızın bir parçası haline getirmeye başladığınızda ortaya çıkar.

Tüm yazılar →