Ağustos 24 2026

Model Context Protocol (MCP) ile Kendi Yerel AI Asistanınızı İnşa Edin

Hadi itiraf edelim: Bulut tabanlı yapay zeka modelleri harika iş çıkarıyor ama şirketinizin mali tablolarını, gizli kaynak kodlarını ya da kişisel notlarınızı OpenAI veya Anthropic sunucularına göndermek her zaman iyi bir fikir değil. Tam bu noktada devreye MCP (Model Context Protocol), local LLM çözümleri ve güçlü bir bare metal donanım giriyor. Bugün, verinizi dışarı sızdırmadan çalışan akıllı bir yerel asistanı nasıl kuracağımızı test edip sonuçları masaya yatırıyoruz.

Nedir Bu Model Context Protocol (MCP)?

Teknoloji dünyasında her model için ayrı bir entegrasyon yazmaktan yorulmuştuk. Context management dediğimiz olay, daha önce karmaşık RAG (Retrieval-Augmented Generation) boru hatları ve özel script’lerle çözülmeye çalışılıyordu. Anthropic tarafından açık standart olarak duyurulan MCP, yapay zekanın “USB-C portu” gibi çalışıyor.

Kısacası MCP; model ile yerel dosyalarınız, veritabanlarınız ve API’leriniz arasında standart bir köprü kuruyor. Siz bir MCP sunucusu yazıyorsunuz (veya hazır olanı kullanıyorsunuz), yerel modeliniz de bu standart protokol üzerinden gidip dosyalarınızı güvenle okuyor.

[Görsel: MCP mimarisini gösteren şema: LLM İstemcisi, MCP Protokolü ve Yerel Veri Kaynakları arasındaki veri akışı]

Neden Bulut Değil de Bare Metal?

VPS veya sanallaştırılmış sunucular genelde GPU kaynaklarını paylaşır veya kısıtlar. Bare metal (fiziksel donanım) tercih ettiğinizde GPU VRAM’inin ve işlemcinin tamamı sizin emrinize amade olur. Yerel bir LLM çalıştırırken milisaniyeler ve token hızları önemlidir; sanallaştırma katmanının getirdiği gecikmeyi kimse istemez.

Adım Adım Kurulum: Kendi Yerel Sisteminizi Kurun

Lafı uzatmadan test ortamımıza geçelim. Senaryomuzda Ubuntu çalışan bir bare metal sunucumuz, yerel model motorumuz ve yerel SQLite veritabanımıza bağlanan bir MCP sunucumuz var.

1. Yerel LLM Motorunu Başlatın (Ollama)

Hızlı ve sorunsuz bir başlangıç için Ollama’yı kullanıyoruz. Terminali açıp şu komutla motoru kuralım ve Llama 3.1 modelini indirelim:

curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3.1:8b

2. Basit Bir Dosya Sistemi MCP Sunucusu Kurun

Modelimizin sadece bizim izin verdiğimiz klasördeki dosyaları okumasını istiyoruz. Node.js tabanlı resmi MCP dosya sistemi sunucusunu kuralım:

npx -y @modelcontextprotocol/server-filesystem /home/kerten/gizli-veriler

[Görsel: Terminal ekranında MCP sunucusunun ayağa kalktığı ve JSON-RPC isteklerini dinlediği anın çıktısı]

3. İstemci ile MCP Sunucusunu Bağlayın

MCP istemcisi olarak Claude Desktop veya açık kaynaklı LibreChat kullanabilirsiniz. Yapılandırma dosyanıza (mcp_config.json) sunucunuzu ekleyin:

{
  "mcpServers": {
    "yerel-dosyalar": {
      "command": "npx",
      "args": ["-y", "@modelcontextprotocol/server-filesystem", "/home/kerten/gizli-veriler"]
    }
  }
}

Gerçek Kullanım Senaryosu: Test Ettik, Gördük

Sistemi kurduktan sonra gizli-veriler klasörüne 2024 yılına ait hayali sunucu loglarını ve fatura dökümlerini içeren bir CSV dosyası attık. Ardından modele şu soruyu sorduk:

“Geçtiğimiz ay en çok harcama yapılan ilk 3 sunucu kalemini bul ve maliyetlerini topla.”

Sonuç: Model, MCP arayüzü sayesinde CSV dosyasını okudu, verileri parse etti ve 3 saniye içinde doğru yanıtı verdi. Hiçbir veri internete çıkmadı, sıfır API maliyetiyle işlem bare metal üzerinde tamamlandı.

[Görsel: Yerel arayüzde modelin MCP aracı üzerinden dosyayı başarıyla sorgulayıp yanıtladığı sohbet ekranı]

Artılar ve Eksiler

Her sistem gibi bu yapının da harika yanları ve bazı zorlukları var:

Avantajlar (Artılar) Dezavantajlar (Eksiler)
%100 Veri Gizliliği (Zero Data Leakage) Yüksek ilk donanım maliyeti (Bare metal / GPU)
Sıfır Token / API Ücreti Model boyutu küçüldükçe akıl yürütme kalitesi düşebilir
Standart MCP protokolü sayesinde kolay araç entegrasyonu Kurulum ve context management optimizasyonu teknik bilgi gerektirir
İnternet bağlantısı kesilse bile çalışabilirlik Büyük dosyalarda context window dolma riski

Maliyetler ve Ücretsiz Alternatifler

Böyle bir sistemi ayağa kaldırmanın maliyeti tamamen seçtiğiniz donanıma bağlıdır:

  • Bare Metal Sunucu Kiralama: NVIDIA RTX 4090 veya A4000 GPU barındıran bir sunucu aylık yaklaşık 70$ – 150$ civarındadır.
  • Kendi Donanımınız: Evinizde en az 16 GB VRAM’e sahip bir ekran kartı (RTX 3060 12GB bile başlangıç için iş görür) varsa yazılım katmanı tamamen ücretsizdir.
  • Ücretsiz Alternatifler: Ollama, vLLM, LM Studio ve açık kaynaklı MCP SDK’ları tamamen ücretsizdir. Bulut API’larına (OpenAI, Claude API) her ay yüzlerce dolar ödemek yerine kendi donanımınızı amorti edebilirsiniz.

Sonuç: Yerel AI Asistanı Kurmaya Değer mi?

Eğer gizlilik takıntınız varsa, regülasyonlara tabi bir sektörde çalışıyorsanız veya sadece kendi sistemleriniz üzerinde tam denetim istiyorsanız: Kesinlikle evet.

MCP sayesinde yerel modeller artık sadece boş sohbet eden chatbot’lar olmaktan çıktı; bilgisayarınızdaki gerçek verilerle konuşabilen yetenekli birer asistan haline geldi. Bir terminal açın, Ollama’yı kurun ve kendi verinizi yönetmenin tadını çıkarın!

Category: Genel | LEAVE A COMMENT
Mayıs 28 2026

Kendi Lokalinizde LLM Çalıştırmak: Ollama Kurulum Rehberi

Yapay zeka hayatımızın merkezine oturdu ama her sorduğumuz sorunun OpenAI veya Google sunucularına gitmesi canınızı sıkmıyor mu? İşte tam bu noktada local llm (yerel büyük dil modeli) kavramı devreye giriyor. Tamamen kendi bilgisayarınızda çalışan, internete ihtiyaç duymayan ve en önemlisi privacy (gizlilik) endişelerinizi sıfıra indiren bir yapay zeka deneyimi artık hayal değil. Bu rehberde, bu işi çocuk oyuncağı haline getiren ollama aracını mercek altına alıyor, Mac ve Linux sistemlerimizde llama, mistral gibi canavarları nasıl koşturacağımızı adım adım inceliyoruz.

Neden Bulut Değil de Local LLM?

ChatGPT veya Claude kullanırken aslında verilerimizi sürekli uzak sunuculara kiralıyoruz. Şirket sırları, kişisel günlükler veya üzerinde çalıştığınız yeni bir startup fikri… Hepsi birilerinin veri merkezinde işleniyor. Kendi bilgisayarınızda bir yapay zeka çalıştırmak ise size tam bir veri egemenliği sunar.

Bunun yanında, “Çevrimdışı çalışabilme” lüksü de cabası. Metroda, uçakta ya da internetin çekmediği bir kamp alanında, kod yazarken takıldığınız bir yeri yapay zekaya sorabildiğinizi hayal edin. Üstelik API ücreti yok, aylık abonelik derdi yok. Bilgisayarınızın elektriği ve donanımı yettiği sürece sınırsız kullanım hakkına sahipsiniz.

Ollama Nedir ve Ne İşe Yarar?

Eskiden lokalde model çalıştırmak tam bir işkenceydi. Hugging Face’ten gigabaytlarca dosya indirmeniz, doğru Python kütüphanelerini (PyTorch, llama.cpp vb.) kurmanız ve uyumluluk sorunlarıyla boğuşmanız gerekirdi. Ollama, bu karmaşayı tek bir satır kodla çözen harika bir araç. Kendisini yapay zeka modellerinin “Docker”ı olarak düşünebilirsiniz. Modelleri paketler, yönetir ve sisteminizde optimize bir şekilde çalıştırır.

[Görsel: Ollama logosu ve terminalde koşan şık, minimalist bir model çalıştırma ekranı]

Adım Adım Ollama Kurulumu

Lafı fazla uzatmadan işe koyulalım. Biz bu rehberde Mac ve Linux odaklı gideceğiz ancak Ollama’nın artık resmi bir Windows desteği de sunduğunu belirtelim.

macOS Kurulumu

Mac kullanıcıları için süreç inanılmaz derecede basit. Eğer sisteminizde Homebrew kuruluysa terminali açıp şu komutu yazmanız yeterli:

brew install ollama

Alternatif olarak, Ollama’nın resmi web sitesinden direkt bir `.dmg` dosyası indirip uygulamalar klasörünüze de sürükleyebilirsiniz.

Linux Kurulumu

Linux severler için ise tek satırlık bir script yeterli oluyor. Terminalinizi açın ve aşağıdaki komutu yapıştırın:

curl -fsSL https://ollama.com/install.sh | sh

İlk Modeli Ayaklandırmak: Llama 3, Mistral ve Phi-3

Kurulum bittiğine göre şimdi motoru çalıştırma zamanı. Ollama kütüphanesinde kullanabileceğimiz onlarca model var. Biz en popüler üç tanesini test ettik:

  • Llama 3 (8B): Meta’nın geliştirdiği, genel yetenekleri ve Türkçe anlama kapasitesi oldukça yüksek olan amiral gemisi.
  • Mistral (7B): Fransız menşeili Mistral AI tarafından geliştirilen, özellikle kodlama ve mantık yürütmede boyutuna göre devleşen bir model.
  • Phi-3 (3.8B): Microsoft’un “küçük ama zehir gibi” modeli. Düşük sistem kaynakları için ideal.

Gelin, hemen Meta’nın llama 3 modelini indirelim ve çalıştıralım:

ollama run llama3

Bu komutu verdiğinizde Ollama önce yaklaşık 4.7 GB boyutundaki modeli arka planda indirecek, ardından terminalinizi interaktif bir chat ekranına dönüştürecektir.

[Görsel: Terminal ekranında Ollama üzerinden Llama 3 modeline ‘Merhaba, bana yerel bir yapay zekanın avantajlarını anlat’ sorusunun sorulduğu ve saniyeler içinde alınan yanıtın ekran görüntüsü]

Deneyim ve Raporlama: Gerçekten Hızlı mı?

Lafı dolandırmayalım, doğrudan test sonuçlarımızı paylaşalım. Testi gerçekleştirdiğimiz makine: M1 MacBook Air (16 GB RAM).

Llama 3 (8B) modeline Türkçe bir soru sorduğumuzda aldığımız hız yaklaşık saniyede 15-18 token civarındaydı. Bu hız, rahatça okuyabileceğinizden daha hızlı bir şekilde metnin ekrana akması demek. Microsoft’un Phi-3 modelinde ise bu hız saniyede 30-35 token seviyelerine fırladı. Yani GPU olmadan, sadece Apple Silicon işlemcinin gücüyle bile akıcı bir deneyim elde etmek son derece mümkün.

Terminalden Sıkılanlara: Open WebUI Entegrasyonu

Terminal ekranında yapay zekayla sohbet etmek havalı görünse de, uzun vadede ChatGPT benzeri, sohbet geçmişini tutan, temiz bir arayüz arıyoruz. İşte burada imdadımıza Open WebUI yetişiyor.

Open WebUI’ı bilgisayarınızda çalıştırmanın en temiz yolu Docker kullanmaktır. Eğer bilgisayarınızda Docker kuruluysa, terminale şu komutu yazarak arayüzü başlatabilirsiniz:

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

Bu işlemden sonra tarayıcınızı açıp http://localhost:3000 adresine gittiğinizde, yerel ağınızda çalışan şık bir ChatGPT klonuyla karşılaşacaksınız. Üstelik Ollama ile indirdiğiniz tüm modeller sol üstteki açılır menüde otomatik olarak belirecektir.

[Görsel: Open WebUI arayüzünün karanlık modda çekilmiş ekran görüntüsü. Sol tarafta sohbet geçmişi, ortada ise Llama 3 ile yapılan Türkçe bir sohbet görünüyor.]

GPU Olmadan Performans Optimizasyonu Nasıl Yapılır?

Eğer güçlü bir ekran kartınız (NVIDIA RTX serisi gibi) veya bir Apple Silicon Mac’iniz yoksa, saf CPU gücüyle LLM çalıştırmak bilgisayarınızı biraz terletebilir. Ancak pes etmenize gerek yok, işte uygulayabileceğiniz optimizasyon adımları:

  1. Kuantize (Quantized) Modeller Seçin: Ollama varsayılan olarak modellerin 4-bit kuantize edilmiş sürümlerini indirir. Bu, modelin beynini (ağırlıklarını) biraz küçültmek ama zekasından çok az ödün vererek RAM kullanımını 1/4 oranına düşürmek demektir. Ekstra bir şey yapmanıza gerek yok, Ollama bunu sizin yerinize zaten yönetiyor.
  2. Küçük Modellere Yönelin: 8B (8 milyar parametre) yerine 3B veya 1.5B parametreli modelleri tercih edin. Örneğin ollama run phi3 veya ollama run gemma:2b düşük RAM’li bilgisayarlar için biçilmiş kaftandır.
  3. Arka Plan Uygulamalarını Kapatın: Yerel LLM çalıştırırken en kritik kaynak RAM’dir. Docker ve Ollama çalışırken özellikle RAM canavarı tarayıcı sekmelerini kapatmak performansı gözle görülür şekilde artırır.

Ollama: Artılar ve Eksiler

Kendi deneyimlerimiz doğrultusunda hazırladığımız dürüst tabloya göz atalım:

Artıları (+) Eksileri (-)
Tamamen ücretsiz ve açık kaynak kodlu. Çok büyük modeller (70B+) için aşırı güçlü donanım ister.
%100 gizlilik ve internet gerektirmeyen çalışma yapısı. Mobil cihazlarda doğrudan çalıştırmak (henüz) pratik değil.
Tek satırla model indirme ve güncelleme kolaylığı. Modeller geliştikçe diskte ciddi yer kaplıyorlar.
Aktif topluluk desteği ve harika API entegrasyonu. Türkçe dil desteği GPT-4 seviyesinde değil ama tatminkar.

Fiyat ve Ücretsiz Alternatifler

Ollama tamamen ücretsizdir. Kullandığınız modeller de açık kaynaklı olduğu için herhangi bir lisans ücreti ödemezsiniz.

Eğer Ollama’nın terminal tabanlı yapısı size hitap etmediyse, alternatif olarak şu tamamen ücretsiz araçları da deneyebilirsiniz:

  • LM Studio: Görsel bir arayüze sahip, modelleri arayıp tek tıkla indirebileceğiniz ve yerel sunucu kurabileceğiniz harika bir masaüstü uygulaması (Mac/Windows/Linux).
  • Jan.ai: Tamamen açık kaynaklı, şık arayüzlü bir başka yerel LLM istemcisi.

Kendi local LLM dünyanızı kurmak işte bu kadar kolay. Terminali açın, Ollama’yı kurun ve yapay zekanın kontrolünü kendi ellerinize alın. Bir sonraki rehberde görüşmek üzere!

Category: Genel | LEAVE A COMMENT