Yazılım ve Yapay Zeka

Yerel LLM Kurulumu (On-Premise Yapay Zeka)

Açık ağırlıklı büyük dil modellerini şirketinizin kendi sunucusunda çalıştırıyoruz. Sorular ve belgeler binanızdan çıkmadan yapay zeka kullanabilirsiniz.

CybUP EkibiSon güncelleme: 5 dk okuma

Kısaca

Yerel LLM kurulumu, açık ağırlıklı büyük dil modellerinin (LLM) Ollama veya vLLM gibi yazılımlarla şirketin kendi GPU sunucusunda çalıştırılmasıdır. Verisini buluta göndermek istemeyen ya da gönderemeyen şirketler içindir. CybUP ihtiyaca göre model ve donanım boyutlandırmasını, gerekirse GPU sunucu tedarikini, kurulumu, RAG entegrasyonunu, güvenliği ve güncellemeleri üstlenir.

Yerel LLM nedir, ne zaman mantıklıdır?

Yerel LLM, ağırlıkları indirilip kendi donanımınızda çalıştırılan bir dil modelidir; sorular ve yanıtlar hiçbir dış servise gitmez. Bunu mümkün kılan, model ağırlıklarını yayımlayan üreticilerin (açık ağırlıklı modeller) sayısının son yıllarda artmasıdır. Her modelin kendi lisansı vardır ve ticari kullanım koşulları farklılık gösterir; model seçerken lisansı da okuyoruz.

Yerel model şu durumlarda mantıklıdır: işlenecek veri kişisel veri veya ticari sır içeriyor ve yurt dışındaki bir servise gönderilmesi istenmiyor; kullanım yoğun ve düzenli, yani bulutta sürekli ödenecek kullanım ücreti donanım yatırımını haklı çıkarıyor; ya da internet bağlantısı kısıtlı, kapalı bir ağda çalışmak gerekiyor. Ara sıra kullanılacak, en güçlü modelin gerektiği işlerde ise bulut genellikle daha pratiktir.

Dürüst olmak gerekirse, şirket içinde çalışabilecek boyuttaki modeller en büyük bulut modelleriyle her işte aynı sonucu vermez. Belgeden özet çıkarma, sınıflandırma, alan çıkarma ve doküman üzerinden soru yanıtlama gibi tanımlı işlerde çoğu zaman yeterlidir. Bunu kurulumdan önce sizin örnek verinizle deneyerek gösteriyoruz.

Ollama ve vLLM arasındaki fark nedir?

Ollama kurulumu ve model yönetimi kolay, tek sunucuda az sayıda kullanıcıya hizmet için uygun bir araçtır; vLLM ise çok sayıda eşzamanlı isteği yüksek verimle karşılamak için tasarlanmış bir çıkarım (inference) sunucusudur. Ollama’nın Linux belgesi kurulumu, systemd servisi olarak çalıştırmayı ve NVIDIA ile AMD GPU desteğini anlatır. Ollama OpenAI uyumlu API uçları sunduğu için birçok mevcut uygulama yalnızca adres değiştirilerek yerel modele bağlanabilir.

vLLM belgelerine göre vLLM, PagedAttention ile bellek yönetimini verimli yapan, istekleri sürekli toplu işleyen ve OpenAI uyumlu bir API sunucusu barındıran bir kütüphanedir. Onlarca kişinin aynı anda kullandığı bir şirket içi asistanda vLLM daha verimli çalışır. Biz küçük kurulumlar ve deneme aşaması için Ollama, yoğun kullanım için vLLM ile başlamayı öneriyoruz; uygulamayı OpenAI uyumlu API’ye göre yazdığımız için sonradan geçiş kolaydır.

“Connect OpenAI clients to Ollama. Ollama supports a subset of the OpenAI API.”

OpenAI istemcilerini Ollama’ya bağlayın. Ollama, OpenAI API’sinin bir alt kümesini destekler.

— Ollama Dokümantasyonu — OpenAI uyumluluğu

Yerel LLM için nasıl bir GPU sunucu gerekir?

GPU boyutunu belirleyen ana etken, modelin parametre sayısı ve hangi hassasiyetle (quantization) çalıştırılacağıdır. Kabaca, model ağırlıklarının tamamı GPU belleğine (VRAM) sığmalıdır. 16 bit hassasiyette her parametre 2 bayt yer kaplar; 8 bit ve 4 bit nicemleme bu ihtiyacı yarıya ve dörtte bire indirir. Ağırlıkların üstüne, aynı anda işlenen istekler ve uzun bağlamlar için ek bellek gerekir.

Bir örnekle: 50 kişilik bir hukuk bürosunun belge üzerinden soru-yanıt için orta büyüklükte bir model kullanacağını ve aynı anda birkaç kişinin soru soracağını varsayalım. Bu ihtiyaç tek GPU’lu bir sunucuyla karşılanabilir. Aynı model 300 kişilik bir şirkette çağrı merkezi notlarından gün boyu özet çıkaracaksa birden fazla GPU veya daha yüksek bellekli kartlar gerekir. Kesin boyutu, sizin örnek iş yükünüzü deneme ortamında çalıştırıp ölçerek veriyoruz.

GPU’nun yanında sunucu tarafı da önemlidir: yeterli sistem belleği, model dosyaları için hızlı NVMe disk, kartların ihtiyaç duyduğu güç kaynağı ve soğutma. Kurumsal GPU sunucularını yurt dışından sıfır olarak tedarik edip kurulumunu yapabiliyoruz; elinizde uygun bir sunucu varsa onu değerlendiriyoruz.

Yerel modele şirket verisi nasıl bağlanır?

Şirket belgelerini yerel modele bağlamanın yaygın yolu RAG’dir: belgeler parçalara bölünür, gömme (embedding) modeliyle vektöre çevrilir, soru geldiğinde ilgili parçalar bulunup modele verilir. Gömme modeli de yerelde çalışır; böylece belgelerin hiçbir aşaması dışarıya gitmez. Bu yapı üzerine kurulan arayüzü şirket içi yapay zeka asistanı sayfasında anlatıyoruz.

Yerel model, sohbet ekranından bağımsız olarak otomasyonların içinde de kullanılabilir. Örneğin gelen e-postaları sınıflandıran ya da PDF’lerden alan çıkaran bir n8n akışı bulut model yerine yerel modeli çağırabilir. Kişisel veri içeren işlerde bu, en sade çözüm olabilir.

Yerel LLM sunucusu nasıl güvenli tutulur?

Model sunucusu, şirket ağında yalnızca onu kullanacak uygulamaların erişebildiği bir iç servis olarak konumlandırılmalıdır. Ollama SSS sayfasına göre Ollama varsayılan olarak yalnızca 127.0.0.1 adresinde, 11434 portunda dinler; ağa açmak için adres değiştirilir. Bu ayarı değiştirdiğimizde önüne kimlik doğrulama yapan bir ters vekil sunucu koyuyor ve firewall’da erişimi ilgili sunucularla sınırlıyoruz. Kimlik doğrulamasız bir model API’sinin internete açık kalması, kaynakların başkaları tarafından kullanılması demektir.

Uygulama katmanında OWASP’ın LLM Top 10 listesindeki riskleri göz önünde tutuyoruz: istem enjeksiyonu, model çıktısının denetimsiz biçimde başka sistemlere aktarılması ve sınırsız kaynak tüketimi. İstek başına uzunluk sınırı, kullanıcı başına hız sınırı ve günlük kayıtları bu yüzden kurulumun parçasıdır.

“Ollama binds 127.0.0.1 port 11434 by default. Change the bind address with the OLLAMA_HOST environment variable.”

Ollama varsayılan olarak 127.0.0.1 adresinde, 11434 portunda dinler. Dinleme adresini OLLAMA_HOST ortam değişkeniyle değiştirin.

— Ollama Dokümantasyonu — SSS

Kurulumdan sonra bakım ve güncelleme nasıl yapılır?

Yerel LLM kurulumu bir kez yapılıp unutulan bir iş değildir. GPU sürücüleri, CUDA veya ROCm bileşenleri, Ollama veya vLLM sürümleri ve modelin kendisi zamanla güncellenir. Sürücü güncellemesi model sunucusunun açılmamasına yol açabileceği için değişiklikleri planlı yapıyor, öncesinde sistemi yedekliyoruz.

Yeni bir model sürümü çıktığında hemen geçmiyoruz. Pilotta hazırladığımız test sorularını yeni modelde çalıştırıp yanıtları karşılaştırıyoruz; daha iyiyse geçiş yapılıyor. GPU sıcaklığı, bellek kullanımı ve yanıt süreleri izleniyor; mevcut izleme sisteminize bağlanabilir. Sunucu işletim sistemi tarafında ise Ubuntu Server bakımının olağan adımları geçerlidir.

Teslim ettiklerimiz

  • Örnek verinizle yapılmış model ve donanım boyutlandırma raporu
  • Gerekirse sıfır GPU sunucu tedariki ve kurulumu
  • Ollama veya vLLM ile çalışan, OpenAI uyumlu API sunan model sunucusu
  • Yerel gömme modeli ve vektör veritabanıyla RAG altyapısı
  • Kimlik doğrulama, ağ kısıtları ve kayıtlarla güvenlik yapılandırması
  • Güncelleme, test seti ve geri dönüş adımlarını anlatan bakım belgesi

Nasıl çalışıyoruz

  1. 1

    Ücretsiz inceleme

    Kullanım senaryoları, veri hassasiyeti, kullanıcı sayısı ve mevcut donanım değerlendiriliyor.

  2. 2

    Deneme ve boyutlandırma

    Aday modeller sizin örnek verinizle deneniyor, gereken GPU ve sunucu yapısı belirleniyor.

  3. 3

    Donanım ve kurulum

    Sunucu hazırlanıyor ya da tedarik ediliyor; sürücüler, model sunucusu ve modeller kuruluyor.

  4. 4

    Entegrasyon ve güvenlik

    RAG, uygulamalar ve otomasyonlar bağlanıyor; erişim kısıtları ve kayıtlar devreye alınıyor.

  5. 5

    Bakım

    Sürücü, yazılım ve model güncellemeleri test edilerek uygulanıyor; performans izleniyor.

Sıkça sorulan sorular

Yerel model ChatGPT kadar iyi mi?

Her işte değil. Şirket içi sunucuda çalışabilecek modeller, belgeden özet çıkarma, sınıflandırma ve doküman üzerinden soru yanıtlama gibi tanımlı işlerde çoğu zaman yeterli sonuç verir. Bunu kurulumdan önce sizin verinizle deneyip gösteriyoruz.

Mevcut sunucumuzda çalışır mı?

GPU’su olmayan bir sunucuda küçük modeller çalışabilir ama yavaştır ve çok kullanıcılı kullanım için uygun değildir. Uygun bir GPU takılabilecek kasa, güç kaynağı ve soğutma varsa mevcut sunucu değerlendirilebilir. İncelemede donanımınızı kontrol ediyoruz.

GPU sunucuyu siz mi temin ediyorsunuz?

İsterseniz evet, kurumsal GPU sunucularını yurt dışından sıfır olarak tedarik edip kurulumunu yapıyoruz. Kendi tedarikçinizden almak isterseniz teknik şartnameyi hazırlıyoruz.

İnternet bağlantısı olmadan çalışır mı?

Evet. Model ve gerekli yazılımlar bir kez indirildikten sonra çalışma için internet gerekmez. Güncellemeler kontrollü biçimde ayrıca aktarılır.

Açık ağırlıklı modelleri ticari olarak kullanabilir miyiz?

Modele göre değişir; her modelin kendi lisansı vardır. Bazıları serbest lisanslıdır, bazıları kullanım koşulları içerir. Model seçerken lisansı birlikte okuyup sizin kullanımınıza uygun olanı seçiyoruz.

Maliyeti nedir?

Kapsamı inceledikten sonra yazılı teklif veriyoruz; inceleme ücretsiz. Donanım, kurulum ve bakım teklifte ayrı kalemler olarak yer alır.

KVKK açısından yerel model yeterli mi?

Yerel model verinin yurt dışına çıkmasını önler ama KVKK uyumunu tek başına sağlamaz. Erişim yetkileri, kayıtlar, saklama süreleri ve aydınlatma gibi konular yine ele alınmalıdır. Teknik tarafını kurulumla birlikte belgeliyoruz.

Kaynaklar ve resmi dokümanlar

CybUP Ekibi

İstanbul merkezli CybUP teknik ekibi tarafından hazırlandı ve kontrol edildi. Son güncelleme: 10 Ekim 2026.

Bu hizmet için ücretsiz inceleme isteyin

Formu doldurun, en kısa sürede size dönüş yapalım. Acil durumlarda WhatsApp ya da telefon daha hızlıdır.

WhatsApp’tan yazın

Çerez tercihleri

Zorunlu

Sitenin temel işlevleri ve tercihlerinizin hatırlanması için gereklidir. Kapatılamaz.

Analitik

Hangi sayfaların ziyaret edildiğini anonim olarak ölçmemizi sağlar (Google Analytics, Google Tag Manager üzerinden).

Pazarlama

Reklam ölçümü ve kişiselleştirme için kullanılır.