Ollama Nedir, Nasıl Kurulur? Kendi Sunucunuzda LLM Çalıştırma Rehberi

Ollama nedir ve ne işe yarar?
Ollama, büyük dil modellerini (LLM) kendi bilgisayarınızda ya da kendi sunucunuzda indirip çalıştırmanızı sağlayan açık kaynak bir araçtır. Model dosyalarını indirir, belleğe yükler ve hem komut satırından hem de yerel bir REST API üzerinden kullanıma açar. Böylece istemleriniz bir bulut sağlayıcısına gitmeden sizin makinenizde yanıt bulur.
Biz Talha Aslan ve ekibi olarak dijital pazarlama, web ve yapay zeka otomasyonu tarafında çalışıyoruz; hosting firması değiliz. Bu yüzden bu rehberdeki komutları ve ayar adlarını aracın resmi belgelerine ve GitHub deposuna dayandırıyoruz. Amacımız, yerel model sunucusunu ne zaman kurmanın mantıklı olduğunu ve nasıl güvenli kuracağınızı netleştirmek.
LLM kavramına yabancıysanız önce büyük dil modelleri ve yazılımda kullanımı rehberimize göz atın. Ayrıca bu yazı yalnız model sunucusunu anlatıyor. Model üzerine araç kullanan bir ajan kurmak istiyorsanız kendi sunucunuzda AI agent kurulumu yazımız o katmanı ele alıyor.
Büyük dil modelini neden kendi sunucunuzda çalıştırmalısınız?
Kendi sunucunuzda model çalıştırmanın üç temel gerekçesi var. İlki gizlilik, ikincisi maliyet kontrolü, üçüncüsü ise internete bağımlı olmamak. Ancak her gerekçenin bir bedeli de var; bunu baştan bilmek, yanlış beklentiyi önler.
- Gizlilik: Resmi SSS sayfasına göre yerel çalıştırmada istemlerinizi ve verinizi geliştirici firma görmez. Müşteri yazışmaları, iç belgeler ya da kişisel veri içeren metinler sunucunuzdan çıkmaz.
- Maliyet kontrolü: Bulut API'lerinde ödeme genellikle kullanılan token miktarına göre değişir. Kendi sunucunuzda ise maliyet donanım ve elektrik gibi sabit kalemlere döner; yoğun ve öngörülebilir kullanımda bunu bütçelemek daha kolaydır.
- Çevrimdışı çalışma: Model bir kez indikten sonra internet bağlantısı olmadan da yanıt üretir. Kapalı ağlar ve saha cihazları için bu önemli bir avantajdır.
- Özelleştirme: Sistem istemini, sıcaklık gibi parametreleri ve bağlam uzunluğunu kendiniz belirlersiniz.
Öte yandan bedel de açık: donanımı, güncellemeyi ve güvenliği siz üstlenirsiniz. Ayrıca yerel olarak çalıştırabildiğiniz açık modeller, en büyük ticari bulut modellerinin her işteki kalitesine ulaşmayabilir. Kısacası bu araç bir "bedava ChatGPT" değil, sorumluluğu size geçen bir altyapı bileşenidir.
Yerel LLM için ne kadar RAM ve VRAM gerekir?
Kesin bir sayı vermek doğru olmaz; çünkü ihtiyaç, modelin parametre sayısına, nicemleme (quantization) düzeyine ve bağlam uzunluğuna göre değişir. Genel kural basittir: model ağırlıklarının tamamı bellekte durmalı, üstüne bağlam için ek alan kalmalıdır.
Örnek hesap (kaba tahmin, garanti değil): 8 milyar parametreli bir modeli 4 bit nicemlemeyle düşünün. Her parametre yaklaşık yarım bayt tutar; yani ağırlıklar kabaca 4 GB eder. Bağlam penceresi ve çalışma ara belleği bunun üstüne biner. Aynı modelin 16 bitlik sürümü ise yaklaşık dört kat yer kaplar.
Bu hesap size iki pratik sonuç verir:
- Parametre sayısı iki katına çıkınca bellek ihtiyacı da kabaca iki katına çıkar.
- Daha düşük bitli nicemleme belleği azaltır, ancak yanıt kalitesinde bir miktar kayıp getirebilir.
- Bağlam uzunluğunu artırmak da belleği artırır; uzun belge özetleyecekseniz bunu hesaba katın.
Model kütüphanesindeki her modelin sayfasında indirme boyutu yazar. Bu boyut, gereken belleğin alt sınırı için iyi bir ipucudur. Dolayısıyla sunucu seçmeden önce hedef modelin boyutuna bakın, sonra üzerine pay bırakın.
GPU olmadan yerel model çalışır mı?
Evet, çalışır. Araç uygun bir GPU bulamazsa modeli işlemci (CPU) ve sistem belleği üzerinde çalıştırır. Ancak yanıt üretimi belirgin biçimde yavaşlar. Küçük modellerle deneme yapmak, gece çalışan toplu işler ya da düşük trafikli dahili araçlar için CPU yeterli olabilir.
Gerçek zamanlı sohbet, çok kullanıcılı erişim ya da büyük modeller için ise GPU fark yaratır. Resmi Docker belgesi NVIDIA ve AMD kartlar için ayrı çalıştırma komutları verir. Ayrıca model GPU belleğine sığmazsa sunucu onu GPU ile CPU arasında bölebilir; bu durumda hız ikisinin arasında kalır.
Hangi işlemcinin kullanıldığını ollama ps komutuyla görürsünüz. Resmi SSS'ye göre bu komut yüklü modelleri ve işlemci dağılımını gösterir: tamamen GPU, tamamen CPU ya da yüzdelik bir karışım. GPU'lu sunucu seçimini ayrıntılı ele aldığımız GPU sunucu kiralama rehberimiz bu noktada işinize yarar.
Sunucu türü konusunda kararsızsanız VPS, VDS ve bulut sunucu farkı yazımız temel seçenekleri karşılaştırıyor. Kısacası önce iş yükünü tanımlayın, sonra donanıma karar verin.
Linux sunucuya Ollama'yı nasıl kurarsınız?
Resmi Linux belgesi bir kurulum betiği sunar. Belge bu betiği, indirip doğrudan kabuğa aktaran tek satırlık bir komutla veriyor. Biz bu yöntemi önermiyoruz; çünkü internetten gelen bir betiği okumadan yönetici yetkisiyle çalıştırmış olursunuz. Bunun yerine üç adımlı yolu izleyin: indirin, inceleyin, çalıştırın.
curl -fsSL https://ollama.com/install.sh -o install.sh
less install.sh
sh install.sh
İkinci adımda betiğin ne yaptığını okursunuz. Betik genel olarak ikili dosyayı yerleştirir, bir ollama sistem kullanıcısı oluşturur ve systemd servisi tanımlar. Gerekli yerlerde yönetici yetkisi ister.
Betik kullanmak istemiyorsanız resmi belgede elle kurulum yolu da var. Bu yolda arşivi indirip /usr altına açarsınız, ardından servis dosyasını kendiniz yazarsınız. Belgedeki servis tanımı şuna benzer:
[Unit]
Description=Ollama Service
After=network-online.target
[Service]
ExecStart=/usr/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
[Install]
WantedBy=multi-user.target
Elle kurulum daha fazla kontrol verir. Öte yandan güncellemeyi de elle yaparsınız. Bu nedenle tek sunucuda deneme yapıyorsanız okuyup çalıştırdığınız betik yolu daha pratiktir.
Kurulumdan sonra servisi nasıl kontrol edersiniz?
Kurulumdan sonra ilk iş, servisin ayakta olduğunu doğrulamaktır. Resmi belgedeki sıra şöyledir: systemd yapılandırmasını yeniden yükleyin, servisi açılışta başlayacak şekilde etkinleştirin, sonra durumuna bakın.
sudo systemctl daemon-reload
sudo systemctl enable ollama
sudo systemctl start ollama
systemctl status ollama
Servis hata verirse kayıtları journalctl -e -u ollama komutuyla okursunuz. GPU sürücüsü bulunamadı, bellek yetmedi ya da port kullanımda gibi mesajlar burada yer alır.
Son olarak API'nin yanıt verdiğini aynı sunucudan test edin. Model listesini döndüren uç nokta bunun için yeterlidir:
curl http://localhost:11434/api/tags
Henüz model indirmediyseniz boş bir liste dönmesi normaldir. Önemli olan bağlantının kurulmasıdır. Güncelleme için resmi belge, kurulum betiğini yeniden çalıştırmayı önerir; burada da aynı indir ve incele yolunu izleyin.
Kaldırmak isterseniz belge şu sırayı verir: servisi durdurun, devre dışı bırakın, servis dosyasını silin, ollama kullanıcısını ve grubunu kaldırın. Ardından model dosyalarının bulunduğu dizini silin. Bu dizini silmeden önce yer açmak dışında bir amacınız olup olmadığını düşünün; indirilen modeller büyük olabilir ama yeniden indirmek de zaman alır.
macOS ve Windows'ta kurulum nasıl farklıdır?
Masaüstü sistemlerde kurulum daha basittir. Ollama'nın indirme sayfasından macOS için uygulama paketini, Windows için kurulum dosyasını alırsınız. Kurulumdan sonra uygulama arka planda çalışır ve aynı komutları terminalden kullanırsınız.
Farklar daha çok ayar tarafında çıkar. Resmi SSS'ye göre:
- macOS: Ortam değişkenlerini
launchctl setenvile tanımlarsınız, ardından uygulamayı yeniden başlatırsınız. Modeller varsayılan olarak~/.ollama/modelsaltında durur. - Windows: Ortam değişkenlerini sistem ayarlarındaki kullanıcı değişkenleri ekranından düzenlersiniz, sonra uygulamayı Başlat menüsünden yeniden açarsınız. Modeller kullanıcı klasörünüzdeki
.ollama\modelsaltında durur. - Linux: Ayarları systemd servis geçersiz kılma dosyasıyla verirsiniz. Modeller varsayılan olarak
/usr/share/ollama/.ollama/modelsaltında durur.
Masaüstü kurulum, modeli denemek ve istem tasarlamak için idealdir. Ancak ekibin ortak kullanacağı bir servis için bilgisayarınızı açık tutmak yerine bir sunucu tercih edin. Böylece uyku modu, güncellemeler ve kişisel kullanım servisi kesintiye uğratmaz.
Docker ile çalıştırmak için hangi komutu kullanırsınız?
Resmi Docker imajı Docker Hub'daki resmi depodan gelir. Belgedeki yalnız CPU kullanan komut, modelleri kalıcı bir adlandırılmış birimde saklar ve 11434 portunu -p 11434:11434 biçiminde yayınlar. Birim sayesinde konteyneri silip yeniden oluşturduğunuzda indirdiğiniz modeller kaybolmaz.
NVIDIA kartlı bir sunucuda komuta --gpus=all bayrağını eklersiniz. Bunun için sunucuda NVIDIA Container Toolkit kurulu olmalıdır. AMD kartlar için belge ollama/ollama:rocm etiketini ve cihaz bağlama bayraklarını gösterir.
Bir noktaya özellikle dikkat edin. -p 11434:11434 yazdığınızda Docker portu sunucunun tüm ağ arayüzlerinde yayınlar. Üstelik Docker'ın kendi ağ kuralları, bazı yapılandırmalarda ufw gibi güvenlik duvarı araçlarının önüne geçebilir. Bu yüzden API'yi yalnız aynı sunucudan kullanacaksanız portu yerel adrese bağlayın:
docker run -d -v ollama:/root/.ollama -p 127.0.0.1:11434:11434 --name ollama ollama/ollama
docker exec -it ollama ollama run gemma4
İkinci satır, konteyner içinde bir modeli indirip etkileşimli olarak başlatır. Docker'a yeniyseniz önce Docker nedir rehberimizi okuyun; birim, port ve imaj kavramları orada ayrıntılı.
Modeli nasıl indirip çalıştırırsınız?
Günlük iş birkaç komutla döner. Aşağıdaki örneklerde model adı olarak resmi CLI belgesindeki gemma4 modelini kullanıyoruz; siz kendi seçtiğiniz modelin adını yazarsınız.
ollama pull gemma4
ollama run gemma4
ollama ls
ollama ps
ollama stop gemma4
ollama rm gemma4
Komutların görevleri şöyle:
pullmodeli kütüphaneden indirir ama başlatmaz. Sunucuyu hazırlarken önce bunu yaparsınız.runmodeli başlatır ve etkileşimli bir sohbet açar. Model yoksa önce indirir.ls(uzun halilist) diskteki modelleri listeler.pso anda bellekte yüklü modelleri ve GPU ile CPU dağılımını gösterir.stopmodeli bellekten hemen boşaltır.rmmodeli diskten siler.
Ayrıca ollama create komutu ve bir Modelfile ile kendi model tanımınızı yaparsınız. Örneğin sistem istemi ve sıcaklığı sabit bir "müşteri destek" sürümü oluşturabilirsiniz. Böylece uygulama tarafında her istekte aynı ayarları göndermeniz gerekmez.
Yerel model hangi işlerde gerçekten işe yarar?
Yerel bir dil modeli her işte bulut modelinin yerini tutmaz. Ancak bazı işlerde hem yeterli kaliteyi verir hem de veriyi içeride tutar. Yapay zeka otomasyonu projelerinde önerdiğimiz başlangıç alanları şunlar:
- Sınıflandırma: Gelen destek taleplerini, form mesajlarını ya da yorumları konu ve öncelik etiketine ayırmak.
- Özetleme: İç toplantı notlarını, uzun e-posta zincirlerini ya da rapor taslaklarını kısa maddelere çevirmek.
- Taslak üretimi: Ürün açıklaması, kategori metni ya da cevap şablonu için ilk taslağı hazırlamak; son kontrolü yine bir insan yapar.
- Bilgi çıkarma: Fatura, sipariş ya da başvuru metninden ad, tarih ve tutar gibi alanları yapılandırılmış biçime aktarmak.
- Anlamsal arama: Gömme modelleriyle iç belgelerinizi vektöre çevirip "buna benzeyen belge hangisi?" sorusunu yanıtlamak.
Bu işlerin ortak noktası, çıktının kısa ve denetlenebilir olmasıdır. Öte yandan uzun, yaratıcı ve hatasız olması gereken metinlerde daha büyük modellere ihtiyaç duyabilirsiniz. Dolayısıyla ilk projeyi küçük ve ölçülebilir seçin; başarıyı gördükten sonra kapsamı genişletin.
Hangi modeli seçmelisiniz?
Model seçimi, kurulumun en çok vakit alan kısmıdır. Belirli bir modeli "en iyisi" diye önermiyoruz; çünkü doğru seçim işinize, dilinize ve donanımınıza bağlıdır. Bunun yerine şu sırayla eleme yapın:
- Görev: Sohbet ve metin üretimi mi, kod mu, görsel anlama mı, yoksa arama için gömme (embedding) mi? Kütüphane, modelleri bu yeteneklere göre etiketliyor.
- Dil: Türkçe içerik üretecekseniz modelin çok dilli desteğini kendi örnek metinlerinizle test edin.
- Boyut: Sunucunuzun belleğine rahat sığan en büyük boyutla başlayın, gerekirse küçültün.
- Lisans: Ticari kullanım koşullarını modelin sayfasından okuyun; bu konuyu aşağıda ayrıca ele alıyoruz.
Pratik bir yöntem şudur: kendi işinizden 20 gerçekçi soru hazırlayın ve iki üç adayı aynı sorularla deneyin. Yanıt kalitesini, hızı ve bellek kullanımını not alın. Bu küçük test, genel sıralama tablolarından daha sağlam bir karar verir.
Örneğin bir e-ticaret ekibi ürün açıklaması taslağı istiyorsa orta boy bir sohbet modeli yeterli olabilir. Öte yandan sözleşme özetleme gibi uzun bağlam isteyen bir iş, daha fazla bellek ve dikkatli test gerektirir.
REST API ile uygulamanıza nasıl bağlarsınız?
Servis çalıştığı anda yerel bir HTTP API açar. Resmi belgeye göre yerel taban adres http://localhost:11434/api şeklindedir. Sohbet için /api/chat, tek seferlik metin üretimi için /api/generate, gömme vektörü için /api/embed uç noktalarını kullanırsınız.
curl http://localhost:11434/api/chat -d '{
"model": "gemma4",
"messages": [{"role": "user", "content": "Kargo iade süreci nasıl işler?"}],
"stream": false
}'
"stream": false değeri yanıtı tek parça halinde döndürür. Sohbet arayüzlerinde ise akışı açık bırakırsınız; böylece kullanıcı ilk kelimeleri beklemeden görür.
Araç ayrıca OpenAI uyumlu bir uç nokta da sunar: http://localhost:11434/v1. Bu sayede OpenAI kütüphanesiyle geliştirdiğiniz bir uygulamayı taban adresini değiştirerek yerel modele yönlendirebilirsiniz. Bulut API tarafını OpenAI API kullanım rehberimizde anlattık; iki tarafı karşılaştırırken işinize yarar.
Bir uyarı: resmi belge açıkça belirtiyor, yerel isteklerde kimlik doğrulama yoktur. Yani API'ye ulaşabilen herkes modeli kullanabilir. Bir sonraki bölüm tam olarak bu riski ele alıyor.
Ollama API'sini internete açmak neden risklidir?
Resmi SSS'ye göre servis varsayılan olarak 127.0.0.1 adresinde, 11434 portunda dinler. Yani kurulumdan hemen sonra yalnız aynı makineden erişebilirsiniz. Bu güvenli bir başlangıçtır. Sorun, OLLAMA_HOST değişkenini 0.0.0.0 yapıp portu doğrudan internete açtığınızda başlar.
Yerel API'de parola ya da anahtar sorulmadığı için açık bir port şu riskleri getirir:
- Kaynak sömürüsü: Başkaları sunucunuzun işlemcisini ve GPU'sunu kendi işleri için kullanır; faturayı ve yavaşlığı siz yaşarsınız.
- Model yönetimi: API yalnız sohbet değil, model indirme ve silme uç noktaları da içerir. Yetkisiz biri diskinizi doldurabilir ya da modelinizi kaldırabilir.
- Veri sızıntısı riski: Özelleştirdiğiniz modellerin sistem istemleri ve yapılandırmaları dışarıdan okunabilir hale gelir.
Dolayısıyla kural nettir: bu portu asla korumasız biçimde internete açmayın. Uzaktan erişim gerekiyorsa önüne kimlik doğrulama yapan bir ters vekil koyun, erişimi IP ile sınırlayın ya da VPN kullanın. Sunucu tarafında bir güvenlik duvarı da kurun; CSF firewall rehberimiz bunun için iyi bir başlangıç noktası.
Nginx ters vekil ile model sunucusunu nasıl korursunuz?
En yaygın yol, model sunucusunu yerel adreste bırakıp önüne Nginx koymaktır. Nginx dış dünyayla HTTPS üzerinden konuşur, temel kimlik doğrulama ister ve izin verdiğiniz IP adreslerini kabul eder. Resmi SSS, Nginx örneğinde isteğin yerel porta iletilmesini ve Host başlığının localhost:11434 olarak ayarlanmasını gösterir.
server {
listen 443 ssl;
server_name llm.example.com;
# ssl_certificate ve ssl_certificate_key satırları buraya
location / {
allow 203.0.113.10;
deny all;
auth_basic "Ollama";
auth_basic_user_file /etc/nginx/.htpasswd;
proxy_pass http://127.0.0.1:11434;
proxy_set_header Host localhost:11434;
}
}
Parola dosyasını htpasswd aracıyla oluşturursunuz. Örnekteki IP adresi yalnız belgelendirme amaçlıdır; kendi ofis ya da uygulama sunucunuzun adresini yazarsınız.
Nginx'i sıfırdan kuracaksanız Nginx kurulumu ve yapılandırma rehberimizi izleyin. Ters vekil mantığını ve grafik arayüzlü alternatifi ise Nginx reverse proxy yazımızda anlattık. Sertifikayı kurduktan sonra alan adınızı SSL sorgulama aracımızla kontrol edin.
Open WebUI gibi arayüzler ne sağlar?
Komut satırı ve API geliştiriciler için yeterlidir. Ancak ekipteki diğer kişiler için tarayıcıdan kullanılan bir sohbet ekranı daha pratiktir. Open WebUI, bu API'ye bağlanabilen açık kaynak bir web arayüzüdür; kullanıcı hesapları, sohbet geçmişi ve model seçimi gibi özellikler sunar.
Kurulumu model sunucusunun değil, Open WebUI projesinin resmi belgelerinden takip edin. Çünkü sürüm, imaj adı ve ortam değişkenleri projenin kendi sayfası bunları güncel tutar. Biz burada komut vermiyoruz.
Arayüz eklediğinizde güvenlik tablosu değişir. Artık iki servis var: model sunucusu ve arayüz. Şu ilkeleri koruyun:
- Model sunucusunu yine yalnız yerel adreste ya da iç Docker ağında dinletin; dışarıya yalnız arayüzü açın.
- Arayüzde ilk yönetici hesabını hemen oluşturun ve yeni kayıtları kapatın ya da onaya bağlayın.
- Arayüzü de HTTPS arkasında yayınlayın.
Böylece kullanıcılar tarayıcıdan sohbet ederken model sunucusu doğrudan erişime kapalı kalır.
Bellek ve eşzamanlı istekleri nasıl yönetirsiniz?
Sunucunun davranışını ortam değişkenleriyle ayarlarsınız. Linux'ta bunun resmi yolu systemd geçersiz kılma dosyasıdır:
sudo systemctl edit ollama
# açılan dosyaya:
[Service]
Environment="OLLAMA_KEEP_ALIVE=10m"
Environment="OLLAMA_MODELS=/data/llm-models"
sudo systemctl daemon-reload
sudo systemctl restart ollama
Resmi SSS'de geçen başlıca ayarlar şunlar:
| Değişken | Ne yapar | Ne zaman değiştirirsiniz |
|---|---|---|
OLLAMA_HOST | Dinlenen adres ve port | Ters vekil başka makinedeyse; yine de korumasız açmayın |
OLLAMA_KEEP_ALIVE | Modelin bellekte kalma süresi (SSS'ye göre varsayılan 5 dakika) | İlk yanıt gecikmesini azaltmak ya da belleği erken boşaltmak için |
OLLAMA_MODELS | Modellerin saklandığı dizin | Sistem diski küçükse ayrı bir veri diskine taşımak için |
OLLAMA_NUM_PARALLEL | Bir modelin aynı anda işlediği istek sayısı | Çok kullanıcılı erişimde; bellek kullanımını artırır |
OLLAMA_MAX_LOADED_MODELS | Aynı anda yüklü tutulabilecek model sayısı | Birden çok modeli sık değiştiriyorsanız |
OLLAMA_CONTEXT_LENGTH | Varsayılan bağlam penceresi | Uzun belgeleri işlerken; bellek ihtiyacını büyütür |
Kısacası her ayar bir takastır. Paralel istek ve uzun bağlam kullanıcı deneyimini iyileştirir, ancak belleği tüketir. Değişiklikten sonra ollama ps ile durumu izleyin.
Açık modellerin lisansı ticari kullanıma izin veriyor mu?
Burada iki ayrı lisans var ve çoğu kişi bunları karıştırıyor. Ollama yazılımının kendisi GitHub deposunda MIT lisansı taşıyor. Ancak indirdiğiniz her modelin lisansı ayrıdır ve modeli geliştiren kuruma aittir.
Bazı modeller Apache 2.0 gibi geniş izin veren açık kaynak lisanslarla gelir. Bazıları ise geliştiricinin kendi kullanım koşullarıyla gelir. Bu koşullar kabul edilebilir kullanım politikası, belirli kullanıcı sayısının üstünde ek izin ya da çıktıların başka model eğitiminde kullanımına sınır gibi maddeler içerebilir.
Pratikte şu adımları izleyin:
- Model kütüphanesinde ilgili sayfadaki lisans bölümünü açın.
- Lisansta bağlantı verilen tam metni modelin geliştiricisinin resmi sayfasından okuyun.
- Ticari ürün, müşteriye sunulan hizmet ya da ince ayar planınız varsa bu kullanımların açıkça izinli olup olmadığını not edin.
- Emin olmadığınız noktada hukuk danışmanınıza sorun.
Bu bölüm hukuki danışmanlık değildir. Amacımız, "açık model" ifadesinin her zaman "her işte serbest" anlamına gelmediğini hatırlatmak. Kişisel veri işliyorsanız KVKK yükümlülükleriniz de modelin nerede çalıştığından bağımsız olarak devam eder.
Yerel model sunucusu için güvenlik kontrol listesi
Kurulumu bitirdikten sonra aşağıdaki listeyi tek tek işaretleyin. Bu adımlar hem resmi belgelerden hem de genel sunucu güvenliği ilkelerinden gelir.
- Model sunucusu yalnız
127.0.0.1ya da iç ağ adresinde dinliyor mu? Docker kullanıyorsanız port yayını yerel adrese bağlı mı? - Uzaktan erişim yalnız kimlik doğrulamalı bir ters vekil, VPN ya da IP kısıtıyla mı mümkün?
- Sunucu güvenlik duvarında yalnız gereken portlar açık mı?
- Kurulum betiğini çalıştırmadan önce okudunuz mu ve kaynağı resmi alan adı mı?
- Sistem paketlerini ve model sunucusunu düzenli güncelliyor musunuz?
- Model dizini için yeterli disk alanı ve izleme var mı?
- Kullandığınız modellerin lisansı iş amacınıza uygun mu?
- Sohbet arayüzü kullanıyorsanız yeni kullanıcı kaydı kapalı mı?
Bu listeyi ayda bir gözden geçirmenizi öneririz. Özellikle yeni bir arayüz, eklenti ya da ajan bağladığınızda erişim yüzeyi büyür. Web uygulaması tarafındaki genel riskler için OWASP Top 10 yazımız tamamlayıcı bir kaynaktır.
Ollama mı, bulut LLM API'si mi daha uygun?
İki yaklaşımın güçlü yanları farklıdır. Aşağıdaki tablo kararı netleştirmek için hazırladığımız genel bir özettir; belirli bir sağlayıcının fiyatını ya da performansını yansıtmaz.
| Ölçüt | Yerel kurulum (kendi sunucunuz) | Bulut LLM API'si |
|---|---|---|
| Verinin konumu | Sunucunuzda kalır | Sağlayıcının altyapısına gider |
| Maliyet yapısı | Donanım ve işletme maliyeti, kullanımdan büyük ölçüde bağımsız | Genellikle kullanıma göre ödeme |
| Kurulum | Sunucu, kurulum ve güvenlik size ait | API anahtarı ile hemen başlar |
| Model seçeneği | Açık ağırlıklı modeller | Sağlayıcının kendi modelleri, en büyükleri dahil |
| Ölçekleme | Donanım ekleyerek, elle | Sağlayıcı tarafında, kota sınırlarıyla |
| Çevrimdışı çalışma | Mümkün | Mümkün değil |
| Bakım ve güncelleme | Sizin sorumluluğunuz | Sağlayıcının sorumluluğu |
Pek çok ekip için cevap ikisinin karışımıdır. Hassas veriyi yerel modelle işlersiniz, en yüksek kaliteyi gerektiren işleri ise bulut API'sine gönderirsiniz. Yerel API'nin OpenAI uyumlu uç noktası bu geçişi kolaylaştırır.
Ollama'yı ne zaman kendiniz kurmamalısınız?
Dürüst olmak gerekirse her işletmenin kendi model sunucusuna ihtiyacı yok. Şu durumlarda kurulumu ertelemenizi ya da işi bir hosting sağlayıcısına veya teknik ekibe bırakmanızı öneririz:
- Ekibinizde Linux sunucu güncellemesi, güvenlik duvarı ve kayıt takibi yapabilecek kimse yoksa.
- Kullanımınız ayda birkaç düzine istekten ibaretse; bu durumda sunucu maliyeti çoğu zaman bulut API'sinin önüne geçer.
- İşiniz en güçlü ticari modellerin kalitesini gerektiriyorsa ve açık modellerle testleriniz yetersiz kaldıysa.
- Yüksek erişilebilirlik ve kesintisiz hizmet sözü vermeniz gerekiyorsa; bu, tek bir sunucunun ötesinde bir mimari ister.
- Paylaşımlı hosting paketiniz varsa; bu paketler uzun süre çalışan servis ve yüksek bellek kullanımına genellikle izin vermez.
Bu durumlarda bile aracı kendi bilgisayarınızda denemek değerlidir. Böylece hangi modelin işinize yettiğini öğrenir, sunucu kararını veriyle alırsınız.
Kuruluma nereden başlamalısınız?
Önerdiğimiz sıra şöyle: önce kendi bilgisayarınızda küçük bir modelle deneyin. Sonra gerçek iş sorularınızla iki üç modeli karşılaştırın. Ardından ihtiyacınıza uyan sunucuyu seçin, kurulum betiğini okuyarak çalıştırın ve API'yi yalnız yerel adreste tutun.
Uzaktan erişim gerektiğinde Nginx ve kimlik doğrulama ekleyin, lisansları kontrol edin, güvenlik listesini düzenli gözden geçirin. Bu sırayı izlediğinizde yerel model sunucunuz, verinizi dışarı çıkarmadan çalışan sağlam bir yapay zeka bileşeni olur.
Yerel modeli iş süreçlerinize bağlamak, örneğin destek taleplerini sınıflandırmak ya da ürün metni taslaklamak istiyorsanız yapay zeka otomasyon hizmetimiz bu entegrasyonu planlıyor. Kendi yazılımınıza özel bir arayüz ya da iş akışı gerekiyorsa özel yazılım geliştirme tarafında birlikte çalışabiliriz.
Kaynaklar: Ollama Linux kurulum belgesi, Ollama SSS, Ollama Docker belgesi, Ollama GitHub deposu.



