Yapay Zeka

GPU Sunucu Kiralama Nedir? Yapay Zeka ve ML İçin Seçim Rehberi

Talha Aslan 16 dakikalık okuma 4 görüntülenme

GPU sunucu kiralama nedir ve kimler için uygundur?

GPU sunucu kiralama, grafik işlemci (GPU) takılı bir sunucuyu ya da bulut sanal makinesini saatlik, aylık veya rezerve süreyle sağlayıcıdan kullanmaktır. Böylece yapay zeka modeli eğitimi, ince ayar, LLM çıkarımı ve görüntü üretimi gibi paralel işlem isteyen iş yüklerini kart satın almadan çalıştırırsınız.

Biz Talha Aslan ve ekibi olarak dijital pazarlama, web ve yapay zeka otomasyonu tarafında çalışıyoruz; hosting firması değiliz. Bu yüzden bu rehberde teknik bilgileri NVIDIA ve Docker'ın resmi belgelerine dayandırıyoruz. Amacımız, GPU sunucu kiralama teklifini doğru sorularla okumanızı sağlamak.

Bu yazı üç okur grubuna hitap ediyor. İlki, kendi verisiyle model denemek isteyen e-ticaret ya da içerik ekibi. İkincisi, LLM tabanlı bir ürünü canlıya almak isteyen yazılım ekibi. Üçüncüsü ise "bize GPU lazım mı?" sorusunu soran işletme sahibi. Ayrıca LLM kavramına yabancıysanız önce büyük dil modelleri rehberimize göz atmanızı öneririz.

GPU ile CPU sunucu arasındaki fark nedir?

CPU, az sayıda ama güçlü çekirdekle sıralı ve dallanan işleri hızlı yürütür. GPU ise çok sayıda daha basit çekirdekle aynı işlemi büyük veri bloklarına aynı anda uygular. Sinir ağlarının temelindeki matris çarpımları tam olarak bu paralel yapıya uyar.

İkinci kritik fark bellektir. GPU'nun kendi belleği vardır ve buna VRAM diyoruz. Model ağırlıkları, ara hesaplar ve çıkarım sırasında tutulan önbellek bu belleğe sığmak zorundadır. Sığmazsa iş ya hiç başlamaz ya da sistem belleğine taşarak ciddi biçimde yavaşlar.

Bu nedenle GPU seçerken yalnız "hangi kart?" diye sormak yetmez. Asıl soru, kartta ne kadar VRAM olduğu ve bu belleğin ne hızla beslendiğidir. Öte yandan CPU tamamen önemsiz değildir. Veri ön işleme, tokenizasyon ve dosya okuma gibi adımlar hâlâ CPU'da koşar. Zayıf bir CPU, pahalı GPU'yu boşta bekletir.

Bir benzetme yapalım: CPU, her işi titizlikle yapan birkaç usta gibidir; GPU ise aynı basit hareketi aynı anda yapan kalabalık bir ekip gibi çalışır. Tek bir karmaşık karar için usta daha hızlıdır. Milyonlarca benzer çarpma işlemi için ise kalabalık ekip açık ara öne geçer. Kısacası CPU sunucu genel amaçlı bir iş makinesidir. GPU sunucu ise paralel matematiğe odaklı uzman bir hızlandırıcıyı taşır. İkisi birbirinin yerine geçmez; doğru iş yükü eşleşmesi asıl kararı belirler.

Hangi iş yükleri GPU sunucu ister?

GPU'nun belirgin kazanç sağladığı iş yükleri, büyük matris işlemlerini tekrar tekrar çalıştıran işlerdir. Ekibimizin müşterilerle konuşurken kullandığı kaba liste şöyle:

  • Model eğitimi. Bir modeli sıfırdan eğitmek en ağır senaryodur ve genellikle birden fazla GPU ister.
  • İnce ayar (fine-tuning). Hazır bir modeli kendi verinizle uyarlamak, sıfırdan eğitime göre çok daha hafiftir ama yine GPU belleğine dayanır.
  • LLM çıkarımı (inference). Eğitilmiş modeli kullanıcı isteklerine yanıt vermek için çalıştırmak, canlı ürünlerde en yaygın GPU kullanımıdır.
  • Görüntü ve video üretimi. Difüzyon tabanlı modeller her adımda yoğun hesap yapar; bu yüzden CPU'da pratik hızda çalışmaz.
  • 3D render ve video kodlama. Render motorları ve donanım hızlandırmalı kodlama da GPU'dan doğrudan güç alır.

Örneğin bir e-ticaret ekibi ürün açıklamalarını kendi markasının diline göre yazan bir model istiyorsa, çoğu zaman ince ayar ve çıkarım yeterlidir. Sıfırdan eğitim ise büyük veri, uzun süre ve geniş bütçe gerektirir. Üretken yapay zekanın genel çerçevesini üretken yapay zeka yazımızda anlattık.

Ayrıca şunu ayırt edin: hazır bir API ile çözebileceğiniz işi kendi GPU'nuzda çalıştırmak her zaman avantaj değildir. Kendi sunucunuz veri kontrolü ve özelleştirme sağlar; buna karşılık işletme yükünü de size bırakır.

Hangi işler için GPU sunucu kiralama gereksizdir?

Pek çok işletme "yapay zeka çağındayız" diye GPU sunucu kiralama yoluna giriyor. Oysa günlük web altyapısının büyük kısmı GPU'ya hiç ihtiyaç duymaz. Aşağıdaki işler için GPU'ya para vermek çoğu zaman boşa harcamadır:

  • Web sitesi barındırma. PHP, Node.js ya da statik site sunmak CPU, RAM ve disk hızına dayanır.
  • Klasik veritabanı. MySQL ve PostgreSQL gibi sistemler disk, bellek ve indeks yapısına bağlıdır, GPU kullanmaz.
  • E-posta, yedekleme ve dosya paylaşımı. Bu servisler ağ ve depolama işidir.
  • Hazır API ile yapılan küçük işler. Ayda birkaç yüz metin özetlemek için kendi GPU'nuzu ayakta tutmak genellikle mantıklı değildir.

Bu tür işler için doğru adres klasik VPS, bulut sunucu ya da adanmış sunucudur. Aralarındaki farkı VPS, VDS ve bulut sunucu karşılaştırmamızda ayrıntılı ele aldık; burada tekrar etmiyoruz.

Peki ara durumlar ne olacak? Örneğin sitenizde küçük bir sınıflandırma modeli çalışıyor olabilir. Küçük modeller CPU üzerinde de kabul edilebilir hızda koşabilir. Önce CPU'da ölçün, gerçekten darboğaz görürseniz GPU'ya geçin. Böylece ihtiyacı varsayıma değil ölçüme dayandırırsınız.

GPU sunucu kiralama modelleri nelerdir?

GPU sunucu kiralama piyasasında üç temel model öne çıkıyor. Her birinin kontrol, esneklik ve sorumluluk dengesi farklıdır.

Adanmış (bare metal) GPU sunucu. Fiziksel makinenin tamamı size aittir; sanallaştırma katmanı yoktur. Donanıma tam erişim, öngörülebilir performans ve uzun süreli işlerde kararlı maliyet sağlar. Buna karşılık kurulum, güncelleme ve izleme genellikle sizin sorumluluğunuzdadır. Adanmış sunucunun genel mantığını dedicated sunucu yazımızda anlattık.

GPU'lu bulut sanal makine. Bulut sağlayıcısı size GPU takılı bir sanal makine verir. Dakikalar içinde açıp kapatabilirsiniz. Bu nedenle deneme, kısa eğitim koşuları ve dalgalı yükler için esnek bir seçenektir.

Faturalama biçimi. Saatlik (kullandıkça öde) modeli kısa ve düzensiz işler için uygundur. Aylık kiralama, sürekli açık kalan çıkarım servislerinde hesabı sadeleştirir. Rezerve ya da taahhütlü kullanım ise uzun vadeli sözleşme karşılığında birim maliyeti düşürmeyi hedefler; ancak kullanmasanız da ödersiniz.

Ayrıca bazı sağlayıcılar kesintiye açık, daha ucuz kapasite sunar. Bu seçeneğin adı sağlayıcıya göre değişir; teklifte "kesintiye açık" ya da "geri alınabilir" ifadesini arayın. Bu kapasite her an geri alınabileceği için yalnızca kaldığı yerden devam edebilen işlerde mantıklıdır.

Tüketici sınıfı ile veri merkezi sınıfı GPU arasında ne fark var?

NVIDIA ürünlerini kabaca iki aileye ayırabiliriz. Tüketici tarafında oyun ve kişisel iş istasyonu odaklı GeForce kartlar yer alır. Veri merkezi tarafında ise NVIDIA'nın sunucu kasası, sürekli yük ve çoklu GPU ölçeklemesi için geliştirdiği kartlar var. Güncel ürün ailelerini NVIDIA'nın veri merkezi sayfasında görebilirsiniz.

Pratikte farklar şu başlıklarda öne çıkar:

  • Bellek kapasitesi. Veri merkezi kartları genellikle çok daha fazla VRAM taşır; büyük modeller için belirleyici fark budur.
  • Bellek güvenilirliği. Veri merkezi kartlarında hata düzeltmeli (ECC) bellek desteği yaygındır.
  • Çoklu GPU bağlantısı. GPU'lar arası hızlı bağlantı ve paylaşım özellikleri veri merkezi tarafında öne çıkar.
  • Lisans ve destek. Sürücü lisans koşulları ve kurumsal destek kapsamı iki aile arasında değişebilir.

Tüketici kartı kiralamak, küçük modellerle deneme ve görüntü üretimi için ekonomik olabilir. Ancak canlı bir ürün için sağlayıcıya kartın lisans uygunluğunu, soğutmasını ve arıza durumunda değişim süresini mutlaka sorun. Model adı geçen her teklifte kartın teknik özelliklerini NVIDIA'nın resmi ürün sayfasından doğrulayın.

Model boyutuna göre ne kadar VRAM gerekir?

Kesin bir rakam vermek mümkün değil, çünkü ihtiyaç modele, bağlam uzunluğuna ve eşzamanlı kullanıcı sayısına göre değişir. Ama kaba hesabın mantığı basittir: parametre sayısı ile parametre başına bayt miktarını çarparsınız.

Parametre başına bayt, sayısal kesinliğe (precision) bağlıdır. 32 bit kayan noktalı sayı 4 bayt, 16 bit 2 bayt, 8 bit 1 bayt, 4 bit ise yarım bayt tutar. Kuantizasyon (quantization), ağırlıkları daha düşük kesinliğe indirerek belleği küçültür; karşılığında kalitede bir miktar kayıp olabilir.

Örnek hesap: 7 milyar parametreli varsayımsal bir model 16 bit kesinlikte yalnızca ağırlıklar için kabaca 7 × 2 = 14 GB ister. Aynı model 4 bit kuantize edilirse ağırlık payı kabaca 3,5 GB'a iner. Bu rakamlar yalnız ağırlık içindir; gerçek ihtiyaç daha yüksektir.

Çünkü çıkarım sırasında bağlam için tutulan anahtar-değer önbelleği (KV cache) ve çalışma alanı da yer kaplar. Uzun bağlam ve çok sayıda eşzamanlı istek bu payı hızla büyütür. Eğitim ve tam ince ayarda ise gradyanlar ve optimizer durumu da devreye girer; ihtiyaç ağırlıkların birkaç katına çıkar. Bu yüzden LoRA gibi parametre verimli ince ayar yöntemleri bellek dostu bir ara yol sunar.

Kısacası teklif almadan önce modelinizi, kesinliğinizi ve hedef eşzamanlılığınızı yazın. Sağlayıcıyla bu üç bilgiyle konuşmak, "en büyük kartı verin" demekten çok daha sağlıklı sonuç verir.

Bellek bant genişliği, çoklu GPU ve NVLink neden önemli?

VRAM miktarı modelin sığıp sığmadığını belirler. Bellek bant genişliği ise sığan modelin ne hızla çalışacağını etkiler. Özellikle LLM çıkarımında her yeni token üretimi ağırlıkların bellekten okunmasını gerektirir. Bu yüzden iki kart aynı VRAM'e sahip olsa bile bant genişliği farkı yanıt hızına doğrudan yansır.

Model tek karta sığmıyorsa çoklu GPU devreye girer. Bu durumda modeli ya da veriyi birden fazla karta bölersiniz ve kartlar sürekli veri alışverişi yapar. Kartlar arasındaki bağlantı yavaşsa hesap gücünün bir kısmı beklemeyle geçer.

NVIDIA, bu sorun için NVLink adını verdiği doğrudan GPU'dan GPU'ya bağlantıyı geliştirdi. Şirketin NVLink sayfasına göre amaç, sunucu içindeki çoklu GPU iletişimini yapay zeka eğitimi ve çıkarımı için hızlandırmaktır. Kartlar yalnız standart PCIe hattı üzerinden haberleşiyorsa çoklu GPU verimi düşebilir.

Dolayısıyla çoklu GPU teklifi aldığınızda şunu sorun: kartlar NVLink ile mi bağlı, yoksa yalnız PCIe üzerinden mi haberleşiyor? Tek karta sığan çıkarım işlerinde bu soru daha az kritiktir. Büyük model eğitiminde ise performansı belirleyen ana kalemlerden biridir.

CPU, RAM, NVMe ve ağ dengesini nasıl kurarsınız?

GPU sunucunun geri kalan bileşenleri zayıfsa pahalı kart boşta bekler. Bu yüzden dengeye bakmak, kart seçmek kadar önemlidir.

  • CPU. Veri yükleme, ön işleme ve tokenizasyon adımlarını besleyecek kadar çekirdek olmalı. Çoklu GPU'da her karta yetecek CPU payını sorun.
  • Sistem belleği (RAM). Veri kümesini ve modeli GPU'ya aktarmadan önce RAM'de tutarsınız. RAM'in VRAM toplamından rahatça büyük olması işinizi kolaylaştırır.
  • NVMe depolama. Büyük veri kümeleri ve model dosyaları için hızlı yerel disk, eğitim sırasında veri okuma darboğazını azaltır.
  • Ağ. Model ve veri indirmesi, kontrol noktası yedekleme ve çoklu sunucu eğitimi için yüksek bant genişliği gerekir.

Örneğin büyük bir görsel veri kümesiyle eğitim yapıyorsanız yavaş bir disk GPU kullanımını düşürür. Bunu anlamak için eğitim sırasında GPU kullanım oranını izleyin. Oran sürekli düşükse darboğaz büyük olasılıkla veri hattındadır.

Ayrıca sunucunun konumu kullanıcılarınıza olan gecikmeyi etkiler. Canlı bir çıkarım servisinde sunucu IP'sinin hangi ülkeye ve ağa ait olduğunu IP sorgulama aracımızla hızla kontrol edebilirsiniz.

GPU kiralama seçenekleri karşılaştırma tablosu

Aşağıdaki tablo, üç temel seçeneği karar açısından özetliyor. Değerlendirmeler genel eğilimdir; sağlayıcıya göre değişebilir.

KriterAdanmış (bare metal) GPUGPU'lu bulut sanal makineHazır yapay zeka API'si
KontrolTam donanım ve işletim sistemi kontrolüİşletim sistemi kontrolü, donanım soyutYalnız API parametreleri
EsneklikDüşük, sözleşmeye bağlıYüksek, dakikalar içinde aç kapatÇok yüksek, altyapı yok
Uygun işUzun eğitim, sürekli çıkarımDeneme, kısa eğitim, dalgalı yükPrototip, düşük hacimli kullanım
Yönetim yüküYüksekOrtaDüşük
Veri konumu kontrolüYüksek, veri merkezini siz seçersinizBölge seçimine bağlıSağlayıcının politikasına bağlı
Maliyet riskiBoşta beklerken de ödemeKapatmayı unutursanız fatura büyürHacim arttıkça hızla büyür

Tablodan çıkan sonuç şu: tek bir doğru yok. Çoğu ekip prototipte API ile başlıyor, ölçeklenince bulut GPU'ya, sürekli ve öngörülebilir yükte ise adanmış sunucuya geçiyor.

Yazılım katmanında neleri kurmanız gerekir?

Donanım hazır olduğunda üç katmanlı bir yazılım yığını kurarsınız. Sıralama önemlidir, çünkü her katman bir öncekine dayanır.

  1. NVIDIA sürücüsü. İşletim sisteminin GPU'yu tanıması için gereken ilk katmandır. Kurulumdan sonra nvidia-smi komutuyla kartları, sürücü sürümünü ve bellek kullanımını görürsünüz.
  2. CUDA. NVIDIA'nın paralel hesaplama platformudur. PyTorch ve TensorFlow gibi çerçeveler GPU'ya CUDA üzerinden erişir. Sürüm uyumunu çerçevenin kendi kurulum sayfasından kontrol edin.
  3. Uygulama ortamı. Çerçeve, model sunucusu ve kendi kodunuz. Bu katmanı konteyner içinde tutmak, ortamın tekrar üretilebilir olmasını sağlar.

Pek çok sağlayıcı sürücü ve CUDA kurulu hazır imajlar sunar. Bu imajlar ilk kurulumu ciddi biçimde hızlandırır. Ancak imajın hangi sürümleri içerdiğini ve güncelleme politikasını öğrenin. Biz burada sürüm numarası vermiyoruz; her zaman güncel kararlı sürümü resmi sayfadan kontrol etmenizi öneririz.

Sunucuya ilk kez kurulum yapıyorsanız temel adımları Ubuntu Server kurulum rehberimizde bulabilirsiniz. Kullanıcı oluşturma, güvenlik duvarı ve güncelleme adımları GPU sunucuda da aynıdır.

Docker konteynerine GPU'yu nasıl tanıtırsınız?

Konteyner, model ortamını sürücüden bağımsız ve taşınabilir tutmanın en pratik yoludur. Docker'ın temel mantığını Docker rehberimizde anlattık. GPU tarafında ise ek bir parça gerekir: NVIDIA Container Toolkit.

NVIDIA'nın resmi kurulum kılavuzuna göre önce ana makineye NVIDIA sürücüsünü kurarsınız. Ardından kılavuzdaki depo adımlarını izleyip nvidia-container-toolkit paketini yüklersiniz. Sonra Docker çalışma zamanını yapılandırıp servisi yeniden başlatırsınız:

sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Kurulumu doğrulamak için Docker'ın GPU erişimi belgesindeki örneği kullanabilirsiniz. Tüm GPU'ları konteynere vermek ya da yalnızca belirli bir kartı seçmek için:

docker run -it --rm --gpus all ubuntu nvidia-smi
docker run -it --rm --gpus device=0 ubuntu nvidia-smi

Komut kart listesini gösteriyorsa konteyner GPU'yu görüyor demektir. Böylece birden fazla projeyi aynı sunucuda farklı kartlara ayırabilirsiniz. Depo ekleme adımını kılavuzdan birebir kopyalayın; internetten bulduğunuz tek satırlık kurulum betiklerini doğrudan kabuğa aktarmayın.

GPU sunucu kiralama maliyetini hangi kalemler belirler?

Burada fiyat vermiyoruz; güncel rakamları her zaman sağlayıcının fiyat sayfasından alın. Genel sunucu fiyatlandırmasını sunucu kiralama maliyeti yazımızda anlattık. GPU sunucu kiralama tarafında öne çıkan ek kalemler şunlardır:

  • Kullanım süresi. Saatlik modelde fatura doğrudan açık kalınan süreye bağlıdır.
  • Boşta bekleme. Eğitim bitti ama makine açık kaldıysa GPU ücreti işlemeye devam eder.
  • Veri çıkış trafiği. Birçok bulut sağlayıcısı dışarı giden veriyi ayrıca ücretlendirir; büyük model ve veri kümesi taşırken bu kalem şişebilir.
  • Depolama. Makineyi kapatsanız bile kalıcı diskler ve anlık görüntüler ücretlendirilmeye devam edebilir.

Örnek hesap: Saatlik ücreti "X" olan bir GPU makinesi düşünün. Haftada 20 saat gerçek eğitim yapıp makineyi hafta boyunca açık bırakırsanız 168 saat ödersiniz. Gerçek kullanım oranınız yaklaşık yüzde 12 olur. Aynı işi otomatik kapatma ile yönetirseniz GPU faturası kabaca 20X'e iner; depolama ve trafik bunun üstüne gelir.

Bu yüzden maliyet kontrolünde en etkili adım, boşta bekleyen makineyi otomatik kapatan bir kural kurmaktır. Ayrıca eğitim kontrol noktalarını düzenli kaydedin; böylece makineyi kapatıp ertesi gün kaldığınız yerden devam edersiniz. Bütçe uyarısı tanımlamak da sürpriz faturaları erken yakalamanızı sağlar.

GPU sunucu kiralamak mı, satın almak mı daha mantıklı?

Karar büyük ölçüde kullanım yoğunluğuna ve belirsizliğe bağlıdır. Kart satın almak, sabit ve yüksek kullanımı olan ekipler için uzun vadede anlamlı olabilir. Ancak satın alma yalnız kart bedeli değildir.

Satın aldığınızda elektrik, soğutma, veri merkezi barındırma, yedek parça ve donanım arızasıyla uğraşma sorumluluğu da size geçer. Üstelik yapay zeka donanımı hızlı eskiyor; bugünün üst seviye kartı birkaç yıl içinde orta seviyeye inebilir. Kiralamada ise yeni nesil karta geçmek bir sözleşme değişikliğinden ibarettir.

Biz şu kaba ayrımı öneriyoruz:

  • Kiralayın. İhtiyacınız belirsizse, proje deneme aşamasındaysa ya da yük dönemsel olarak değişiyorsa.
  • Uzun süreli kiralayın veya rezerve edin. Sürekli açık bir çıkarım servisiniz varsa ve yükü öngörebiliyorsanız.
  • Satın almayı değerlendirin. Kullanım yüksek ve kesintisizse, veri tesis dışına çıkamıyorsa ve donanımı işletecek ekibiniz varsa.

Kararı vermeden önce birkaç ay kiralık sunucuda gerçek kullanım verisi toplayın. Böylece satın alma hesabını tahmine değil, ölçülmüş saatlere dayandırırsınız.

Veri konumu ve KVKK açısından nelere dikkat etmelisiniz?

Bu bölüm hukuki danışmanlık değildir; somut durumunuz için bir hukuk uzmanına danışın. Yine de teknik karar verirken şu soruyu baştan sormalısınız: eğitim ya da çıkarım verim kişisel veri içeriyor mu?

Müşteri yazışmaları, destek kayıtları, ses kayıtları veya CRM verisi çoğu zaman kişisel veri içerir. GPU sunucunuz yurt dışındaki bir veri merkezindeyse bu veriyi oraya göndermek, KVKK açısından yurt dışına aktarım anlamına gelebilir. Kişisel Verileri Koruma Kurumu, bu konunun çerçevesini yurt dışına aktarım rehberinde açıklıyor. Kurumun duyurularına göre standart sözleşme yoluyla aktarımda sözleşmeyi imzalar tamamlandıktan sonra beş iş günü içinde Kuruma bildirmek gerekiyor.

Teknik tarafta yapabilecekleriniz şunlar:

  • Veri merkezi konumunu yazılı olarak öğrenin. Yedeklerin ve anlık görüntülerin nerede tutulduğunu da sorun.
  • Veriyi küçültün. Eğitimden önce kimlik bilgilerini maskeleyin ya da anonimleştirin.
  • Silme sürecini netleştirin. Sözleşme bitince disklerin nasıl temizlendiğini öğrenin.

Web sitesi tarafındaki uyum adımlarını KVKK ve GDPR uyumlu web sitesi rehberimizde ele aldık.

GPU sunucuyu nasıl güvenli tutarsınız?

GPU sunucular saldırganlar için cazip hedeftir, çünkü yüksek hesap gücü kötüye kullanılabilir. Ayrıca model ağırlıkları ve eğitim verisi şirketiniz için değerli varlıklardır. Temel güvenlik adımları klasik Linux sunucudan farklı değildir ama ihmal etmenin bedeli daha yüksektir.

  • SSH'ı sıkılaştırın. Parola ile girişi kapatıp anahtar tabanlı kimlik doğrulama kullanın, root ile doğrudan girişi engelleyin. Adımları SSH güvenliği rehberimizde anlattık.
  • Arayüzleri internete açmayın. Jupyter, model sunucusu ve izleme panellerini herkese açık porttan yayınlamayın.
  • İzole ağ kullanın. Sağlayıcı özel ağ ya da VPC sunuyorsa sunucular arası trafiği oradan geçirin.
  • Kullanımı izleyin. Beklenmedik GPU kullanımı, yetkisiz bir işin çalıştığının işareti olabilir.

Örneğin Jupyter'a erişmek için portu açmak yerine SSH tüneli kurabilirsiniz. Aşağıdaki örnekte belge amaçlı IP adresi kullanıyoruz:

ssh -L 8888:localhost:8888 kullanici@203.0.113.10

Bu komut, uzak sunucudaki 8888 portunu yerel makinenize güvenli tünelle taşır. Böylece arayüz internete hiç çıkmaz.

Ne zaman GPU sunucuyu kendiniz yönetmemelisiniz?

Dürüst olmak gerekirse her ekip GPU sunucu işletmeye uygun değildir. Kendi sunucunuzu yönetmek; sürücü güncellemesi, güvenlik yaması, izleme, yedekleme ve arıza müdahalesi demektir. Bu işleri düzenli yapacak birini ayıramıyorsanız yönetilen hizmeti tercih edin.

Şu durumlarda işi sağlayıcıya ya da yönetilen bir platforma bırakmanızı öneririz:

  • Ekibinizde Linux yönetim deneyimi yoksa. Hatalı bir SSH ayarı ya da unutulan açık bir port ciddi risk doğurur.
  • Servis kesintisiz çalışmak zorundaysa. Gece arıza çıktığında müdahale edecek nöbet düzeni gerekir.
  • İhtiyacınız sadece çıkarımsa. Yönetilen çıkarım servisleri altyapıyı soyutlar; siz yalnız modele odaklanırsınız.
  • Hacim düşükse. Ayda birkaç saatlik iş için sunucu bakımı ayırmak verimli değildir.

Öte yandan veri konumu üzerinde tam kontrol istiyorsanız ya da özel bir model yapılandırması kuruyorsanız kendi sunucunuz avantaj sağlar. Bu durumda bile işletim sistemi bakımını yönetilen pakete devretmek mantıklı bir orta yol olabilir.

GPU sunucu kiralama öncesi sağlayıcıya sorulacak sorular

Teklifleri karşılaştırırken aşağıdaki soruları yazılı olarak sorun. Yanıtların netliği, sağlayıcının olgunluğu hakkında da bilgi verir.

  1. Kart modeli, VRAM miktarı ve kart sayısı nedir? Bu bilgiyi NVIDIA'nın resmi sayfasıyla karşılaştırın.
  2. Kartları sanal makineye tamamen mi ayırıyorsunuz, yoksa paylaşımlı mı kullanıyorsunuz?
  3. Çoklu GPU'da kartlar NVLink ile mi bağlı, yoksa yalnız PCIe üzerinden mi?
  4. CPU çekirdek sayısı, RAM ve NVMe kapasitesi ne kadar?
  5. Veri merkezi hangi ülkede? Yedekler ve anlık görüntüler nerede duruyor?
  6. Veri çıkış trafiği ücretli mi? Ücretliyse hesaplama yöntemi nedir?
  7. Makine kapalıyken hangi kalemler ücretlendirilmeye devam ediyor?
  8. Sürücü ve CUDA kurulu hazır imaj var mı? Güncelleme sorumluluğu kimde?
  9. Donanım arızasında değişim ve müdahale süresi nedir?
  10. Sözleşme bitince disklerdeki veriyi nasıl siliyorsunuz?

Bu listeyi teklif tablonuza sütun olarak ekleyin. Böylece fiyatı tek başına değil, hizmet kapsamıyla birlikte karşılaştırırsınız.

Kendi sunucunuzda AI agent çalıştırmak GPU gerektirir mi?

Her zaman değil. Bir yapay zeka ajanı, görevleri adım adım planlayan ve araç çağıran bir yazılımdır. Ajanın beyni olan dil modelini harici bir API'den çağırıyorsanız ajanın kendisi sıradan bir VPS'te rahatça çalışır. GPU ancak modeli de kendi sunucunuzda barındırmak istediğinizde gündeme gelir.

Bu ayrım bütçeyi ciddi biçimde etkiler. Ajan mantığını, iş akışlarını ve entegrasyonları ucuz bir CPU sunucuda tutup modeli ayrı bir GPU servisine taşımak esnek bir mimari sunar. Böylece GPU'yu yalnız gerçekten ihtiyaç duyan katmana ayırırsınız.

Ajanların pazarlama tarafındaki kullanımını AI agent yazımızda anlattık. Kendi sunucunuzda ajan kurulumunu ise bu serideki kardeş yazımızda ayrıca ele alıyoruz. Python tarafında yolunuzu çizmek isterseniz Python ile yapay zeka yol haritamız iyi bir başlangıç olur.

GPU sunucu kiralamada doğru kararı nasıl verirsiniz?

Doğru karar, donanımdan değil iş yükünden başlar. Önce modelinizi, kesinliğinizi, bağlam uzunluğunuzu ve beklenen eşzamanlı kullanıcı sayısını yazın. Ardından VRAM ihtiyacını kaba hesapla çıkarın ve kart seçimini bu hesaba dayandırın.

Sonra kiralama modelini seçin: deneme için saatlik bulut GPU, sürekli yük için aylık ya da adanmış sunucu. Maliyet tarafında boşta bekleme, veri çıkışı ve depolamayı unutmayın. Veri kişisel bilgi içeriyorsa konum ve aktarım kurallarını teknik kurulumdan önce netleştirin.

Son olarak yönetim yükünü dürüstçe değerlendirin. Ekibiniz sunucu işletmeye hazır değilse yönetilen hizmet, uzun vadede daha ucuz ve daha güvenli olabilir.

Ekibimiz, yapay zekayı pazarlama ve operasyon süreçlerine bağlarken altyapı kararlarında da yol gösteriyor. GPU ihtiyacınızı netleştirmek ya da bir otomasyon fikrini hayata geçirmek isterseniz yapay zeka otomasyon hizmetimizi inceleyebilirsiniz.

Sıkça Sorulan Sorular

GPU sunucu kiralama ile CPU sunucu kiralama arasındaki temel fark nedir?
Temel fark, GPU sunucunun paralel matematik işlemleri için tasarlanmış ve kendi belleği (VRAM) olan bir hızlandırıcı taşımasıdır. Model eğitimi, ince ayar ve LLM çıkarımı bu paralel yapıdan büyük kazanç sağlar. Web sitesi, e-posta ve klasik veritabanı gibi işler ise GPU'dan yararlanmaz; bunlar için CPU sunucu yeterlidir.
Küçük bir işletme için GPU sunucu kiralamak mantıklı mı?
Çoğu küçük işletme için ilk adımda mantıklı değildir. Düşük hacimli metin üretimi veya özetleme işlerini hazır bir yapay zeka API'si ile daha ucuz ve hızlı çözersiniz. Veri konumu kontrolü, özel model ihtiyacı ya da yüksek ve sürekli kullanım ortaya çıktığında saatlik bulut GPU ile denemeye başlamanızı öneririz.
Bir LLM için ne kadar VRAM gerektiğini nasıl tahmin ederim?
Kaba tahmin için parametre sayısını parametre başına bayt ile çarparsınız. 16 bit kesinlikte parametre başına 2 bayt, 4 bit kuantizasyonda yarım bayt düşer. Bu hesap yalnız ağırlıkları verir. Bağlam önbelleği, eşzamanlı istekler ve çalışma alanı için ek pay bırakın; eğitimde ihtiyaç birkaç kat artar.
GPU sunucuda Docker kullanmak için ne kurmam gerekir?
Önce ana makineye NVIDIA sürücüsünü kurmanız gerekir. Ardından NVIDIA'nın resmi kılavuzunu izleyerek NVIDIA Container Toolkit paketini yükler, Docker çalışma zamanını nvidia-ctk komutuyla yapılandırır ve Docker servisini yeniden başlatırsınız. Sonrasında konteyneri --gpus parametresiyle çalıştırarak GPU erişimini nvidia-smi çıktısıyla doğrularsınız. Depo ekleme adımını da kılavuzdan birebir izleyin.
Yurt dışındaki GPU sunucuya müşteri verisi göndermek KVKK açısından sorun olur mu?
Olabilir. Veri kişisel bilgi içeriyorsa yurt dışındaki sunucuya göndermek KVKK kapsamında yurt dışına aktarım sayılabilir ve ayrı şartlara bağlıdır. Veri merkezi konumunu yazılı öğrenin, mümkünse veriyi anonimleştirin ve bir hukuk uzmanına danışın. Bu yanıt hukuki danışmanlık değildir; Kurumun rehberini esas alın.
GPU sunucu faturasının beklenenden yüksek gelmesinin en sık nedeni nedir?
En sık neden, iş bittikten sonra açık kalan makinedir. Saatlik modelde GPU ücreti siz kullanmasanız da işler. Bunun yanında veri çıkış trafiği, kalıcı diskler ve anlık görüntüler de faturayı büyütür. Otomatik kapatma kuralı kurmak ve sağlayıcının ücretlendirme sayfasını düzenli kontrol etmek bu sürprizi büyük ölçüde önler.
  • gpu sunucu kiralama
  • gpu sunucu
  • yapay zeka altyapısı
  • llm çıkarımı
  • fine-tuning
  • nvidia
  • docker
  • bulut sunucu
Paylaş:
Talha Aslan

Google Partner dijital pazarlama uzmanı. 2012’den beri SEO, Google Ads, web tasarım ve e-ticaret projelerinde sahada; bu blogda gördüğünüz her yazı o deneyimden çıkar.

Sıradaki proje

Projenizi konuşalım.

Talebiniz doğrudan Talha Aslan ve ekibine ulaşır: stratejiyi Talha kurar, uygulamayı deneyimli ekip yürütür. İlk istişare ücretsizdir; hedefinizi dinler, net bir yol haritasıyla döneriz.