Yapay Zeka

Inference Nedir? Yapay Zekada Çıkarım ve Eğitimden Farkı

Talha Aslan 15 dakikalık okuma 3 görüntülenme

Inference nedir?

Inference (çıkarım), eğitimi biten bir yapay zeka modelinin yeni bir girdiyi alıp ondan yanıt, tahmin veya sınıflandırma üretmesidir. Model bu aşamada yeni bir şey edinmez; eldeki ağırlıkları kullanarak sorunuzu işler ve cevabı üretir. Kısacası bir yapay zekayı her kullandığınızda arka planda inference çalışır.

Basit bir benzetme yapalım. Eğitim, bir aşçının yıllarca tarif öğrendiği okul dönemidir. Inference ise aşçının mutfakta gelen siparişe yemek yapmasıdır. Okul dönemi bir kez ve büyük emekle biter, mutfak ise her gün ve her sipariş için çalışır.

Bu yazıda inference nedir sorusunu kavram düzeyinde yanıtlıyoruz. Model adı, sürüm, fiyat ve hız gibi hızla eskiyen bilgileri bilerek rakamla yazmadık. Güncel değerler için sağlayıcının resmi belgesini kontrol etmeniz gerekir.

Inference nedir sorusu işletmeler için neden önemlidir?

Çünkü yapay zeka ürününün günlük faturasını ve kullanıcı deneyimini doğrudan inference belirler. Eğitim çoğu zaman sağlayıcının işidir. Sizin ürününüzde kullanıcı her tıkladığında çıkarım çalışır ve her çalışma bir süre ile bir maliyet doğurur.

Üstelik hız kararları ticari sonuç yaratır. Cevabı geç gelen bir asistan ziyaretçiyi sıkar, pahalı çalışan bir otomasyon ise kârı eritir. Bu yüzden inference nedir sorusunu yalnızca teknik ekip değil, ürün ve yönetim tarafı da bilmelidir.

Ayrıca doğru terimi bilmek doğru soruyu sormanızı sağlar. Bir tedarikçiye "modeliniz kaç saniyede ilk cevabı veriyor, yoğun saatte ne olur?" diye sorabilirsiniz. Böylece teklifleri sadece model ünüyle değil, çıkarım davranışıyla karşılaştırırsınız.

Son olarak güvenlik ve uyum tarafı vardır. Çıkarım sırasında modele gönderdiğiniz her girdi bir veri akışıdır. Bu akışın nereye gittiğini bilmek, kişisel veri taşıyan işlerde ilk koşuldur.

Inference nedir ve eğitimden farkı hangi noktada başlar?

Bir model iki ayrı yaşam evresinden geçer. İlk evre eğitimdir; model çok sayıda örnekten örüntü çıkarır ve iç ayarlarını (ağırlıklarını) günceller. İkinci evre inference evresidir; ağırlıklar artık sabittir ve model yalnızca yeni girdilere cevap verir.

Bu ayrımı günlük hayatta şöyle fark edersiniz. ChatGPT benzeri bir sohbet asistanına soru yazdığınızda eğitim yapmazsınız, inference tetiklersiniz. Modeli yeni bilgiyle kalıcı olarak değiştirmek ise ayrı bir eğitim ya da ince ayar işidir.

Ayrıca ekiplerin çoğu için asıl süreklilik inference tarafındadır. Eğitim işini genellikle model sağlayıcısı yapar. Siz ise hazır modeli bir uygulamaya bağlar ve her kullanıcı isteğinde çıkarım maliyetini ödersiniz.

Bir inference isteği adım adım nasıl çalışır?

Teknik ayrıntıya girmeden akışı şöyle özetleyebiliriz. Kullanıcı bir metin, görsel ya da ses gönderir. Sistem bu girdiyi modelin anlayacağı sayısal parçalara çevirir ve model ağırlıklarıyla birlikte işler.

  1. Girdi gelir ve parçalara bölünür; metinde bu parçalara token denir.
  2. Model girdinin tamamını okur ve içeriği iç temsillere dönüştürür.
  3. Model ilk çıktı parçasını üretir; ardından her yeni parçayı öncekilere bakarak sırayla ekler.
  4. Üretim bir durma koşuluna ulaşınca sistem cevabı birleştirir ve kullanıcıya iletir.
  5. Sağlayıcı ya da sunucu, kullanılan hesaplama emeğini kaydeder; fatura bu kayda dayanır.

Yani model cevabı tek hamlede yazmaz. Büyük dil modelleri çoğunlukla çıktıyı parça parça üretir. Bu davranışı büyük dil modelleri (LLM) yazımızda ayrıca anlatıyoruz.

Prefill ve decode aşamaları inference için neden önemlidir?

Büyük dil modellerinde çıkarım iki evreden oluşur. Prefill evresinde model girdinin tamamını paralel olarak işler. Decode evresinde ise çıktıyı sırayla, tek tek üretir. NVIDIA, bu iki evrenin farklı kaynakları zorladığını kendi teknik yazısında açıklıyor.

  • Prefill evresi hesaplama gücüne yaslanır ve uzun girdilerde belirginleşir.
  • Decode evresi çoğunlukla bellek erişim hızına yaslanır, çünkü her yeni parça önceki durumlara bakar.
  • İlk yanıtın ne kadar çabuk görüneceği büyük ölçüde prefill evresine bağlıdır.
  • Cevabın ne kadar akıcı biçimde sürdüğü büyük ölçüde decode evresine bağlıdır.

Bu yüzden uzun bir belgeyi modele yapıştırmak ilk cevabı geciktirir. Cevabın uzaması ise toplam süreyi uzatır. Kaynak olarak NVIDIA'nın LLM çıkarım optimizasyonu yazısına bakabilirsiniz.

Inference sunucusu (serving) ne yapar ve neden gerekir?

Modeli bir dosya olarak indirmek, onu hizmete çevirmek anlamına gelmez. Serving, yani model sunumu, gelen istekleri alan, sıraya koyan ve modele ileten yazılım katmanıdır. Bu katman olmadan model yalnızca diskte duran büyük bir dosyadır.

  • İstekleri kuyruğa alır ve sırayla ya da paket hâlinde modele verir.
  • Aynı anda gelen kullanıcıları ayrı ayrı yönetir.
  • Cevabı parça parça akıtabilir.
  • Yoğunlukta aşırı yüklenmeyi sınırlayıp hata dönebilir.
  • Kaç isteğin işlendiğini ve ne kadar sürdüğünü kayda geçirir.

Hugging Face belgeleri, yoğun talepte sunucunun "overloaded" türünde bir hata dönebildiğini ve istemcinin bunu yeniden denemeyle karşılayabileceğini anlatıyor. Bulut API kullanıyorsanız bu katmanı sağlayıcı sizin yerinize işletir. Kendi sunucunuzda ise bu iş ekibinize düşer.

Eğitim ile inference arasındaki fark tablosu neyi gösterir?

Aşağıdaki tablo iki evreyi donanım, maliyet yapısı ve sıklık açısından karşılaştırır. Rakam vermiyoruz, çünkü değerler modele ve sağlayıcıya göre değişir. Önemli olan, iki işin doğasının farklı olmasıdır.

ÖlçütEğitimInference (çıkarım)
AmaçVeriden örüntü öğrenmek, ağırlıkları güncellemekHazır modelle yeni girdiye yanıt üretmek
DonanımÇok sayıda hızlandırıcıyı bir arada çalıştıran büyük kümelerTek hızlandırıcıdan bulut havuzuna ve cihaza kadar geniş aralık
Maliyet yapısıBüyük, dönemsel ve öngörülebilir bir yatırımHer isteğe bağlı, kullanımla büyüyen sürekli gider
SıklıkSeyrek; model sürümü yenilendiğindeSürekli; her kullanıcı isteğinde
AğırlıklarSürekli değişirSabit kalır
ÖncelikDoğruluk ve kaliteGecikme, verim ve istek başına maliyet
Sorumlu tarafÇoğunlukla model sağlayıcısıModeli ürününe bağlayan işletme ya da geliştirici

Özetle eğitim bir kez yapılan büyük yatırım gibidir. Inference ise her müşteri geldiğinde açılan kasa gibidir. Kullanıcı sayınız arttıkça ikinci kalem birinciden çok daha belirleyici olur.

Gecikme (latency) nedir ve inference sırasında kullanıcıya nasıl yansır?

Gecikme, kullanıcının isteği gönderdiği andan cevabı görmeye başladığı ana kadar geçen süredir. İngilizce karşılığı latency olan bu kavram, yapay zeka ürünlerinde "bu araç hızlı mı?" sorusunun cevabını belirler. Ağ gecikmesi de buna ekleniyor; konuya ping ve gecikme yazımızdan bakabilirsiniz.

Gecikmenin iki yüzü vardır. İlk yüz, ilk parçanın ekrana gelme süresidir. İkinci yüz, cevabın tamamlanma süresidir. Kullanıcı çoğu zaman ilkini hisseder, çünkü cevap akmaya başlayınca bekleme duygusu azalır.

Hugging Face belgeleri bu noktayı destekliyor. Parça parça yanıt akıtan (streaming) bir sistemde toplam süre aynı kalsa bile algılanan gecikme düşer. Bu yüzden sohbet arayüzlerinin çoğu cevabı yazılırken gösterir. Ayrıntı için Hugging Face akış belgesine göz atın.

Verim (throughput) nedir ve gecikmeyle arasında nasıl bir denge var?

Verim, sistemin belirli bir sürede ne kadar iş bitirebildiğidir. Örneğin aynı anda kaç isteğe cevap verebildiğiniz ya da saniyede kaç çıktı parçası ürettiğiniz verimle ilgilidir. Gecikme tek bir kullanıcının deneyimini, verim ise toplam kapasiteyi anlatır.

İkisi çoğu zaman birbirine ters çeker. Sunucu aynı anda çok isteği paketleyip işlerse donanım daha verimli çalışır, ancak her isteğin kuyrukta beklemesi uzayabilir. Tersine, her isteğe hemen cevap vermek gecikmeyi düşürür ama donanımı boş bırakabilir.

  • Canlı sohbet ve sesli asistan gibi etkileşimli işlerde gecikme önceliklidir.
  • Gece çalışan toplu raporlarda verim ve toplam maliyet önceliklidir.
  • Karma iş yüklerinde ekipler genellikle iki ayrı hat kurar: biri hızlı, biri ucuz.

Doğru denge ürününüzün ihtiyacına bağlıdır. Bu yüzden önce kullanıcı beklentisini yazın, ardından sistemi ona göre ayarlayın.

Bir benzetme daha kullanalım. Küçük bir restoranda her masaya hemen garson gönderirseniz servis çabuk olur, ama mutfak verimsiz çalışır. Siparişleri biriktirip toplu pişirirseniz mutfak rahatlar, fakat ilk masa bekler. Çıkarım sunucuları da aynı ikilemi yaşar.

Toplu (batch) ve gerçek zamanlı inference arasında ne fark var?

Gerçek zamanlı (online) inference, bir kullanıcı bekliyorken cevap üretir. Toplu (batch) inference ise çok sayıda girdiyi önceden toplar ve acele etmeden işler. İki yöntem aynı modeli kullanabilir; fark, beklemenin kabul edilebilir olup olmadığıdır.

ÖzellikGerçek zamanlı inferenceToplu inference
Bekleyen kullanıcıVarYok
ÖncelikDüşük gecikmeYüksek verim ve düşük birim maliyet
Tipik örnekSohbet asistanı, canlı öneriKatalog açıklamalarını topluca yazma, arşiv etiketleme
ZamanlamaKullanıcı istediği andaPlanlı ya da kuyruğa dizilmiş
Hata yönetimiAnında yeniden deneme ve yedek yolSonradan toplu yeniden çalıştırma

Örneğin bir e-ticaret ekibi, binlerce ürün açıklamasını gece toplu işleyebilir. Aynı ekip, müşteri sohbetini gerçek zamanlı yürütür. Sağlayıcıların bir kısmı toplu işler için ayrı bir yol sunar; koşulları resmi belgelerden kontrol etmelisiniz.

Inference maliyetini hangi etkenler belirler?

Inference maliyeti tek bir kalemden oluşmaz. Bulut API kullanırsanız genellikle girdi ve çıktı miktarına göre ödersiniz. Kendi sunucunuzda çalıştırırsanız donanım, enerji ve işletme emeği devreye girer. Rakam yazmıyoruz; güncel birim fiyatları sağlayıcının resmi fiyat sayfasından kontrol edin.

  • Girdi uzunluğu: istem, belge ve konuşma geçmişi büyüdükçe işlem emeği artar.
  • Çıktı uzunluğu: model uzun yazdıkça decode evresi uzar.
  • Model büyüklüğü: daha büyük modeller genellikle daha fazla bellek ve hesaplama ister.
  • İstek sayısı: kullanıcı arttıkça toplam gider doğrusal biçimde büyür.
  • Eşzamanlılık: aynı anda gelen yoğun talep için ayrılan kapasite maliyeti etkiler.
  • Tekrar eden içerik: aynı başlangıcı her istekte yeniden işlemek gereksiz yük yaratır.

Bu listedeki son madde optimizasyon fırsatıdır. Tekrar eden başlangıçları önbelleğe almayı prompt caching yazımızda anlattık.

Inference için bulut API, kendi sunucu ve cihaz üstü seçeneklerini nasıl karşılaştırırsınız?

Bir modeli çalıştırmanın üç yaygın yolu vardır. Bulut API ile sağlayıcının altyapısını kiralarsınız. Kendi sunucunuzda ya da kiralık GPU üzerinde modeli siz işletirsiniz. Cihaz üstü çalıştırmada ise model telefon, bilgisayar ya da yerel donanımda koşar.

SeçenekGüçlü yanıDikkat noktası
Bulut APIHızlı başlangıç, bakım yükü yok, ölçeklenme sağlayıcıdaKullanımla büyüyen gider, veri yolunu ve sağlayıcı koşullarını incelemek gerekir
Kendi sunucu ya da kiralık GPUVeri üzerinde daha fazla denetim, öngörülebilir kapasiteKurulum, güncelleme ve izleme emeği sizde kalır
Cihaz üstüÇok düşük ağ gecikmesi, veri cihazdan çıkmayabilirModel boyutu ve cihaz gücüyle sınırlı kalır

Örneğin bir muhasebe kaydı ya da müşteri listesi gibi hassas veriyle çalışıyorsanız yerel çalıştırmayı daha çok düşünürsünüz. Genel bir metin özeti için ise bulut API çoğu zaman daha hızlı ve ucuz bir başlangıç sunar. Karma yapılar da mümkündür: hassas işler yerelde, genel işler bulutta çalışır.

Seçim yaparken veri hassasiyeti, trafik düzeni ve ekip yetkinliği birlikte değerlendirilir. Kendi sunucu seçeneği için GPU sunucu kiralama rehberimizi, yerel çalıştırma için Ollama yazımızı, cihaz üstü yaklaşım için ise edge AI yazımızı okuyabilirsiniz.

Inference gerçek işlerde nerede işe yarar?

Günlük kullandığınız yapay zeka özelliklerinin neredeyse tamamı inference üzerine kuruludur. Metin üretimi, çeviri, görsel sınıflandırma, ses yazıya çevirme ve öneri sistemleri bunların başında gelir. Eğitim arka planda bir kez gerçekleşir, kullanıcı ise yalnızca çıkarımı görür.

Şimdi bir örnek senaryo kuralım. Bir mobilya mağazası, ürün sayfasına bir soru-cevap asistanı ekliyor. Müşteri "bu koltuk balkonda durur mu?" diye sorduğunda sistem soruyu modele gönderir. Model ürün bilgisini okur ve birkaç saniye içinde cevap üretir.

  • Müşteri sorusuna anlık cevap üreten sohbet asistanı.
  • Gelen e-postaları konuya göre etiketleyen sınıflandırma hattı.
  • Toplantı kaydını yazıya döken ses modeli.
  • Ürün görselindeki nesneyi tanıyan görüntü modeli.
  • Her ziyaretçiye farklı ürün sıralayan öneri sistemi.

Aynı mağaza ikinci bir iş için toplu inference de kullanabilir. Örneğin yüzlerce ürün fotoğrafını gece boyunca etiketletir, sabah hazır listeyi alır. Burada kimse cevabı beklemediği için süre değil birim maliyet önemlidir. Bu örnek senaryo, aynı modelin iki farklı çalışma biçimini gösterir.

Bu senaryoda mağazanın hiçbir eğitim yapmadığına dikkat edin. İşletme yalnızca inference tüketir. Bu yüzden doğru soru, "modeli nasıl eğitirim?" değil, "çıkarımı hangi koşulda, hangi maliyetle çalıştırırım?" sorusudur.

Inference hızını ve maliyetini hangi optimizasyon yolları iyileştirir?

Optimizasyonun amacı aynı kaliteyi daha az bellek, daha az süre ya da daha az para ile elde etmektir. Her yöntemin bir bedeli vardır; bu yüzden değişikliği kendi veriniz üzerinde ölçmeden canlıya almamalısınız.

  • Kuantizasyon: model sayılarını daha düşük hassasiyetle saklayarak bellek ihtiyacını azaltır. Ayrıntıyı kuantizasyon nedir yazımızda bulabilirsiniz.
  • Önbellek: tekrar eden istem başlangıçlarını yeniden işlemekten kurtarır. Konuyu prompt caching yazımızda ele aldık.
  • Sürekli (continuous) batching: biten istekleri hemen kuyruktan çıkarıp yenilerini araya alır, böylece donanım boşta kalmaz.
  • Daha kısa istem ve çıktı: gereksiz bağlamı kırpmak hem süreyi hem gideri azaltır.
  • Daha küçük model seçimi: basit işler için büyük model yerine yeterli küçük model kullanmak kaynak kazandırır.
  • Akış (streaming): toplam süreyi değiştirmez ama kullanıcının beklediği hissini azaltır.

Küçük model seçimi ayrıca yönlendirme (routing) fikrini doğurur. Basit sorular küçük modele, zor sorular büyük modele gider. Böylece kaliteyi korurken ortalama gideri düşürebilirsiniz. Ancak yönlendirme kuralını da test etmeniz gerekir.

Ancak her optimizasyon her işte uygun değildir. Örneğin kuantizasyon bazı görevlerde kaliteyi hafifçe etkileyebilir. Bu nedenle önce hedef metriğinizi belirleyin, sonra değişikliği küçük bir test kümesinde deneyin.

Hangi donanım ve kavramlar inference performansını belirler?

Inference hızını üç şey birlikte belirler: modelin büyüklüğü, donanımın hesaplama gücü ve belleğin veriyi taşıma hızı. Büyük bir modelin ağırlıkları belleğe sığmazsa sistem ya yavaşlar ya da hiç çalışmaz.

GPU, yani grafik işlemci, paralel hesaplamada güçlü olduğu için çıkarımda yaygın seçimdir. Ancak küçük modeller sıradan işlemcide ya da telefondaki özel çiplerde de çalışabilir. Seçim, hedef gecikmeye ve bütçeye bağlıdır.

Bir de bellek tarafı vardır. Model her yeni parçayı üretirken önceki durumlara baktığı bir önbellek (KV cache) tutar. Bu önbellek uzun konuşmalarda büyür ve bellek tüketir. Bu yüzden uzun bağlam, hem süreyi hem kapasiteyi etkiler; bağlam penceresi yazımız bu noktayı tamamlıyor.

Inference ile sık karıştırılan terimler nelerdir?

Yapay zeka sözlüğünde birbirine yakın birçok kavram var. Aşağıdaki tablo, inference ile karıştırılan terimleri tek bakışta ayırır. Her terimi burada kısa tutuyoruz; ayrıntı için ilgili yazılarımıza bakabilirsiniz.

TerimNe anlama gelir?Inference ile ilişkisi
Eğitim (training)Modelin veriden öğrenip ağırlıklarını güncellemesiInference öncesindeki evredir
İnce ayar (fine-tuning)Hazır modeli küçük bir veriyle uzmanlaştırmakYine bir eğitim işidir, çıkarım değildir
KuantizasyonModel sayılarını daha düşük hassasiyetle saklamakÇıkarımı hafifletmek için işe yarar
Prompt cachingTekrar eden istem başlangıcını yeniden işlememekÇıkarım maliyetini düşüren bir yöntemdir
RAGCevaptan önce ilgili belgeleri bulup modele vermekÇıkarım sırasında bağlam ekler
EmbeddingMetni sayısal vektöre dönüştürmekKendisi de bir çıkarım çağrısıdır
Serving (model sunumu)Modeli bir hizmet olarak erişilebilir kılmakInference isteklerini karşılayan altyapıdır

Bu tablodaki RAG için RAG nedir yazımıza göz atabilirsiniz.

Türkçede "çıkarım" kelimesi neden kafa karıştırır?

Türkçede çıkarım kelimesi mantıkta bir öncülden sonuca varmayı da anlatır. Yapay zekada ise inference karşılığı olarak, eğitimi biten modelin yanıt üretmesini anlatır. İki anlam birbirine yakındır ama aynı değildir.

Bir de "tahmin" kelimesi var. Klasik makine öğrenmesinde model çıktısına tahmin (prediction) denir. Üretken yapay zekada çıktı bir metin ya da görsel olduğundan çoğu kişi çıkarım terimini tercih eder. Pratikte ikisi aynı mekanizmayı anlatır.

Biz yazılarımızda iki ifadeyi birlikte kullanıyoruz. Ancak başka kaynaklarda aynı kavramın "çıkarsama" ya da "çıkarım" diye geçtiğini görebilirsiniz. Ana fikir değişmez: eğitim bitti, model artık cevap veriyor.

Inference nedir sorusunun sınırları ve riskleri nelerdir?

Inference güçlü bir araçtır, ancak kendi sınırları vardır. Bu sınırları bilmek, ürününüzü gerçekçi tasarlamanıza yardım eder.

  • Hatalı cevap riski: model akıcı ama yanlış bir cevap üretebilir; buna halüsinasyon denir.
  • Gecikme dalgalanması: yoğun saatlerde cevap süresi değişebilir.
  • Beklenmedik maliyet: kontrolsüz kullanım ya da döngüye giren bir otomasyon faturayı hızla büyütebilir.
  • Veri gizliliği: bulut kullanımında hangi verinin sağlayıcıya gittiğini bilmelisiniz.
  • Sağlayıcı bağımlılığı: tek bir sağlayıcıya sıkı bağlanmak ileride geçişi zorlaştırır.
  • Tutarsızlık: aynı soruya her seferinde birebir aynı cevabın gelmesi garanti değildir.

Halüsinasyon, modelin gerçeğe dayanmayan ama ikna edici bir cevap üretmesidir. Çıkarım aşamasında ortaya çıkar, çünkü model örüntüye dayanarak en olası devamı yazar. Ayrıntıyı ayrı bir yazıda ele almak gerekir; burada yalnızca bu riskin inference ile doğrudan bağlantılı olduğunu not edin.

Bu riskler engel değil, tasarım girdisidir. Örneğin hatalı cevap riskini kaynak gösterme ve insan onayıyla azaltırsınız. Maliyet riskini ise kullanım üst sınırları ve uyarılarla sınırlarsınız. Kişisel veri içeren işlerde hukuki danışmanlık almanız gerekir; bu yazı hukuki danışmanlık değildir.

Inference konusunda en sık yapılan hatalar nelerdir?

Ekiplerin çoğu aynı birkaç noktada tökezliyor. Bu hataları önceden bilmek, hem bütçeyi hem zamanı korur.

  • Eğitim ile inference arasındaki farkı karıştırıp model "öğrensin" diye her konuşmayı eğitim sanmak.
  • Yalnızca ortalama süreye bakıp en yavaş kullanıcıları görmemek.
  • Çıktı uzunluğuna sınır koymadan uzun cevapların faturasını büyütmek.
  • Her işte en büyük modeli seçmek, oysa basit işte küçük model yeterli olabilir.
  • Tekrar eden istem başlangıcını her seferinde baştan işletmek.
  • Test etmeden kuantizasyon ya da sıkıştırma uygulayıp kaliteyi kontrol etmemek.

Bu hataların ortak noktası ölçüm eksikliğidir. Neyi ölçtüğünüzü bilirseniz neyi düzelteceğinizi de bilirsiniz. Ayrıca küçük bir deneme çoğu zaman pahalı bir yanlış yatırımı önler.

İşletme için inference kontrol listesi neleri içermelidir?

Bir yapay zeka özelliğini canlıya almadan önce aşağıdaki soruları yanıtlayın. Liste kısa ama karar vermenizi kolaylaştırır.

  1. Bu özellik gerçek zamanlı mı çalışmalı, yoksa toplu işlenebilir mi?
  2. Kullanıcı ilk cevabı en fazla ne kadar bekleyebilir?
  3. Aylık kaç istek bekliyoruz ve bu sayı büyürse gider nasıl değişir?
  4. Hangi veri modele gidiyor ve bu veriyi sağlayıcıyla paylaşmamız uygun mu?
  5. Hata ve yavaşlama durumunda kullanıcıya ne göstereceğiz?
  6. Basit işler için daha küçük ya da daha ucuz bir model yeterli mi?
  7. Kullanımı izleyen bir üst sınır ve uyarı mekanizmamız var mı?

Bu soruların cevapları, hangi dağıtım seçeneğinin size uyduğunu da gösterir. Yani seçimi modelin ünü değil, kendi gereksinimleriniz belirlemelidir.

Geliştirici için inference kontrol listesi neleri içermelidir?

Geliştirici tarafında odak, çıkarımı ölçülebilir ve yönetilebilir hâle getirmektir. Aşağıdaki maddeler çoğu projede işe yarar.

  • İstemi sabit başlangıç ve değişken son ek olarak ayırın; böylece önbellekten yararlanırsınız.
  • Çıktı uzunluğuna açık bir üst sınır koyun.
  • Akışı (streaming) etkileşimli ekranlarda açın.
  • Zaman aşımı, yeniden deneme ve yedek yol tanımlayın.
  • Her istek için girdi ve çıktı miktarını kaydedin.
  • Aynı istemle farklı model seçeneklerini küçük bir test kümesinde karşılaştırın.
  • Düzenli bir JSON çıktısı gerekiyorsa structured output yazımızdaki yaklaşımı değerlendirin.

Böylece çıkarım davranışını tahmin etmek yerine veriyle izlersiniz. Bu alışkanlık, hem maliyeti hem kaliteyi yönetmenin en sağlam yoludur.

Inference performansını ve maliyetini nasıl ölçersiniz?

Ölçmediğiniz şeyi iyileştiremezsiniz. İlk adım, birkaç temel metriği düzenli kaydetmektir. Bunlar için karmaşık bir araç şart değildir; basit bir kayıt tablosu bile başlangıç için yeterlidir.

  • İlk yanıt süresi: isteğin gönderilmesinden ilk çıktı parçasına kadar geçen süre.
  • Toplam yanıt süresi: cevabın tamamlanmasına kadar geçen süre.
  • İstek başına girdi ve çıktı miktarı: maliyetin ana sürücüsü.
  • Hata ve zaman aşımı oranı: kullanıcı deneyiminin kırılma noktası.
  • Eşzamanlı istek sayısı: kapasite planının temeli.

Bu metrikleri yoğun ve sakin saatlerde ayrı ayrı izleyin. Çünkü ortalama değer, en kötü kullanıcı deneyimini gizleyebilir. Hedeflerinizi kendi ürününüze göre yazın; evrensel bir "doğru değer" yoktur.

Ekibimiz inference konusunda işletmelere nasıl yardımcı olur?

Talha Aslan ve ekibi olarak yapay zekayı süs olarak değil, iş akışının parçası olarak ele alıyoruz. Önce gereksinimi netleştirir, ardından bulut API, yerel kurulum ya da karma yapı arasında sade bir karşılaştırma çıkarırız.

Bu çalışmalarda yapay zeka ve otomasyon hizmetlerimiz kapsamında entegrasyon, maliyet izleme ve kontrol listesi hazırlığı yaparız. Verinin kendi ortamınızda kalması gerekiyorsa yerel LLM kurulumu seçeneğini birlikte değerlendiririz.

Örneğin önce küçük bir pilot kurar, gecikmeyi ve istek başına girdi miktarını birkaç hafta izler, sonra büyütme kararını birlikte veririz. Bu yaklaşım sürpriz faturaları ve gereksiz yatırımı azaltır.

Hiçbir sonucu garanti etmiyoruz; yalnızca ölçülebilir hedef koyup adım adım ilerliyoruz. Kullandığınız modelin kapsamı ve fiyatı sağlayıcıya göre değiştiği için güncel koşulları resmi belgelerden doğrulamanızı öneririz.

Inference nedir sorusunun kısa özeti nedir?

Inference nedir diye sorarsanız cevap basit: eğitimi biten modelin yeni girdiye yanıt üretmesi. Eğitim bir kez ve büyük emekle biter, inference ise ürün yaşadığı sürece her istekte çalışır.

  • Gecikme tek kullanıcının, verim ise toplam sistemin deneyimini anlatır.
  • Maliyet çoğunlukla girdi, çıktı ve istek sayısıyla büyür.
  • Bulut API, kendi sunucu ve cihaz üstü seçeneklerin her biri farklı bir denge sunar.
  • Kuantizasyon, önbellek ve toplu işleme gibi yöntemler çıkarımı hafifletir.

Rakamlar ve model özellikleri hızla değiştiği için karar vermeden önce sağlayıcının resmi belgesini kontrol edin. Ayrıca Hugging Face Text Generation Inference belgelerini bir başlangıç noktası olarak inceleyebilirsiniz.

Sıkça Sorulan Sorular

Inference ile eğitim arasındaki en büyük fark nedir?
En büyük fark ağırlıkların değişip değişmemesidir. Eğitimde model veriden öğrenir ve iç ayarlarını günceller. Inference sırasında ağırlıklar sabit kalır ve model yalnızca yeni girdiye cevap verir. Eğitim seyrek ve büyük bir yatırımdır, inference ise ürün kullanıldıkça her istekte çalışan sürekli bir iştir.
Inference her zaman GPU gerektirir mi?
Hayır, her zaman gerektirmez. Büyük modeller genellikle GPU gibi hızlandırıcılarda rahat çalışır, ancak küçük ya da sıkıştırılmış modeller sıradan işlemcide veya cihazdaki özel çiplerde de koşabilir. Seçim hedef gecikmeye, model boyutuna ve bütçeye bağlıdır. Bulut API kullanırsanız donanımı sağlayıcı yönetir.
Gecikme ile verim aynı şey midir?
Hayır, aynı şey değildir. Gecikme tek bir isteğin cevaba ulaşma süresidir. Verim ise sistemin belirli sürede toplam ne kadar iş bitirdiğidir. İkisi çoğu zaman birbirine ters çeker; çok isteği paketlemek verimi artırır ama tek bir kullanıcının bekleme süresini uzatabilir. Bu yüzden ürününüzün önceliğine göre denge kurmanız gerekir.
Inference maliyeti neye göre değişir?
Maliyet, girdi ve çıktı uzunluğuna, model büyüklüğüne, istek sayısına ve eşzamanlı talebe göre değişir. Bulutta çoğunlukla kullandığınız miktar kadar ödersiniz. Kendi sunucunuzda donanım, enerji ve işletme emeği eklenir. Güncel birim fiyatlar için sağlayıcının resmi sayfasına bakmalısınız, çünkü bu değerler zamanla ve modele göre değişir.
Toplu inference ne zaman mantıklıdır?
Cevabı bekleyen bir kullanıcı yoksa toplu inference mantıklıdır. Örneğin arşivdeki yüzlerce kaydı etiketlemek ya da ürün açıklamalarını gece topluca üretmek buna uyar. Acele etmediğiniz için verimi ve birim maliyeti öne çıkarabilirsiniz. Gerçek zamanlı sohbet gibi işlerde ise toplu yöntem uygun olmaz, çünkü kullanıcı hemen yanıt bekler.
Inference hızını artırmak için ilk ne yapmalıyım?
Önce ölçün, sonra en kolay kazançtan başlayın. İstemi kısaltmak, çıktı uzunluğuna üst sınır koymak ve tekrar eden başlangıcı önbelleğe almak genellikle ilk adımlardır. Ardından daha küçük model denemek ya da kuantizasyon gibi yöntemlere geçebilirsiniz. Her değişikliği kendi test verinizle karşılaştırın ve kaliteyi mutlaka kontrol edin.
  • inference nedir
  • yapay zeka çıkarım
  • model çıkarımı
  • gecikme ve verim
  • eğitim ve inference farkı
  • batch inference
  • yapay zeka maliyeti
Paylaş:
Talha Aslan

Google Partner dijital pazarlama uzmanı. 2012’den beri SEO, Google Ads, web tasarım ve e-ticaret projelerinde sahada; bu blogda gördüğünüz her yazı o deneyimden çıkar.

Sıradaki proje

Projenizi konuşalım.

Talebiniz doğrudan Talha Aslan ve ekibine ulaşır: stratejiyi Talha kurar, uygulamayı deneyimli ekip yürütür. İlk istişare ücretsizdir; hedefinizi dinler, net bir yol haritasıyla döneriz.