Yapay Zeka

Model Distilasyonu (Bilgi Damıtma) Nedir? Küçük Model Büyük Modelden Nasıl Öğrenir?

Talha Aslan 15 dakikalık okuma 2 görüntülenme

Model distilasyonu nedir?

Model distilasyonu (bilgi damıtma), büyük ve başarılı bir yapay zeka modelinin (öğretmen) davranışını daha küçük bir modele (öğrenci) öğretme yöntemidir. Öğrenci model yalnızca doğru cevabı değil, öğretmenin olasılık tahminlerini de taklit eder. Böylece daha az kaynakla öğretmene yakın sonuç verir.

Basit bir benzetme düşünün. Usta bir şef tarifi tek tek yazmaz, çırağıyla yan yana çalışır. Böylece el hareketini, tadı ve zamanlamayı aktarır. Çırak ustanın bütün tecrübesine sahip olmaz. Ancak dar bir menüyü çok daha hızlı ve ucuz pişirir.

Bu yazı tek bir terimi anlatıyor. Ancak komşu kavramlara yalnızca karşılaştırma tablosunda ve kısa bağlamda değiniyoruz, çünkü onlar için ayrı yazılarımız var ve gerekli yerlerde bağlantı veriyoruz.

Terimin Türkçe karşılığı olarak "bilgi damıtma" ve "distilasyon" birlikte kullanılır. İngilizcesi knowledge distillation'dır. Kimyadaki damıtma gibi, karışımın özünü ayırıp daha yoğun ve taşınabilir bir forma getirmeyi anlatır. Burada karışım büyük modelin bilgisi, öz ise küçük modele geçen davranıştır.

Öğretmen ve öğrenci benzetmesi neyi anlatır?

Benzetmeyi biraz açalım. Öğretmen model büyüktür, pahalıdır ve yavaştır. Milyarlarca parametresi olabilir; ancak bu sayıyı kavram olarak bırakıyoruz, çünkü güncel değerleri sağlayıcının resmi belgesinden kontrol etmeniz gerekir. Öğrenci model ise aynı işi çok daha az hesapla yapmak zorundadır.

Sınıf ortamında iyi bir öğretmen yalnızca "cevap B" demez. "Bence B, ama C de makul, A kesinlikle değil" der. Öğrencinin asıl kazandığı şey bu ince bilgidir.

Benzetmenin sınırı da var. Öğrenci, öğretmenin hiç görmediği bir konuyu kendi başına kavrayamaz. Öğretmenin yanlışlarını ise kolayca devralır. Yani damıtma sihirli bir sıkıştırma değil, bilinçli bir bilgi aktarımıdır.

Bir örnek verelim. Öğretmen, binlerce konuda sohbet edebilen genel bir modeldir. Öğrenci ise yalnızca fatura sorularına cevap verecek şekilde eğitilir. Bu dar alanda öğrenci öğretmene yaklaşabilir. Alan dışı bir soruda ise öğretmenin gerisinde kalması doğaldır.

Hinton ve arkadaşlarının makalesi ne söylüyor?

Fikrin bilinen kaynağı, Geoffrey Hinton, Oriol Vinyals ve Jeff Dean'in "Distilling the Knowledge in a Neural Network" başlıklı makalesidir. Makale, birden çok modelden oluşan bir topluluğun (ensemble) tahminlerini almanın hantal ve pahalı olduğunu söyler. Çözüm olarak bu topluluğun bilgisini tek bir modele sıkıştırmayı önerir.

Özetin üç ana fikri vardır:

  • Öğrenci, sert etiketlerin yanında öğretmenin yumuşak olasılıklarından da ders alır.
  • Sıcaklık adlı bir parametre, yumuşatmanın düzeyini belirler.
  • Genel modellerin karıştırdığı ince sınıfları ayırt eden uzman modeller de eğitilebilir.

Yani model distilasyonu nedir sorusunun akademik cevabı bu makalede yatar. Makalenin tam metnini arXiv sayfasında okuyabilirsiniz. Biz burada yalnızca kavramı aktarıyoruz ve deney sonuçlarındaki rakamları kopyalamıyoruz.

Üstelik aynı mantık sonradan dil modellerine de uyarlandı. Hugging Face ekibi, BERT adlı dil modelinin damıtılmış bir sürümünü DistilBERT makalesiyle paylaştı. Makale, damıtmanın yalnızca sınıflandırmada değil, dil anlama modellerinde de işe yaradığını gösteren bilinen bir örnektir. Ayrıntılı sonuçlar için kaynağı kendiniz okuyun.

Bilgi damıtma nasıl çalışır?

Süreç kavramsal olarak dört adımdan oluşur. Her adımı basit tutuyoruz, çünkü ayrıntı çerçeveden çerçeveye değişir.

  1. Önce güçlü bir öğretmen model seçer ya da eğitirsiniz.
  2. Ardından öğretmene çok sayıda örnek girdi gösterir ve çıktılarını kaydedersiniz.
  3. Sonra küçük öğrenci modeli, hem gerçek etiketleri hem de öğretmenin çıktılarını taklit edecek şekilde eğitirsiniz.
  4. Son olarak öğrenciyi gerçek görev verisinde sınar ve öğretmenle karşılaştırırsınız.

Kritik fikir şudur: öğrencinin hedefi yalnızca "doğru sınıf" değildir. Öğretmenin bütün olasılık dağılımını yakalamaya çalışır. Dolayısıyla öğrenci, tek bir cevaptan çok daha fazla sinyalle ders alır.

Eğitim kaybı çoğu zaman iki parçadan oluşur. Birincisi gerçek etiketle uyumu ölçer. İkincisi öğretmenle uyumu ölçer. İki parçanın ağırlığını ekibiniz ayarlar ve bu ayar görevden göreve değişir.

Burada "transfer seti" kavramı önemlidir. Öğrenciye göstereceğiniz örnekler, gerçek kullanımı iyi temsil etmelidir. Örnekler dar ya da yanlı olursa öğrenci yalnızca o dar dünyayı öğrenir. Bu yüzden örnek havuzunu hazırlarken gerçek girdilerden yola çıkın ve nadir durumları da ekleyin.

Yumuşak etiket nedir ve neden sert etiketten daha çok bilgi taşır?

Sert etiket, bir örneğin tek doğru sınıfını söyler. Örneğin bir fotoğraf için "kedi" demek sert etikettir. Yumuşak etiket ise modelin her sınıfa verdiği olasılıktır: kedi için yüksek, köpek için orta, kamyon için çok düşük gibi.

Yumuşak etiket neden değerlidir? Çünkü sınıflar arasındaki benzerliği gösterir. Öğretmen "bu kedi, biraz da köpeğe benziyor" dediğinde, öğrenci hayvanların birbirine yakınlığını da kavrar. Sert etiket bu bilgiyi tamamen siler.

Pratikte bunun üç faydası vardır:

  • Öğrenci daha az örnekle daha iyi genelleme yapar.
  • Öğrenci, öğretmenin kararsız kaldığı sınır durumlarını da tanır.
  • Eğitim sinyali zenginleştiği için küçük model daha kararlı ders alır.

Literatür yumuşak etiketleri bir tür "karanlık bilgi" taşıyıcısı olarak tanımlar. Terim mecazidir; gizemli bir şey yoktur, yalnızca olasılıkların ince farkları vardır.

Küçük bir örnek hesapla gösterelim. Öğretmen bir fotoğraf için kediye 0,90, köpeğe 0,09, kamyona 0,01 olasılık versin. Sert etiket yalnızca "kedi" der. Yumuşak etiket ise kedinin köpeğe kamyondan çok daha yakın olduğunu da söyler. Bu rakamlar yalnızca kavramı göstermek içindir, gerçek bir ölçüm değildir.

Sıcaklık (temperature) damıtmada ne işe yarar?

Sıcaklık, olasılık dağılımının ne kadar keskin ya da yumuşak olacağını ayarlayan bir parametredir. Düşük sıcaklıkta model neredeyse tek seçeneğe yönelir. Yüksek sıcaklıkta ise olasılıklar birbirine yaklaşır ve ikinci, üçüncü seçeneklerin sinyali ortaya çıkar.

Hinton ve arkadaşlarının yaklaşımı, bu yumuşatmayı eğitim sırasında kullanır. Böylece öğrenci, öğretmenin zayıf ama anlamlı tahminlerini de duyar. Eğitim bittikten sonra sıcaklık normale döner.

Üretimde metin üreten bir modelde ayarladığınız `temperature` değeri ise farklı bir amaca hizmet eder: çıktıdaki çeşitliliği belirler. İkisi aynı matematiksel fikre dayanır, fakat işlevleri farklıdır. Üretim tarafındaki ayarı temperature ve top-p yazımızda ayrıca anlattık.

Bunu şöyle düşünün: sert bir fotoğrafta yalnızca en parlak noktayı görürsünüz. Yumuşatılmış fotoğrafta ise gölgedeki ayrıntılar da belirir. Sıcaklık, bu gölgeleri aydınlatan bir ışık düğmesi gibi çalışır. Öğrenci gölgedeki ayrıntıları gördükçe öğretmenin düşünme biçimine daha çok yaklaşır.

Büyük dil modellerinde sentetik çıktıyla damıtmayı nasıl yaparsınız?

Büyük dil modellerinde durum biraz farklıdır. Çoğu zaman öğretmenin iç olasılıklarına erişemezsiniz, yalnızca metin çıktısını görürsünüz. Bu durumda yaygın yaklaşım şudur: öğretmene bir görev listesi verir ve cevapları toplarsınız. Sonra bu cevapları küçük modelin eğitim verisi yaparsınız.

Bu yöntemde öğrenci, öğretmenin yazdığı metni taklit eder. Yani yumuşak etiket yerine "sentetik çıktı" devreye girer. Sentetik verinin genel mantığını sentetik veri yazımızda ele aldık, burada tekrar etmiyoruz.

Bu yaklaşımın güçlü yanı kolaylığıdır. Zayıf yanı ise öğretmenin hatalarının, üslubunun ve önyargılarının öğrenciye geçmesidir. Ayrıca küçük model, öğretmenin cevap verdiği alanın dışına çıkınca hızla zayıflar.

Bu nedenle kalite için iyi bir pratik, öğretmen çıktılarını eğitime sokmadan önce filtrelemektir. Örneğin hatalı, çelişkili ya da gereksiz uzun cevapları eleyin.

Veri çeşitliliği burada belirleyicidir. Aynı türden yüz soru yerine farklı konulardan, farklı uzunlukta ve farklı zorlukta görevler hazırlayın. Tekrar eden örnekleri ayıklayın. Ayrıca öğretmenin reddettiği ya da cevaplayamadığı örnekleri de ayrı bir sınıf olarak ele alın, çünkü öğrenci bu sınırları da bilmelidir.

Damıtmanın başlıca çeşitleri nelerdir?

Damıtmayı, öğrencinin neyi taklit ettiğine göre üç gruba ayırabilirsiniz. Ayrım kavramsaldır; çerçeveler farklı adlar kullanabilir.

  • Yanıt tabanlı damıtma: Öğrenci, öğretmenin son çıktısını ya da olasılıklarını taklit eder. Hinton makalesindeki klasik yaklaşım budur.
  • Ara katman tabanlı damıtma: Öğrenci, öğretmenin iç katmanlarındaki temsilleri de yakalamaya çalışır. Bu yol öğretmenin iç yapısına erişim ister.
  • Dizi düzeyinde damıtma: Öğrenci, öğretmenin ürettiği tam cümleleri ya da cevapları örnek alır. Dil modellerinde sentetik çıktıyla eğitim bu gruba yakındır.

Hangisini seçeceğiniz, öğretmene ne kadar erişebildiğinize bağlıdır. Kapalı bir API'den yalnızca metin alıyorsanız ilk yol çoğunlukla kapalıdır. Açık ağırlıklı bir modelle çalışıyorsanız üç seçeneği de düşünebilirsiniz.

Ayrıca bu ayrım pratikte erişim izniyle de ilgilidir. Kendi ağırlıklarını sahiplendiğiniz bir modelden damıtmak, başkasının API çıktısından damıtmaktan teknik ve hukuki olarak farklıdır. Lisans konusuna aşağıda ayrı bir bölümde dönüyoruz.

Model distilasyonu nedir ve neden bu kadar yaygınlaştı?

Cevap maliyet, hız ve konumdur. Büyük modeller güçlüdür, ancak her istekte yüksek hesaplama ister. Trafik arttıkça fatura büyür ve yanıt süresi uzar. Bir büyük dil modelinin her küçük görevde çalışması çoğu zaman gereksizdir.

Damıtma bu dengeyi değiştirir. Dar bir görev için küçük bir model eğitirseniz şunları kazanırsınız:

  • Daha düşük gecikme: yanıt daha hızlı gelir.
  • Birim maliyet düşer: aynı donanımda daha çok isteği karşılarsınız.
  • Daha az bellek: telefon ya da tarayıcı gibi sınırlı cihazlarda çalışabilir.
  • Daha fazla kontrol: modeli kendi ortamınızda barındırabilirsiniz.

Sayısal karşılaştırma vermiyoruz. Kazanç görevden göreve değişir ve her projede yeniden ölçmeniz gerekir. Ayrıca token bazlı maliyet mantığını merak ediyorsanız token yazımıza göz atın.

Bir başka neden de ürün döngüsüdür. Ekipler önce büyük modelle hızlıca prototip kurar. Ardından kullanım netleşince en sık tekrarlanan görevleri küçük modellere taşır. Böylece pahalı model yalnızca gerçekten ihtiyaç duyulan zor işlerde çalışır.

Distilasyon hangi alanlarda işe yarar?

Kullanım alanları, "büyük model fazla ağır" dediğiniz her yerde ortaya çıkar. Birkaç tipik örnek verelim.

  • Cihaz üstü yapay zeka: Telefon klavyesindeki öneri, çevrimdışı çeviri ya da kulaklıktaki ses komutu gibi işler küçük modellere ihtiyaç duyar.
  • Gerçek zamanlı sistemler: Canlı sohbet, arama önerisi ve sesli asistan gibi senaryolarda gecikme kullanıcı deneyimini doğrudan etkiler.
  • Yüksek hacimli sınıflandırma: Destek taleplerini etiketlemek ya da yorumları ayrıştırmak gibi günde binlerce tekrarlı işte küçük model yeterli olabilir.
  • Yerel kurulumlar: Verisini dışarı çıkarmak istemeyen kurumlar için küçük modeller kendi sunucuda çalışır.

Akademik tarafta da örnekler var. Hugging Face ekibinin yayımladığı DistilBERT makalesi, damıtmanın dil modellerinde de işe yaradığını gösteren bilinen bir çalışmadır. Makalenin rakamlarını burada kopyalamıyoruz; güncel ve tam değerler için kaynağı okuyun.

Seçim yaparken şu soruyu sorun: bu görev her gün çok sık tekrarlanıyor mu ve cevap biçimi öngörülebilir mi? İki cevap da "evet" ise damıtma güçlü bir adaydır. Cevaplar her seferinde açık uçlu ve yaratıcıysa küçük model daha çabuk sınıra dayanır.

Bir işletme senaryosunda model distilasyonu nedir ve nasıl işler?

Aşağıdaki bir örnek senaryodur, gerçek bir müşteri sonucu değildir. Bir e-ticaret şirketi düşünün. Müşteri mesajlarını "kargo", "iade", "ürün sorusu" ve "şikayet" başlıklarına ayırmak istiyor.

İlk aşamada şirket, büyük bir modeli bu işte kullanır. Sonuçlar iyidir, ancak her mesaj için ödeme yapmak ve bekleme süresine katlanmak gerekir. Mesaj hacmi arttıkça maliyet de artar.

Bu noktada ekip şöyle ilerleyebilir:

  1. Gerçek mesajlardan kişisel bilgileri temizlediği bir örnek havuzu hazırlar.
  2. Büyük modelin bu örnekler için verdiği etiketleri toplar.
  3. İnsan gözüyle bir kısmını kontrol eder ve hatalı etiketleri düzeltir.
  4. Küçük bir modeli bu etiketlerle eğitir.
  5. Küçük modeli ayrı tuttuğu bir test setinde büyük modelle kıyaslar.

Sonuç yeterliyse günlük yük küçük modele geçer. Belirsiz mesajlar ise büyük modele ya da bir insana gider. Böylece kalite ve maliyet dengede kalır. Bu tür kurulumlar için yapay zeka danışmanlığı sayfamızdan bilgi alabilirsiniz.

Dağıtımdan sonra iş bitmez. Gelen mesajların dağılımı değiştikçe, örneğin yeni bir kampanya yeni sorular getirdikçe, küçük modelin güvenini izlemeniz gerekir. Güveni düşük cevapları büyük modele yönlendirmek iyi bir emniyet supabıdır. Bu kayıtlar ise bir sonraki eğitim turu için değerli bir veri havuzu olur.

Distilasyon, kuantizasyon ve budama arasındaki fark nedir?

Üç yöntem de modeli hafifletir, fakat farklı yollardan. Karıştırılmaları çok yaygındır. Kuantizasyon, modelin sayılarını daha az bitle saklamak demektir. Budama ise işe yaramayan bağlantıları silmektir. Aşağıdaki tablo farkı özetler.

YöntemNe yapar?Model mimarisiEk eğitim gerekir mi?Tipik risk
DistilasyonKüçük bir öğrenciyi büyük öğretmenin çıktılarıyla eğitirYeni, daha küçük bir modelEvet, tam bir eğitim süreciÖğretmenin hatalarını devralır
KuantizasyonSayıların hassasiyetini düşürürAynı model, daha az bitGenellikle hayır ya da çok azHassas görevlerde kalite kaybı
BudamaÖnemsiz bağlantıları ya da nöronları silerAynı model, seyrek yapıÇoğunlukla ince ayar gerekirAşırı budamada ani kalite düşüşü
İnce ayarMevcut modeli yeni göreve uyarlarAynı boyutEvet, ama daha hafifEski bilgiyi unutabilir

Bu yöntemleri birlikte de kullanabilirsiniz. Örneğin önce damıtır, sonra kuantize edersiniz. Böylece hem boyut hem hız kazancı katlanabilir.

Seçim için kaba bir kural: hazır bir modeli hızlıca küçültmek istiyorsanız kuantizasyon en az emek ister. Gereksiz bağlantıların çok olduğunu biliyorsanız budama mantıklıdır. Dar bir görevde en küçük ve en hızlı modeli hedefliyorsanız damıtma öne çıkar. Rakamsal kazanç görevden göreve değiştiği için her seçeneği kendi verinizde deneyin.

Distilasyon ile ince ayar (fine-tuning) aynı şey midir?

Hayır, ama komşudurlar. İnce ayar, var olan bir modeli sizin verinize uyarlar. Model boyutu değişmez. Distilasyon ise farklı, genellikle daha küçük bir modeli eğitir ve öğretmeni hedef olarak kullanır.

Pratikte iki yöntem sık birleşir. Örneğin önce büyük modeli ince ayarla alanınıza uydurur, sonra bu uzman modeli öğretmen yapıp küçük bir öğrenci damıtırsınız. İnce ayarın temellerini fine-tuning ve LoRA yazımızda bulabilirsiniz.

Karar vermek için basit bir soru işe yarar: sorun "model yanlış biliyor" mu, yoksa "model çok ağır" mı? İlk durumda ince ayar, ikinci durumda damıtma daha mantıklıdır. Bilgi eksikliği içinse çoğu zaman RAG yeterli olur.

İnce ayarla damıtma arasındaki bir başka fark, hedef sinyaldir. İnce ayarda hedef çoğunlukla insan etiketidir. Damıtmada hedef, öğretmenin çıktısıdır. Bu nedenle damıtma, etiketli veriniz azken bile işe yarayabilir. Yeter ki öğretmenin kalitesine güvenebilin.

Hangi yöntemi hangi sırayla denemelisiniz?

Çoğu proje için en ucuz yoldan başlamak mantıklıdır. Aşağıdaki sıra, saha tecrübesine dayanan genel bir yaklaşımdır ve her görevde birebir geçerli olmayabilir.

  1. Önce istemi iyileştirin ve birkaç örnek ekleyin.
  2. Bilgi eksikse şirket belgelerini modele bağlayan RAG kurun.
  3. Davranış ya da üslup sorunu varsa ince ayar düşünün.
  4. Maliyet ya da gecikme sorunu kalırsa damıtmayı değerlendirin.
  5. Son olarak kuantizasyonla boyutu ve hızı ayrıca iyileştirin.

Bu sıra bir kural değil, tasarruf önerisidir. Damıtma en çok emek isteyen adımlardan biridir. Bu yüzden sorunu gerçekten ölçmeden bu adıma geçmeyin.

Her adımda aynı test setiyle ölçün. Böylece hangi yöntemin gerçekten fark yarattığını görürsünüz. Çünkü ölçmeden yapılan her iyileştirme, sonradan açıklaması zor bir varsayıma dönüşür.

Distilasyonun avantajları nelerdir?

Avantajlar, doğru kullanım alanında belirgindir. Şöyle özetleyebiliriz:

  • Hız: Küçük model daha kısa sürede cevap üretir.
  • Maliyet: Aynı iş için daha az hesaplama gerekir.
  • Taşınabilirlik: Model uç cihazlara ve yerel sunuculara sığabilir.
  • Gizlilik: Veriyi dışarı göndermeden işleyebilirsiniz.
  • Öngörülebilirlik: Dar bir görev için eğitilen model, genel amaçlı modelden daha tutarlı davranabilir.

Ayrıca model distilasyonu nedir sorusuna ürün gözüyle bakarsanız, cevap bir olgunlaşma aracıdır. Damıtma, bir ürünün olgunlaşmasına yardımcı olur. Prototipi büyük modelle kurar, trafiği ve ihtiyaçları gördükten sonra küçük modele geçersiniz. Yani önce doğru çalışan bir ürün, sonra ucuz çalışan bir ürün elde edersiniz.

Bir noktayı özellikle vurgulayalım: avantajların hiçbiri otomatik gelmez. Hepsi iyi bir öğretmene, temiz bir eğitim verisine ve sağlam bir testten geçmeye bağlıdır. Bu üçü eksikse küçük model, hızlı ama güvenilmez bir sistem olur.

Distilasyonun sınırları ve riskleri nelerdir?

Dürüst olmak gerekirse damıtma bedava bir öğle yemeği değildir. Başlıca sınırlar şunlardır:

  • Kapasite sınırı: Küçük model, büyük modelin bütün yeteneğini taşıyamaz. Genel bilgi ve karmaşık akıl yürütme ilk zayıflayan alanlardır.
  • Hata mirası: Öğretmen yanlış ya da önyargılıysa öğrenci de aynı hatayı tekrarlar.
  • Dağılım kayması: Eğitimde görmediği türde girdi gelince öğrenci beklenmedik davranabilir.
  • Bakım yükü: Öğretmen güncelleyince öğrenciyi yeniden eğitmeniz gerekebilir.
  • Ölçüm zorluğu: Ortalama skor iyi görünse bile nadir durumlarda ciddi hatalar saklanabilir.

Bu nedenle riskleri azaltmak için kapsamlı bir test seti hazırlayın. Ayrıca kritik kararlarda insan denetimini koruyun. Halüsinasyon konusu için yapay zeka halüsinasyonu yazımıza bakabilirsiniz.

Bir örnek senaryo ile somutlaştıralım. Fatura sorularına eğitilmiş bir öğrenciye bir gün iade sorusu gelir. Öğrenci bu alanı hiç görmediği için kendinden emin ama yanlış bir cevap üretebilir. Bu yüzden alan dışı girdileri tanıyan bir filtre ve insana yönlendirme yolu ekleyin.

Başka bir sağlayıcının çıktısıyla model eğitmek lisans açısından sorun olur mu?

Bu soru önemlidir, çünkü damıtma pratikte çoğu zaman bir sağlayıcının API çıktısına dayanır. Birçok sağlayıcı kullanım şartlarında, çıktılarını rakip bir model geliştirmek için kullanmayı sınırlayabilir. Şartlar sağlayıcıdan sağlayıcıya ve zamanla değişir.

Bu yüzden şu adımları izlemenizi öneririz:

  1. Kullandığınız sağlayıcının güncel kullanım şartlarını ve hizmet koşullarını okuyun.
  2. Çıktıları başka bir model eğitmek için kullanmanın serbest olup olmadığını netleştirin.
  3. Belirsiz kalan noktada sağlayıcıya yazılı olarak sorun.
  4. Açık lisanslı modellerde lisans metnini ayrıca okuyun, çünkü bazılarının kendi kısıtları vardır.
  5. Kararınızı ve gerekçenizi kayıt altına alın.

Şartları atlatmak için sahte hesap açmak ya da yöntemi gizlemek bir çözüm değildir. Bu tür girişimler sistemleri aşmak anlamına gelir ve hesabınızın kapanmasına yol açabilir. Bu bölüm hukuki danışmanlık değildir; kritik projelerde bir hukukçuya danışın.

Açık lisanslı modellerde de durum basit değildir. Bazı lisanslar ticari kullanımı, bazıları çıktıdan başka modeli eğitmeyi ayrıca düzenler. Lisans metnini her seferinde gözden geçirin ve sürüm değiştirdiğinizde yeniden kontrol edin.

Küçük model ne zaman iyi bir seçim olmaz?

Her proje damıtmaya uygun değildir. Aşağıdaki durumlarda büyük modelle devam etmek daha akıllıca olabilir.

  • Görev çok geniştir ve her türlü soruya cevap vermesi gerekir.
  • Trafik düşüktür, dolayısıyla maliyet kazancı eğitim emeğini karşılamaz.
  • Güvenebileceğiniz bir test seti yoktur.
  • Ekibinizde model eğitimini sürdürecek kimse yoktur.
  • Görevde hata payı çok düşüktür ve her sapma ciddi sonuç doğurur.

Bu durumlarda önce istem mühendisliği gibi daha hafif çözümleri deneyin. Çoğu zaman bilgi eksikliğini RAG, davranış eksikliğini ince ayar, maliyet ve hız sorununu ise damıtma çözer.

Bir ara yol da var: ağır işi büyük modele bırakıp yalnızca en sık tekrarlanan kolay kısmı küçük modele devredin. Bu karma yapı, her şeyi damıtma zorunluluğunu ortadan kaldırır. Üstelik riski de küçültür.

Distilasyon projesine başlamadan önce hangi kontrol listesini izlemelisiniz?

Aşağıdaki liste, yazılım ekipleri ve işletme sahipleri için pratik bir başlangıçtır.

  • Görevi tek cümleyle tanımladınız mı?
  • Büyük modelin bu görevde yeterince iyi çalıştığını ölçtünüz mü?
  • Mevcut maliyet ve gecikme sorununu somut olarak gördünüz mü?
  • Eğitim verisinde kişisel veri ya da gizli bilgi var mı, bunları temizlediniz mi?
  • Öğretmen sağlayıcının şartları çıktı kullanımına izin veriyor mu?
  • Ayrı bir test seti ve kabul eşiği belirlediniz mi?
  • Küçük model yetersiz kaldığında büyük modele ya da insana yönlendirme planınız var mı?
  • Modeli kimin, ne sıklıkla güncelleyeceğini yazdınız mı?

Dolayısıyla bu soruların çoğuna "evet" diyemiyorsanız, önce temel hazırlığı tamamlayın. Kurulum desteği gerekiyorsa yerel LLM kurulumu sayfamıza ve Ollama rehberimize bakabilirsiniz.

Listeyi bir proje belgesi gibi kullanın. Her soruya bir sahip atayın ve cevabı yazın. Cevabı olmayan soru, projenin en riskli noktasıdır.

Öğrenci modelin kalitesini nasıl ölçersiniz?

Ölçüm, damıtmanın en çok ihmal edilen adımıdır. Ortalama doğruluk tek başına yetmez. Üç düzeyde bakmanızı öneririz.

Birincisi, öğretmenle uyum: aynı girdilerde öğrenci öğretmenle ne kadar örtüşüyor? İkincisi, gerçek görev başarısı: insan etiketli bir test setinde sonuç ne? Üçüncüsü, zor durumlar: nadir, belirsiz ya da kenar vakalarda model nasıl tepki veriyor?

Ayrıca üretim ortamında canlı izleme kurun. Çünkü gerçek kullanıcı davranışı, test setinizin göstermediği sürprizler getirir. Kullanıcı şikayetlerini, insana yönlendirdiğiniz vakaların oranını ve gecikmeyi düzenli takip edin. Böylece kalite düşüşünü erken fark edersiniz.

Güncel kıyas yöntemleri hızla değiştiği için belirli bir skor ya da eşik yazmıyoruz. Kendi görevinize uygun eşiği ekibinizle belirleyin.

Bir ek ipucu: test setinize bilerek zor ve tuzaklı örnekler koyun. Öğrencinin kolay örneklerde öğretmenle aynı sonucu vermesi şaşırtıcı değildir. Asıl fark, sınırda kalan örneklerde ortaya çıkar. Bu nedenle ortalama skorun yanında hata türlerini de tek tek inceleyin.

Sık yapılan hatalar nelerdir?

Sahada en sık gördüğümüz hatalar şunlardır:

  • Öğretmen çıktısını hiç filtrelemeden eğitime sokmak.
  • Test setini eğitim verisiyle karıştırmak, böylece skoru şişirmek.
  • Küçük modelden büyük modelin yeteneğini beklemek.
  • Kullanım şartlarını okumadan çıktı toplamak.
  • Eğitimden sonra izleme kurmamak.

Her birinin çözümü basittir ama disiplin ister. Özellikle test setini en başta ayırmak ve dokunmamak, projenin en ucuz sigortasıdır.

Bir başka hata da sürüm yönetimini atlamaktır. Öğretmen modelin sağlayıcı tarafından değiştiği bir ortamda, eğittiğiniz öğrenci zamanla eskiyebilir. Hangi öğretmen sürümüyle, hangi veriyle eğittiğinizi kaydedin. Böylece sorun çıkınca nedeni hızla bulursunuz.

Sonuç: model distilasyonu nedir ve nereden başlamalısınız?

Model distilasyonu, büyük bir modelin bilgisini daha küçük bir modele aktaran, maliyeti ve gecikmeyi düşürmeyi hedefleyen bir yöntemdir. Yumuşak etiketler ya da sentetik çıktılar sayesinde öğrenci, öğretmenin davranışını dar bir görevde yakalar.

Özetle model distilasyonu nedir sorusunun pratik cevabı, daha küçük ve daha ucuz bir modelle aynı görevi yapmaktır. Başlamak için önce görevi ve mevcut maliyeti netleştirin. Ardından öğretmen sağlayıcının şartlarını okuyun, küçük bir pilot kurun ve sonucu ayrı bir test setiyle ölçün. Kuantizasyon ve budama ise bu yolun tamamlayıcılarıdır, alternatifi değil.

Talha Aslan ve ekibi olarak yapay zeka projelerinde önce ihtiyacı, sonra aracı seçmenizi öneriyoruz. Genel çerçeve için yapay zeka otomasyon hizmetlerimize göz atabilirsiniz.

Sıkça Sorulan Sorular

Model distilasyonu ile ince ayar aynı şey mi?
Hayır, aynı şey değildir. İnce ayar mevcut bir modeli kendi verinize uyarlar ve model boyutu genelde aynı kalır. Distilasyon ise büyük bir öğretmenin davranışını daha küçük bir öğrenci modele aktarır. Pratikte ikisini birleştirebilirsiniz: önce ince ayar yapar, sonra uzman modeli öğretmen olarak kullanıp küçük bir model damıtırsınız.
Damıtılmış model her zaman büyük modelden kötü mü olur?
Genel yetenekte genellikle geride kalır, ancak dar bir görevde öğretmene yakın sonuç verebilir. Bunun için görevin net tanımlanması ve iyi bir eğitim verisi gerekir. Karar vermeden önce kendi test setinizde ölçüm yapın, çünkü sonuç görevden göreve ve veriden veriye değişir. Kritik işlerde insan denetimini de koruyun.
Bir API sağlayıcısının çıktısıyla küçük model eğitebilir miyim?
Bu, sağlayıcının kullanım şartlarına bağlıdır. Birçok sağlayıcı, çıktıların rakip model geliştirmek için kullanımını sınırlayabilir. Güncel şartları okuyun, belirsiz noktada sağlayıcıya yazılı sorun ve kararınızı kayıt altına alın. Bu bilgi hukuki danışmanlık değildir, kritik projelerde bir hukukçuya başvurun ve şartları atlatmaya çalışmayın.
Distilasyon ile kuantizasyon arasındaki temel fark nedir?
Distilasyon yeni ve daha küçük bir modeli öğretmenin çıktılarıyla eğitir. Kuantizasyon ise aynı modelin sayılarını daha düşük hassasiyetle saklar ve mimariyi değiştirmez. Birincisi ek eğitim gerektirir, ikincisi çoğu zaman gerektirmez. İkisini birlikte kullanıp hem boyutu hem hızı iyileştirmek de mümkündür.
Küçük bir işletme model distilasyonu yapmalı mı?
Çoğu küçük işletme için ilk adım hazır bir küçük model ya da iyi yazılmış istemlerdir. Distilasyon, yüksek hacimli ve tekrarlı bir görevde maliyet ya da gecikme gerçek bir sorunsa anlamlı olur. Önce ihtiyacı ve mevcut maliyeti ölçün, sonra pilot bir denemeyle karar verin.
Yumuşak etiket ne demektir?
Yumuşak etiket, modelin her sınıfa verdiği olasılık değeridir. Tek bir doğru cevabı söyleyen sert etiketin aksine, sınıflar arasındaki benzerliği de gösterir. Öğrenci model bu ince bilgiyle eğitildiğinde daha az örnekle daha iyi genelleme yapabilir. Kavramı Hinton ve arkadaşlarının makalesinde ayrıntılı bulabilirsiniz.
  • model distilasyonu
  • bilgi damıtma
  • knowledge distillation
  • yapay zeka
  • küçük dil modeli
  • kuantizasyon
  • LLM
Paylaş:
Talha Aslan

Google Partner dijital pazarlama uzmanı. 2012’den beri SEO, Google Ads, web tasarım ve e-ticaret projelerinde sahada; bu blogda gördüğünüz her yazı o deneyimden çıkar.

Sıradaki proje

Projenizi konuşalım.

Talebiniz doğrudan Talha Aslan ve ekibine ulaşır: stratejiyi Talha kurar, uygulamayı deneyimli ekip yürütür. İlk istişare ücretsizdir; hedefinizi dinler, net bir yol haritasıyla döneriz.