Bilgisayarlı Görü (Computer Vision) Nedir? Makineler Görüntüyü Nasıl Anlar?

Bilgisayarlı görü nedir ve makineler görüntüyü nasıl anlar?
Bilgisayarlı görü (computer vision), bilgisayarların fotoğraf ve videolardaki pikselleri analiz ederek nesneleri, yazıları, yüzleri ve sahneleri tanımasını sağlayan yapay zeka alanıdır. Sistem görüntüyü sayılara dönüştürür, bu sayılarda örüntü arar ve "burada ne var, nerede duruyor, ne kadar eminim?" sorusuna yanıt üretir.
Bunu bir benzetmeyle düşünün: Yeni işe başlayan bir kalite kontrol çalışanına binlerce etiketli fotoğraf gösteriyorsunuz. Zamanla hatalı parçayı ezbere değil, ayırt edici ipuçlarıyla tanıyor. Bilgisayarlı görü modeli de aynı şekilde çalışır, ancak yorulmadan ve aynı ölçütle.
Alan, dijital pazarlamadan üretime kadar pek çok işletme sürecine dokunuyor. Örneğin ürün fotoğrafı yükleyen bir e-ticaret ekibi de, depoda koli sayan bir lojistik ekibi de aynı teknolojinin farklı yüzleriyle çalışıyor.
Bu yazıda terimi kavram olarak anlatıyoruz. Yani belirli bir ürünü, sürümü ya da skoru değil, mantığı ve işletmeniz için ne anlama geldiğini konuşuyoruz. Güncel model ve araç ayrıntıları için sağlayıcının resmi belgesine bakmanızı öneririz.
Bilgisayarlı görü insan görmesinden nasıl ayrışır?
İnsan beyni sahneyi bağlamıyla birlikte anlar. Bir mutfakta duran kupayı gördüğünüzde, onun ne işe yaradığını, sıcak olabileceğini ve masadan düşebileceğini de bilirsiniz. Bilgisayar ise ham veriyle başlar: her piksel için bir parlaklık ya da renk değeri.
Bu fark pratikte önemlidir. Model, eğitim verisinde hiç görmediği bir ışığa, açıya ya da arka plana çıkarsa şaşırabilir. Örneğin yalnızca gün ışığındaki ürün fotoğraflarına bakarak yetişen bir sistem, depo içindeki sarı lamba ışığında beklenenden kötü sonuç verebilir.
Öte yandan makine, insanın bıkacağı işte çok güçlüdür. Binlerce kareyi aynı dikkatle tarar, küçük bir çizik farkını her seferinde aynı ölçütle işaretler. Dolayısıyla en iyi sonuç çoğu zaman "makine ayıklasın, insan karar versin" düzeninden gelir.
Bilgisayarlı görü neden bu kadar yaygın kullanılıyor?
Üç gelişme bir araya geldi. Birincisi, kamera ve telefon sayesinde görüntü verisi çok bol. İkincisi, grafik işlemciler gibi donanımlar büyük ağları makul sürede eğitmeyi mümkün kıldı. Üçüncüsü, derin öğrenme yöntemleri el yapımı kurallara göre çok daha esnek sonuç verdi.
Sonuç olarak bilgisayarlı görü nedir sorusunun cevabı artık laboratuvarla sınırlı değil. Telefonunuzda yüz kilidi, fotoğraf galerisinde otomatik gruplama, ödeme uygulamasında kart okuma ve fabrikada kusur tarama aynı temel fikre dayanıyor.
Eskiden her görev için uzmanlar kuralları elle yazardı. Örneğin "kenar şu kadar keskinse çizik vardır" gibi eşikler tanımlardı. Ancak gerçek hayatta ışık, açı ve yüzey sürekli değiştiği için bu kurallar kırılgan kalıyordu. Öğrenen modeller ise örneklerden kendi ayırt edici ölçütlerini çıkarıyor.
Yine de her sorun için ağır bir model gerekmez. Sabit kamera, sabit ışık ve çok net bir ayrım varsa basit yöntemler de iş görür. Dürüst bir proje, ilk önce en basit işe yarayan çözümü dener.
Bilgisayarlı görü nedir sorusunda temel görevler hangileridir?
Alanın temelinde birkaç görev yatar. Çoğu gerçek proje bunların bir ya da ikisini birleştirir. Hangi görevi seçtiğiniz, hem veri hazırlığını hem de maliyeti belirler.
- Görüntü sınıflandırma: Tüm görüntüye tek bir etiket verir, örneğin "hasarlı" ya da "sağlam".
- Nesne tespiti: Görüntüdeki nesneleri bulur ve her birinin çevresine bir kutu çizer.
- Segmentasyon: Her pikseli bir sınıfa atar, yani nesnenin tam sınırını çıkarır.
- OCR (optik karakter tanıma): Görüntüdeki yazıyı makinenin okuyabileceği metne çevirir.
- Poz ve hareket analizi: Vücut ya da nesne konumunu kareler boyunca izler.
- Görüntü eşleştirme ve arama: Benzer görselleri bulur ya da iki görüntüyü karşılaştırır.
Sonraki iki bölümde en sık kullanılan dört görevi ayrıntılı anlatıyoruz.
Görüntü sınıflandırma ve nesne tespiti ne işe yarar?
Sınıflandırma en basit görevdir. Model fotoğrafın tamamına bakar ve "bu ürün hatalı mı" gibi tek bir soruya cevap verir. Kamera sabitse ve ürün hep aynı pozisyondaysa, çoğu zaman yeterli ve ucuz çözümdür.
Nesne tespiti ise bir adım ileri gider. Model hem "ne var" hem "nerede" sorusunu yanıtlar. Raftaki ürünleri saymak, bir kasadaki palet sayısını bulmak ya da bir görüntüde etiketin konumunu yakalamak bu gruba girer.
Burada sık yapılan hata, her projeye tespit modeli koymaktır. Oysa sayma ya da konum ihtiyacınız yoksa sınıflandırma daha az veri ve daha az emekle iş görür. Ayrıca tespit modellerinde her kutuya bir güven puanı gelir; bu puana bir eşik koyup eşiğin altındaki sonuçları insan kontrolüne yönlendirmek iyi bir alışkanlıktır.
Eşik değerini ezbere belirlemeyin. Kendi örnek görüntülerinizde yanlış alarm ile kaçırılan hata arasındaki dengeyi deneyerek bulun.
Segmentasyon ve OCR hangi sorunları çözer?
Segmentasyon, kutunun yetmediği durumlarda devreye girer. Yüzeydeki çatlağın tam şeklini, tarladaki hasta bitki alanını ya da ürünün arka plandan sınırını piksel düzeyinde belirler. Bu ayrıntı, alan ölçümü ya da arka plan temizleme gibi işler için gereklidir.
OCR ise görüntüyü metne dönüştürür. Fatura, kimlik, etiket, fiş ve sevk irsaliyesi gibi belgelerdeki yazıyı okur. Modern sistemler yalnızca harfleri değil, belgenin düzenini de anlamaya çalışır; bir değerin "toplam tutar" mı yoksa "tarih" mi olduğunu ayırt etmek bunun örneğidir.
Yine de OCR çıktısı kusursuz değildir. Bulanık çekim, el yazısı ya da eğri tarama oranı düşürür. Bu nedenle finansal ya da hukuki sonuç doğuran alanları, otomatik kayıttan önce insan onayına bağlamanız doğru olur.
Belge okuma ihtiyacınız varsa yapay zeka ile belge işleme sayfamızdaki çerçeveye göz atabilirsiniz.
Bir görüntü modele girmeden önce neler olur?
Bilgisayar için bir fotoğraf, satır ve sütunlardan oluşan bir sayı tablosudur. Renkli görüntüde her piksel üç değer taşır: kırmızı, yeşil ve mavi yoğunluğu. Model işte bu tabloyu girdi olarak alır.
Ham görüntüyü çoğu zaman doğrudan modele vermezsiniz. Önce boyutu sabitler, parlaklık değerlerini ortak bir aralığa getirir ve gerekirse görüntüyü kırparsınız. Bu adıma ön işleme denir. Eğitim sırasında ayrıca veri çeşitliliğini artırmak için görüntüyü hafifçe çevirir, döndürür ya da parlaklığını değiştirirsiniz.
Etiketleme de bu aşamanın parçasıdır. Gözetimli öğrenmede her örneğin yanında doğru cevap yer alır: sınıf adı, kutu ya da piksel maskesi. Etiketlerin tutarlılığı, çoğu projede modelin mimarisinden daha belirleyicidir. İki etiketleyici aynı çizik için farklı karar veriyorsa, model de kararsız kalır.
Kısacası iyi sonuç, iyi veriyle başlar. Mimariyi değiştirmeden önce veriyi gözden geçirmek çoğu zaman daha hızlı kazanç getirir.
Bilgisayarlı görü için veri nasıl hazırlanır ve etiketlenir?
Veri hazırlığı, çoğu ekibin tahmin ettiğinden fazla zaman alır. Önce hangi sınıfları ayırt edeceğinizi yazarsınız. Ardından her sınıf için örnek görüntüler toplar ve etiketleme kurallarını bir sayfaya dökersiniz. "Hafif çizik" ile "derin çizik" arasındaki sınırı herkes aynı yerden çekmelidir.
Dengeli veri de önemlidir. Hatalı parça çok seyrek görülüyorsa, model neredeyse hep "sağlam" diyerek yüksek doğruluk alabilir. Bu yüzden nadir sınıflardan bilinçli olarak daha fazla örnek toplamanız gerekir. Ayrıca zor örnekleri, yani bulanık, gölgeli ya da kısmen kapalı görüntüleri de ekleyin.
- Etiketleme kılavuzunu görsel örneklerle yazın ve ekipte herkesle paylaşın.
- İki kişiye aynı küçük örnek kümesini etiketletip uyuşmayanları birlikte tartışın.
- Gerçek çalışma ortamından örnek alın; yalnızca internetten indirilmiş fotoğraflara güvenmeyin.
- Kişisel veri içeren görüntüleri gerekmedikçe bulanıklaştırın ya da veri setine almayın.
- Veri setinin sürümünü ve kaynağını kayıt altına alın.
Bu çalışma sıkıcı görünse de sonucu en çok belirleyen kısımdır. Etiket kalitesi düşükse en gelişmiş mimari bile istikrarlı sonuç vermez.
Bilgisayarlı görü nedir sorusunun teknik cevabı: evrişimli ağlar nasıl çalışır?
Uzun süre bu alanın ana yapı taşı evrişimli sinir ağı (CNN, convolutional neural network) oldu. Fikir basittir: küçük bir filtre görüntünün üzerinde kayar ve her konumda "burada bir kenar var mı, bir köşe var mı" diye bakar.
İlk katmanlar kenar ve renk geçişi gibi basit örüntüleri yakalar. Sonraki katmanlar bunları birleştirerek doku, parça ve en sonunda bütün nesneleri tanır. Yani ağ, basitten karmaşığa doğru bir görsel hiyerarşi kurar. Bu yapı, derin öğrenme yaklaşımının görüntüye uygulanışıdır.
Filtrelerin değerlerini elle yazmazsınız. Model, etiketli örneklerde hata yaptıkça bu değerleri küçük adımlarla düzeltir ve zamanla işe yarayan filtreleri kendisi bulur. Derin ağların eğitimini kolaylaştıran artık bağlantılar (residual connections) gibi fikirler için ResNet makalesinin arXiv özetine bakabilirsiniz.
Katman sayısı arttıkça ağ daha soyut kavramları yakalar. Ancak daha fazla katman, daha fazla veri ve işlem gücü anlamına gelir. Bu nedenle küçük projelerde çoğu zaman önceden eğitilmiş bir ağı alıp kendi verinizle ince ayar yapmak (fine-tuning) daha mantıklıdır. Böylece sıfırdan öğrenme yükünü atlarsınız.
CNN'lerin güçlü yanı, aynı filtreyi her yerde kullandığı için görüntünün neresinde olursa olsun benzer örüntüyü yakalayabilmesidir.
Görüntü transformer'ları evrişimli ağlardan ne farkla çalışır?
Görüntü transformer'ı (Vision Transformer, ViT), dil modellerindeki dikkat mekanizmasını görüntüye taşıyan yaklaşımdır. Model resmi küçük karelere, yani yamalara böler. Her yamayı bir kelime gibi ele alır ve yamalar arasındaki ilişkiyi dikkat mekanizmasıyla kurar.
Fark şurada ortaya çıkar: Evrişim önce yakındaki pikselleri birleştirir, transformer ise daha ilk katmanda görüntünün uzak köşelerini birbirine bağlayabilir. Bu özellik, bütün sahnenin bağlamının önemli olduğu işlerde işe yarar. Yöntemi tanıtan makalenin özeti arXiv üzerinde yer alıyor.
Dikkat mekanizmasının mantığını merak ediyorsanız transformer mimarisi yazımız temelleri anlatıyor; burada tekrar etmiyoruz.
Hangisi daha iyidir diye sormak yerine şunu sorun: Elinizde ne kadar etiketli veri, ne kadar işlem gücü ve hangi gecikme sınırı var? Küçük veriyle ve sınırlı donanımla çoğu zaman evrişimli yapılar pratik kalır. Büyük veri ve geniş bağlam ihtiyacında ise transformer tabanlı modeller öne çıkabilir. Ayrıca iki yaklaşımı birleştiren karma modeller de vardır.
Bilgisayarlı görü nedir sorusunun eğitim tarafı: model nasıl öğrenir ve ölçersiniz?
Süreci kabaca üç parçada düşünün: veriyi toplamak, modeli eğitmek ve sonucu ölçmek. Veriyi eğitim, doğrulama ve test olarak bölersiniz. Model yalnızca eğitim kümesine bakar; doğrulama kümesi ayarları denemek, test kümesi ise nihai dürüst ölçüm içindir.
Test kümesini eğitimde kullanmak en sık görülen hatadır. Model o örnekleri ezberler ve rakamlar gerçeğinden parlak çıkar. Canlıya çıktığında ise hayal kırıklığı yaşarsınız.
Ölçüt seçimi de iş hedefine bağlıdır. Kesinlik (precision), modelin "hatalı" dediklerinin ne kadarının gerçekten hatalı olduğunu gösterir. Duyarlılık (recall) ise gerçek hataların ne kadarını yakaladığını anlatır. Bir güvenlik kontrolünde kaçırmak pahalıysa duyarlılığı, her alarm bir insanı meşgul ediyorsa kesinliği öne alırsınız.
Bu yüzden proje başında şu soruyu yazılı hale getirin: Yanlış alarm mı daha maliyetli, kaçırılan hata mı? Cevap, eşik ayarınızı ve başarı ölçütünüzü belirler.
Bir de zaman içindeki kaymaya dikkat edin. Ürün ambalajı değişir, kamera yeri oynar ya da mevsim ışığı farklılaşır. Düzenli aralıklarla yeni örnekleri kontrol edip gerekirse modeli yeniden eğitmeniz gerekir.
İşletmelerde bilgisayarlı görü nedir sorusunun pratik karşılığı hangi işlerde ortaya çıkar?
Kavramın değeri, somut bir işi hızlandırdığında ortaya çıkar. Aşağıdaki alanlar, ekiplerin en sık sorduğu kullanım örnekleridir. Buradaki senaryolar örnek senaryodur, belirli bir müşteri sonucu değildir.
- Stok sayımı: Raf ya da palet fotoğraflarından ürün adedini ve boş alanı tahmin eder.
- Kalite kontrol: Üretim bandında çizik, eksik parça ya da yanlış etiket gibi sapmaları işaretler.
- Belge okuma: Fatura ve irsaliyedeki alanları ayıklayıp muhasebe kaydına hazırlar.
- Ürün kataloğu: Fotoğraftan ürün özelliklerini önerir ve benzer ürün araması sağlar.
- Güvenlik ve saha emniyeti: Baret ya da yasak bölge ihlali gibi durumları kameradan fark eder.
- Görsel arama: Müşterinin yüklediği fotoğrafa benzer ürünleri listeler.
E-ticaret tarafında görsel kataloğu zenginleştirmek isterseniz e-ticaret için yapay zeka çözümümüz ilgili örnekleri topluyor.
Stok sayımı ve kalite kontrolde örnek senaryo nasıl işler?
Örnek senaryo olarak orta ölçekli bir depo düşünün. Her koridorun sonunda sabit bir kamera durur ve belirli aralıklarla palet fotoğrafı çeker. Amaç, sayımı tamamen otomatikleştirmek değil, insan sayımının önceliğini belirlemek.
Model her palet için bir ürün adedi tahmini üretir. Güven puanı düşük olan, ya da kayıtla büyük fark gösteren paletler bir listeye düşer. Depo çalışanı yalnızca o listeyi fiziksel olarak kontrol eder. Böylece sayım emeği azalır, ancak sorumluluk insanda kalır.
Kalite kontrol akışı da benzerdir. Sistem bantta ilerleyen parçayı sabit ışık altında fotoğraflar, sınıflandırma modeli "geçti" ya da "şüpheli" der. Şüpheli parçaları ayrı bir kutuya alırsınız ve uzman bakar. Uzmanın kararı, sonraki eğitim turunda yeni etiket olarak veri setine geri döner.
Bu döngü sistemi zamanla iyileştirir. Üstelik ilk günden her şeyi otomatikleştirmeye çalışmadığınız için riskiniz de küçük kalır.
Işık, kamera açısı ve arka plan sabit olduğunda sonuçlar belirgin biçimde tutarlı olur. Bu yüzden saha kurulumu, model seçimi kadar önemlidir.
Belge okuma süreci bir işletmede nasıl işler?
Belge okuma, bilgisayarlı görünün en yaygın iş uygulamalarından biridir. Süreç genellikle dört adımda ilerler. Önce belgeyi tararsınız ya da fotoğraflarsınız, sonra görüntüyü düzeltirsiniz. Ardından OCR metni çıkarır ve bir model alanları, yani tarih, tutar ve firma adı gibi değerleri ayıklar.
- Belge türlerini listeleyin: fatura, irsaliye, sözleşme, form.
- Her tür için hangi alanların gerekli olduğunu yazın.
- Birkaç örnek belge üzerinde okuma kalitesini deneyin ve hataları sınıflandırın.
- Güven puanı düşük alanlar için insan onay adımı ekleyin.
- Okunan veriyi muhasebe ya da stok sistemine bağlamadan önce doğrulama kuralları koyun.
Doğrulama kuralları basit olabilir. Örneğin kalemlerin toplamı genel toplamla uyuşmuyorsa belge otomatik olarak incelemeye düşer. Böyle küçük kurallar, hataların sessizce muhasebeye geçmesini engeller.
Belgelerde kişisel veri bulunabileceğini unutmayın. Bu nedenle erişim yetkisini ve saklama süresini baştan düşünmeniz gerekir.
Multimodal yapay zeka ile bilgisayarlı görü arasındaki ilişki nedir?
Bilgisayarlı görü, belirli bir görsel işi çözen alandır. Multimodal yapay zeka ise metin, görüntü, ses gibi birden fazla veri türünü birlikte işleyen modelleri anlatan daha geniş bir şemsiyedir. İkisi birbirini dışlamaz; görüntü anlama, multimodal modellerin yeteneklerinden biridir.
Fark kullanımda ortaya çıkar. Klasik bir bilgisayarlı görü modelini genellikle tek bir iş için eğitirsiniz ve çıktısı etiket, kutu ya da maskedir. Multimodal bir model ise bir fotoğrafa bakıp serbest metinle soru cevaplayabilir, örneğin "bu faturada vade tarihi hangisi" gibi.
Esneklik bedelsiz değildir. Genel amaçlı modeller bazen kesin sayım ya da milimetrik ölçüm gibi hassas işlerde özel modelden daha az tutarlı kalabilir. Buna karşılık hızlı prototip için çok pratiktir.
Multimodal modelleri ayrı bir yazımızda (multimodal yapay zeka nedir) ayrıntılı anlatıyoruz, bu yüzden burada konuyu tekrar etmiyoruz. Ses tarafı için ise speech-to-text yazımız yakın bir kardeş konudur.
Bilgisayarlı görü, derin öğrenme ve komşu terimler arasındaki farklar nelerdir?
Bu terimler günlük konuşmada sık karışır. Aşağıdaki tablo, her terimin ne anlattığını ve bilgisayarlı görüyle ilişkisini özetliyor.
| Terim | Ne anlatır? | Bilgisayarlı görüyle ilişkisi |
|---|---|---|
| Bilgisayarlı görü | Görüntü ve videodan anlam çıkarma alanı | Konunun kendisi |
| Derin öğrenme | Çok katmanlı sinir ağlarıyla öğrenme yöntemi | Alanda en yaygın kullanılan yöntem ailesi |
| Evrişimli ağ (CNN) | Görüntü örüntülerini filtrelerle yakalayan ağ türü | Uzun süre alanın ana mimarisi |
| Görüntü transformer'ı | Görüntüyü yamalara bölüp dikkat mekanizması uygulayan ağ | CNN'e alternatif ya da tamamlayıcı mimari |
| OCR | Görüntüdeki yazıyı metne çevirme | Bilgisayarlı görünün bir görevi |
| Multimodal yapay zeka | Metin, görüntü ve sesi birlikte işleyen modeller | Görüntü anlamayı kapsayan daha geniş şemsiye |
| Difüzyon modeli | Gürültüden yeni görüntü üreten model | Anlama değil üretim odaklı komşu alan |
| Uç yapay zeka (edge AI) | Modeli bulut yerine cihazın üzerinde çalıştırma | Görüntü modellerinin çalışma yeri seçeneği |
Özellikle son ikisini ayırmak önemlidir. Görüntü üretimi için difüzyon modeli yazımıza bakabilirsiniz. Modeli cihazın üzerinde çalıştırmak ise edge AI konusudur ve kamera tabanlı sistemlerde gecikme ile gizlilik açısından önemlidir.
Bilgisayarlı görünün sınırları ve riskleri nelerdir?
Her güçlü araç gibi bu alanın da bilinen zayıf noktaları var. Bunları baştan bilmek, beklentiyi doğru kurmanızı sağlar.
- Veri uyumsuzluğu: Eğitimde görülmeyen ışık, açı ya da arka plan başarıyı düşürür.
- Önyargı: Veri belirli gruplarda ya da koşullarda zayıfsa, model de orada zayıf kalır.
- Yanıltıcı örnekler: Bilerek tasarlanmış küçük değişiklikler modeli şaşırtabilir.
- Açıklanabilirlik: Modelin neden o kararı verdiğini anlamak her zaman kolay değildir.
- Bakım yükü: Ortam değiştikçe modeli izlemek ve yenilemek gerekir.
- Aşırı güven: Yüksek güven puanı, doğru olduğu anlamına gelmez.
Gerçek hayattan bir benzetme yardımcı olur. Yeni bir çalışanı yalnızca yaz aylarında çekilmiş fotoğraflarla eğittiğinizi düşünün. Kışın karlı bir sahada ilk kez çalıştığında kararsız kalması doğaldır. Modeller de aynı biçimde, gördükleri dünyayla sınırlıdır.
Bu risklerin hiçbiri projeyi imkânsız yapmaz. Ancak her biri için bir önlem planlamanız gerekir: insan onayı, düzenli test, çeşitli veri ve kayıt tutma.
Kararın sonucu bir insanın hakkını, işini ya da güvenliğini etkiliyorsa otomasyon düzeyini düşürüp insan denetimini artırın. Açıklanabilirlik tarafında açıklanabilir yapay zeka yazımız yardımcı olur.
Yüz tanıma ve gizlilik açısından nelere dikkat etmelisiniz?
Görüntü işlemenin en hassas alanı, kişileri tanımlayan uygulamalardır. Yüz görüntüsü, kişisel veridir ve kişiyi tanımak için işlenen biyometrik veri özel koruma gerektirebilir. Bu nedenle kamera tabanlı bir projeye başlamadan önce hukuki çerçeveyi netleştirmeniz gerekir.
Bu bölüm genel bilgidir ve hukuki danışmanlık değildir. Projeniz için geçerli yükümlülükleri bir hukuk uzmanıyla doğrulayın. Türkiye'de kişisel verilere ilişkin resmi bilgi ve rehberleri Kişisel Verileri Koruma Kurumu sayfasında bulabilirsiniz.
Uygulamada işe yarayan ilkeler genelde şunlardır:
- Gerçekten gereken en az veriyi toplayın; amaç yüz tanıma değilse nesne sayımıyla yetinin.
- Kameraların nerede ve ne amaçla çalıştığını açıkça duyurun.
- Görüntüleri gerekenden uzun saklamayın ve erişimi yetkili kişilerle sınırlayın.
- Mümkünse görüntüyü cihaz üzerinde işleyip yalnızca sonucu aktarın.
- Üçüncü taraf bir bulut hizmeti kullanıyorsanız verinin nereye gittiğini sözleşmede netleştirin.
Ayrıca kişileri izleme amacı taşımayan çözümler, örneğin raf doluluk analizi, çoğu zaman daha az hassas veri gerektirir. Önce amacı yazın, sonra tekniği seçin.
Bilgisayarlı görü projesine başlamadan önce hangi kontrol listesini izlemelisiniz?
Aşağıdaki liste, iş ve geliştirme ekiplerinin ilk toplantıda birlikte doldurabileceği kısa bir çerçevedir. Her maddeye yazılı cevap vermek, sonradan çıkacak sürprizleri azaltır.
- İş hedefi: Hangi karar ya da süreç hızlanacak, başarıyı nasıl ölçeceksiniz?
- Görev türü: Sınıflandırma, tespit, segmentasyon ya da OCR, hangisi yeterli?
- Veri durumu: Elinizde yeterli, çeşitli ve etiketli örnek var mı?
- Ortam: Işık, kamera açısı ve arka plan ne kadar sabit?
- Hata maliyeti: Yanlış alarm mı, kaçırılan hata mı daha pahalı?
- İnsan onayı: Düşük güvenli sonuçlar kime gidecek?
- Gizlilik: Kişisel veri var mı, saklama ve erişim kuralı ne olacak?
- Çalışma yeri: Bulut mu, cihaz üstü mü? Gecikme ve bağlantı koşulları ne?
- Bakım: Modeli kim izleyecek, ne sıklıkla yenileyecek?
Veri hazırlığında görüntü boyutunu küçültmek ya da formatı dönüştürmek gerekirse resim küçültme aracımızı ve resim format dönüştürücümüzü kullanabilirsiniz.
Hazır bir görüntü servisi mi, özel model mi seçmelisiniz?
Her iki yol da meşrudur; doğru seçim ihtiyacınıza bağlıdır. Bulut sağlayıcılarının hazır görüntü servisleri etiket tespiti, nesne konumlama, metin okuma ve yüz algılama gibi genel görevleri kutudan çıkar çıkmaz sunar. Güncel özellik listesi için Google Cloud Vision özellik sayfası gibi resmi belgelere bakın.
Hazır servis, genel görevlerde hızlı başlangıç sağlar. Ancak sektörünüze özgü bir ayrım, örneğin kendi ürününüzdeki belirli bir kusur tipi, çoğu zaman özel eğitim ister. Açık eğitim kaynakları arasında Hugging Face bilgisayarlı görü kursu temel görevleri uygulamalı olarak anlatıyor.
Maliyet tarafında da şunu aklınızda tutun: Hazır servislerde çoğunlukla işlenen görüntü sayısına göre ödeme yaparsınız, özel modelde ise ilk yatırım yüksek, birim maliyet düşük olabilir. Güncel fiyatlar sağlayıcıya göre değiştiği için rakam vermiyoruz; resmi fiyat sayfasını kontrol edin.
Pratik bir yol şudur: Önce hazır servisle küçük bir deneme yapın. Sonuç yeterliyse orada kalın. Yetersizse, elde ettiğiniz örnek hatalar özel model için ilk veri setinizin çekirdeği olur.
Özel bir kamera uygulaması ya da panel gerekiyorsa özel yazılım geliştirme tarafında nasıl çalıştığımıza bakabilirsiniz.
Talha Aslan ve ekibi bu konuda nasıl destek olur?
Biz bilgisayarlı görüyü bir vitrin teknolojisi olarak değil, belirli bir iş sorununu çözen araç olarak ele alıyoruz. İlk adımda süreci, veriyi ve hata maliyetini birlikte netleştiriyoruz. Ardından hazır servis mi yoksa özel model mi sorusuna gerçekçi bir cevap arıyoruz.
Belge okuma, görsel katalog zenginleştirme ya da süreç otomasyonu gibi konularda yapay zeka ve otomasyon hizmetlerimizi inceleyebilirsiniz. Kapsam ve beklenti konusunda dürüst bir görüşme için bize ulaşın.
Bu yazı genel bilgilendirme amaçlıdır. Model adı, sürüm ve fiyat gibi hızlı değişen ayrıntılar için ilgili sağlayıcının resmi belgesini kontrol edin.



