Araçlar
A/B Testi Hesaplama
A/B testi hesaplama aracıyla sonucunuzun istatistiksel olarak anlamlı olup olmadığını saniyede görün: p-değeri, güven düzeyi, artış oranı, güven aralığı ve B'nin kazanma olasılığı tek ekranda. Test başlamadan önce gereken örneklem büyüklüğünü ve süreyi de planlayın. Ücretsiz, kayıt yok.
Ziyaretçi: teste giren tekil kullanıcı. Dönüşüm: hedefi tamamlayan kullanıcı. İki sayıyı da aynı tarih aralığından alın.
Sayıları girdiğinizde trafik dağılımı (SRM) ve örneklem yeterliliği burada kontrol edilir. SRM kontrolü eşit dağılım varsayar.
MDE, fark etmek istediğiniz en küçük değişimdir: göreli %10, %4'lük oranı %4,4'e taşımak demektir; mutlak 0,5 puan ise %4,5'e. Küçük MDE daha çok ziyaretçi ister.
Ziyaretçi ve dönüşüm sayılarını girin; sonuç anında hesaplanır.
Mevcut dönüşüm oranını ve MDE'yi girin.
Süreyi görmek için günlük ziyaretçi sayısını girin. Hesap çift yönlü teste göredir.
A/B Testi Hesaplama nasıl kullanılır?
- 1Varyantların sayılarını girin
A (kontrol) ve B için teste giren ziyaretçi ile dönüşüm sayısını yazın. Araç 12.000 ve 12000 biçimlerini aynı okur; üçüncü sürüm için + C varyantı düğmesine basın.
- 2Güven düzeyini ve test türünü seçin
Çoğu pazarlama testinde %95 güven ve çift yönlü test iyi bir başlangıçtır. Bu ayarı test başlamadan belirleyin ve sonucu gördükten sonra değiştirmeyin.
- 3Rozeti ve artışı okuyun
Rozet farkın anlamlı olup olmadığını söyler. Büyük sayı B'nin A'ya göre göreli artışıdır, altındaki satır da bu artışın güven aralığıdır.
- 4Veri kontrolü kutusuna bakın
Trafik eşit bölünmediyse SRM uyarısı, dönüşüm çok azsa örneklem uyarısı çıkar. Uyarı varken sonuca güvenmeyin.
- 5Yeni testi önceden planlayın
Örneklem Büyüklüğü sekmesine mevcut dönüşüm oranını, MDE'yi ve günlük ziyaretçiyi yazın; varyant başına gereken sayıyı ve aracın tam haftaya yuvarladığı süreyi alın.
A/B testi hesaplama formülleri
Araç iki oranlı z testini kullanır. Normal dağılım olasılıklarını harici kütüphane olmadan, W. J. Cody ve P. J. Acklam yaklaşımlarıyla çift hassasiyette hesaplar.
p = dönüşüm / ziyaretçi(pB - pA) / pAp̄ = (cA + cB) / (nA + nB)z = (pB - pA) / √(p̄ × (1 - p̄) × (1/nA + 1/nB))Çift yönlü: 2 × (1 - Φ(|z|)); tek yönlü: 1 - Φ(z)[(pB - pA) ± z(1 - α/2) × √(pA(1 - pA)/nA + pB(1 - pB)/nB)] / pAΦ(|z| - z(1 - α/2))Φ((mB - mA) / √(vA + vB)); m ve v, Beta(c + 1, n - c + 1) dağılımının ortalaması ve varyansıχ² = Σ (gözlenen - beklenen)² / beklenen; eşit dağılım, serbestlik derecesi = varyant sayısı - 1n = [z(1 - α/2) × √(2p̄(1 - p̄)) + z(1 - β) × √(p1(1 - p1) + p2(1 - p2))]² / (p2 - p1)²Üç varyantta ve örneklem hesabında ikiden fazla varyantta araç α'yı karşılaştırma sayısına böler (Bonferroni). Tek yönlü testte araç güven aralığı yerine z(1 - α) ile alt sınırı verir, gözlenen gücü de Φ(z - z(1 - α)) ile hesaplar.
Örnek A/B testi hesaplamaları
Aşağıdaki satırlar örnek hesaptır; aynı sayıları araca girdiğinizde kartlarda ve rozette birebir bu sonuçları görürsünüz.
| A: ziyaretçi / dönüşüm | B: ziyaretçi / dönüşüm | Ayar | Artış | p-değeri | Güven | Rozet |
|---|---|---|---|---|---|---|
| 12.000 / 480 | 12.000 / 564 | %95, çift yönlü | +%17,5 | 0,0079 | %99,2 | Anlamlı |
| 10.000 / 500 | 10.000 / 540 | %95, çift yönlü | +%8,0 | 0,2027 | %79,7 | Anlamlı değil |
| 10.000 / 500 | 10.000 / 560 | %95, çift yönlü | +%12,0 | 0,0583 | %94,2 | Anlamlı değil |
| 10.000 / 500 | 10.000 / 560 | %95, tek yönlü | +%12,0 | 0,0291 | %97,1 | Anlamlı |
| 8.000 / 400 | 8.000 / 330 | %95, çift yönlü | -%17,5 | 0,0080 | %99,2 | Anlamlı |
| 20.000 / 600 | 19.000 / 650 | %99, çift yönlü | +%14,0 | 0,0183 | %98,2 | Anlamlı değil |
Üçüncü ve dördüncü satır aynı veridir: tek yönlü test p-değerini yarıya indirir. Beşinci satırdaki düşüş de anlamlıdır, yani B kaybettirir. Son satırda araç ayrıca SRM uyarısı verir; 20.000 ile 19.000'lik bölünme eşit dağılımdan beklenmeyecek kadar sapmıştır (p < 0,0001).
Varyant başına gereken ziyaretçi tablosu
%95 güven, %80 güç, çift yönlü test ve iki varyant için; MDE göreli artıştır. Değerler aracın Örneklem Büyüklüğü sekmesiyle aynıdır.
| Mevcut dönüşüm oranı | MDE %5 | MDE %10 | MDE %20 |
|---|---|---|---|
| %1 | 637.010 | 163.095 | 42.693 |
| %2 | 315.206 | 80.682 | 21.109 |
| %3 | 207.938 | 53.211 | 13.914 |
| %5 | 122.124 | 31.234 | 8.158 |
| %10 | 57.763 | 14.751 | 3.841 |
Toplam ziyaretçi için değeri varyant sayısıyla çarpın. MDE'yi yarıya indirmek gereken örneklemi yaklaşık dört katına çıkarır.
A/B testi hesaplama nedir, hangi soruyu cevaplar?
A/B testi hesaplama, iki sürüm arasında gördüğünüz dönüşüm farkının gerçek mi yoksa şans eseri mi olduğunu sayılarla gösterir. Bir açılış sayfasının iki başlığını, iki reklam metnini ya da iki fiyat sunumunu aynı dönemde farklı ziyaretçilere gösterirsiniz. Ardından her sürümün ziyaretçi ve dönüşüm sayısını araca yazarsınız. Araç da bu sayılardan p-değerini, güven düzeyini ve artışın güven aralığını çıkarır.
Bu hesap tek başına “hangisi daha iyi?” sorusunu cevaplamaz. Asıl cevapladığı soru şudur: bu fark, veri yeniden toplansa da büyük olasılıkla sürer mi? Örneğin B sürümü %17,5 daha fazla dönüşüm getirdiyse ama örneklem küçükse, aynı fark bir sonraki hafta kaybolabilir. Bu yüzden araçta üç çıktıyı birlikte okumanızı öneririm:
- Rozet: fark seçtiğiniz güven düzeyinde anlamlı mı?
- Güven aralığı: gerçek artış hangi aralıkta olabilir?
- Veri kontrolü: trafik iki varyanta dengeli dağıldı mı, veri yeterli mi?
Testi reklam tarafında kuruyorsanız ölçüm temiz olmalı. Örneğin UTM oluşturucu ile her varyantın trafiğini ayrı etiketlemek, sonradan kaynak karışıklığını önler.
p-değeri ve güven düzeyi size ne söyler, ne söylemez?
p-değeri, A ile B arasında gerçekte hiçbir fark yokken en az gördüğünüz kadar büyük bir farkın şans eseri ortaya çıkma olasılığıdır. Örneğin p = 0,0079 çıktıysa, eşit performanslı iki sürümün bu kadar ayrışma ihtimali yaklaşık binde 8'dir. Araç bu değeri %95 güven düzeyinde 0,05 eşiğiyle karşılaştırır; altında kalırsa rozet “Anlamlı” olur.
Güven kartındaki yüzde ise 1 eksi p-değeridir. Ancak bu sayı “B'nin daha iyi olma olasılığı %99,2” anlamına gelmez; bu yaygın bir yanlış okumadır. Amerikan İstatistik Derneği'nin p-değeri bildirgesi de iki noktanın altını çizer:
- p-değeri etkinin büyüklüğünü veya önemini ölçmez.
- İş kararları yalnızca p-değerinin bir eşiği geçip geçmemesine dayanmamalıdır.
Bu nedenle araçta p-değerinin yanında artışın güven aralığını da veriyorum. Aralık +%4,6 ile +%30,4 arasındaysa artış anlamlıdır, fakat gerçek etki küçük de olabilir, büyük de. Karar verirken aralığın alt ucunu, yani en kötümser senaryoyu, iş hedefinizle karşılaştırın.
A/B testi hesaplama öncesinde örneklem büyüklüğünü nasıl belirlersiniz?
A/B testi hesaplama işinin yarısını test başlamadan önce yaparsınız. Örneklem Büyüklüğü sekmesi dört girdiyle çalışır: mevcut dönüşüm oranınız, yakalamak istediğiniz en küçük etki (MDE), güven düzeyi ve test gücü. Güç, gerçekte var olan bir farkı yakalama olasılığıdır; istatistikte yaygın varsayılan %80'dir.
Formülün mantığı basit: küçük farkları görmek için çok veri gerekir. Örnek hesap: %5 dönüşüm oranında %10'luk göreli artışı %95 güven ve %80 güçle yakalamak için varyant başına 31.234 ziyaretçi gerekir. Hedefi %20'ye çıkarırsanız ihtiyaç 8.158'e iner. Kısacası MDE'yi yarıya indirmek, örneklemi yaklaşık dört katına çıkarır.
Günlük ziyaretçi sayısını da yazarsanız araç süreyi hesaplar ve tam haftaya yuvarlar. Böylece hafta içi ve hafta sonu davranışı iki varyantta eşit yer tutar. Süre uzun çıkıyorsa üç seçeneğiniz var:
- Daha büyük bir değişikliği test edin, yani MDE'yi büyütün.
- Teste daha fazla trafik gönderin; bütçe tarafı için Google Ads bütçe rehberime bakabilirsiniz.
- Hedefi huninin daha üst adımına taşıyın, örneğin satış yerine sepete eklemeyi ölçün.
Testi erken bitirmek neden yanlış kazanan üretir?
En pahalı A/B testi hatası, sonuca her gün bakıp ilk “anlamlı” gördüğünüz anda testi durdurmaktır. Her ara bakış, şansın size yanlış bir kazanan gösterme ihtimalini artırır. Evan Miller'ın A/B testi hataları yazısındaki örnek senaryoda bu yaklaşım, %5 sandığınız yanlış pozitif oranını %26,1'e çıkarıyor.
Aynı kaynağa göre testi 10 kez ara kontrol edecekseniz, gerçek %5 düzeyini korumak için raporlanan anlamlılığın %1'e inmesini beklemeniz gerekir. Pratikte en temiz yol şu üç adımdır:
- Örneklemi ve süreyi test başlamadan Örneklem Büyüklüğü sekmesiyle belirleyin.
- Test sürerken yalnız teknik sorunları, yani sayfanın açılıp açılmadığını ve SRM uyarısını izleyin.
- Planlanan ziyaretçi sayısına ulaşınca sonucu bir kez okuyun ve kararı verin.
Ayrıca kazanan ilan ettiğiniz varyantın etkisi, ilk haftalardaki yenilik etkisi geçince azalabilir. Bu yüzden büyük değişiklikleri yayına aldıktan sonra da dönüşüm oranını birkaç hafta izliyorum.
SRM uyarısı çıkarsa ne yapmalısınız?
SRM (sample ratio mismatch), yani örneklem oranı uyumsuzluğu, trafiği eşit bölmeyi planladığınız hâlde varyantlara düşen ziyaretçi sayısının beklenmedik ölçüde ayrışmasıdır. Araç bunu ki-kare testiyle kontrol eder ve p < 0,01 olduğunda veri kontrolü kutusunda uyarı gösterir. Örneğin 20.000 ve 19.000'lik bir bölünme ilk bakışta masum görünür; ancak bu hacimde eşit dağılımdan beklenmeyecek bir sapmadır.
Microsoft Research'ün SRM teşhis rehberine göre Microsoft'taki A/B testlerinin yaklaşık %6'sında SRM çıkıyor. Ekip sonuçları göstermeden önce daha da katı bir eşik, p < 0,0005 kullanıyor. Sık rastlanan nedenler şunlar:
- Kullanıcıları varyantlara atayan koddaki hatalar.
- Varyant sayfasına yönlendirme sırasında kaybolan ziyaretçiler.
- Bir varyantta sayfanın geç açılması ya da hata vermesi yüzünden eksik kalan kayıtlar.
- Test sürerken trafik oranını elle değiştirmek.
SRM varken p-değerine güvenmeyin. Önce nedeni bulun, düzeltin ve testi yeniden başlatın. Bilerek eşit olmayan bir dağılım kullanıyorsanız, örneğin 90/10, bu kontrol size uymaz; o durumda uyarıyı dikkate almayın.
Üç varyantta Bonferroni düzeltmesi neden gerekli?
+ C varyantı düğmesine bastığınızda araç B'yi ve C'yi ayrı ayrı A ile karşılaştırır. Her karşılaştırma şansa bir kez daha kapı açar; iki karşılaştırmada %5'lik hata payı toplamda neredeyse %10'a çıkar. Bonferroni düzeltmesi bu yüzden anlamlılık eşiğini karşılaştırma sayısına böler. Yani %95 güvende araç her karşılaştırmayı α = 0,025 ile değerlendirir.
Örnek hesap: A'da 5.000 ziyaretçi ve 150 dönüşüm, B'de 5.100 ziyaretçi ve 180 dönüşüm, C'de 4.950 ziyaretçi ve 190 dönüşüm olsun. C'nin artışı +%27,9, p-değeri 0,0214; bu değer 0,025'in altında kaldığı için C anlamlı çıkar. B ise +%17,6 artışa rağmen p = 0,1346 ile anlamlı değildir. Araç başlıkta en yüksek oranlı varyantı gösterir; grafikte de her varyantın yanına A'ya göre artışını ve p-değerini yazar.
Düzeltmenin bir bedeli de var: gücü düşürür, dolayısıyla aynı farkı yakalamak için her varyanta daha çok ziyaretçi gerekir. Örneklem Büyüklüğü sekmesinde varyant sayısını artırdığınızda araç aynı düzeltmeyi uygular. Trafiğiniz sınırlıysa üç varyant yerine iki güçlü fikri test etmenizi öneririm.
Bayesçi kazanma olasılığını nasıl okumalısınız?
P(B > A) kartı klasik testten farklı bir soruyu cevaplar: elimdeki veriyle B'nin gerçek dönüşüm oranının A'nınkinden yüksek olma olasılığı nedir? Araç her varyant için Beta(dönüşüm + 1, ziyaretçi - dönüşüm + 1) dağılımını kurar ve iki dağılımın farkını normal yaklaşımla hesaplar. Başlangıç varsayımı düzdür, yani araç hiçbir varyantı önceden kayırmaz.
Yöneticilere anlatması en kolay çıktı budur, çünkü “B'nin daha iyi olma ihtimali %99,6” cümlesini herkes doğrudan anlar. Yine de iki uyarım var:
- Olasılık yüksek olsa bile artış küçük olabilir; bu kartı güven aralığıyla birlikte okuyun.
- Bayesçi yaklaşım da sık bakıp erken durdurmaya karşı bağışık değil; önceden belirlediğiniz örneklem kuralı burada da geçerli.
Gözlenen güç kartı ise planlama için değil, bilgi içindir. p-değerinden türer ve testin yeterince büyük olduğunu geriye dönük olarak kanıtlamaz. Yeni bir test planlarken her zaman Örneklem Büyüklüğü sekmesindeki güç ayarını esas alın.
Google Ads ve açılış sayfası testlerinde nasıl bir düzen kurmalısınız?
Reklam tarafında Google Ads'in deney özelliği trafiği ve bütçeyi bölerek kampanya değişikliklerini test etmenizi sağlar. Google, deney yardım sayfalarında trafiği %50 bölmeyi, deneyi en az 4 ila 6 hafta çalıştırmayı ve 1 ila 2 dönüşüm döngüsü beklemeyi öneriyor. Ayrıca ilk 7 günün verisini hazırlık dönemi olarak değerlendirme dışında bırakıyor. Sonucu bu araçla ikinci kez kontrol etmek için deney raporundaki tıklama ve dönüşüm sayılarını girebilirsiniz.
Açılış sayfası testlerinde SEO'yu da korumanız gerekir. Google Search Central, test sırasında şu kuralları öneriyor:
- Googlebot'a ziyaretçiden farklı içerik göstermeyin, yani gizleme yapmayın.
- Varyantlar ayrı adreslerdeyse hepsine asıl sayfayı gösteren canonical etiketi ekleyin.
- Yönlendirmeyle test ediyorsanız kalıcı 301 yerine geçici 302 yönlendirmesi kullanın.
- Test bitince kazanan sürümü yayına alın ve test kodunu kaldırın.
Kurumsal projelerde bu düzeni Google Ads yönetimi sürecinin parçası olarak kuruyorum. Dönüşüm tarafını ise kurumsal web sitesinde CRO yazımda adım adım anlattım. Kazanan varyantın reklam kârlılığına etkisini görmek için ROAS hesaplayıcı da işinize yarar.
A/B testi hesaplarken sık yapılan hatalar
- ✕HataOturum veya sayfa görüntülemesini ziyaretçi diye girmek✓DoğrusuAynı kişi birden çok oturum açtığında gözlemler bağımsız olmaz ve p-değeri olduğundan küçük çıkar. Tekil kullanıcı sayısını girin.
- ✕HataSonucu gördükten sonra ayarları değiştirmek✓DoğrusuGüven düzeyini ve test türünü test başlamadan belirleyin. Sonuca bakıp tek yönlü teste geçmek, anlamlılığı yapay olarak kolaylaştırır.
- ✕HataAz dönüşümle karar vermek✓DoğrusuBir varyantta 10'dan az dönüşüm varsa normal yaklaşım sağlıklı çalışmaz ve araç sizi uyarır. Karar vermeden önce veri toplamaya devam edin.
- ✕HataGüven yüzdesini kazanma olasılığı sanmak✓Doğrusu%99,2 güven, B'nin %99,2 ihtimalle daha iyi olduğu anlamına gelmez. Bu soruya P(B > A) kartı cevap verir.
- ✕HataFarklı dönemleri karşılaştırmak✓DoğrusuEylüldeki A ile ekimdeki B'yi karşılaştırmak A/B testi değildir, çünkü mevsimsellik farkı yutar. Varyantları aynı günlerde, rastgele ayırdığınız trafikle çalıştırın.
Sıkça Sorulan Sorular
Kazanan varyantı bulmak için yeterli ve doğru trafik gerekir.
A/B testi ancak nitelikli trafikle sonuç verir. Google Ads kampanya deneyleri ve açılış sayfası testleriyle dönüşüm oranınızı veriye dayanarak büyütelim.
İlgili Yazılar
Blog
Kurumsal Web Sitesinde CRO Nasıl Yapılır? Dönüşüm Oranı Optimizasyonu RehberiYazıyı oku →
Call to Action (CTA) Nedir? Dönüşüm Getiren CTA Butonu ÖrnekleriYazıyı oku →
B2B Landing Page Nasıl Yapılır? Satış Fırsatı Üreten Sayfa KurgusuYazıyı oku →
Web Sitesinde Video Kullanımı Dönüşüm Oranını Nasıl Etkiler?Yazıyı oku →

