A/B testi, bir değişikliğin tanımlı bir metrik üzerindeki etkisini kontrollü biçimde tahmin etmek için kullanılan deney yöntemidir. Rastgele atama, doğru ölçüm ve önceden belirlenmiş analiz planı varsa nedensel çıkarımı destekleyebilir; ancak her test kazanan bir varyant üretmez ve hiçbir tasarım kesinlik sağlamaz. Bu rehber test tasarımını, istatistiksel yorumu ve yaygın hata kaynaklarını ele alır.
A/B Testi Nedir ve Neden Yapmalısınız?
A/B testi (split test), bir web sayfasının, e-postanın veya reklamın iki farklı versiyonunu eş zamanlı olarak farklı kullanıcı gruplarına göstererek hangisinin daha iyi performans gösterdiğini ölçme yöntemidir.
Neden yalnızca tahmine dayanmak yerine test etmelisiniz?
Ekip görüşleri hipotez üretmek için değerlidir, fakat tek başına bir değişikliğin etkisini ayırt edemez. A/B testi de "kesin veri" sunmaz; örnekleme hatası, ölçüm hatası, dış geçerlilik ve uygulama sorunları devam eder. Avantajı, karar kuralını ve belirsizliği görünür hale getirmesidir.
A/B Testinin Temel Kavramları
- Kontrol grubu (A): Mevcut versiyon, değişiklik yapılmamış hali
- Varyant (B): Test edilen yeni versiyon
- Dönüşüm oranı: Hedef aksiyonu gerçekleştiren kullanıcı yüzdesi
- İstatistiksel anlamlılık: Sonuçların rastlantısal olmadığına dair güven seviyesi
- Güven aralığı: Gerçek değerin düşeceği tahmini aralık
Test Tasarımının Temelleri
Başarılı bir A/B testi, iyi bir hipotezle başlar.
Hipotez Oluşturma
Güçlü bir A/B test hipotezi şu yapıda olmalıdır:
"[Değişiklik] yapılırsa, [metrik] [yönde] değişecektir, çünkü [sebep]."
Aşağıdaki örnekler hipotetiktir; beklenen yönü veya sonucu garanti etmez:
- "CTA butonunun rengini kırmızıdan yeşile değiştirirsek, tıklama oranı artacaktır, çünkü yeşil renk olumlu bir aksiyon çağrışımı yapar."
- "Ürün sayfasına müşteri yorumları eklersek, sepete ekleme oranı artacaktır, çünkü sosyal kanıt güven oluşturur."
- "Form alanı sayısını 8'den 4'e düşürürsek, form tamamlama oranı artacaktır, çünkü sürtünme azalır."
Tek Değişkenli vs. Çok Değişkenli Test
| Test Türü | Açıklama | Ne Zaman Kullanılır |
|---|---|---|
| A/B Test | Tek bir değişken test edilir | Düşük trafikli siteler, net hipotezler |
| A/B/n Test | Aynı değişkenin 3+ varyantı | Birden fazla alternatif varsa |
| Multivariate Test (MVT) | Birden fazla değişken aynı anda | Yüksek trafikli siteler, etkileşim analizi |
Tasarım notu: Çok değişkenli testlerde tahmin edilecek kombinasyon sayısı arttığı için çoğu durumda daha fazla gözleme ihtiyaç duyulur. Yöntemi aylık trafik için evrensel bir eşik kullanarak değil, beklenen etki, varyans, kombinasyon sayısı ve karar maliyetine göre seçin.
İstatistiksel Anlamlılık: Bilimsel Temeller
İstatistiksel anlamlılık, tanımlı bir model altında verinin sıfır hipoteziyle ne kadar uyumlu olduğunu değerlendiren karar çerçevesinin bir parçasıdır. Tek başına etkinin büyüklüğünü, iş değerini veya sonucun başka dönemlerde tekrarlanacağını göstermez.
p-Değeri Nedir?
p-değeri; sıfır hipotezi ve model varsayımları doğru kabul edildiğinde, gözlenen kadar veya daha uç bir sonucun elde edilme olasılığıdır. Sıfır hipotezinin doğru olma ya da sonucun "rastlantısal çıkma" olasılığı değildir. Bu yaygın yorum hataları American Statistical Association'ın p-değeri açıklamasında ayrıntılandırılır.
0,05 sık kullanılan bir anlamlılık düzeyidir, fakat evrensel veya sihirli bir eşik değildir. Eşik, metrik ve analiz yöntemi veri görülmeden önce belirlenmeli; karar etki büyüklüğü, güven aralığı, maliyet ve riskle birlikte verilmelidir.
Pratik yorum:
p = 0,01, sıfır hipotezinin yalnızca %1 olasılıkla doğru olduğu anlamına gelmez.p = 0,05, tek başına önemli veya uygulanabilir bir etki kanıtlamaz.p = 0,10, testi otomatik olarak uzatma talimatı değildir; veri izlerken durdurma kuralını değiştirmek hata oranını bozabilir.- Büyük bir p-değeri, iki varyantın eşdeğer olduğunu kanıtlamaz; eşdeğerlik ayrı bir tasarım gerektirir.
Tip I ve Tip II Hatalar
| Hata Türü | Tanım | Sonuç | Nasıl Önlenir |
|---|---|---|---|
| Tip I (Yanlış Pozitif) | Gerçek bir fark yokken sıfır hipotezini reddetmek | Etkisiz değişikliği uygulamak | Alfa düzeyini ve çoklu karşılaştırma düzeltmesini önceden belirleyin |
| Tip II (Yanlış Negatif) | Hedeflenen büyüklükte fark varken bunu saptayamamak | Yararlı olabilecek değişikliği kaçırmak | Güç analizi yapın ve ölçüm gürültüsünü azaltın |
Sample Size (Örneklem Büyüklüğü) Hesaplama
Testin ne kadar süreceğini belirleyen en önemli faktör örneklem büyüklüğüdür. Hesaplama için şu parametreler gerekir:
- Mevcut dönüşüm oranı (Baseline): Kontrol grubunun mevcut dönüşüm oranı
- Minimum Algılanabilir Etki (MDE): Tespit etmek istediğiniz minimum fark yüzdesi
- İstatistiksel güç (Power): Hedeflenen etki varsa testin bunu saptama olasılığı
- Anlamlılık düzeyi (Alpha): Kabul edilen Tip I hata oranı
Hipotetik planlama girdileri:
- Mevcut dönüşüm oranı: %3
- MDE: göreli %20 (yani %3'ten %3,6'ya artış)
- Güç: %80
- İki yönlü alpha: %5
Bu girdiler eğitim amaçlıdır ve tek başına hazır bir örneklem sonucu vermez. Gereken örneklem; kullanılan teste, tek/çift yönlü hipoteze, grup dağılımına, birden fazla metrik veya varyant düzeltmesine, beklenen veri kaybına ve sıralı analiz planına göre değişir. Hesabı kullanılan istatistik paketinde yeniden üretin ve test başlamadan belgeleyin. Süreyi toplam ziyaretçiyle değil, deneye uygun ve gruplara gerçekten atanacak gözlem sayısıyla tahmin edin.
Bayesian vs. Frequentist Yaklaşım
Deney platformları frequentist, Bayesian veya hibrit çıkarım yöntemleri kullanabilir:
Frequentist: Sıfır hipotezi altında verinin davranışını değerlendirir. Sabit örneklem tasarımı kullanılabilir; geçerli bir sıralı tasarım varsa ara okumalar da yöntemin parçası olabilir.
Bayesian: Önsel dağılım ve gözlenen veriyi birleştirerek etki için sonsal dağılım üretir. Önsel, karar eşiği ve durdurma kuralı yine önceden tanımlanmalıdır; yöntem seçimi kontrolsüz erken durdurmayı geçerli kılmaz.
A/B Test Araçları
Google Optimize ve Optimize 360, Google'ın resmi duyurusuna göre 30 Eylül 2023'ten beri kullanılamıyor. Aşağıdaki ürünlerin fiyatı, istatistik motoru ve dağıtım seçenekleri değişebileceği için karar sırasında resmi belgeleri kontrol edin:
| Araç | Resmi Bilgi | Değerlendirilecek Konular |
|---|---|---|
| VWO | Rapor yorumlama belgeleri | Hesap sürümüne göre istatistik yöntemi, veri dışa aktarma, trafik birimi |
| Optimizely | Feature Experimentation belgeleri | İstemci/sunucu uygulaması, bayrak yönetimi, lisans |
| AB Tasty | Resmi dokümantasyon | Web ve ürün deneyi kapsamı, entegrasyonlar, yönetişim |
| PostHog | Experiments belgeleri | Olay modeli, barındırma seçeneği, veri hacmi maliyeti |
| GrowthBook | Resmi dokümantasyon | Veri kaynağı, özellik bayrakları, analiz ayarları |
Araç seçerken yalnızca arayüzü değil; rastgeleleştirme birimini, örneklem oranı uyuşmazlığı kontrollerini, çoklu test politikasını, kimlik çözümlemeyi ve sonuçların yeniden üretilebilirliğini değerlendirin.
Yaygın Hatalar ve Çözümleri
1. Testi Erken Durdurmak
Yaygın risklerden biri, ilk birkaç günde olumlu bir tahmin görünce testi durdurmaktır. Gözlem sayısı azken etki tahmini geniş bir belirsizlik taşıyabilir ve tekrarlı kontrol, planlanan hata oranını değiştirebilir.
Çözüm: Önceden belirlenen örneklem veya geçerli sıralı durdurma kuralını izleyin. Test süresi, ilgili iş döngülerini kapsamalıdır; her ürün için geçerli sabit bir gün veya hafta sayısı yoktur.
2. Aynı Anda Çok Fazla Test Çalıştırmak
Çakışan testler her zaman geçersiz değildir; ancak aynı kullanıcı veya metrik üzerinde etkileşim varsa yorum zorlaşabilir.
Çözüm: Deney maruziyetlerini kaydedin, olası etkileşimleri önceden tanımlayın ve gerekiyorsa deneyleri ayrıştırın ya da faktöriyel tasarım kullanın. "Sayfa başına tek test" gibi evrensel bir kural yerine etkileşim riskini değerlendirin.
3. Yanlış Metrik Seçimi
Mikro dönüşümü (buton tıklama) optimize ederken makro dönüşümü (satın alma) gözden kaçırmak.
Çözüm: Birincil metrik olarak iş sonucuna en yakın metriği seçin. İkincil metriklerle destekleyin.
4. Segmentasyon Yapmamak
Ortalama etki, önceden tanımlanmış segmentler arasında farklılaşabilir. Ancak çok sayıda sonradan oluşturulmuş segment, yanlış pozitif olasılığını artırır.
Çözüm: İş açısından gerekçeli segmentleri ve etkileşim testlerini analiz planına ekleyin. Keşifsel segment sonuçlarını yeni bir deneyde doğrulanması gereken hipotezler olarak etiketleyin.
5. Novelty Effect'i (Yenilik Etkisi) Göz Ardı Etmek
Yeni bir tasarım, sadece yeni olduğu için kısa vadede daha iyi performans gösterebilir. Kullanıcılar alışınca fark kapanır.
Çözüm: Etkinin zaman içindeki seyrini inceleyin ve gözlem penceresini ürünün kullanım döngüsüne göre belirleyin. Sabit bir süre, yenilik etkisini otomatik olarak ortadan kaldırmaz.
Pratik Test Fikirleri
Nereden başlayacağınızı bilmiyorsanız, aşağıdaki alanlarda ölçülebilir hipotezler üretebilirsiniz. Hiçbiri kendi başına olumlu sonuç vaat etmez:
- CTA butonları: Metin, renk, boyut, pozisyon
- Başlıklar: Ana sayfa ve landing page başlıkları
- Form alanları: Alan sayısını azaltma, otomatik doldurma
- Fiyat sunumu: Yıllık vs. aylık, indirim gösterimi
- Sosyal kanıt: Müşteri yorumları, güven rozetleri
- Sayfa düzeni: Tek sütun vs. çift sütun, bilgi hiyerarşisi
Sonuç: Test Kültürü Oluşturun
A/B testi tek seferlik bir aktivite yerine, karar maliyeti ve trafik elverdiğinde kullanılan tekrar edilebilir bir süreç olarak ele alınabilir. Her pazarlama kararı deney gerektirmez; düşük riskli değişiklikler, nitel araştırma veya operasyonel zorunluluklar farklı yöntemlerle değerlendirilebilir.
Maviona'nın CRO hizmeti kapsamında deney hipotezi, ölçüm planı ve sonuç değerlendirme desteği proje ihtiyacına göre ele alınabilir. Testlerin belirli bir dönüşüm artışı sağlayacağı taahhüt edilmez. Kapsamı görüşmek için iletişime geçin.
