Artık hipotez testinin felsefesini biliyorsun: null, alternatif, p-değeri, hatalar. Şimdi ilk gerçek aracı eline alıyoruz — en çok karşılaşacağın, en pratik test: t-testi. İki grubun ortalamasını karşılaştırmak istediğinde başvuracağın araç budur. Ve söz veriyorum: formüllerin içine girmeyeceğiz; t-testinin altındaki o güzel, basit fikri kavrayacaksın. Green Belt'in işi matematiği elle yapmak değil — ne zaman hangi testi kullanacağını ve sonucu nasıl yorumlayacağını bilmek.
İki grup ortalaması, standart sapma ve n gir → t-istatistiği ve tahmini p-değeri (α=0.05).
Bir farkın anlamlı olup olmadığı, sadece farkın büyüklüğüne değil, grupların içindeki değişkenliğe de bağlıdır. Az değişken iki grup arasındaki küçük bir fark, çok değişken iki grup arasındaki büyük bir farktan daha anlamlı olabilir. Ve daha çok veri gürültüyü azaltır: aynı bir dakikalık fark, 30 veriyle 'anlamsız', 300 veriyle 'anlamlı' çıkabilir — t-testi örneklem büyüklüğünü otomatik hesaba katar.
Bir lojistik şirketi, yeni bir rota yazılımının teslimat süresini kısalttığını test ediyor. İlk yaklaşım: bir grup şoföre yeni yazılım, başka bir gruba eski; iki grubu karşılaştır. Ama şoförler arasındaki farklar — deneyim, bölge, araç — o kadar büyük gürültü yaratıyor ki, yazılımın etkisi bu gürültüde kayboluyor; iki örneklem t-testi "anlamlı fark yok" diyor.
Green Belt duruyor: "Bunu eşleştirebiliriz." Aynı şoförlere, aynı rotaları, önce eski sonra yeni yazılımla yaptırıyorlar. Şimdi her şoför kendi kontrolü; şoför farkı gürültüsü yok oluyor.
Eşleştirilmiş t-testi, yazılımın gerçek ve tutarlı bir kısalma sağladığını net biçimde yakalıyor. Aynı veri, doğru test türüyle, gizli bir gerçeği ortaya çıkardı.
t-testi, Analyze fazının en sık kullanılan aracıdır: 'iki ortalama farklı mı' sorusunu sinyal/gürültü oranıyla cevaplar ve kök neden hipotezlerini iki-grup karşılaştırmasıyla sınar.
Verini verip uygun t-testini — tek örneklem, iki örneklem ya da eşleştirilmiş — seçmesini, çalıştırmasını ve p-değerini hesaplamasını isteyebilirsin. Asıl değeri rehberlikte: "benim durumumda hangi tür doğru; bunu eşleştirebilir miyim; verim varsayımları karşılıyor mu?" Yapay zekâ doğru testi seçmene ve varsayımları kontrol etmene yardım eder — çoğu kişinin atladığı, en çok hata yapılan adım budur. Ama "aynı şoförlere aynı rotaları yaptırabilir miyim" gibi bir tasarım kararı sahanın gerçeğini bilmeyi gerektirir; ve test "fark gerçek" dese bile o farkın değeri senin yargındır.
t-testi, ortalamaların farkını veri değişkenliğiyle karşılaştırır. Fark büyük, değişkenlik küçükse güçlü kanıt — fark küçük, değişkenlik büyükse şüphe var.