t-testi iki grubu karşılaştırdı. Ama gerçek hayatta çoğu zaman ikiden fazla grubun olur: üç vardiya, dört makine, beş tedarikçi. En doğal fikir: "her ikiliyi ayrı t-testiyle karşılaştırırım, olur biter." Mantıklı görünüyor, değil mi? Bu derste sana bunun neden tehlikeli bir tuzak olduğunu ve yerine kullanılan zarif aracı — ANOVA'yı — göstereceğim.
HİKÂYE AKIŞI
Piyango Tuzağından Tek Adil Teste
1
Çok bilet = sahte kazanç
Her testte %5 Tip 1 hata riski var. Bir test: kabul edilebilir. Ama 5 grubu ikişerli karşılaştırmak 10 test demek — sırf şans eseri en az bir 'sahte fark' bulma olasılığın kabaca %40'a fırlar. Hiçbir grup farklı olmasa bile bir yerlerde 'anlamlı' bir şey göreceksin — çok denemenin yanılsaması.
2
Gruplar arası ÷ grup içi
ANOVA, sinyal-gürültü fikrinin akıllı uzantısıdır: grup ortalamalarının birbirinden saçılması (sinyal) ile her grubun kendi içindeki dalgalanmayı (gürültü) oranlar. Ortalamalar, grupların doğal dalgalanmasından belirgin biçimde daha fazla saçılmışsa: gruplar gerçekten farklı. 'Varyans analizi' ismi buradan.
3
En az biri farklı — ama hangisi?
ANOVA anlamlı çıkınca sadece 'hepsi aynı değil' bilgisini alırsın; HANGİSİNİN farklı olduğunu söylemez. Onu bulmak için post-hoc takip testleri gerekir — çoklu karşılaştırmayı hesaba katan kontrollü aramayla. ANOVA kavganın bittiğini değil, başladığını söyler.
TUZAK
Neden 4 t-Testi Yapmayalım?
4 tedarikçi için 6 ikili karşılaştırma gerekir (AB, AC, AD, BC, BD, CD). Her birinde α = 0.05 hata riski varsa, birleşik yanlış alarm olasılığı 1 − 0.95⁶ ≈ %26'ya yükselir!
❌ Çoklu t-testi
4 grup → 6 ikili karşılaştırma
Birleşik Tip 1 hata ≈ %26
Sonuçlar güvenilmez
✅ ANOVA
Tek test, tüm grupları karşılaştırır
Tip 1 hata kontrolü: α = 0.05
F-istatistiği ile karar
F-ORANI
ANOVA Mantığı — Gruplar Arası vs Grup İçi
Gruplar Arası Varyans
Grup ortalamalarının genel ortalamadan ne kadar saptığı. Gruplar gerçekten farklıysa bu büyük olur.
Grup İçi Varyans
Her grubun kendi içindeki değişkenlik. Tesadüfi gürültü (hata) bileşeni.
F-istatistiği
F büyükse: gruplar arası fark, tesadüfü aşıyor. H₀ reddedilir.
F = MSB / MSW = (Gruplar arası ortalama kare) / (Grup içi ortalama kare)
İNTERAKTİF
t-Testi mi, ANOVA mı? — Karar Ağacı
Kaç grup karşılaştırıyorsun? Seç ve doğru aracı gör.
✅ t-testi kullan
İki grup ortalaması karşılaştırması. Bağımsız gruplar için bağımsız iki örneklem t-testi, önce/sonra için eşleştirilmiş t-testi.
✅ ANOVA kullan
F-testi ile H₀: "Tüm grup ortalamaları eşit" test edilir. ANOVA anlamlı çıkarsa hangi gruplar farklı sorusunu post-hoc testlerle (Tukey, Bonferroni) cevapla.
Piyangoyu düşün: bir bilet alırsan kazanma şansın çok düşük. Ama bin bilet alırsan birinin tutması neredeyse kesindir — bu senin yeteneğin değil, sadece çok denemenin matematiği. Çoklu test de böyle: yeterince karşılaştırma yaparsan, içlerinden biri sırf şans eseri 'anlamlı' çıkar. Bir farkın anlamlı çıkması, onu yüzlerce karşılaştırma arasından seçtiysen çok daha az şey ifade eder.
Buna 'çoklu karşılaştırma problemi' denir — bilimde sahte keşiflerin en büyük kaynaklarından biri. ANOVA: bir sürü bilet yerine tek, adil, kontrollü test.
ÖRNEK ANOVA
Tedarikçi Kalitesi — 4 Grup, Tek Test
Tedarikçi
n
Ortalama DPMO
Std Sapma
Karşılaştırma
Tedarikçi A
25
320
48
✅ En iyi
Tedarikçi B
25
410
62
⚠️ Orta
Tedarikçi C
25
680
91
❌ Yüksek
Tedarikçi D
25
355
55
✅ İyi
ANOVA sonucu: F = 18.4, p < 0.001 → H₀ reddedildi. Tukey post-hoc: C tedarikçisi A, B ve D'den anlamlı şekilde daha yüksek DPMO. Önerilen aksiyon: C tedarikçisiyle sözleşme gözden geçirilmeli.
🏭 Üretim
3 vardiyanın fire ortalaması — ANOVA
🏥 Sağlık
3 bölümün bekleme süresi
📞 Hizmet
3 ekibin performansı
SAHADAN
Gıda Fabrikası: ANOVA Doğru Hatta Yönlendirdi
Tek kontrollü test + takip analizi = doğru hat, sıfır sahte suçlu.
Bir gıda fabrikasında dört üretim hattının fire oranları karşılaştırılıyor. Acemi yaklaşım: dört hattı ikişer ikişer, altı ayrı t-testiyle karşılaştırmak. Sorun: altı testte, hatlar gerçekte aynı olsa bile sırf şans eseri bir 'anlamlı fark' bulma şansları yüksek — sahte bir suçlu yaratabilirler.
Green Belt yaklaşımı: önce bir ANOVA. ANOVA "evet, dört hat aynı değil, en az birinde gerçek bir fark var" diyor — tek test, kontrollü hata. Sonra takip analizi: farkın esasen üçüncü hattan geldiği, diğer üçünün birbirine çok yakın olduğu görülüyor.
Şimdi odaklarını biliyorlar: üçüncü hat. Altı t-testiyle başlasalardı, belki rastgele bir ikilide sahte bir fark görüp yanlış hatta saatler harcayacaklardı. ANOVA hem hata oranını korudu hem doğru yere yönlendirdi.
Örnek: 4 üretim hattı fire karşılaştırması; ANOVA (tek kontrollü test) + post-hoc → fark 3. hattan; çoklu t-testinin sahte-suçlu riski önlendi.
SIK YAPILAN HATALAR
Çoklu Grup Tuzakları
Her ikiliyi ayrı t-testiyle karşılaştırmak
Testler çoğaldıkça birleşik Tip 1 hata şişer (%5 → %26-40). Tek ANOVA ile kontrollü karşılaştır.
ANOVA anlamlı çıkınca 'hangisi' sorusunu atlamak
ANOVA sadece 'en az biri farklı' der; farkın kaynağını post-hoc testle (Tukey, Bonferroni) bul.
Post-hoc'u düzeltmesiz ikili t-testlerle yapmak
Takip analizi de çoklu karşılaştırmayı hesaba katmalı — düzeltmeli post-hoc kullan.
Varsayımları atlamak
ANOVA da normallik ve varyans homojenliği varsayar; bozuksa Welch ANOVA ya da parametrik olmayan alternatif.
İstatistiksel bulguyla yetinmek
"3. hat farklı" bir kapı açar; nedenini (makine? operatör? malzeme?) saha ve kök neden araştırması bulur.
DMAIC İÇİNDE YERİ
Analyze'ın Çoklu Grup Hakemi
ANOVA, Analyze'da çok gruplu karşılaştırmaların hakemi: vardiyalar, makineler, tedarikçiler arasında gerçek fark olup olmadığını tek kontrollü testle söyler ve kök neden aramasını doğru gruba odaklar.
Tek test
İkili t-testler yerine ANOVA: 'en az biri farklı mı?' — tek p, kontrollü α.
Suçluyu bul
Anlamlıysa post-hoc (Tukey/Bonferroni/Games-Howell) ile hangi grubun farklı olduğunu teşhis et.
Sahaya taşı → sıradaki ders
Farklı grubu kök neden araştırmasına çevir. Verin kategorikse (sayım/oran) sıradaki araç: ki-kare testi.
Çok gruplu verini verip ANOVA çalıştırmasını, p-değerini hesaplamasını ve 'en az biri farklı mı' sorusunu cevaplamasını isteyebilirsin. Asıl değeri rehberlikte: "birden çok t-testi yapmaya meyilliydim — bu neden tehlikeli?" diye sorarsan seni çoklu karşılaştırma tuzağından korur; anlamlı sonuçta doğru post-hoc'u önerir ve varsayımları kontrol eder. Ama "üçüncü hat farklı" bilgisinin nedenini — hangi makine, hangi operatör, hangi malzeme — sahada araştıracak ve farkı aksiyona çevirecek olan sensin ve takımın.
AI Asistanı
Çok gruplu verini ver (ör. "4 üretim hattının fire oranları, her hattan ~50 ölçüm"); önce çoklu t-testi riskini sayısal göstereyim, ANOVA çalıştırıp 'en az biri farklı mı' cevabını vereyim, post-hoc ile suçlu grubu işaretleyeyim. Kök neden araştırmasını saha bilgisiyle sen yönetirsin.
Bir Yalın Altı Sigma istatistik mentoru gibi davran. Aşağıdaki çok gruplu veriyi analiz et. (1) Önce beni uyar: bu grupları ikişer ikişer ayrı t-testleriyle karşılaştırmak neden tehlikeli (çoklu karşılaştırma / şişen Tip 1 hata)? Kaç test gerekir ve yanlış pozitif riski ne olur? (2) Bunun yerine ANOVA çalıştır: gruplar arası değişkenliği grup içi değişkenliğe oranlayarak 'en az biri farklı mı?' sorusunu cevapla; p-değerini ver. (3) ANOVA'nın varsayımlarını verim karşılıyor mu kontrol et.
Devam et: (4) ANOVA anlamlı çıktıysa, HANGİ grubun/grupların farklı olduğunu bulmak için doğru (kontrollü) takip analizini öner ve uygula. (5) Sonucu sade dille yorumla: hangi hat sorunlu, fark pratikte önemli mi? (6) Bu istatistiksel bulguyu nasıl bir kök neden araştırmasına çevirmeliyim?
AI tuzaktan korur — nedeni sahada araştıran ve aksiyona çeviren takımdır.
KENDİNİ SINA
Hızlı Kontrol
Çoklu karşılaştırma Tip 1 hata şişmesi — 5 grup için 10 ikili test gerekir. Her birinde α=0.05 hata payı birikince birleşik hata ≈ %40. ANOVA tek testle α=0.05 kontrolünü korur.
H₀ reddedildi — en az bir çift grup ortalaması istatistiksel olarak anlamlı şekilde farklı. Hangi gruplar farklı olduğunu bulmak için post-hoc test (Tukey vb.) gerekir.
ANOVA yalnızca 'en az bir fark var' der — hangi grubun hangisinden farklı olduğunu söylemez. Post-hoc testler (Tukey, Bonferroni) tüm ikili karşılaştırmaları α düzeltmesiyle yaparak farkın kaynağını gösterir.
3+ grup ortalamasını kıyaslarken — ANOVA, ikiden fazla grubun ortalamaları arasında anlamlı fark olup olmadığını test eder.
En az bir grup diğerlerinden farklı — anlamlı sonuç, gruplardan en az birinin farklı olduğunu söyler; hangisi olduğu ek analizle bulunur.
SON SÖZ
ANOVA, F-istatistiğiyle gruplar arası farkın grup içi gürültüden büyük olup olmadığını sınar. Fark bulunduktan sonra post-hoc testler suçluyu — yani farklı grubu — teşhis eder.
Bir sonraki çok gruplu karşılaştırmanda elini t-testine giderken durdur: kaç ikili test gerekir, birleşik yanlış alarm riski ne olur? Tek ANOVA ile başla; anlamlıysa post-hoc'la suçluyu bul; sonra sahaya inip nedenini araştır. Sıradaki ders: ki-kare testi — sayısal değil, kategorik veriyle çalışan test.