p-Değeri — Dünyanın En Çok Yanlış Anlaşılan Sayısı
Sana istatistiğin en ünlü, en güçlü ve en çok yanlış anlaşılan sayısını tanıtacağım: p-değeri. Bu küçük sayı milyonlarca araştırmada karar verir; ama onu doğru anlayan insan sayısı şaşırtıcı derecede azdır. Bu derste p-değerini hem gerçekten anlayacak hem de herkesin düştüğü tuzaklardan kaçınacaksın — çünkü bir Green Belt için p-değerini yanlış anlamak, yanlış karar vermek demektir.
HİKÂYE AKIŞI
Şaşırtıcılık Ölçer
1
p = şaşırtıcılık göstergesi
Mahkemeyi hatırla: null 'fark yok, sadece şans' der. p-değeri şu sorunun cevabıdır: gözlemlediğimiz bu fark, null doğruysa ne kadar şaşırtıcı? Küçük p = 'şans bunu açıklayamaz' (ibre uç bölgede); büyük p = 'şans bunu rahatça açıklar' (ibre sakin bölgede).
2
Tek yönlü mantık yolu
p-değeri, null'un doğru olduğunu VARSAYARAK hesaplanır: 'fark yok' dünyasından veriye doğru tek yönlü bir yol. Tersine yürüyemezsin — p sana 'hipotezin doğru olma olasılığını' ya da 'yanılma olasılığını' SÖYLEMEZ. Bu, dünyanın en yaygın istatistik hatasıdır.
3
İki ayrı kadran
"GERÇEK Mİ?" kadranı (p-değeri) ile "ÖNEMLİ Mİ?" kadranı (farkın büyüklüğü) bağımsız çalışır. Devasa örneklemde minicik bir fark ilk kadranı yeşil yakar ama ikincisi kırmızıda kalır. Anlamlı ≠ önemli — bu ikisini karıştırmak p tuzaklarının kralıdır.
DOĞRU TANIM
p-Değeri Sezgisel Anlatım
Soru: H₀ gerçekten doğru olsaydı (yani "fark yok" olsaydı), mevcut verimizdeki kadar büyük bir fark şans eseri ortaya çıkabilir miydi? p-değeri: Bu sorunun cevabı. Yani "H₀ doğruyken bu verinin görülme olasılığı." Cümleyi yavaş oku — her kelimesi önemli: null doğruyken, EN AZ bu kadar büyük bir farkın sırf şans eseri çıkma olasılığı.
p = 0.001
Şans eseri bu sonuç neredeyse imkânsız. H₀'ı reddet. Güçlü kanıt.
p-değeri gir → α=0.05 ile karşılaştır → kararı gör.
KRİTİK EŞİK
α (Alfa) — Ne Kadar Hataya Razıyım?
α, "H₀ doğruyken ne kadar hata yapmaya razıyım?" sorusunun cevabıdır. Genellikle 0.05 (%5) seçilir: "100 testten en fazla 5'inde yanlış alarm vermek istiyorum."
α = 0.10
Liberal. Daha çok yanlış alarm kabul ediyorum. Keşif araştırmalarında.
α = 0.05
Standart. Sanayi ve akademik çalışmalarda en yaygın eşik.
α = 0.01
Muhafazakâr. Çok katı. Sağlık, güvenlik veya kritik süreçlerde.
Eşik kutsal değil, bir gelenektir: 0.049 ile 0.051 neredeyse aynı kanıt gücünü taşır — ama biri "anlamlı", diğeri "anlamsız" damgası yer. Olgun yaklaşım, p'yi bir açma-kapama düğmesi gibi değil, kanıt gücü göstergesi gibi okumaktır: ne kadar küçükse, null'a karşı kanıt o kadar güçlü. 0.01, 0.04'ten daha güçlü kanıttır — ikisi de "anlamlı" olsa bile.
MODÜLÜN İMZASI
p, Hipotezin Doğru Olma Olasılığı DEĞİLDİR
Dünyanın en yaygın istatistik hatası — bunu aklına kazı, çünkü herkes yapıyor: "p = 0.03, demek ki %3 ihtimalle yanılıyoruz" YANLIŞ. "p = 0.03, demek ki %97 ihtimalle gerçek fark var" YANLIŞ. p-değeri, null'un doğru olduğunu VARSAYARAK hesaplanır: 'fark yok' dünyasında bu veriyi görme olasılığıdır. Tersini söylemez — mantık yolu tek yönlüdür.
p-değeri, hipotezin doğruluğu hakkında değil; verinin, null altında ne kadar UÇ olduğu hakkındadır. Bu ayrımı kaçıran, p'yi her gün yanlış yorumlar.
EN PRATİK İÇGÖRÜ
İki Kadran: Gerçek mi? × Önemli mi?
🟢 GERÇEK Mİ? (p-değeri)
p sana farkın gerçek olup olmadığını söyler: şans bunu açıklayabilir mi? Devasa örneklemde %3,00 → %3,01'lik gülünç fark bile p'yi minik yapar — kadran yeşil yanar.
🔴 ÖNEMLİ Mİ? (etki büyüklüğü)
Farkın işine değer olup olmadığını p söyleyemez. 0,01 puanlık dönüşüm artışı 'gerçek' olabilir ama uğruna milyonluk yatırım yapılmaz — bu kadran kırmızıda kalır.
Altın kural: p-değeri farkın GERÇEK olup olmadığını söyler; ÖNEMLİ olup olmadığını değil. Önem, farkın büyüklüğünde ve senin bağlamındadır. Tersi de olur: gerçekten değerli bir fark, küçük örneklemde 'anlamlı' çıkmayabilir.
🏭 Üretim
p=0.01 → ayar gerçekten etkili
🏥 Sağlık
p=0.3 → fark kanıtlanamadı
📞 Hizmet
p=0.02 → eğitim işe yaradı
MİT KIRICI
p-Değeri Hakkında Yaygın Yanlış Anlamalar
❌ "p = 0.03 → H₁'in doğru olma olasılığı %97."
✅ YANLIŞ! p-değeri H₁'in olasılığı değildir. H₀ doğruyken bu verinin görülme olasılığıdır.
❌ "p < 0.05 → büyük etki var."
✅ YANLIŞ! p-değeri etki büyüklüğünü ölçmez. 0.1 dakikalık fark da p<0.05 verebilir — ama pratik önemi yoktur.
❌ "p = 0.051 → kesinlikle fark yok."
✅ YANLIŞ! 0.05 eşiği keyfi bir sınırdır. 0.051 ve 0.049 neredeyse aynı kanıt gücünü taşır.
SAHADAN
Çağrı Merkezi: p Kapıyı Açtı, Değer Karar Verdi
Fark gerçek — ama iki parmak arası kadar.
Bir çağrı merkezi, yeni bir eğitim programının çağrı süresini kısalttığını test ediyor. Eğitim öncesi ortalama 6 dakika, sonrası 5 dakika 50 saniye. Hipotez testi: p = 0.02 — anlamlı! Ekip seviniyor.
Ama Green Belt iki soru soruyor. Birincisi: "p bize ne diyor? Eğitimin hiçbir etkisi olmasaydı, bu kadar farkı görme şansımız %2 — şans bunu zor açıklar, fark muhtemelen gerçek." Doğru. İkincisi: "Peki bu fark önemli mi? On saniyelik kısalma için bu eğitime değer mi?"
İşte burada p-değeri susar; bu bir iş kararıdır. Fark gerçek ama belki önemsiz. p-değeri kapıyı açtı; ama içeri girip girmemeye, anlamlılık değil, değer karar verdi.
Örnek: çağrı merkezi eğitimi; 6:00 → 5:50, p=0.02 (gerçek) ama 10 saniyelik etki (önem tartışılır) → yayılım kararı maliyet/değer tartışmasına taşındı.
SIK YAPILAN HATALAR
p Tuzakları
p'yi 'hipotezin doğru olma olasılığı' sanmak
p, null'u varsayarak hesaplanır; 'fark yok dünyasında bu verinin görülme olasılığı'dır. Tersini söylemez.
p farkın gerçekliğini söyler, önemini değil. Farkın büyüklüğüne ve iş bağlamına ayrıca bak.
0.05 eşiğini kutsal sınır gibi okumak
Eşik bir gelenektir; p'yi kanıt gücü göstergesi gibi oku — 0.049 ile 0.051 neredeyse aynı kanıttır.
Büyük p'de 'fark yok' ilan etmek
Büyük p 'şans bunu açıklar' der; fark yok İSPATI değildir. Örneklem gücünü sorgula.
Devasa örneklemin minik farkı 'keşif' sanması
Çok büyük örneklemde önemsiz farklar da anlamlı çıkar; önce etki büyüklüğüne bak.
DMAIC İÇİNDE YERİ
Analyze'ın Karar Sayısı
p-değeri, Analyze fazında kurulan H₀/H₁ mahkemesinin karar mekanizmasıdır: kök neden hipotezinin kanıt gücünü sayıya döker — ama son sözü etki büyüklüğü ve iş bağlamıyla birlikte söyler.
Hesapla
Uygun test (ilerleyen derslerde: t-testi, ANOVA, ki-kare) veriden p-değerini üretir.
Yorumla (bu ders)
Küçük p → null'a karşı güçlü kanıt; büyük p → şans açıklıyor. Eşiği gösterge gibi oku; asla 'hipotez olasılığı' sanma.
Karar → Improve
GERÇEK Mİ kadranından geçen farkı ÖNEMLİ Mİ kadranına sok: etki büyüklüğü + maliyet/değer → yayılım kararını takım verir.
AI KÖŞESİ
Yapay Zekâ Olasılığı Söyler — Önemi ve Kararı İnsan Verir
Verini verip uygun testi çalıştırmasını ve p-değerini hesaplamasını isteyebilirsin. Ama asıl değeri yorumda: "bu p-değeri tam olarak ne anlama geliyor, ne anlama gelmiyor?" diye sorabilirsin. Yapay zekâ seni klasik yanlış yorumlardan ("hipotezin doğru olma olasılığı") korumakta ve anlamlılık ile pratik önemi ayırmanda iyidir. Ama "on saniyelik kısalma bu eğitime değer mi?" sorusu bir değer ve strateji kararıdır — onu verin değil, yargın cevaplar. "Anlamlı çıktı, hemen yapalım" aceleciliğine karşı yorumu ekiple paylaş; Green Belt tartışmayı kolaylaştırır, kararı takım verir.
AI Asistanı
Test sonucunu ve bağlamı ver (ör. "eğitim öncesi 6,0 dk, sonrası 5,83 dk; p=0,02; 500 çağrı"); p'nin tam olarak ne söylediğini doğru cümleyle açıklayayım, klasik yanlış yorumlardan koruyayım ve farkın pratik önemini ayrıca değerlendireyim. Yayılım kararını değer/maliyet tartışmasıyla takımın verir.
Bir Yalın Altı Sigma istatistik mentoru gibi davran. Aşağıdaki p-değerini doğru yorumlamama yardım et. (1) Bu p-değeri TAM OLARAK ne anlama geliyor — doğru cümleyle açıkla (null doğruysa bu kadar uç bir farkı görme olasılığı). (2) Beni klasik yanlış yorumlardan koru: bu p 'hipotezin doğru olma olasılığı' mı, 'yanılma olasılığımız' mı — neden DEĞİL? (3) Bu sonuç null'a karşı ne kadar güçlü kanıt — eşiği açma-kapama düğmesi değil, kanıt gücü göstergesi gibi yorumla.
Devam et: (4) EN ÖNEMLİSİ: Bu fark anlamlı olsa bile PRATİKTE önemli mi? Farkın büyüklüğüne (0,17 dk ≈ 10 saniye) bakarak değerlendir. (5) Örneklem büyüklüğü bu yorumu nasıl etkiliyor — çok büyük örneklemde önemsiz farklar da anlamlı çıkabilir mi? (6) Bu bir 'hemen yap' kararı mı, yoksa değer/maliyet tartışması mı gerektiriyor?
AI olasılığı söyler — önemi ve kararı insan verir.
KENDİNİ SINA
Hızlı Kontrol
H₀ reddedilir — p < α olduğu için H₀'ı reddederiz. Fark istatistiksel olarak anlamlıdır. Ancak etki büyüklüğü de değerlendirilmelidir.
H₀ doğruyken bu kadar aşırı (veya daha aşırı) bir verinin görülme olasılığı — etki büyüklüğünü, H₁'in doğruluk olasılığını veya farkın önemini ölçmez.
Daha muhafazakâr eşik — H₀'ı reddetmek için %1 hata payını kabul ediyorum. Daha güçlü kanıt gerekir. Tip 1 hata (yanlış alarm) olasılığı azalır, Tip 2 hata riski artar.
Fark anlamlı, tesadüf değil — düşük p, gözlenen farkın yalnızca şansla oluşma olasılığının küçük olduğunu; H₀'ın reddedildiğini gösterir.
Fark kanıtlanamadı — yeterli kanıt yoktur; 'fark yok' ispatı değil, 'gösteremedik' anlamına gelir.
SON SÖZ
p-değeri, H₀ doğruyken bu kadar şaşırtıcı bir veri görme olasılığıdır. Küçükse H₀'ı reddet, büyükse kanıt yetersiz — ama hiçbir zaman etki büyüklüğüyle karıştırma.
Bir sonraki test sonucunda iki kadranı ayrı ayrı oku: önce "GERÇEK Mİ?" (p-değeri, kanıt gücü göstergesi olarak), sonra "ÖNEMLİ Mİ?" (etki büyüklüğü + iş bağlamı). p gerçeği söyler; önemi sen verirsin. Sıradaki ders: Güven aralığı — "fark tam olarak ne kadar, ne kadar eminiz?" sorusuna p'den daha zengin cevap veren araç.