Gage R&R'ı öğrendik; ölçüm sistemine sayısal bir sınav verdik. Ama o sınavın gizli bir varsayımı vardı: ölçtüğümüz şeyin bir sayı olması. Peki ya ölçtüğün şey bir sayı değil, bir yargıysa? 'Bu lehim iyi mi kötü mü?' 'Bu kaynak kabul edilebilir mi?' Bunları kumpasla ölçemezsin. Bu derste, en sinsi ve en çok güvenilen veri türünün — geçti-kaldı, kusurlu-sağlam gibi nitel verinin — güvenilirliğini sorgulayacağız.
Hikâye Storyboard
Yargıyı Cetvelle Ölçemezsin: Üç Kare
1
Kesinlik kılığında tutarsızlık
Geçti-kaldı verisi nesnel hisseder — cevap kesin görünür, ya geçti ya kaldı, ortası yok. Ama tuzak burada: o kararın arkasında bir insan yargısı var, ve yargı sayı kadar nesnel değil. Bir kumpas her zaman aynı uzunluğu okur; ama bir insan aynı parçaya bugün 'kabul', yarın 'ret' diyebilir. Nitel verinin tutarsızlığı kesinlik kılığında saklanır.
2
Mesafe yok, uyum var
Standart Gage R&R'ı burada kullanamayız: bir yargıda 'ne kadar uzakta' diye bir şey yoktur, sadece 'aynı mı, farklı mı' vardır. İki kişi 12,1 ve 12,3 mm ölçerse aralarındaki mesafeyi hesaplarsın; ama biri 'kabul' diğeri 'ret' derse ortada mesafe yok. Bu yüzden nitel veride değişkenliği 'ne kadar' değil, 'ne sıklıkta anlaşıyorlar' diye ölçeriz — buna uyum analizi denir.
3
Uyum ≠ doğruluk
Nitel ölçümde üç soru sorarız: aynı kişi tutarlı mı, kişiler birbiriyle uyumlu mu, ve doğru mu (bilinen gerçekle, cevap anahtarıyla karşılaştır). Çünkü en kritik içgörü şu: herkes birbiriyle tam uyumlu olabilir ama hep birlikte yanlış olabilir. Üç kontrolcü de kusurlu parçaya 'sağlam' diyorsa mükemmel uyumları vardır — ama hep birlikte yanılıyorlardır.
Sahneden
Boyama Hattı Kalite Muayenesi
Ali
"100 parçadan 12'si geçmez → hata oranı %12"
Ayşe
"Aynı 100 parçadan 28'i geçmez → %28!"
⚠️ Aynı partiden aynı parçalar — %40 farklı oy! Süreç sorunu mu yoksa muayene sorunu mu?
Görsel muayenede standart tanım olmadan iki kişi tamamen farklı karar verebilir. Bu veri kaliteyi değil, operatörü yansıtır.
İki Veri Türü
Nitel vs Nicel Ölçüm
Nicel Ölçüm
Continuous Data
18.2 mm, 50.1 g, 3.7 sn
Sayısal, kesirli olabilir
Gage R&R ile analiz
EV ve AV hesaplanabilir (mesafe var).
Nitel Ölçüm
Attribute Data
Geç / Geçmez, İyi / Kötü
Kategorik, ikili veya çok sınıflı
Attribute MSA ile analiz
Kappa katsayısı ile güvenilirlik (uyum var, mesafe yok).
Üç Soru
Nitel Ölçümü Nasıl Test Edersin?
1
Aynı kişi tutarlı mı?
Aynı parçayı aynı kişiye iki kez, karışık sırayla göster. İki kez aynı kararı mı veriyor? — nitel verinin tekrarlanabilirliği.
2
Kişiler uyumlu mu?
Aynı parçaları farklı kişilere göster. Hepsi aynı karara mı varıyor, yoksa biri 'sıkı' biri 'gevşek' mi? — nitel verinin yeniden üretilebilirliği.
3
Doğru mu?
Sayısal ölçümde olmayan boyut. Kararı bilinen 'doğru cevapla' (uzman/referans) karşılaştır. Herkes uyumlu ama hep birlikte yanlış olabilir — uyum, doğruluk demek değildir.
İnteraktif
Görsel Standart Oluşturucu
6 ürünü incele ve karar ver — GEÇ / SINIR / GEÇMEZ. (Sınır örnekleri belirlemek ölçüm tutarsızlığını azaltır.)
Ürün 1: Çok küçük çizik, görünmez
Ürün 2: Orta boyut çizik, derin değil
Ürün 3: Derin çizik, müşteri görür
Ürün 4: Yüzey lekesi, çok küçük
Ürün 5: Büyük kabarcık, yüzey bozuk
Ürün 6: Hafif renk farkı, eşik altı
Çözümün Anahtarı
Sınır Örnekler (Limit Samples) Neden Önemli?
🟢
Kesin GEÇ Örnek
Herkesin anlaşacağı açıkça kabul edilebilir parça. Referans alt uç.
🟡
Alt Sınır Örnek
Kabul/ret sınırının alt kenarı. Bu ve altı artık geçmez.
🔴
Kesin GEÇMEZ Örnek
Herkesin anlaşacağı açıkça reddedilecek parça. Referans üst uç.
💡 Sınır örnek seti oluşturulduktan sonra tüm operatörler aynı referansa bakarak karar verir → tutarsızlık dramatik şekilde azalır. Çözüm cihaz değil, ortak bir dildir.
İki Yön
İki Hata, İki Bedel
Kusuru Kaçırma
Kötü bir parçaya 'iyi' demek. Kusurlu ürünü müşteriye gönderir; bedeli itibar, güvenlik, iade. Genellikle daha tehlikeli.
Yanlış Alarm
İyi bir parçaya 'kötü' demek. Sağlam ürünü çöpe atar ya da gereksiz yeniden işler; bedeli boşa giden maliyet.
İyi bir Green Belt, ölçüm sisteminin hangi yönde daha çok yanıldığını bilir — kusuru kaçırmak ile sağlamı reddetmek çok farklı problemlerdir ve farklı önemleri vardır.
Sayısal Ölçüt
Kappa Katsayısı — Neden Sadece %Uyum Yetmez?
İki operatörün %90 uyumu güçlü görünür; ancak parçaların %85'i zaten açıkça geçiyorsa şans yüzünden de %85 uyum beklenir. Kappa, şans faktörünü çıkarır.
κ = (P_gözlem − P_şans) / (1 − P_şans)
κ ≥ 0.8
Mükemmel uyum
0.6 – 0.8
İyi uyum
0.4 – 0.6
Orta uyum
κ < 0.4
Zayıf — standart gerekli
Hikâye
Tekstil Firması: Sistematik Sapan Denetçi Para Kaybettiriyordu
Yargı ortak dile bağlanınca tutarsızlık çöktü.
Green seviyesinin özü: nitel ölçümü iyileştirmenin yolu neredeyse her zaman aynıdır — yargıyı somut bir ortak standarda bağlamak. Madem sorun insan yargısının kayganlığı, çözüm o yargıyı mümkün olduğunca somutlaştırmaktır: net, görsel, örnekli kabul kriterleri; sınır numuneleri; belirsiz kelimeler yerine ölçülebilir eşikler. Nitel ölçümü iyileştirmek çoğu zaman bir cihaz değil, bir ortak dil meselesidir.
Bir tekstil firmasında kumaş '1. kalite' mi '2. kalite' mi diye sınıflanıyor; bu karar fiyatı doğrudan etkiliyor. Şikâyetler artıyor: aynı kumaş bir gün birinci, başka gün ikinci çıkıyor. Ekip bir uyum testi yapıyor — yirmi örnek (gerçek kaliteleri uzmanca belirlenmiş), beş denetçi, ikişer kez, karışık. Sonuç üç şeyi açığa çıkarıyor: denetçiler kendi içinde tutarsız; birbirleriyle uyumsuz; ve en önemlisi, uzmanın doğru cevabıyla karşılaştırınca bir denetçi sistematik olarak '2.'ye kaydırıyor — sürekli düşük puanlayıp şirkete para kaybettiriyor.
Çözüm: belirsiz 'kalite hissi' yerine fotoğraflı ve dokunsal sınır numuneleriyle somut bir standart. Yargı, ortak bir dile bağlanınca tutarsızlık çöktü. Ders: geçti-kaldı verisine kör güvenme — önce yargıyı standarda bağla.
Jüri paneli / puanlama metaforu (nitel karar = jüri puanı; cevap anahtarı = uzmanın gerçek kararı), kesinlik kılığında tutarsızlık, mesafe-yok-uyum-var, üç soru (tutarlı/uyumlu/doğru), uyum≠doğruluk, iki hata (kusur kaçırma vs yanlış alarm), yargıyı standarda bağlama (sınır numuneleri) ve tekstil (1./2. kalite, sistematik sapan denetçi) örneği; nitel verinin kaygan yargısını somutlaştırmak içindir.
Sık Hatalar
Nitel Veride Yaygın Tuzaklar
Geçti-kaldı verisini kesin/nesnel sanmak
Nesnel hisseder ama arkasında kaygan bir insan yargısı vardır; tutarsızlık kesinlik kılığında saklanır. Önce uyumunu test et.
Nitel veriye standart Gage R&R uygulamak
Yargıda mesafe yok, sadece 'aynı/farklı' var. 'Ne kadar' değil 'ne sıklıkta anlaşıyorlar' diye ölç — uyum analizi ve Kappa kullan.
Uyumu doğruluk sanmak
Herkes birbiriyle tam uyumlu olup hep birlikte yanılabilir. Kararı bilinen 'doğru cevapla' (uzman/referans) da karşılaştır — sadece birbirleriyle değil.
İki hata türünü ayırmamak
Kusuru kaçırma (kötüye 'iyi') ile yanlış alarm (iyiye 'kötü') farklı bedeller taşır. Sisteminin hangi yönde daha çok yanıldığını bil.
Belirsiz kelimelerle standart yazmak
'Kalite hissi' gibi belirsiz ifadeler tutarsızlık üretir. Fotoğraflı/dokunsal sınır numuneleriyle somut, ortak bir dil kur.
DMAIC Bağı
Attribute MSA — Nitel Verinin Gage R&R'ı
Attribute MSA, Measure'da nitel (geçti/kaldı) kararların güvenilirliğini sınar — sürekli Gage R&R'ın nitel veri karşılığıdır; kararlara güvenmeden Analyze yapılamaz.
Gage R&R ile
Sürekli veride EV/AV; nitel veride kişi içi tutarlılık + kişiler arası uyum + doğruluk (cevap anahtarı).
Bu uyumu daha yakından — denetçiler arası uyum ve Kappa hesabı açısından — inceliyoruz.
AI Köşesi
AI Üç Boyutu Ayırır ve 'Hep Birlikte Yanılma'yı Yakalar, Doğruyu Sen Tanımlarsın
Test verisini — parça, denetçi, tekrar, karar ve bilinen doğru cevap — verip uyum analizini yaptırabilirsin: 'denetçiler kendi içinde tutarlı mı, birbirleriyle uyumlu mu, doğru cevaba ne kadar yakınlar, hangi denetçi hangi yöne sapıyor?' Yapay zekâ bu üç boyutu ayırıp 'herkes uyumlu ama hep birlikte kusuru kaçırıyor' gibi tehlikeli bir durumu yakalar; iki hata türünü sayar ve sistematik sapan denetçiyi işaret eder. Bazı nitel sınıflandırmalar artık AI'ya da yaptırılabiliyor (görüntü/dil modelleri) — ama dikkat, AI'nın da kendi tutarsızlıkları vardır, o da bir 'denetçi' gibi sınanmalıdır. Ama 'doğru cevabın' ne olduğunu ve standardın ne olması gerektiğini insan belirler: 'kabul edilebilir kalite' çizgisinin nerede olduğu müşteriye/maliyete/riske bağlı bir karardır ve o ortak standardı sahadaki insanlarla kuran sensin. Yapay zekâ kimin saptığını gösterir; doğru olanı tanımlayan sensin.
AI Asistanı
Bir geçti-kaldı/kalite kararını mı sınayacaksın? Gerçek durumu uzmanca belirlenmiş ~15-20 örneği birkaç denetçiye ikişer kez karışık değerlendirtip tabloyu (örnek, gerçek karar, denetçi, tekrar, denetçi kararı) ver; ben kişi içi tutarlılığı, kişiler arası uyumu ve doğruluğu (cevap anahtarına yakınlık) ayırayım, 'hep birlikte yanılma'yı ve sistematik sapan denetçiyi yakalayayım — doğru çizgiyi sen tanımla.
Bir Yalın Altı Sigma ölçüm sistemi mentoru gibi davran. Ekte nitel (geçti/kaldı) uyum verisi var; her örneğin uzmanca belirlenmiş GERÇEK kararı da mevcut. (1) Her denetçi KENDİ İÇİNDE tutarlı mı (aynı örneğe iki kez aynı karar)? (2) Denetçiler BİRBİRİYLE uyumlu mu, biri 'sıkı' biri 'gevşek' mi? (3) Uzmanın DOĞRU cevabına ne kadar yakınlar — herkes uyumlu ama hep birlikte yanılıyor olabilir mi? (4) İki hata türünü ayır: kötüye 'iyi' (kusur kaçırma) ve iyiye 'kötü' (yanlış alarm) — hangisi daha sık, bedeli ne? (5) Hangi denetçi hangi yöne sistematik sapıyor? (6) Güvenilirliği artırmak için somut, örnekli standart öner. [Veriyi ekle.]
Şu geçti-kaldı kararlarını değerlendir: [denetçi kararları + gerçek cevap]. Denetçiler tutarlı ve uyumlu mu, doğru cevaba yakın mı? Herkes anlaşıp hep birlikte yanılıyor mu? Kusuru mu kaçırıyorlar yoksa yanlış alarm mı?
AI kimin saptığını gösterir — doğru olanı sen tanımlarsın.
Anlayalım
Tıkla, Cevabı Gör
Geçti/kaldı gibi sınıflandırma kararlarının tutarlılığını: aynı kişi tekrar aynı kararı veriyor mu (tekrarlanabilirlik), kişiler birbiriyle uyumlu mu (yeniden üretilebilirlik) ve doğru cevaba yakınlar mı (doğruluk).
Çünkü yargıda mesafe yoktur, sadece 'aynı mı farklı mı' vardır. Değişkenliği 'ne kadar' değil 'ne sıklıkta anlaşıyorlar' diye ölçeriz — uyum analizi ve Kappa katsayısıyla.
Herkes birbiriyle mükemmel uyumlu olabilir ama hep birlikte yanılabilir — üç kontrolcü de kusurlu parçaya 'sağlam' derse uyumları mükemmel ama hepsi yanlış. Bu yüzden bilinen doğru cevapla da karşılaştır.
Cebine Koymalık
Geçti-kaldı verisi nesnel hisseder ama çoğu zaman en güvenilmez veridir — çünkü arkasında kaygan bir insan yargısı yatar; uyum, doğruluk demek değildir, herkes anlaşıp hep birlikte yanılabilir.
Geçti-kaldı, kusurlu-sağlam gibi nitel veri nesnel hisseder ama çoğu zaman en güvenilmez veridir, çünkü arkasında kaygan bir insan yargısı yatar. Onu 'ne kadar' ile değil, 'ne sıklıkta anlaşıyorlar' ile ölçeriz. Üç soru sor: aynı kişi tutarlı mı, kişiler uyumlu mu, ve doğru mu — çünkü herkes anlaşıp hep birlikte yanılabilir. Kusuru kaçırmak ile sağlamı reddetmek farklı bedeller taşır. Altın kural: çözüm neredeyse her zaman yargıyı somut bir ortak standarda (sınır numuneleri) bağlamaktır — cihaz değil, ortak dil. Sıradaki: denetçiler arası uyum ve Kappa.