Küçük örneklemde (n < 30) hangi testler güvenilir?

Tez · · İstatistikçi · Yaklaşık 4 dk okuma

Yayın:

Kısa cevap

Küçük örneklemde sorun testin 'yasak' olması değil, gücün düşmesidir. Veri yaklaşık normalse 15–20 gözlemle bile t-testi geçerlidir; belirgin çarpıklık, uç değer veya sıralı veri varsa Mann-Whitney U, Wilcoxon, Kruskal-Wallis gibi kesin dağılıma dayanan testler ve kategorik veride Fisher kesin testi tercih edilir. Her durumda etki büyüklüğü ve güven aralığı raporlanmalı, anlamsız sonuçlar 'fark yok' değil 'bu örneklemle fark saptanamadı' diye yorumlanmalıdır.

Bu yazıda neler var?

"Örneklemim 24 kişi, istatistik yapılabilir mi?" Yapılabilir; nadir hastalık çalışmaları, pilot uygulamalar, tek sınıfla yürütülen deneysel tasarımlar hep küçük örneklemle yapılır. Sorun testin yapılıp yapılamaması değil, hangi testin hangi koşulda doğru olduğu ve sonuçların nasıl yorumlanacağıdır. Bu yazıda "30 kuralı"nın nereden geldiğini, küçük örneklemde test seçimini ve jürinin bu konudaki sorularını ele alıyoruz.

"n en az 30 olmalı" kuralı nereden geliyor?

Bu eşik, örneklem ortalamalarının dağılımının normale yaklaşması için ders kitaplarında verilen kaba bir rehberdir; bir yasa değildir. Student'ın t dağılımı zaten küçük örneklemler için geliştirilmiştir ve ham verinin yaklaşık normal olduğu durumda t-testi 10–15 gözlemle de geçerli sonuç verir. Tersine, veri aşırı çarpıksa 30 gözlem de yetmeyebilir. Yani 30 sayısı, test seçiminin değil, normallik varsayımının ne kadar kritik olduğunun göstergesidir.

Asıl mesele güçtür. İstatistiksel güç, gerçekte var olan bir farkı yakalama olasılığıdır. İki grupta 12'şer kişiyle orta büyüklükte bir farkı (d = 0,5) yakalama olasılığı yaklaşık %21'dir; aynı fark için %80 güç 64'er kişi gerektirir. Küçük örneklemin bedeli, anlamsız çıkan sonuçların büyük bölümünün "fark yok" değil "görülemedi" anlamına gelmesidir. Güç hesabının nasıl yapıldığını G*Power ile örneklem büyüklüğü hesaplama yazısında anlattık.

Küçük örneklemde test seçimi

Kararı iki şey belirler: değişkenin türü ve dağılımın görünümü.

Sürekli değişken, yaklaşık simetrik dağılım, uç değer yok: t-testi ve eşleştirilmiş t-testi kullanılabilir. Küçük örneklemde normallik testleri (Shapiro-Wilk) sapmayı yakalayamayacak kadar güçsüzdür; bu yüzden karar, histogram, kutu grafiği ve çarpıklık katsayısı ile verilir. Welch düzeltmeli t-testi, grup varyansları farklı göründüğünde standart seçenektir ve SPSS'te "varyanslar eşit varsayılmıyor" satırı olarak hazırdır.

Sürekli değişken, belirgin çarpıklık veya uç değer: Mann-Whitney U (iki bağımsız grup), Wilcoxon işaretli sıralar (eşleştirilmiş), Kruskal-Wallis (üç ve daha fazla grup). Bu testler sıraları kullandığı için uç değerden etkilenmez. Küçük örneklemde SPSS'in kesin (exact) p değerini seçtiğinizden emin olun; asimptotik p değeri 20'nin altındaki örneklemde yanıltıcı olabilir.

Sıralı (ordinal) değişken: Tek Likert maddesi, evre, derece gibi veriler örneklem büyüklüğünden bağımsız olarak parametrik olmayan testlerle incelenir.

Kategorik değişken: Ki-kare testinin beklenen göze sayısının 5'in altında olmaması koşulu küçük örneklemde neredeyse hiç sağlanmaz. 2×2 tablolarda Fisher kesin testi, daha büyük tablolarda Fisher-Freeman-Halton kesin testi (SPSS'te "Exact" seçeneği) kullanılır.

Korelasyon: 15–20 gözlemle hesaplanan korelasyon katsayısının güven aralığı çok geniştir; r = 0,45 bulunsa bile aralık −0,05 ile 0,75 arasında olabilir. Katsayıyı aralığıyla birlikte raporlamak ve tek bir uç gözlemin katsayıyı sürükleyip sürüklemediğini saçılım grafiğinde göstermek gerekir.

Regresyon ve çok değişkenli modeller: Küçük örneklemde en riskli alan burasıdır. Her bağımsız değişken için en az 10–15 gözlem kuralı, 25 kişilik bir çalışmada en fazla iki yordayıcıya izin verir. Faktör analizi, yapısal eşitlik modeli ve lojistik regresyon küçük örneklemde ya hiç yapılmamalı ya da sınırlılık olarak açıkça yazılmalıdır.

Bootstrap ve kesin testler ne zaman işe yarar?

Bootstrap, veriden tekrar tekrar örneklem çekerek güven aralığı üreten bir yöntemdir ve SPSS'te çoğu analizde tek tıkla açılır. Dağılım varsayımına dayanmadığı için küçük ve çarpık örneklemde ortalama farkı, korelasyon ve regresyon katsayıları için daha gerçekçi aralıklar verir. Ancak sihirli bir çözüm değildir: 10 gözlemden 1000 örneklem çekmek, 10 gözlemin taşıdığı bilgiyi artırmaz. Bootstrap'i varsayım sorununu hafifletmek için kullanın, örneklem küçüklüğünü gidermek için değil.

Permütasyon ve kesin testler aynı ailedendir: p değerini teorik dağılımdan değil, verinin tüm olası yeniden düzenlemelerinden hesaplar. Küçük örneklemde en savunulabilir seçeneklerdir.

Sonuçları nasıl yorumlamalı?

Küçük örneklemde iki yorum hatası yaygındır. İlki, anlamsız sonucu "gruplar arasında fark yoktur" diye yazmaktır; doğru ifade "bu örneklemde anlamlı fark saptanmamıştır" ve mümkünse gözlenen güç ya da gereken örneklem büyüklüğüyle birlikte verilmesidir. İkincisi, anlamlı çıkan bir sonucu olduğundan büyük sunmaktır; küçük örneklemde anlamlı bulunan etkiler sistematik olarak abartılı tahmin edilir (literatürde "kazananın laneti" denir). Bu yüzden etki büyüklüğünü güven aralığıyla vermek ve aralığın genişliğini açıkça yorumlamak gerekir. Etki büyüklüğü hesabı ve yorumu için etki büyüklüğü nedir, neden önemli? yazısına bakabilirsiniz.

Jüriye nasıl savunulur?

Savunmada "örneklem küçük, sonuçlar güvenilir mi?" sorusu neredeyse kesin gelir. Hazır cevap üç parçadan oluşur:

  • Gerekçe: Örneklemin neden bu büyüklükte olduğu (evrenin küçüklüğü, erişim kısıtı, pilot niteliği) yöntem bölümünde yazılı.
  • Yöntem uyumu: Testler küçük örneklem için uygun seçildi; kesin p değerleri ve bootstrap güven aralıkları kullanıldı; varsayımlar grafiklerle değerlendirildi.
  • Sınırlılık ve güç: Sınırlılıklar bölümünde güç sorunu açıkça belirtildi; anlamsız sonuçlar "kanıt yok" olarak değil "bu örneklemle saptanamadı" olarak yorumlandı; ileri çalışmalar için gereken örneklem büyüklüğü hesaplanıp verildi.

Bu üç parça yerindeyse küçük örneklem, tezi reddettiren bir kusur değil, doğru yönetilmiş bir sınırlılık olarak değerlendirilir.

Raporlama örneği

"Deney grubunun (n = 13) son test puanları (Ort = 71,2; SS = 8,4) kontrol grubundan (n = 12; Ort = 63,5; SS = 9,1) yüksektir; Mann-Whitney U = 38,0; kesin p = ,031; r = 0,43; %95 bootstrap GA fark için [1,2; 14,6]. Örneklem büyüklüğü nedeniyle sonuç dikkatle yorumlanmalı; orta büyüklükte bir etki için %80 güç 34'er kişi gerektirmektedir."

Elinizdeki örneklem küçükse analiz planını baştan buna göre kurmak gerekir; verinizi ve araştırma sorularınızı gönderin, hangi testlerin savunulabilir olduğunu ve neyin sınırlılık olarak yazılacağını birlikte belirleyelim.

İlgili hizmetler

Bu konuda nasıl destek alabilirsiniz?

Tez İstatistik Analizi Küçük örneklemli tezlerde uygun test seçimi, güç değerlendirmesi ve jüriye savunulabilir bulgu raporu. İstatistik danışmanlığı Araştırma sorusundan raporlamaya kadar yöntem planınızı uzmanla değerlendirin.

Sonraki adım

Çalışmanız için doğru yöntemi birlikte netleştirelim

Araştırma sorunuzu, veri yapınızı ve hedef teslim tarihinizi paylaşın. İlk değerlendirmede uygun analiz yaklaşımını ve izlenecek yolu açıklayalım.

Ön değerlendirme isteyin Telefonla görüşün
Yararlı bulduysanız paylaşın Bağlantıyı kopyalayabilir veya telefonunuzun paylaşım menüsünü açabilirsiniz.

Çalışmanızın istatistiğini birlikte planlayalım

Ücretsiz ön görüşme için bizi arayın veya WhatsApp'tan yazın. Verilerinizi WhatsApp ya da e-posta ile iletebilirsiniz.