İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
En iyi öngörücü olarak Koşullu beklentinin kanıtı ile ilgili sorun
Kanıtıyla ilgili bir sorunum var E(Y|X)∈argming(X)E[(Y−g(X))2]E(Y|X)∈arg⁡ming(X)E[(Y−g(X))2]E(Y|X) \in \arg \min_{g(X)} E\Big[\big(Y - g(X)\big)^2\Big] bu da büyük olasılıkla beklentilerin ve koşullu beklentilerin daha derin bir yanlış anlaşılmasını ortaya koymaktadır. Bildiğim kanıt şu şekildedir (bu kanıtın başka bir versiyonunu burada bulabilirsiniz ) ===argming(X)E[(Y−g(x))2]argming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]argming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]argming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]arg⁡ming(X)E[(Y−g(x))2]=arg⁡ming(X)E[(Y−E(Y|X)+E(Y|X)−g(X))2]=arg⁡ming(x)E[(Y−E(Y|X))2+2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]=arg⁡ming(x)E[2(Y−E(Y|X))(E(Y|X)−g(X))+(E(Y|X)−g(X))2]\begin{align*} &\arg \min_{g(X)} E\Big[\big(Y - g(x)\big)^2\Big]\\ = &\arg \min_{g(X)} E \Big[ …

4
Bayesci İstatistiklerde güç analizi gerekli mi?
Son zamanlarda Bayes klasik istatistiklerini araştırıyorum. Bayes faktörü hakkında okuduktan sonra, bu istatistik görünümünde güç analizinin bir gereklilik olup olmadığını merak ettim. Bunu merak etmemin ana nedeni Bayes faktörünün gerçekten bir olasılık oranı gibi görünüyor. Bir kez 25: 1 gibi bir gece diyebilirim. Uzak mıyım? Daha fazla bilgi için yapabileceğim …

2
Rastgele orman aşırı uyuyor mu?
Scikit-learn ile rastgele ormanları deniyorum ve eğitim setimin harika sonuçlarını alıyorum, ancak test setimde nispeten zayıf sonuçlar elde ediyorum ... İşte çözmeye çalıştığım problem (pokerden esinlenerek): Oyuncu A'nın delik kartları, oyuncu B'nin delik kartları ve bir flop (3 kart) verildi, hangi oyuncu en iyi ele sahip? Matematiksel olarak, bu 14 …

1
R (nnet paketi) içinde “multinom” için p-değerleri alma
İçindeki paket multinomişlevini kullanarak p-değerlerini nasıl alabilirim ?nnetR Sonuç değişkeni olarak “Patoloji skorlarından” (Yok, Hafif, Şiddetli) oluşan bir veri setim ve iki ana etkim var: Yaş (iki faktör: yirmi / otuz gün) ve Tedavi Grubu (dört faktör: ATB olmadan enfekte; enfekte + ATB1; enfekte + ATB2; enfekte + ATB3). İlk …

1
İstatistik tablolarında (enterpolasyonda) verilmeyen değerleri nasıl bulurum?
Çoğu zaman insanlar p değerlerini elde etmek için programları kullanırlar, ancak bazen - her ne nedenle olursa olsun - bir dizi tablodan kritik bir değer elde etmek gerekebilir. Sınırlı sayıda anlamlılık seviyesi ve sınırlı sayıda serbestlik derecesine sahip bir istatistiksel tablo göz önüne alındığında, diğer anlamlılık düzeylerinde veya serbestlik derecelerinde …


2
Lojistik regresyonda kategorik öngörücünün önemi
Lojistik regresyonda kategorik değişkenler için z değerlerini yorumlamakta zorlanıyorum. Aşağıdaki örnekte 3 sınıflı bir kategorik değişkenim var ve z değerine göre CLASS2, diğerleri olmasa da alakalı olabilir. Ama şimdi bu ne anlama geliyor? Diğer sınıfları birleştirebileceğimi mi? Tüm değişkenin iyi bir öngörücü olmayabilir mi? Bu sadece bir örnektir ve buradaki …

3
Merkezi limit teoremi için büyük örneklem büyüklüğünün gerekli olduğu dağıtım örneği
Bazı kitaplar, merkezi sınır teoreminin için iyi bir yaklaşım sağlayabilmesi için 30 veya daha büyük bir örneklem boyutunun gerekli olduğunu belirtir . X¯X¯\bar{X} Bunun tüm dağıtımlar için yeterli olmadığını biliyorum. Büyük örneklem büyüklüğünde (belki 100 veya 1000 veya daha yüksek) bile, örnek ortalamanın dağılımının hala oldukça çarpık olduğu bazı dağılım …


3
Veri madenciliğinde ilişkilendirme kuralları ve karar ağaçları arasındaki pratik fark nedir?
Bu iki teknik arasındaki pratik farklılıkların gerçekten basit bir açıklaması var mı? Her ikisi de denetimli öğrenme için kullanılmış gibi görünmektedir (ilişkilendirme kuralları denetimsiz olarak da ele alınabilir). Her ikisi de tahmin için kullanılabilir 'İyi' bir açıklama bulduğum en yakın Statsoft Ders Kitabı'ndan . İlişkilendirme Kurallarının aşağıdakiler için kullanıldığını söylüyorlar …

5
Karşılıklı (eşleştirilmiş) deneyler için hata çubuklarını görüntüleme
Aşağıdaki senaryo, arsa yaratıcısı olarak araştırmacı (I), gözden geçiren / editör (R, CRAN ile ilgili değil) ve ben (M) üçlüsünde En Çok SSS olmuştur. (R) 'nin tipik bir tıbbi büyük patron incelemesi olduğunu varsayabiliriz, sadece her arsanın hata çubuğuna sahip olması gerektiğini bilir, aksi takdirde yanlıştır. İstatistiksel bir gözden geçiren …



2
Hangi teşhisler belirli bir GLM ailesinin kullanımını doğrulayabilir?
Bu çok basit görünüyor, ama ben her zaman bu noktada takılıp kalıyorum ... Ele aldığım verilerin çoğu normal değil ve analizlerin çoğu bir GLM yapısına dayanıyor. Mevcut analiz için, "yürüme hızı" (metre / dakika) olan bir yanıt değişkenim var. OLS'yi kullanamayacağımı tanımlamak kolay, ancak o zaman, hangi ailenin (Gama, Weibull, …

1
Lmer () spline'ları rastgele efektler olarak kullanabilir mi?
Diyelim ki zaman içinde bazı sayım verilerinin rastgele efektler modeli üzerinde çalışıyoruz ve bazı eğilimleri kontrol etmek istiyoruz. Normalde şöyle bir şey yaparsınız: lmer(counts ~ dependent_variable + (1+t+I(t^2)|ID), family="poisson") ikinci dereceden bir şekil eklemek t. Bu ilişkiyi modellemek için LOESS daha pürüzsüz veya spline gibi daha karmaşık pürüzsüzleştirme teknikleri kullanmak …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.