İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Bu örnek için normallik (log-) alabilir miyim?
İşte benim örnek için bir QQ grafiği (logaritmik Y ekseni dikkat edin); :n=1000n=1000n = 1000 Whuber tarafından işaret edildiği gibi, bu, alttaki dağılımın sola eğik olduğunu gösterir (sağ kuyruk daha kısadır). shapiro.testR'de (log dönüştürülmüş verilerde) kullanarak , test istatistiklerini ve p değerini , bu da null hipotezini resmen reddettiğimiz anlamına …


1
R'de orantılı olasılık varsayımı olmadan bir sıralı lojistik regresyonda bir katsayı nasıl düzeltilir?
Orantılılık olasılıkları varsayımı olmadan R'de sıralı bir lojistik regresyon yapmak istiyorum. Bu ayarı kullanarak vglm()fonksiyonu kullanarak doğrudan yapılabilir biliyorum .Rparallel=FALSE Ama benim sorunum, bu regresyon düzeninde belirli bir katsayı setinin nasıl düzeltileceği? Örneğin, bağımlı değişken ayrık ve sıralı olduğunu ve Y = 1 , 2 veya 3 değerlerini alabileceğini varsayalım …
11 r  regression  logistic 

1
Schoenfeld kalıntıları
Çok değişkenli bir Cox orantılı tehlike modelinde, Schoenfeld kalıntıları değişkenlerden biri için düz değilse, bu tüm modeli geçersiz kılar mı yoksa sadece düşük performans gösteren değişken göz ardı edilebilir mi? Yani, diğer değişkenler için katsayıları yorumlamakla birlikte, düşük performans gösteren değişken için elde edilen katsayıları yorumlamamaktadır. Schoenfeld artıklarının düz olmadığı …

3
Simülasyon çalışması: yineleme sayısı nasıl seçilir?
"Model 1" ile veri oluşturmak ve bunları "Model 2" ile sığdırmak istiyorum. Temel fikir "Model 2" nin sağlamlık özelliklerini araştırmaktır. Özellikle% 95 güven aralığının kapsama oranı ile ilgileniyorum (normal yaklaşıma dayanarak). Yineleme çalıştırma sayısını nasıl ayarlayabilirim? Gerekenden daha büyük tekrarların sahte önyargılara neden olabileceği doğru mu? Eğer öyleyse, bu nasıl?

2
GLM çıkışındaki dağılım parametresi
R'de bir glm koştum ve summary()çıktının altına yakın bir yerde (Dispersion parameter for gaussian family taken to be 28.35031) Google'da bazı rummaging yaptım ve dispersiyon parametresinin standart hatalara uyacak şekilde kullanıldığını öğrendim. Birisinin dağılım parametresinin ne olduğu ve nasıl yorumlanması gerektiği hakkında daha fazla ayrıntı sağlayabileceğini umuyorum.

2
Saf matematikçiler için uygulamalı olasılığa giriş?
Saf matematik (lisans teorisi, fonksiyonel analiz, operatör cebiri, vb) lisans düzeyinde bir arka plan var Ayrıca olasılık teorisi (temel ilkelerden makine öğrenme teknikleri) bilgi gerektiren bir iş var. Benim sorum: Birisi kanonik okuma ve referans malzemeleri sağlayabilir: Olasılık teorisine müstakil giriş Teorik metodolojileri ve kanıtları ölçmekten çekinmeyin Uygulanan tekniklere büyük …

1
Ridge ve LASSO bir kovaryans yapısına sahip mi?
İstatistiksel Öğrenme Unsurları'nda (Hastie, Tibshrani & Friedman) Bölüm 3'ü okuduktan sonra, bir kovaryans yapısı göz önüne alındığında, bu sorunun başlığında alıntılanan ünlü büzülme yöntemlerinin uygulanmasının mümkün olup olmadığını merak ettim, ) miktar ( y⃗ - Xβ⃗ )TV- 1( y⃗ - Xβ⃗ ) + λ f( β) , ( 1 ) …

3
Bir LASSO modelinde
Lambda'mı çapraz doğrulama ile belirlediğimde, tüm katsayılar sıfır olur. Ancak literatürden bazı öngörücülerin sonuçları kesinlikle etkilemesi gerektiğine dair bazı ipuçları var. İstenildiği kadar çok azlık olması için lambda'yı keyfi olarak seçmek saçma mıdır? Bir cox modeli için 135'ten en iyi 10'u tahmin etmek istiyorum ve ne yazık ki efekt boyutları …
11 lasso 


2
Standartlaştırılmış katsayıları standartlaştırılmamış katsayılara nasıl dönüştürebilirim?
Amacım, bir dizi bağımsız değişken verilen gerçek sonuçları tahmin etmek için konuyla ilgili önceki araştırmalardan elde edilen katsayıları kullanmaktır. Bununla birlikte, araştırma makalesinde sadece Beta katsayıları ve t-değeri listelenmektedir. Standartlaştırılmış katsayıları standartlaştırılmamış katsayılara dönüştürmenin mümkün olup olmadığını bilmek istiyorum. Öngörülen değeri hesaplamak için standartlaştırılmamış bağımsız değişkenlerimi standartlaştırılmış değişkenlere dönüştürmek yararlı …

4
OLS'de atlanan değişken sapma için bir test var mı?
Doğrusal olmayan bağımlılıkları tespit edebilecek Ramsey Sıfırlama testinin farkındayım. Bununla birlikte, regresyon katsayılarından birini (sadece doğrusal bağımlılıklar) dışarı atarsanız, korelasyonlara bağlı olarak bir önyargı alabilirsiniz. Sıfırlama testi tarafından açıkça algılanmaz. Bu durum için bir test bulamadım, ancak şu ifade: "OVB için test edilemez, potansiyel atlanan değişkenler hariç." Muhtemelen makul bir …

2
Neden kısmen simüle edilmiş veriler üzerinde meta analiz yapmıyorsunuz?
Arka fon: Psikolojide tipik bir meta-analiz, iki X ve Y değişkeni arasındaki korelasyonu modellemeye çalışabilir. Analiz tipik olarak, örnek boyutları ile birlikte literatürden bir dizi ilgili korelasyon elde edilmesini içerecektir. Formüller daha sonra ağırlıklı ortalama korelasyonu hesaplamak için uygulanabilir. Daha sonra, korelasyonların çalışmalarda rastgele örneklemenin etkileriyle ima edilenden daha fazla …

3
Veri madencileri için deneysel tasarım dersi
Veri madenciliğinde çalışan bir bilgisayar bilimcisiyim. Bilgisayar bilimcilerinin sistematik deneysel tasarım ve değerlendirme yapmada oldukça fakir olduklarını söylemek bir sır değil - p-değerleri ve güven tahminlerinin kullanımı ileri kabul ediliyor :). Bilgisayar bilim insanlarına iyi deneysel tasarım hakkında bilgi vermek için iyi dersler / materyaller olup olmadığını bilmek istiyorum. Bunu …

2
için referans
Onun içinde yanıt önceki sorunun, @Erik S. ekspresyon veren burada olan aşırı basıklık dağılım. Örnek varyansının dağılımı ile ilgili Wikipedia girişine bir referans verilmiştir, ancak wikipedia sayfasında "alıntı gerekli" yazmaktadır.κV a r [ s2] = σ4( 2n - 1+ κn),Var[s2]=σ4(2n−1+κn), \mathrm{Var}[s^2]=\sigma^4 \left(\frac{2}{n-1} + \frac{\kappa}{n}\right) \>, κκ\kappa Asıl sorum şu, bu …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.