İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
Poisson rasgele değişkenlerinin yuvarlanmış ortalamasının dağılımı nedir?
Poisson rasgele değişkenlerim varsa , (yani ortalamanın tamsayı katı)?λ 1 , λ 2 , … , λ n Y = ⌊ ∑ n i = 1 X iX1,X2,…,XnX1,X2,…,XnX_1,X_2,\ldots,X_nλ1,λ2,…,λnλ1,λ2,…,λn\lambda_1, \lambda_2,\ldots, \lambda_nY=⌊∑ni=1Xin⌋Y=⌊∑i=1nXin⌋Y=\left\lfloor\frac{\sum_{i=1}^n X_i}{n}\right\rfloor Poissons'ın toplamı da Poisson'dur, ancak yukarıdaki durum için aynı olup olmadığını belirlemek için istatistiklerden yeterince emin değilim.

2
Lojistik regresyondan tahmin edilen olasılıklar için güven aralıklarının çizilmesi
Tamam, lojistik regresyonum var ve predict()tahminlerime dayanarak bir olasılık eğrisi geliştirmek için bu fonksiyonu kullandım . ## LOGIT MODEL: library(car) mod1 = glm(factor(won) ~ as.numeric(bid), data=mydat, family=binomial(link="logit")) ## PROBABILITY CURVE: all.x <- expand.grid(won=unique(won), bid=unique(bid)) y.hat.new <- predict(mod1, newdata=all.x, type="response") plot(bid<-000:1000,predict(mod1,newdata=data.frame(bid<-c(000:1000)),type="response"), lwd=5, col="blue", type="l") Bu harika ama olasılıklar için güven aralıklarını …

1
Qqline () tarafından R'de üretilen hattın kullanımı nedir?
qqnorm()R fonksiyonu normal QQ-arsa üreten ve qqline()birinci ve üçüncü çeyrek içinden geçen bir çizgi ekler. Bu hattın kökeni nedir? Normalliği kontrol etmek yardımcı olur mu? Bu klasik çizgi değildir ( muhtemelen doğrusal ölçeklemeden sonra diyagonal ).y= xy=xy=x İşte bir örnek. İlk önce ampirik dağılım fonksiyonunu teorik dağılım fonksiyonu ile karşılaştırıyorum …

2
Lineer karma etkili modellemenin özel bir örneği olarak eşleştirilmiş t-testi
Eşleştirilmiş bir t -testinin, R'de nlme paketiyle gösterilebilen lineer karışık etkili modelin yanı sıra tek yönlü tekrarlanan ölçümlerin (veya öznenin içinde) özel bir örneği olduğunu biliyoruz. Aşağıda gösterildiği gibi. #response data from 10 subjects under two conditions x1<-rnorm(10) x2<-1+rnorm(10) # Now create a dataframe for lme myDat <- data.frame(c(x1,x2), c(rep("x1", …

3
Doğrusal olmayan korelasyonları saptamak için MIC algoritması sezgisel olarak açıklanabilir mi?
Daha yakın zamanlarda iki makale okudum. Birincisi korelasyonun tarihiyle, ikincisi ise Maksimal Bilgi Katsayısı (MIC) adı verilen yeni yöntemle ilgilidir. Değişkenler arasındaki doğrusal olmayan korelasyonları tahmin etmek için MIC yöntemini anlama konusunda yardımınıza ihtiyacım var. Dahası, R'de kullanımıyla ilgili talimatlar yazarın web sitesinde ( İndirmeler altında ) bulunabilir: Umarım bu …

3
ANCOVA'ya karşı kukla kodlama ile çoklu regresyon ne zaman kullanılmalıdır?
Geçenlerde ANCOVA kullanarak 2 kategorik değişken ve bir sürekli değişkeni manipüle eden bir deneyi analiz ettim. Bununla birlikte, bir gözden geçiren, kukla değişkenler olarak kodlanan kategorik değişken ile çoklu regresyonun, hem kategorik hem de sürekli değişkenlerle deneyler için daha uygun bir test olduğunu ileri sürmüştür. ANCOVA'ya karşı kukla değişkenlerle çoklu …

2
Orana oranla doğrusal model mi oluşturuyorsunuz?
Bir tür oran veya yüzde tahmin etmek için bir model oluşturmak istediğimi varsayalım. Örneğin, bir partiye katılacak erkek veya kız çocuk sayısını tahmin etmek istediğimi ve modelde kullanabileceğim partinin özellikleri, parti için reklam miktarı, mekanın büyüklüğü, partide alkol vb. olacaktır. (Bu sadece uydurulmuş bir örnektir; özellikler gerçekten önemli değildir.) Sorum …


2
ANOVA'daki değişkenlerin sırası önemlidir, değil mi?
Çok faktörlü bir ANOVA'da değişkenlerin hangi sırayla belirtildiğinin bir fark yarattığını ancak çoklu doğrusal regresyon yaparken sıralamanın önemli olmadığını anlamak doğru muyum? Böylece ölçülen kan kaybı y ve iki kategorik değişken gibi bir sonuç varsayarsak adenoidektomi yöntemi a , tonsillektomi yöntemi b . Model y~a+b, modelden farklıdır y~b+a(veya R'deki uygulamamın …


9
Bir zaman serisinin Ljung-Box testinde kaç gecikme kullanılır?
Bir ARMA modeli bir zaman serisine uyduktan sonra, kalıntıları Ljung-Box portmanteau testi (diğer testlerin yanı sıra) yoluyla kontrol etmek yaygındır. Ljung-Box testi ap değerini döndürür. Test edilecek gecikme sayısı olan h parametresine sahiptir . Bazı metinler h = 20 kullanmanızı önerir ; diğerleri h = ln (n) kullanmanızı önerir ; …

4
Hayatta kalma analizi: sürekli ve ayrık zamanlı
Hayatta kalma analizinde zamanın sürekli mi yoksa ayrık mı olacağına nasıl karar vereceğim konusunda kafam karıştı. Özellikle, erkeklerin kız çocuklarının hayatta kalmasına (5 yaşına kadar) etkileri konusunda en büyük tutarsızlığa sahip çocuk ve ev düzeyinde değişkenleri belirlemek için hayatta kalma analizini kullanmak istiyorum. Çocuğun yaşayıp yaşamadığını, ölüm yaşını (ay cinsinden) …
20 survival  ties 


7
Bir kutu grafiğine alternatifler nelerdir?
Seçilen kullanıcı çokgenler için sayım verilerini görüntüler ve grafiksel olarak çeşitli parametrelerin (parametre başına bir grafik) dağılımını göstermek istiyorum bir web sitesi oluşturma üzerinde çalışıyorum. Veriler genellikle aşağıdaki özelliklere sahiptir: Örnek boyutu büyük olma eğilimindedir (yaklaşık 10.000 veri noktası diyelim) Değerlerdeki aralık büyük ölçüde quire olma eğilimindedir (örneğin, minimum nüfus …

6
Her Zaman Sağlam (Beyaz) Standart Hatalar Bildirilsin mi?
Angrist ve Pischke tarafından Sağlam (yani heteroskedastisite veya eşit olmayan varyanslara karşı sağlam) Standart Hataların test edilmekten ziyade bir sorun olarak bildirildiği ileri sürülmüştür. İki soru: Homoskedastisite söz konusu olduğunda bunu yapmanın standart hataları üzerindeki etkisi nedir? Aslında bunu işlerinde yapan var mı?

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.