İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
Doane'nin histogram bölmesi için formülü
Histogramlar için kullanılacak en iyi kutu sayısını tahmin etmek için çeşitli algoritmalar uyguluyorum. Uyguladığımların çoğu, "Kutu sayısı ve genişlik " * bölümündeki Wikipedia "Histogram" sayfasında açıklanmaktadır . Doane'nin formülü ile ilgili bir soruna takılı kaldım: 1 + log(n) + log(1 + kurtosis(data) * sqrt(n / 6.)) nveri boyutu nerede . …

2
Eşit dağılmış iki nokta arasındaki beklenen mesafe nasıl bulunur?
Koordinatlar tanımlamak olsaydı ve(X1,Y1)(X1,Y1)(X_{1},Y_{1})(X2,Y2)(X2,Y2)(X_{2},Y_{2}) X1,X2∼ Unif ( 0 , 30 ) ve Y1,Y2∼ Unif ( 0 , 40 ) .X1,X2∼Unif(0,30) and Y1,Y2∼Unif(0,40).X_{1},X_{2} \sim \text{Unif}(0,30)\text{ and }Y_{1},Y_{2} \sim \text{Unif}(0,40). Aralarındaki mesafenin beklenen değerini nasıl bulabilirim? , mesafe beklenen değer sadece ?(X1-X2)2+ (Y1-Y2)2-------------------√)(X1−X2)2+(Y1−Y2)2)\sqrt{(X_{1}-X_{2})^{2} + (Y_{1}-Y_{2})^{2}})( 1 / 30 + 1 / 30)2+ …

1
Bir seviye ile diğerlerinin ortalaması arasındaki fark için bir kontrast matrisi (R cinsinden) nasıl belirtilir?
benzeyen bir regresyon modelim var:Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y = \beta_0+\beta_1X_1 + \beta_2X_2 + \beta_3X_3 +\beta_{12}X_1X_2+\beta_{13}X_1X_3+\beta_{123}X_1X_2X_3 ... veya R gösterimi ile: y ~ x1 + x2 + x3 + x1:x2 + x1:x3 + x1:x2:x3 Diyelim ki ve kategorik değişkenler ve sayısal. Karmaşık üç seviye ve standart kontrastlar yerine, test etmek gerekir:X1X1X_1X2X2X_2X3X3X_3X1X1X_1X1 a,X1 b,X1 cX1a,X1b,X1cX_{1a}, …
9 r  contrasts 


3
K-ortalamaları için küme seçimi: 1 küme durumu
Kimse kmeans kullanarak kümelenmenin uygun olup olmadığını belirlemek için iyi bir yöntem biliyor mu? Yani, numuneniz aslında homojen ise? Bir karışım modeli gibi bir şey biliyorum (R'de mclust aracılığıyla) 1: k küme durumu için uygun istatistikler sağlayacaktır, ancak kmeans değerlendirmek için tüm teknikler en az 2 küme gerektirir gibi görünüyor. …
9 r  clustering  k-means 


1
T-testinin formüle edilmesinde Student (Gosset) katkısı neydi?
Bir son soru , ilgili soru ve anılan kaynak , son zamanlarda bu beni haberdarN−1N−1N-1popülasyon varyansının örnek tahminleri için düzeltme Bessel düzeltmesi olarak adlandırılır . Bessel 1846'da öldü ( wikipedia alıntısı ) ve t testi 1908'de ( wikipedia alıntısı ) yayınlandı . Bir nedenden ötürü, her zaman Gosset'in (aka Öğrenci) …


3
Yapboz Ortalama gerileme
Daniel Kahneman'ın "Düşünce, Hızlı ve Yavaş" bölümünde "Ortaya Regresyon" bölümünde bir örnek verilmiş ve okuyucudan genel satış tahmini ve önceki yıla ait satış sayıları göz önüne alınarak bireysel mağazaların satışlarını tahmin etmesi istenmiştir. . Örneğin (kitabın örneğinde 4 mağaza var, basitlik için burada 2 kullanıyorum): Store 2011 2012 1 100 …

2
Bir kutu grafiğinin bıyıklarını anlama
Bir boxplot bıyıklarının yorumlanması ile ilgili bir sorum var. Aşağıdakileri okudum: "Dikdörtgenin üstünde ve altında" bıyık ", 0.25- ve 0.75-quantiles arasındaki mesafenin 1.5 katını gösteriyor, ancak" mesafe "ile ne kastedildiğini tam olarak anlamıyorum. . Olasılık kütlesi kastedilemez, çünkü 0.25 ve 0.75 kantil arasında her zaman aynı veri yüzdesine sahibiz. O …

1
Kategorik bir değişkenle lojistik regresyon için veri simülasyonu
Lojistik regresyon için bazı test verileri oluşturmaya çalışıyordum ve bu yazıyı buldum Lojistik regresyon için yapay veriler nasıl simüle edilir? Güzel bir cevap ama sadece sürekli değişkenler yaratıyor. Bağlantıdaki ile aynı örnek için y ile ilişkili 5 seviyeli (ABCDE) kategorik bir x3 değişkenine ne dersiniz?

2
Kara kutu doğrusal olmayan bir model için öngörüye farklı girdilerin önemini nasıl görselleştirebilirim?
Kuruluşumda yapılan tahminlere yardımcı olması için etkileşimli bir tahmin aracı (python'da) oluşturuyorum. Bugüne kadar, tahmin süreci büyük ölçüde insan güdümlüdür, tahminciler doğal sinir ağlarındaki verileri özümser ve öğrenilmiş bağırsaklarını kullanarak tahminlerde bulunurlar. Uzun vadeli tahmin doğrulaması ve öngörülü modelleme çalışmasından beklediğiniz şeyi buldum; farklı tahminciler farklı önyargılar sergiler, bazı öngörücülerin …

2
Genelleştirilmiş doğrusal modellerin varsayımları
"Uygulamalı regresyona R arkadaşı" sayfa 232'de Fox ve Weisberg notu Sadece Gaussian ailesi sürekli varyansa sahiptir ve diğer tüm GLM'lerde y'nin koşullu varyansı xx\bf{x} bağlıμ ( x )μ(x)\mu(x) Daha önce, Poisson'un koşullu varyansının olduğunu ve binomialın koşulunun olduğunu belirtmişlerdir .μμ\muμ ( 1 - μ )N-μ(1-μ)N-\frac{\mu(1-\mu)}{N} Gauss için bu tanıdık ve …

3
Matris çarpımı kullanarak ikili veri için Jaccard veya diğer ilişkilendirme katsayısının hesaplanması
Matris çarpımı kullanarak Jaccard katsayısını hesaplamanın olası bir yolu olup olmadığını bilmek istiyorum. Bu kodu kullandım jaccard_sim <- function(x) { # initialize similarity matrix m <- matrix(NA, nrow=ncol(x),ncol=ncol(x),dimnames=list(colnames(x),colnames(x))) jaccard <- as.data.frame(m) for(i in 1:ncol(x)) { for(j in i:ncol(x)) { jaccard[i,j]= length(which(x[,i] & x[,j])) / length(which(x[,i] | x[,j])) jaccard[j,i]=jaccard[i,j] } } …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.