İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
“Hipotez testi” ile “anlamlılık testi” arasındaki fark nedir?
"Hipotez testi" ve "anlamlılık testi" ifadeleri arasında bir fark var mıdır yoksa aynı mıdır? @Micheal Lew'in ayrıntılı bir cevabından sonra, günümüzde hipotezin (örneğin, test ortalaması için t-testi) ya "anlamlılık testi" ya da "hipotez testi" örneği olduğu konusunda bir karışıklığım var mı? Yoksa ikisinin bir kombinasyonu mu? Bunları basit bir örnekle …

2
Tukey post-hoc bulgularını nasıl yazıyorsunuz?
Tukey post-hoc sonuç yazmanın doğru yolu nedir? Farklı sonuçlara sahip birkaç örnek var mı? Diyelim ki Kuzey, Güney, Doğu ve Batı var. North N=50 Mean=2.45 SD=3.9 std error=.577 LB=1.29 UB=3.62 South N=40 Mean=2.54 SD=3.8 std error=.576 LB=1.29 UB=3.63 East N=55 Mean=3.45 SD=3.7 std error=.575 LB=1.29 UB=3.64 West N=45 Mean=3.54 SD=3.6 …

4
SVD / PCA için “normalleştirme” değişkenleri
NNN ölçülebilir değişkenimiz olduğunu varsayalım , bir dizi ölçüm yapıyoruz ve sonra noktaları için en yüksek varyansın eksenlerini bulmak için sonuçlarda tekil değer ayrışması yapmak istiyoruz. içerisinde boyutlu alan. ( Not: araçlarının zaten çıkarıldığını varsayalım , bu yüzden tüm için )(a1,a2,…,aN)(a1,a2,…,aN)(a_1, a_2, \ldots, a_N)M>NM>NM > NMMMNNNaiaia_i⟨ai⟩=0⟨ai⟩=0\langle a_i \rangle = 0iii …


5
Veri temizliği istatistiksel analiz sonuçlarını kötüleştirebilir mi?
Bir virüs dolaşımı (2002'de ABD'de West Nile Virus gibi) veya insanların direncinin azalması veya yiyecek veya su kontaminasyonu veya sayısındaki artış nedeniyle salgınlar sırasında (sayılarda ani artış) meydana gelen vaka ve ölüm sayısında bir artış meydana gelir. sivrisinekler. Bu salgınlar her 1 ila 5 yılda bir ortaya çıkabilecek aykırı değerler …

3
Temel bileşen analizi “geriye”: Verilerin ne kadar varyansı, değişkenlerin belirli bir doğrusal kombinasyonu ile açıklanır?
AAA , BBB , CCC , DDD , EEE ve F değişkenlerinin altı temel bileşen analizi yaptım FF. Doğru anlıyorsam, döndürülmemiş PC1 bu değişkenlerin hangi doğrusal kombinasyonunun verilerdeki en çok varyasyonu açıkladığını / açıkladığını ve PC2 bu değişkenlerin hangi doğrusal kombinasyonunun verilerdeki bir sonraki en fazla varyasyonu tanımladığını vb. Sadece …


1
Sweave ve Xtable ile renkli tablolar nasıl oluşturulur? [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 2 yıl önce kapalı . Bir rapor oluşturmak için Sweave ve xtable kullanıyorum . Masaya biraz renk katmak istiyorum. Ama xtable ile renkli tablolar oluşturmak …


3
Etkileşimli veri görselleştirmesi ne zaman yararlıdır?
Yakında vereceğim bir konuşmaya hazırlanırken, yakın zamanda etkileşimli veri görselleştirme için iki büyük (Ücretsiz) araca girmeye başladım : GGobi ve mondrian - her ikisi de çok çeşitli yetenekler sunuyorlar (biraz buggy olsalar bile). Artikülasyon konusunda yardımınızı istiyorum (hem kendime hem de gelecekteki izleyicilerime) Etkileşimli grafikleri kullanmak ne zaman yardımcı olur? …

2
“Her mavi tişörtlü kişi” sistematik bir örnek midir?
Bir giriş istatistik dersi veriyorum ve her kth bireyi veya nesneyi örneklediğiniz sistematik örnekleme de dahil olmak üzere örnekleme türlerini inceliyordum. Bir öğrenci, belirli bir karakteristiği olan herkesi örneklemenin aynı şeyi başaracağını sordu. Örneğin, mavi tişörtlü herkesi örneklemek yeterince rasgele olur ve tüm nüfusun yeterince temsil edilmesini sağlar mı? En …
17 sampling 

7
Ortanca ortalamadan daha mı adil?
Son zamanlarda, aykırı değerleri ortadan kaldırmak için genellikle medyan kullanmamanız gerektiği tavsiyesini okudum. Örnek: Aşağıdaki makale http://www.amazon.com/Forensic-Science-Introduction-Scientific-Investigative/product-reviews/1420064932/ Şu anda 16 yorum var: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary Min. 1st Qu. Median Mean 3rd Qu. …
17 mean  median  average 

3
Lojistik Regresyon ve Veri Kümesi Yapısı
Bu soruyu doğru şekilde sorabileceğimi umuyorum. Tek tek oynatma verilerine erişimim var, bu yüzden en iyi yaklaşım ve verileri düzgün bir şekilde oluşturmak daha önemli. Yapmak istediğim şey, yönetmelikte kalan puan ve süre göz önüne alındığında bir NHL oyunu kazanma olasılığını hesaplamak. Lojistik bir gerileme kullanabileceğimi düşünüyorum, ancak veri kümesinin …

2
İstatistiksel manzara
İstatistiğe çeşitli yaklaşımlar hakkında kısa bir anket yazan var mı? İlk yaklaşıma göre sık ve Bayesci istatistikleriniz var. Ama yakından baktığınızda, olasılıkçı ve ampirik Bayes gibi başka yaklaşımlarınız da var. Ve sonra Bayes istatistikleri içinde öznel Bayes objektif Bayes gibi gruplar içinde alt bölümleriniz var. Bir anket makalesi iyi olur. …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.