İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


1
Negatif Türetme. Sıkışmak
Yani, bu soru biraz dahil olmakla birlikte, bunu olabildiğince basit bir şekilde ileriye doğru yapmaya çalıştım. Hedef: Uzun lafın kısası, yok negentropi bir türetme vardır değil yüksek mertebeden cumulant'larının dahil ve bunu elde edilmiştir anlamaya çalışıyorum. Arka plan: (Tüm bunları anlıyorum) Burada bulunan 'Bağımsız Bileşen Analizi' kitabını kendi kendime çalışıyorum …

3
Standart kümelenme ölçüsü mü?
Çok fazla veri var ve çok basit görünen bir şey yapmak istiyorum. Bu büyük veri setinde, belirli bir elementin ne kadar topaklandığını merak ediyorum. Verilerimin şu şekilde sıralı bir küme olduğunu varsayalım: {A, C, B, D, A, Z, T, C ...}. Diyelim ki, A'nın set boyunca rastgele (veya daha eşit …

5
Regresyonda yüzdeleri bağımlı değişken olarak tahmin etme
Çalışmamda bağımlı değişken olarak 38 sınavda öğrenci sıralamasında yüzdelerim var. Sıra yüzdesi (bir öğrencinin sıradaki / sınavdaki öğrenci sayısı) ile hesaplanır. Bu bağımlı değişken neredeyse eşit dağılım gösterir ve bazı değişkenlerin bağımlı değişken üzerindeki etkilerini tahmin etmek istiyorum. Hangi regresyon yaklaşımını kullanıyorum?

2
Nasıl değerini kullanabilirsiniz
Aşağıdaki grafikler, "normallik", "homossedastisite" ve "bağımsızlık" varsayımlarının kesin olarak karşılandığı regresyon testinin artık saçılma grafiğidir! "Doğrusallık" varsayımını test etmek için , grafiklere bakarak, ilişkinin eğrisel olduğu tahmin edilebilir, ancak soru şudur: "R2 Doğrusal" değeri doğrusallık varsayımını test etmek için nasıl kullanılabilir? İlişkinin doğrusal olup olmadığına karar vermek için "R2 Linear" …

3
PCA bileşenleri gerçekten varyans yüzdesini temsil ediyor mu? Toplamı% 100'den fazla olabilir mi?
O'Reilly'nin "Hackerlar İçin Makine Öğrenmesi" her temel bileşenin varyansın bir yüzdesini temsil ettiğini söylüyor. Aşağıdaki sayfanın ilgili kısmını alıntıladım (bölüm 8, s.207). Başka bir uzmanla görüştüklerinde, bunun yüzde olduğunu kabul ettiler. Bununla birlikte, 24 bileşen% 133.2095'tir. Nasıl olabilir? Kendimizi PCA kullanabileceğimize ikna ettikten sonra, bunu R'de nasıl yapabiliriz? Yine, bu …
13 r  pca 

6
Topluluk yöntemlerinin nasıl uygulanacağını öğrenmek için kaynaklar
Teorik olarak (nasıl çalışacaklarını) anlıyorum, ama aslında bir topluluk yöntemini (oylama, ağırlıklı karışımlar, vb.) Kullanmayı nasıl yapacağımdan emin değilim. Topluluk yöntemlerini uygulamak için iyi kaynaklar nelerdir? Python'da uygulama ile ilgili belirli kaynaklar var mı? DÜZENLE: Bazı yorumlarda tartışmaya dayanarak temizlemek için, randomForest, vb gibi topluluk algoritmaları aramıyorum. Bunun yerine, farklı …

2
Büyük örnek boyutları için dağınıklık sorunu neden zorlaştırılır?
Varsayalım ki bir dizi . Her y i noktası p ( y i | x ) = 1 dağılımı kullanılarak oluşturulur y={y1,y2,…,yN}y={y1,y2,…,yN}\mathbf{y} = \{y_1, y_2, \ldots, y_N \}yiyiy_i Arka için elde etmek içinxbiz yazmak p(x|y)αp(y|x)p(X)=p(x) , N Π i=1p(yı|x). Minka'nınBeklenti Yayılımıbelgesine göreposterior elde etmek için2Nhesaplamayaihtiyacımız varp(yi|x)=12N(x,1)+12N(0,10).p(yi|x)=12N(x,1)+12N(0,10). p(y_i| x) = \frac12 …

4
Fisher'ın DoE hakkında verdiği alıntıdan gerçek bir örnek almak
Ekibim ve ben, şirketin istatistikçi olmayanlarına deney tasarımının faydası hakkında bir sunum yapmak istiyoruz. Bu istatistikçi olmayanlar da bizim müşterilerimizdir ve genellikle verilerini toplamadan önce bize danışmazlar. Fisher'in ünlü sözünü iyi gösterecek bazı gerçek örnekler biliyor musunuz? "Deney yapıldıktan sonra istatistikçiyi aramak, ondan sonra ölüm sonrası inceleme yapmasını istemekten başka …

1
Bayes glm'deki -değerlerini anlamama yardım et
Burada veriler üzerinde bir Bayesian logit çalıştırmak çalışıyorum . R paketinde kullanıyorum bayesglm(). armKodlama yeterince basit: df = read.csv("http://dl.dropbox.com/u/1791181/bayesglm.csv", header=T) library(arm) model = bayesglm(PASS ~ SEX + HIGH, family=binomial(link="logit"), data=df) summary(model) aşağıdaki çıktıyı verir: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.10381 0.10240 1.014 0.311 SEXMale 0.02408 0.09363 0.257 …
13 r  bayesian  p-value 

2
Gruplanmış çiftleri gösteren bir tabloda Tukey HSD post-hoc testinin sonuçları nasıl elde edilir?
R ile iki yönlü Anova'mdan sonra TukeyHSD post-hoc testi yapmak istiyorum, önemli bir farkla gruplandırılmış sıralanmış çiftleri içeren bir tablo elde etmek istiyorum. (İfadeler için üzgünüm, istatistikler konusunda hala yeniyim.) Ben böyle bir şey istiyorum: Yani, yıldızlar veya harflerle gruplandırılmış. Herhangi bir fikir? Ben fonksiyonunu test HSD.test()gelen agricolaepaketin, ama buna …

1
R'de glmnet kullanarak tahminler
glmnetR'deki paketi kullanarak bazı verileri modellemeye çalışıyorum. Diyelim ki aşağıdaki verilere sahibim training_x <- data.frame(variable1 = c(1, 2, 3, 2, 3), variable2 = c(1, 2, 3, 4, 5)) y <- c(1, 2, 3, 4, 5) (Bu bir basitleştirme; verilerim çok daha karmaşık.) Sonra glmnet modeli oluşturmak için aşağıdaki kodu kullandım. …
13 r  glmnet 

1
Komik istatistik sınav cevapları [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 7 yıl önce kapalı . Sınavları düzeltmek muhtemelen bir öğretmenin en sıkıcı görevidir. Ancak komik istatistik sınav cevaplarını toplamak bizim için eğlenceli olabilir. Her cevap …
13 teaching  humor 


4
K-ortalamaları veri kümesinin rasgele alt örnekleri aracılığıyla başlatmak?
Belirli bir veri kümem varsa, küme merkezlerini bu veri kümesinin rasgele örneklerini kullanarak başlatmak ne kadar akıllı olurdu? Örneğin, istediğimi varsayalım 5 clusters. Orijinal veri kümesinden 5 random samplessöz ediyorum size=20%. Daha sonra bu 5 rastgele örneğin her birini ortalayabilir ve bu araçları ilk 5 küme merkezim olarak kullanabilir miyim? …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.