İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
Çarpık ve normal olmayan verilerle Z puanı kullanabilir miyim? [kapalı]
Kapalı . Bu sorunun ayrıntılara veya açıklığa ihtiyacı var . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Bu yayını düzenleyerek ayrıntıları ekleyin ve sorunu giderin . 5 yıl önce kapalı . Tam döngü süresinin bölümleri arasında karşılaştırma yapmak için standart z-skoru kullanarak bazı süreç döngü süresi verileri …

2
PCA ve rastgele ormanlar
Yakın zamanda Kaggle yarışması için, eğitim setim için daha sonra rastgele bir orman sınıflandırıcısını eğitmek için kullanılacak 10 ek özellik tanımladım. PCA'yı yeni özelliklerle veri kümesinde çalıştırmaya karar verdim, birbirleriyle nasıl karşılaştırıldıklarını görmek için. Varyansın ~% 98'inin birinci bileşen (ilk özvektör) tarafından taşındığını buldum. Daha sonra sınıflandırıcıyı birçok kez eğittim, …

2
Faktör analizi, iç tutarlılık ve madde yanıt teorisi ile birlikte madde sayısı nasıl azaltılır?
Ampirik olarak bir anket geliştirme sürecindeyim ve bu örnekte rasgele sayılar kullanacağım. Bağlam için, anksiyete bozuklukları olan bireylerde sıkça tanımlanan düşünce kalıplarını değerlendirmeye yönelik psikolojik bir anket geliştiriyorum. Bir öğe, " Kapalı olduğundan emin olamadığım için fırını tekrar tekrar kontrol etmem gerekiyor " gibi görünebilir . Bir ya da iki …

1
Önyargı düzeltmesi nedir? [kapalı]
Kapalı . Bu sorunun ayrıntılara veya açıklığa ihtiyacı var . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Bu yayını düzenleyerek ayrıntıları ekleyin ve sorunu giderin . 4 yıl önce kapalı . İlk olarak doğrusal bir regresyon çizgisi oluşturdukları, önyargıları düzelttikleri ve daha sonra sadece bu verileri modelleri …

2
Lojistik regresyon kalıntı analizi
Bu soru biraz genel ve uzun soluklu, ama lütfen bana katlan. Uygulamamda, her biri ~ 50 özellikli ~ 20.000 veri noktasından ve tek bir bağımlı ikili değişkenten oluşan birçok veri setim var. Veri kümelerini düzenli lojistik regresyon (R paket glmnet ) kullanarak modellemeye çalışıyorum Analizimin bir parçası olarak, aşağıdaki gibi …


1
Büyük bir veri setine tekrar tekrar karmaşık bir model takarken hesaplama verimliliğini nasıl optimize edebilirim?
MCMCglmmKarışık efektler modeli çalıştırmak için R paketini kullanarak performans sorunları yaşıyorum . Kod şöyle görünür: MC1<-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) Verilerde yaklaşık 20.000 gözlem vardır ve bunlar yaklaşık 200 okulda kümelenmiştir. Kullanılmamış tüm değişkenleri veri çerçevesinden bıraktım ve çalıştırmadan önce diğer tüm nesneleri bellekten kaldırdım. …


2
Fonksiyonel veriler nasıl simüle edilir?
Çeşitli fonksiyonel veri analizi yaklaşımlarını test etmeye çalışıyorum. İdeal olarak, simüle edilmiş fonksiyonel veriler üzerinde sahip olduğum yaklaşımlar panelini test etmek istiyorum. Bir Gauss gürültüsü (aşağıdaki kod) toplayan bir yaklaşım kullanarak simüle edilmiş FD oluşturmaya çalıştım, ancak ortaya çıkan eğriler gerçek şeye kıyasla çok sağlam görünüyor . Birisinin daha gerçekçi …

2
Ölçüm aracı nedeniyle tavan etkisi ile nasıl başa çıkılır?
Deneklerin (iki grup) titreşimi algılama yeteneğini ölçen psikofizyolojik veriler topladım. Titreşimli bir prob daha küçük ve daha küçük yer değiştirmelerde cilde karşı hareket eder ve özne titreşimi ne zaman hissettiğini gösterir. Ne yazık ki, yüksek frekanslarda, prob sadece kısa bir mesafe hareket edebilir ve bazen probun hareket edebileceği en büyük …

1
Rjags ile tahminler nasıl oluşturulur?
JJS dilinde belirtilen bir modelde MCMC çalıştırmak için rjags kullandım. Bu modeli çıkartmanın ve onunla tahminler yapmanın iyi bir yolu var mı (parametrelerimin posterior dağılımlarını kullanarak)? Modeli R'de yeniden belirtebilir ve parametre posterlerimin modlarını takabilirim; Sadece bunu yapmanın daha az gereksiz bir yolu olup olmadığını merak ediyorum. Http://sourceforge.net/p/mcmc-jags/discussion/610037/thread/0ecab41c aynı soruyu …
12 r  jags 

2
Veri kümesi verildiğinde olasılık dağılımını otomatik olarak belirleme
Bir veri kümesi verildi: x <- c(4.9958942,5.9730174,9.8642732,11.5609671,10.1178216,6.6279774,9.2441754,9.9419299,13.4710469,6.0601435,8.2095239,7.9456672,12.7039825,7.4197810,9.5928275,8.2267352,2.8314614,11.5653497,6.0828073,11.3926117,10.5403929,14.9751607,11.7647580,8.2867261,10.0291522,7.7132033,6.3337642,14.6066222,11.3436587,11.2717791,10.8818323,8.0320657,6.7354041,9.1871676,13.4381778,7.4353197,8.9210043,10.2010750,11.9442048,11.0081195,4.3369520,13.2562675,15.9945674,8.7528248,14.4948086,14.3577443,6.7438382,9.1434984,15.4599419,13.1424011,7.0481925,7.4823108,10.5743730,6.4166006,11.8225244,8.9388744,10.3698150,10.3965596,13.5226492,16.0069239,6.1139247,11.0838351,9.1659242,7.9896031,10.7282936,14.2666492,13.6478802,10.6248561,15.3834373,11.5096033,14.5806570,10.7648690,5.3407430,7.7535042,7.1942866,9.8867927,12.7413156,10.8127809,8.1726772,8.3965665) .. Parametrelerin bir tahminiyle en uygun olasılık dağılımını (gama, beta, normal, üstel, poisson, ki-kare, vb.) Belirlemek istiyorum. R kullanarak bir çözümün sağlandığı aşağıdaki bağlantıdaki sorunun zaten farkındayım: /programming/2661402/given-a-set-of-random-numbers-drawn-from-a- sürekli-tek-değişken-dağılım-f en iyi önerilen çözüm şudur: > library(MASS) > fitdistr(x, 't')$loglik #$ > fitdistr(x, 'normal')$loglik …

6
en üst düzeye çıkaran bir nokta tahmini kullanırsanız , bu felsefeniz hakkında ne diyor? (frekansçı, Bayesci veya başka bir şey?)
Birisi demişse "Bu yöntem MLE'yi değerini en üst düzeye çıkaran parametre tahmini için kullanır , bu nedenle sıkça kullanılır ve daha fazla Bayesian değildir."P(x|θ)P(x|θ)\mathrm{P}(x|\theta) kabul eder misin Arka planda güncelleme : Son zamanlarda, sık olduğunu iddia eden bir makale okudum. İddialarına katılmıyorum, en iyi ihtimalle belirsiz olduğunu hissediyorum. Kağıt açıkça …

3
Ağır kuyruklu dağıtılmış bir işlemin önemli ölçüde iyileşip iyileşmediğini belirleyin
Sürecin değişiklikle düzelip düzelmediğini öğrenmek için bir değişiklikten önce ve sonra bir işlemin işlem sürelerini gözlemliyorum. İşlem süresi kısalırsa süreç iyileşmiştir. İşlem süresinin dağılımı yağ kuyrukludur, bu nedenle ortalamaya göre karşılaştırma mantıklı değildir. Bunun yerine, değişiklikten sonra daha düşük bir işlem süresi gözlemleme olasılığının önemli ölçüde% 50'nin üzerinde olup olmadığını …

1
Ampirik Bayes ve rastgele etkiler arasında bir bağlantı var mı?
Son zamanlarda ampirik Bayes (Casella, 1985, Ampirik Bayes veri analizine giriş) hakkında bir şeyler okudum ve rastgele etkiler modeline çok benziyordu; çünkü her ikisinin de küresel ortama daralmış tahminleri var. Ama bunu tam anlamıyla okumadım ... Aralarındaki benzerlik ve farklılıklar hakkında herhangi bir görüş sahibi olan var mı?

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.