İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Poisson dağılımına normal yaklaşım
İşte Wikipedia şöyle der: Yeterince büyük λλλ değerleri için (örneğin λ>1000λ>1000λ>1000 ), ortalama λλλ ve varyans λλλ (standart sapma λ−−√λ\sqrt{\lambda} ) ile normal dağılım , Poisson dağılımına mükemmel bir yaklaşımdır. Eğer λλλ 10 ° C'den daha yüksektir, uygun bir süreklilik düzeltmesi, yani gerçekleştirilir, daha sonra normal dağılım iyi bir yaklaşımdır …

1
Önemli örneklemenin sezgisel örnekleri
Geçmişim bilgisayar bilimi. Monte carlo örnekleme yöntemlerinde oldukça yeniyim ve matematiği anlasam da, önem örneklemesi için sezgisel örnekler bulmakta zorlanıyorum. Daha doğrusu, birisi aşağıdakilere örnekler verebilir: orijinal bir dağıtım örnekleme yapamaz ancak tahmin edebilir bu orijinal dağıtımdan örneklenebilen ve bu dağılım için yeterli bir önem dağılımı.

1
Fisher Kesin Testi ve Hipergeometrik Dağılım
Balıkçı testini daha iyi anlamak istedim, bu yüzden f ve m erkek ve kadına karşılık gelen ve n ve y "soda tüketimine" karşılık gelen aşağıdaki oyuncak örneğini tasarladım: > soda_gender f m n 0 5 y 5 0 Açıkçası, bu büyük bir basitleştirme, ama bağlamın önüne geçmesini istemedim. Burada sadece …

2
Thomas Bayes neden Bayes teoremini bu kadar zor buldu?
Bu daha çok bir bilim tarihi sorusudur, ama umarım burada konu başlıkları vardır. Thomas Bayes'in Bayes teoremini daha önce özel bir üniforma davası için keşfetmeyi başardığını okudum ve o zaman bile görünüşe göre onunla mücadele etti. Genel Bayes teoreminin modern tedavide ne kadar önemsiz olduğu düşünüldüğünde, o zaman Bayes ve …

1
Caret paketi ile RandomForest FinalModel'i kullanmadan önce ön işleme gerek var mı?
10x10CV ile randomForest nesnesini eğitmek için düzeltme paketi kullanıyorum. library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) Bundan sonra, rastgele bir testSet (yeni veri) üzerinde test RF.testSet$Prediction <- predict(RFFit, newdata=testSet) Karışıklık matrisi bana modelin o kadar da kötü olmadığını gösteriyor. confusionMatrix(data=RF.testSet$Prediction, …

3
AIC'yi en aza indirerek modelleri seçmek ne zaman uygundur?
En azından bazı yüksek kalibreli istatistikçiler arasında, minimum değerin belirli bir eşiği içinde AIC istatistiği değerlerine sahip modellerin AIC istatistiğini en aza indiren model olarak uygun olarak kabul edilmesi gerektiği iyi bilinmektedir. Örneğin, [1, s.221] Daha sonra küçük GCV veya AIC'li modeller en iyi olarak kabul edilir. Tabii ki GCV …

2
'Kısmi' ve 'marjinal' korelasyon isimlerinin arkasındaki sezgi
2 değişken arasındaki koşullu korelasyonun neden "kısmi" korelasyon ve aralarındaki basit korelasyon (yani, başka bir değişken üzerinde koşullandırılmadığında) "marjinal" korelasyon olarak adlandırıldığı hakkında bir fikri olan var mı? "Kısmi" ve "marjinal" kelimelerinin ardındaki sezgi nedir? "Parçalar" veya "kenar boşlukları" ile ne yaparlar? Bu kavramları daha iyi anlamak için cevabı öğrenmek …


1
Teşhis neden artıklara dayanıyor?
Basit doğrusal regresyonda, genellikle çıkarım yapabilmek için belirli varsayımların karşılanıp karşılanmadığını doğrulamak ister (örn. Artıklar normal olarak dağıtılır). Takılan değerlerin normal olarak dağıtılıp dağıtılmadığını kontrol ederek varsayımları kontrol etmek makul müdür?

1
İlişkisizlik hangi dağılımlar için bağımsızlık anlamına gelir?
İstatistikte bir zaman onur hatırlatma "uncorrelatedness yapmasıdır değil bağımsızlığı ima". Genellikle bu hatırlatma psikolojik yatıştırıcı (ve bilimsel olarak doğru) deyimi "yine iki değişken zaman, ile takviye edilir ortaklaşa normal dağılıma sahip , daha sonra uncorrelatedness bağımsızlığını ima yok". Mutlu istisnaların sayısını birden ikiye çıkarabilirim: iki değişken Bernoulli'ye dağıtıldığında , o …

2
Bir eğri takarken, takılmış parametrelerim için% 95 güven aralığını nasıl hesaplayabilirim?
Bir parametreyi çıkarmak için verilerime eğriler yerleştiriyorum. Ancak, bu parametrenin kesinliğinin ne olduğundan ve % güven aralığını nasıl hesaplayacağım / ifade edeceğimden emin değilim .959595 Üstel olarak çürüyen veriler içeren bir veri kümesi için, her veri kümesine bir eğri sığdırıyorum. O zaman ayıklamak istediğim bilgi üs . Ben değerlerini biliyoruz …


3
Veri belirsizliğine dayalı olarak doğrusal regresyon eğiminin belirsizliğini hesaplayın
Veri belirsizliğine dayalı olarak doğrusal regresyon eğiminin belirsizliği nasıl hesaplanır (muhtemelen Excel / Mathematica'da)? Örnek: (0,0), (1,2), (2,4), (3,6), (4,8), ... (8, 16) veri noktalarına sahip olalım, ancak her y değerinin Bulduğum çoğu işlev, noktalar y = 2x işleviyle mükemmel bir şekilde eşleştiğinden belirsizliği 0 olarak hesaplar. Ancak, resimde gösterildiği …

2
Ayrıntılı dengeyi sağlayan bir MCMC sabit bir dağıtım sağlıyor mu?
Sanırım ayrıntılı denge koşulunun denklemini anlıyorum, geçiş olasılığı ve sabit dağılım , eğer bir Markov Zinciri ise ayrıntılı dengeyi sağlıyorqqqππ\piq(x|y)π(y)=q(y|x)π(x),q(x|y)π(y)=q(y|x)π(x),q(x|y)\pi(y)=q(y|x)\pi(x), Bu şekilde yeniden ifade edersem bana daha mantıklı: q(x|y)q(y|x)=π(x)π(y).q(x|y)q(y|x)=π(x)π(y).\frac{q(x|y)}{q(y|x)}= \frac{\pi(x)}{\pi(y)}. Temel olarak, durum durum geçiş olasılığı, olasılık yoğunluklarının oranıyla orantılı olmalıdır.xxxyyy

4
Büyük Verilerle Hipotez Testi
Büyük verilerle hipotez testlerini nasıl yapıyorsunuz? Karışıklığımı vurgulamak için aşağıdaki MATLAB senaryosunu yazdım. Tek yaptığı iki rastgele seri oluşturmak ve bir değişkenin diğerinde basit bir doğrusal regresyonunu çalıştırmaktır. Bu regresyonu farklı rasgele değerler kullanarak birkaç kez gerçekleştirir ve ortalamaları rapor eder. Örnekleme boyutunu büyüttüğümde gerçekleşme eğilimi, ortalama olarak p değerleri …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.