İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Meta analizde efekt boyutu için önceliğin belirtilmesi
Efekt boyutlarına Sorum endişeleri Sabıkası, benim projede tedbir Cohen'in olan . Literatürü okuyarak, iyi bilinen sekiz okulda, hiyerarşik bir Bayes meta-analiz örneği gibi, belirsiz önceliklerin sıklıkla kullanıldığı görülmektedir. Sekiz okul örnekte,, mu tahmin için kullanılan belli belirsiz bir önceki gibi gördük u İçeride ISTV melerin RWMAIWi'nin ~ Normal ( 0 …

1
Küçük veri kümesinde LSTM'nin aşırı takılmasını önleme
80 boyutlu bir word2vec benzeri temsil kullanarak 128 gizli birimleri ile tek bir katman LSTM kullanarak duygu tahmini için 15000 tweet modelleme. 1 çağdan sonra bir iniş doğruluğu (rastgele% 38 =% 20) alıyorum. Daha fazla eğitim, eğitim doğruluğu tırmanmaya başladığında doğrulama doğruluğunun azalmaya başlamasını sağlar - açık bir aşırı sığdırma …

4
Bir Kutu Grafiği, bir Histogramın sunmadığı hangi bilgileri sağlar?
Histogramlar, bir değişkenin dağılımı hakkında iyi bir fikir verir. Kutu grafikleri aynı şeyi yapmaya çalışır, ancak bu değişkenin dağılımının bir resmini vermezler. İnsanların neden kutu grafikleri kullandığını anlamıyorum. Histogramlar her açıdan daha iyidir. Her ikisini de kullanmamın bir nedeni var mı? Kutu çizimlerinin sağladığını düşündüğüm tek şey: aykırı değerler! Hangi …

2
Bağımsız numuneler t-testi: Büyük numune boyutları için verilerin gerçekten normal olarak dağıtılması gerekir mi?
Diyelim ki iki bağımsız örneğin farklı araçları olup olmadığını test etmek istiyorum. Altta yatan dağılımın normal olmadığını biliyorum . Doğru anlarsam, test istatistiğim ortalamadır ve yeterince büyük örnek boyutları için, numuneler olmasa bile ortalama normal olarak dağıtılmalıdır. Bu durumda parametrik bir anlamlılık testi geçerli olmalıdır, değil mi? Bu konuda çelişkili …

2
Veri madenciliğinde kaos teorisinin bilinen, mevcut pratik uygulamaları nelerdir?
Son birkaç yılda kaos teorisi üzerinde bazı kitlesel pazar çalışmalarını rasgele okurken, veri madenciliği ve sinir ağları, örüntü tanıma, belirsizlik yönetimi vb. Gibi ilgili alanlara çeşitli yönlerinin nasıl uygulanabileceğini merak etmeye başladım. yayınlanmış araştırmada bu tür uygulamaların o kadar az örneğiyle karşılaştım ki, a) bilinen, yayınlanmış deney ve projelerde gerçekten …

3
Makine öğrenimi modelleri (GBM, NN vb.) Hayatta kalma analizi için nasıl kullanılabilir?
Ben Cox Orantılı Tehlike regresyon & bazı Kaplan-Meier modelleri gibi bu geleneksel istatistiksel modeller bir olay diyelim başarısızlık sonraki geçtiği kadar gün tahmin etmek için kullanılabilir biliyorum vs. yani Survival analizi Sorular GBM, Yapay sinir ağları vb. Makine öğrenimi modellerinin regresyon versiyonu bir olayın gerçekleşmesine kadar geçen günleri tahmin etmek …

3
Ronald Fisher'ın ana istatistiksel katkıları nelerdi?
Richard Dawkins, Ronald Fisher'ı Fisher'ın biyografisinde alıntılanan bir çizgi olan "modern istatistiklerin ve deneysel tasarımın babası" olarak tanımladı . Ayrıca Anders Hald , A matematiksel istatistik tarihi adlı kitabında "neredeyse modern istatistik biliminin temellerini yaratan bir dahi" olarak adlandırdı . Tam olarak ne yaptığını merak ediyorum, böylece insanlar ona bu …

1
Random Forest: OOB vs CV'yi değerlendirin
Rastgele Bir Orman'ın kalitesini, örneğin AUC kullanarak değerlendirdiğimizde, bu miktarları Torba Dışı Örnekler üzerinden veya bekletme çapraz doğrulama seti üzerinden hesaplamak daha uygun mudur? OOB Örnekleri üzerinden hesaplamanın daha kötümser bir değerlendirme verdiğini duydum, ama nedenini göremiyorum.

2
Layman'ın hayatta kalma analizinde sansür açıklaması
Sansürün ne olduğunu ve hayatta kalma analizinde nasıl dikkate alınması gerektiğini okudum, ancak bunun daha az matematiksel bir tanımını ve daha sezgisel bir tanımını duymak istiyorum (resimler harika olurdu!). Herkes bana 1) sansür ve 2) Kaplan-Meier eğrileri ve Cox regresyonu gibi şeyleri nasıl etkilediğini açıklayabilir mi?


1
Önyargı-varyans ayrışması
Bishop'un Örüntü Tanıma ve Makine Öğreniminin 3.2. Bölümünde , bir kare kaybı fonksiyonu için beklenen kaybın kare şeklinde bir önyargı terimine ayrılabileceğini belirten sapma-varyans ayrışmasını tartışır (bu, ortalama tahminlerin doğrudan ne kadar uzak olduğunu açıklar) model), bir varyans terimi (tahminlerin ortalamanın etrafına yayılmasını tanımlar) ve bir gürültü terimi (verilerin gerçek …

4
Küçük örneklerin grafiklendirilmesi
Bir görevi tamamlamak için 14 ayrı veri setim var. Ancak ben verileri grafik için kullanmak için uygun bir grafik bulmakta zorluk yaşıyorum. Örnek daha büyük olsaydı, bir kutu çizimi veya histogram kullanırdım, ancak örnek çok küçük olduğunda bu durumda kullanmanın uygun olup olmadığından emin değilim. Güncelleme: Zamanlar 5.2,3.9,5.6,4.2,3.8,4.1,6.0,5.6,4.4,4.5,4.9,4.5,4.9,4.2


1
Çok koşullu Bayes Teoremi
Bu denklemin nasıl türetildiğini anlamıyorum. P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M_{1}\cap M_{2}) \leq \frac{P(I)}{P(I')}\cdot \frac{P(M_{1}|I)P(M_{2}|I)}{P(M_{1}|I')P(M_{2}|I')} Bu denklem, OJ Simpson vakasına örnek bir problem olarak verildiği "Olasılıkla Deneme" adlı makaleden alınmıştır. Sanık çifte cinayetten yargılanıyor ve aleyhine iki delil sunuluyor. M1M1M_{1} , sanığın kanının bir suç mahallinde bulunan bir damla kanla eşleşmesi olayıdır. kurbanın kanının davalıya …

1
ANOVA, maksimum olasılığa değil, moment yöntemine mi dayanıyor?
ANOVA'nın tahminlerini moment yöntemini kullanarak yaptığı çeşitli yerlerde görüyorum. Bu iddiayla kafam karıştı, çünkü anların yöntemine aşina olmasam da, anlayışım bunun maksimum olabilirlik yönteminden farklı ve ona eşit olmayan bir şey olduğu; Öte yandan, ANOVA kategorik prediktörlerin ve regresyon parametrelerinin EKK tahmini doğrusal bir regresyon olarak görülebilir olduğu maksimum olabilirlik. …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.