İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

8
İstatistikler matematik değil mi?
İstatistikler matematik mi değil mi? Çoğunlukla matematik bölümleri tarafından öğretilen ve bunun için matematik kredisi aldığınız tüm sayılar göz önüne alındığında, insanların söylediklerinde sadece şaka olarak mı demek istediklerini merak ediyorum. Her şeyi temel aksiyomlara inşa edemediğiniz istatistik gibi bir şeyin matematik olarak kabul edilip edilemeyeceğini merak ediyorum. Örneğin, değeri, …

12
Negatif çarpıklığa sahip gerçek dağılım örnekleri
" Ortak dağılımların gerçek hayattan örneklerinden " esinlenerek , insanların olumsuz çarpıklık göstermek için kullandıkları pedagojik örneklerin ne olduğunu merak ediyorum? Öğretimde kullanılan simetrik veya normal dağılımların birçok "kanonik" örneği vardır - boy ve kilo gibi olanlar daha yakından biyolojik incelemede hayatta kalmasalar bile! Kan basıncı normale yakın olabilir. Astronomik …


2
Tekrarlayan Takviye Öğrenme Nedir?
Geçenlerde "Tekrarlayan Takviye Öğrenme" kelimesiyle karşılaştım. "Tekrarlayan Sinir Ağı" nın ne olduğunu ve "Takviye Öğrenme" nin ne olduğunu anlıyorum, ancak "Tekrarlayan Takviye Öğrenme" nin ne olduğu hakkında fazla bilgi bulamadım. Birisi bana "Tekrarlayan Takviye öğrenme" nedir ve "Tekrarlayan Takviye öğrenme" ile Q-Öğrenme algoritması gibi normal "Takviye öğrenme" arasındaki farkın ne …


3
Boş hipotezi reddetmek için 0,04993'lük bir p değeri yeterli mi?
Wilcoxon imzalı dereceli istatistiksel anlamlılık testinde, 0.04993 değeri üreten bazı verilerle karşılaştık . P &lt; 0.05 eşiği ile bu sonuç sıfır hipotezini reddetmek için yeterli midir , yoksa testin sonuçsuz olduğunu söylemek daha güvenlidir, çünkü p değerini 3 ondalık basamağa yuvarlarsak 0,050 olur mu?ppp0.049930.049930.04993p&lt;0.05p&lt;0.05p < 0.050.0500.0500.050

1
Sandviç tahmincisi sezgisi
Vikipedi ve R sandviç paketi vinyeti , OLS katsayısı standart hatalarını destekleyen varsayımlar ve sandviç tahmincilerinin matematiksel arka planı hakkında iyi bilgi verir. Yine de, artık standart OLS katsayıları varyans tahminini tam olarak anlayamadığım için, artıkların heteroseladastisite sorununun nasıl ele alındığından emin değilim. Sandviç tahmin edicisinin ardındaki sezgi nedir?

3
Fisher metrik ve bağıl entropi arasındaki bağlantı
Birisi Fisher bilgi metriği ile bağıl entropi (veya KL diverjansı) arasındaki aşağıdaki bağlantıyı tamamen matematiksel bir titizlikle kanıtlayabilir mi? D(p(⋅,a+da)∥p(⋅,a))=12gi,jdaidaj+(O(∥da∥3)D(p(⋅,a+da)∥p(⋅,a))=12gi,jdaidaj+(O(‖da‖3)D( p(\cdot , a+da) \parallel p(\cdot,a) ) =\frac{1}{2} g_{i,j} \, da^i \, da^j + (O( \|da\|^3) burada a=(a1,…,an),da=(da1,…,dan)a=(a1,…,an),da=(da1,…,dan)a=(a^1,\dots, a^n), da=(da^1,\dots,da^n) , gi,j=∫∂i(logp(x;a))∂j(logp(x;a)) p(x;a) dxgi,j=∫∂i(log⁡p(x;a))∂j(log⁡p(x;a)) p(x;a) dxg_{i,j}=\int \partial_i (\log p(x;a)) \partial_j(\log p(x;a))~ …

3
Doğrusal ayrılabilirlik testi
İki sınıflı bir veri kümesinin doğrusal ayrılabilirliğini yüksek boyutlarda test etmenin bir yolu var mı? Özellik vektörlerim 40 uzun. Her zaman lojistik regresyon deneylerini çalıştırabildiğimi ve iki sınıfın doğrusal olarak ayrılabilir olup olmadığını belirlemek için hitrate vs false alarm oranını belirleyebileceğimi biliyorum, ancak bunu yapmak için zaten standart bir prosedür …

2
Doğada bir yerlerde normal eğrinin şeklini görebilir miyiz?
Doğada bazı fenomenlerin normal dağılıma sahip olup olmadığını bilmek istemiyorum, ama normal eğri şeklini bir yerde görüp göremeyeceğimiz gibi, örneğin Galton kutusunda. Wikipedia'dan bu şekle bakın . Birçok matematiksel şeklin veya eğrinin doğada doğrudan görüldüğüne dikkat edin, örneğin altın ortalama ve logaritmik spiral salyangozlarda bulunabilir. İlk naif cevap, bükülmemiş tepelerin …


2
EM algoritması manuel olarak uygulandı
Ben elle EM algoritmayı uygulamak ve ardından sonuçlarına karşılaştırmak istediğiniz normalmixEMbir mixtoolspakette. Tabii ki, her ikisi de aynı sonuçlara yol açarsa mutlu olurum. Ana referans, Sonlu Karışım Modelleri olan Geoffrey McLachlan (2000) . Genelde iki Gausslu karışım yoğunluğum var, log olabilirliği (McLachlan sayfa 48): logLc(Ψ)=∑i=1g∑j=1nzij{logπi+logfi(yi;θi)}.günlük⁡Lc(Ψ)=Σben=1gΣj=1nzbenj{günlük⁡πben+günlük⁡fben(yben;θben)}. \log L_c(\Psi) = \sum_{i=1}^g \sum_{j=1}^n …

5
Beklenti Maksimizasyon algoritmasının motivasyonu
EM algoritma yaklaşımında Jensen'in eşitsizliğinilogp(x|θ)≥∫logp(z,x|θ)p(z|x,θ(k))dz−∫logp(z|x,θ)p(z|x,θ(k))dzlog⁡p(x|θ)≥∫log⁡p(z,x|θ)p(z|x,θ(k))dz−∫log⁡p(z|x,θ)p(z|x,θ(k))dz\log p(x|\theta) \geq \int \log p(z,x|\theta) p(z|x,\theta^{(k)}) dz - \int \log p(z|x,\theta) p(z|x,\theta^{(k)})dz ve tanımlamak tarafından θ ( k + 1 ) = arg max θ ∫ log p ( z , x | θ ) p ( z | x , θ ( k ) …

1
libsvm "maksimum yineleme sayısına ulaşma" uyarısı ve çapraz doğrulama
C-SVC modunda libsvm'yi derece 2 polinom çekirdeği ile kullanıyorum ve birden fazla SVM eğitmem gerekiyor. Her eğitim setinde 10 özellik ve 5000 vektör bulunur. Eğitim sırasında, eğittiğim SVM'lerin çoğu için bu uyarıyı alıyorum: WARNING: reaching max number of iterations optimization finished, #iter = 10000000 Birisi bu uyarının ne anlama geldiğini …

4
Sürekli verilerin modellenmesinde Poisson dağılımı nasıl çalışır ve bilgi kaybına neden olur mu?
Bir iş arkadaşı, bazı kötü Heteroscedasticity ile tezi için bazı biyolojik verileri analiz ediyor (aşağıdaki şekil). Karma bir modelle analiz ediyor, ancak artıklarla sorun yaşıyor. Yanıt değişkenlerinin log dönüştürülmesi işleri temizler ve bu soruya verilen geri bildirimlere dayanarak bu uygun bir yaklaşım gibi görünmektedir. Bununla birlikte, başlangıçta, dönüştürülmüş değişkenleri karma …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.