İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
Normal gaussian vektörlerin doğrusal dönüşümü
Aşağıdaki ifadeyi kanıtlamakta zorlanıyorum. Google'da bulunan bir araştırma makalesinde verilmiştir. Bu ifadeyi kanıtlamak için yardıma ihtiyacım var! Let , ortogonal matris ve Gauss olan. Herhangi bir ortonormal bazda aynı dağılıma sahip olan Gauss izotopik davranışı .X=ASX=ASX= ASAAASSSSSS üzerine uyguladıktan sonra Gauss nasıl ?XXXAAASSS

2
“Verilerin kendisi için konuşmasına izin ver” neyi amaçlıyor?
Aşağıdaki makaleyi okurken, aşağıdaki ifadeyle karşılaştım: Belirtildiği gibi, Benzecri'nin [1973] “verinin kendisi için konuşmasına izin verme” fikri doğrultusunda olasılıklı modellere atıfta bulunulmadan sunulur. (alıntı JP Benzécri'den alınmıştır. L'analyse des données. Tome II: L'analyse des correspondances. Dunod, 1973.) Bu makaleyi nasıl okuduğumdan, "verinin kendisi için konuşmasına izin ver" ifadesi , bir …
10 eda  quotation 

2
verilme olasılığı nedir ?
XXX ve YYY ortalama μ=(μ1,μ2)μ=(μ1,μ2)\mu=(\mu_1,\mu_2) ve kovaryans ile iki değişkenli normal olduğunu varsayalım Σ=[σ11σ12σ12σ22]Σ=[σ11σ12σ12σ22]\Sigma = \begin{bmatrix} \sigma_{11} & \sigma_{12} \\ \sigma_{12} & \sigma_{22} \\ \end{bmatrix} . \ Pr \ left (X &lt;Y | \ min \ left (X, Y \ right) \ right) olasılığı nedir Pr(X&lt;Y|min(X,Y))Pr(X&lt;Y|min(X,Y))\Pr\left(X<Y|\min\left(X,Y\right)\right)?

1
Ait tahminleyicisinin UMVUE varlığı ve seçim günü içinde nüfus
Let çekilen rasgele numune olduğu popülasyonu burada .(X1,X2,⋯,Xn)(X1,X2,⋯,Xn)(X_1,X_2,\cdots,X_n)N(θ,θ2)N(θ,θ2)\mathcal N(\theta,\theta^2)θ∈Rθ∈R\theta\in\mathbb R UMVUE'yu arıyorum .θθ\theta Ortak yoğunluğu olduğu(X1,X2,⋯,Xn)(X1,X2,⋯,Xn)(X_1,X_2,\cdots,X_n) fθ(x1,x2,⋯,xn)=∏i=1n1θ2π−−√exp[−12θ2(xi−θ)2]=1(θ2π−−√)nexp[−12θ2∑i=1n(xi−θ)2]=1(θ2π−−√)nexp[1θ∑i=1nxi−12θ2∑i=1nx2i−n2]=g(θ,T(x))h(x)∀(x1,⋯,xn)∈Rn,∀θ∈Rfθ(x1,x2,⋯,xn)=∏i=1n1θ2πexp⁡[−12θ2(xi−θ)2]=1(θ2π)nexp⁡[−12θ2∑i=1n(xi−θ)2]=1(θ2π)nexp⁡[1θ∑i=1nxi−12θ2∑i=1nxi2−n2]=g(θ,T(x))h(x)∀(x1,⋯,xn)∈Rn,∀θ∈R\begin{align} f_{\theta}(x_1,x_2,\cdots,x_n)&=\prod_{i=1}^n\frac{1}{\theta\sqrt{2\pi}}\exp\left[-\frac{1}{2\theta^2}(x_i-\theta)^2\right] \\&=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[-\frac{1}{2\theta^2}\sum_{i=1}^n(x_i-\theta)^2\right] \\&=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[\frac{1}{\theta}\sum_{i=1}^n x_i-\frac{1}{2\theta^2}\sum_{i=1}^nx_i^2-\frac{n}{2}\right] \\&=g(\theta,T(\mathbf x))h(\mathbf x)\qquad\forall\,(x_1,\cdots,x_n)\in\mathbb R^n\,,\forall\,\theta\in\mathbb R \end{align} , burada ve .sa(x)=1g(θ,T(x))=1(θ2π√)nexp[1θ∑ni=1xi−12θ2∑ni=1x2i−n2]g(θ,T(x))=1(θ2π)nexp⁡[1θ∑i=1nxi−12θ2∑i=1nxi2−n2]g(\theta, T(\mathbf x))=\frac{1}{(\theta\sqrt{2\pi})^n}\exp\left[\frac{1}{\theta}\sum_{i=1}^n x_i-\frac{1}{2\theta^2}\sum_{i=1}^nx_i^2-\frac{n}{2}\right]h(x)=1h(x)=1h(\mathbf x)=1 Burada , ve - ve bağımsızdır . Bu yüzden, Fisher-Neyman- factorisation teoreminden, iki boyutlu istatistik …

1
Olumsuz olasılıklar: Layman açıklamaları
Buradaki cevap beni çok şaşırttı . Olumsuz olasılıkların ne anlama gelebileceği ve muhtemelen örneklerle uygulamaları hakkında daha ayrıntılı bir açıklama yapmak istiyorum. Örneğin, bu genişletilmiş olasılık ölçülerine göre, bir olayın olasılık-% 10 olması ne anlama gelir?

2
UMVUE /
Let (X1,X2,…,Xn)(X1,X2,…,Xn)(X_1,X_2,\ldots,X_n) yoğunluktan gelişigüzel bir örnek olması fθ(x)=θxθ−110&lt;x&lt;1,θ&gt;0fθ(x)=θxθ−110&lt;x&lt;1,θ&gt;0f_{\theta}(x)=\theta x^{\theta-1}\mathbf1_{00 UMVUE'yu bulmaya çalışıyorum θ1+θθ1+θ\frac{\theta}{1+\theta} . Ortak yoğunluk (X1,…,Xn)(X1,…,Xn)(X_1,\ldots,X_n) olduğu fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110&lt;x1,…,xn&lt;1=exp[(θ−1)∑i=1nlnxi+nlnθ+ln(10&lt;x1,…,xn&lt;1)],θ&gt;0fθ(x1,⋯,xn)=θn(∏i=1nxi)θ−110&lt;x1,…,xn&lt;1=exp⁡[(θ−1)∑i=1nln⁡xi+nln⁡θ+ln⁡(10&lt;x1,…,xn&lt;1)],θ&gt;0\begin{align} f_{\theta}(x_1,\cdots,x_n)&=\theta^n\left(\prod_{i=1}^n x_i\right)^{\theta-1}\mathbf1_{00 \end{align} Nüfus PDF olarak fθfθf_{\theta} bir parametreli üstel familyasına aittir için tam yeterli istatistiği ki bu da θθ\theta olan T(X1,…,Xn)=∑i=1nlnXiT(X1,…,Xn)=∑i=1nln⁡XiT(X_1,\ldots,X_n)=\sum_{i=1}^n\ln X_i Yana E(X1)=θ1+θE(X1)=θ1+θE(X_1)=\frac{\theta}{1+\theta} , ilk düşünce,E(X1∣T)E(X1∣T)E(X_1\mid T)Bana UMVUE verecektiθ1+θθ1+θ\frac{\theta}{1+\theta}Lehmann-Scheffe …

3
“Pragmatik” denemeler: bunlar nedir?
Twitter'da, bir araştırmacı Stuart Nicholls yakın zamanda yayınlanan bir çalışmayı şöyle söyleyerek eleştirdi: Dal-Re'nin çok ilginç makalesine ek olarak, pragmatik terimin kullanımını sorgulayan birkaç örneği işaret ediyorlar. Faz 3, çok bölgeli, çift kör, plasebo kontrollü, paralel kollu, doz artışlı randomize çalışma gerçekten 'pragmatik' olarak adlandırılabilir mi? Söz konusu araştırma makalesi …

3
İki değişkenin toplamının varyansı için formülün arkasındaki sezgi
Önceki çalışmalardan biliyorum ki Var(A+B)=Var(A)+Var(B)+2Cov(A,B)Var(A+B)=Var(A)+Var(B)+2Cov(A,B)Var(A+B) = Var(A) + Var(B) + 2 Cov (A,B) Ancak bunun neden olduğunu anlamıyorum. Etkinin, A ve B yüksek oranda değiştiğinde varyansı 'yükseltmek' olacağını görebiliyorum. Yüksek derecede korelasyonlu iki değişkenten bir kompozit oluşturduğunuzda, A'dan yüksek gözlemler ile B'den yüksek gözlemler ve A'dan düşük gözlemler ile B'den …

2
Üçgen Sayımının Rastgele Grafikte Dağılımı ve Sapması
Bir Erdos-Renyi rastgele grafiği düşünün G=(V(n),E(p))G=(V(n),E(p))G=(V(n),E(p)). nnn köşe kümesi, V = { 1 , 2 , … , n }VVV ile etiketlenmiştir . Kenar E kümesi rastgele bir işlemle oluşturulur.V={1,2,…,n}V={1,2,…,n}V = \{1,2,\ldots,n\}EEE Let ppp olasılık olarak 0&lt;p&lt;10&lt;p&lt;10<p<1 , daha sonra her bir sırasız çifti {i,j}{i,j}\{i,j\} köşelerin ( i≠ji≠ji \neq j …

3
MAP,
Ben geldim bu slaytlar çevrimiçi derslerin birinde (slayt # 16 &amp; # 17). Eğitmen Maksimum Posterior Tahmini (MAP) çözüm aslında nasıl anlatmaya çalışıyordu L ( θ ) = I[ θ ≠ θ*]L(θ)=ben[θ≠θ*]L(\theta) = \mathcal{I}[\theta \ne \theta^{*}] , nerede θ*θ*\theta^{*} gerçek bir parametredir. Birisi bunun nasıl olduğunu açıklayabilir mi? Düzenle: Bağlantının …

2
Meta-analizde sabit etkilerle rastgele etkiler modelinin gerekçeleri
"Heterojenite düşük olduğu için sabit etkiler modeli seçildi" satırları boyunca sabit etkiler modelinin ifadeleriyle birlikte kullanılmasını haklı kılan birkaç yayını okudum. Bununla birlikte, veri analizine hala uygunsuz bir yaklaşım olabileceğinden endişe ediyorum. Bunun bir hata olup olmayacağını ve neden olabileceğini tartışan nedenler veya yayınlar var mı?

2
Uygunsuz Karışımlardan Kesin Örnekleme
Varsayalım sürekli dağılımından örnek almak istiyorum . Formda ifadesi varsapp(x)p(x)p(x)ppp p(x)=∑i=1∞aifi(x)p(x)=∑i=1∞aifi(x)p(x) = \sum_{i=1}^\infty a_i f_i(x) burada ve f_i kolayca örneklenebilen dağılımlardır, o zaman kolayca p ile örnekleri oluşturabilirim :ai⩾0,∑iai=1ai⩾0,∑iai=1a_i \geqslant 0, \sum_i a_i= 1fifif_ippp A_i olasılığı olan bir i etiketini örneklemeiiiaiaia_i Örnekleme X∼fiX∼fiX \sim f_i aiaia_i ara sıra negatifse bu …

4
Yeniden örneklenen veri kümelerindeki hipotez testleri null değerini çok sık reddediyor?
tl; dr: null altında oluşturulan bir veri kümesi ile başlayarak, vakaları değiştirerek yeniden örnekledim ve her yeniden örneklenen veri kümesi üzerinde bir hipotez testi gerçekleştirdim. Bu hipotez testleri boş değeri% 5'ten fazla reddeder. Aşağıda, çok basit bir simülasyonda, ile veri kümeleri oluşturuyorum X∼N(0,1)⨿Y∼N(0,1)X∼N(0,1)⨿Y∼N(0,1)X \sim N(0,1) \amalg Y \sim N(0,1)ve her …

5
Kelime sıklığı verilerindeki dağılım nasıl ölçülür?
Kelime sayımlarının bir vektöründeki dağılım miktarını nasıl ölçebilirim? Sıklıkla ortaya çıkan bir kelime (veya birkaç kelime) içerdiğinden, nadiren ortaya çıkan birçok farklı kelime ve B belgesi için düşük olduğu için A belgesi için yüksek olacak bir istatistik arıyorum. Daha genel olarak, nominal verilerdeki dağılım veya "yayılma" nasıl ölçülür? Bunu metin …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.