İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Boole özelliklerinin küçük bir örnek kümesi için PCA ve spektral kümeleme arasındaki fark
50 örneklik bir veri setim var. Her örnek 11 (muhtemelen ilişkili) Boole özelliğinden oluşur. Bu örnekleri 2B çizimde nasıl görselleştirebilir ve 50 örnek arasında küme / gruplama olup olmadığını incelemek isterim. Aşağıdaki iki yaklaşımı denedim: (a) PCA'yı 50x11 matrisinde çalıştırın ve ilk iki temel bileşeni seçin. Verileri 2D çizim üzerine …


3
bölünmüş bir normal size t-dağılımı - kanıtı sağlar
ve diyelim .Z∼N(0,1)Z∼N(0,1)Z \sim N(0,1)W∼χ2(s)W∼χ2(s)W \sim \chi^2(s) Eğer ve bağımsız bir şekilde, daha sonra dağıtıldığı değişkeni aşağıda belirtildiği gibi özgürlük dereceleri ile dağıtım .ZZZWWWY=ZW/s√Y=ZW/sY = \frac{Z}{\sqrt{W/s}}tttsss Bu gerçeğin bir kanıtını arıyorum, tam argümanı yazmak istemiyorsanız bir referans yeterince iyi.

1
Lsmeans, Poisson karışık model (glmer ile uyum) gibi genelleştirilmiş doğrusal bir model için ne rapor eder?
Tasarlanmış bir deneyden göz izleme verilerini analiz ediyorum. Verilerimin basitleştirilmiş bir sürümü şuna benzer (dput () verilerini buradan alabilirsiniz ), head(lookDATA) participant fixationImage fixationCount 1 9 Automobile 81 2 9 Bird 63 3 9 Chair 82 4 9 Dog 64 5 9 Face 90 6 9 Plant 75 burada katılımcı …

2
Uygulamalı akademik dergi makalelerindeki istatistik bölümlerine iyi örnekler
Uygulamalı bir alanda çalışan bir biyoistatistim ve üzerinde çalıştığım makaleler için istatistik yöntemleri bölümünü yazmaktan sorumluyum. Çok sayıda akademik makaleyi okurken, kötü yazılmış istatistik bölümlerinin birçok örneğiyle karşılaştım (çoğunlukla sıkıcı, bilgisiz ve kullanılan metodolojinin kesinliği, detayı ve anlayışından yoksundurlar). Konuya ve kullanılan istatistiksel yöntemlerin karmaşıklığına bakılmaksızın, uygulamalı araştırma makalelerinde iyi …

2
Bayes lineer regresyonunda posterior prediktif dağılımın değerlendirilmesi
Bayes lineer regresyon için posterior doğrusal regresyonun nasıl değerlendirileceği konusunda kafam karıştı, burada sayfa 3'te açıklanan ve aşağıda kopyalanan temel vakayı geçti . p (y~∣ y) = ∫p (y~∣ β,σ2) p ( β,σ2∣ y)p(y~|y)=∫p(y~|β,σ2)p(β,σ2|y) p(\tilde y \mid y) = \int p(\tilde y \mid \beta, \sigma^2) p(\beta, \sigma^2 \mid y) Temel …

2
R'deki bir Kolmogorov-Smirnov testinin gücünü hesaplayabilir misiniz?
R'de 2 taraflı Kolmogorov Smirnov testi için güç analizi yapmak mümkün müdür? İki ampirik dağılımın ks.test () kullanarak farklılık gösterip göstermediğini test ediyorum ve bir güç analizi eklemek istiyorum. R'deki KS testleri için yerleşik güç analizleri bulamadım. Herhangi bir öneriniz var mı? Düzenleme : Bunlar rasgele oluşturulan dağıtım verilerimi yakından …

1
Neredeyse yakınsama tam bir yakınsama anlamına gelmez
Biz demek tamamen yakınsama her için ise .X1,X2,…X1,X2,…X_1, X_2, \ldotsXXXϵ&gt;0ϵ&gt;0\epsilon>0 ∑∞n=1P(|Xn−X|&gt;ϵ)&lt;∞∑n=1∞P(|Xn−X|&gt;ϵ)&lt;∞\sum_{n=1}^\infty \text{P}\left(|X_n-X|>\epsilon\right) <\infty Borel Cantelli'nin lemması, tam yakınsamanın neredeyse kesin yakınsama anlamına geldiğini kanıtlamak için ileriye dönüktür. Neredeyse yakınsamanın Borel Cantelli ile kanıtlanamayacağından emin olduğum bir örnek arıyorum. Bu, neredeyse kesin olarak ama tamamen değil birbirine yaklaşan rastgele değişkenler dizisidir.

1
Bayesian A / B Testi Formülü bir anlam ifade etmiyor
Bayes metodolojisi kullanarak AB testi sonuçlarını hesaplamak için Bayesian ab test formülünü kullanıyorum. Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA)Pr(pB&gt;pA)=∑i=0αB−1B(αA+i,βB+βA)(βB+i)B(1+i,βB)B(αA,βA) \Pr(p_B > p_A) = \sum^{\alpha_B-1}_{i=0} \frac{B(\alpha_A+i,\beta_B+\beta_A)}{(\beta_B+i)B(1+i,\beta_B)B(\alpha_A, \beta_A)} nerede αAαA\alpha_A bir arada artı A için başarı sayısı βAβA\beta_A bir arada artı A için başarısızlık sayısı αBαB\alpha_B bir artı B için başarı sayısı βBβB\beta_B bir artı B için …
10 r  bayesian  ab-test 

2
Yuvalanmış çapraz doğrulamanın uygulanması
İç içe çapraz doğrulama anlayışımın doğru olup olmadığını anlamaya çalışıyorum, bu yüzden doğru olup olmadığımı görmek için bu oyuncak örneğini yazdım: import operator import numpy as np from sklearn import cross_validation from sklearn import ensemble from sklearn.datasets import load_boston # set random state state = 1 # load boston dataset …

3
Dengesiz Sinir Ağları (CNN) ile dengesiz bir veri seti nasıl sınıflandırılır?
İkili sınıflandırma görevinde dengesiz bir veri setim var, burada pozitifler negatiflere karşı% 0.3'e karşı% 99.7. Pozitif ve negatifler arasındaki boşluk çok büyük. Bir CNN'yi MNIST probleminde kullanılan yapı ile eğittiğimde, test sonucu yüksek bir Yanlış Negatif Oran gösterir. Ayrıca, eğitim hatası eğrisi başlangıçta birkaç dönemde hızla düşer, ancak sonraki dönemlerde …

1
Asimptotik kovaryans matrisi nedir?
Asimptotik kovaryans matrisinin parametre tahminlerinin kovaryans matrisine eşit olduğu doğru mu? Eğer değilse, nedir? Ve bu durumda kovaryans matrisi ile asimptotik kovaryans matrisi arasındaki fark nedir? Şimdiden teşekkürler!

2
Markov zincir tabanlı örnekleme Monte Carlo örneklemesi için “en iyi” midir? Mevcut alternatif şemalar var mı?
Markov Zinciri Monte Carlo, numuneleri doğrudan çizemediğimiz standart olmayan dağıtımlardan (Monte Carlo ortamında) numune almamıza izin veren Markov zincirlerine dayanan bir yöntemdir. Benim sorum Markov zincirinin Monte Carlo örneklemesi için neden "son teknoloji" olduğudur. Alternatif bir soru, Monte Carlo örneklemesi için kullanılabilecek Markov zincirleri gibi başka yollar var mı? MCMC'nin …

1
Yeterlilik veya Yetersizlik
Rasgele örnek düşünün iid rastgele değişkenler . için yeterli bir istatistik olup olmadığını kontrol edin .{X1,X2,X3}{X1,X2,X3}\{X_1,X_2,X_3\}XiXiX_iBernoulli(p)Bernoulli(p)Bernoulli(p)p∈(0,1)p∈(0,1)p\in(0,1)T(X)=X1+2X2+X3T(X)=X1+2X2+X3T(X)=X_1+2X_2+X_3ppp İlk olarak, dağıtımını nasıl bulabiliriz ? Yoksa ve sonra takip edecek mi? Bence değil çünkü tüm değişkenlerin burada bağımsız olmadığını unutmayın.(X1+2X2+X3)(X1+2X2+X3)(X_1+2X_2+X_3)X1+X2+X2+X3X1+X2+X2+X3X_1+X_2+X_2+X_3Bin(4,p)Bin(4,p)Bin(4,p) Alternatif olarak, sadece ortak PMF dikkate alınarak çarpanlara durum kullanır ise daha sonra …

2
Aşırı parametreli bir model için Fisher bilgi matrisi belirleyicisi
parametresiyle (başarı olasılığı) bir Bernoulli rasgele değişkeni düşünün . Olabilirlik fonksiyonu ve Fisher bilgisi ( matris):X∈{0,1}X∈{0,1}X\in\{0,1\}θθ\theta1×11×11 \times 1 L1(θ;X)I1(θ)=p(X|θ)=θX(1−θ)1−X=detI1(θ)=1θ(1−θ)L1(θ;X)=p(X|θ)=θX(1−θ)1−XI1(θ)=detI1(θ)=1θ(1−θ) \begin{align} \mathcal{L}_1(\theta;X) &= p(\left.X\right|\theta) = \theta^{X}(1-\theta)^{1-X} \\ \mathcal{I}_1(\theta) &= \det \mathcal{I}_1(\theta) = \frac{1}{\theta(1-\theta)} \end{align} Şimdi iki parametreli bir "aşırı parametreli" versiyonu düşünün: başarı olasılığı θ1θ1\theta_1 ve hata olasılığı θ0θ0\theta_0 . ( …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.