İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Birisi bana NUTS'u İngilizce olarak açıklayabilir mi?
Algoritmayı anlama şeklim şudur: Hiçbir U Dönüşü Örnekleyici (NUTS), Hamiltonian Monte Carlo Yöntemidir. Bu, bir Markov Zinciri yöntemi olmadığı anlamına gelir ve bu nedenle, bu algoritma, genellikle verimsiz ve yakınsama yavaş olarak kabul edilen rastgele yürüyüş parçasından kaçınır. Rastgele yürüyüş yapmak yerine, NUTS x uzunluğunda atlar yapar. Her atlama algoritma …

3
İstatistiksel çıkarım yaparken düzenlemeyi kullanma
Kestirimci modeller oluştururken düzenlileşmenin yararlarını biliyorum (sapma ve varyans, aşırı takmayı önleme). Ancak, regresyon modelinin temel amacı katsayılara çıkarım olduğunda (hangi öngörücülerin istatistiksel olarak anlamlı olduğunu görmek) düzenlileştirme (kement, sırt, elastik ağ) yapmanın iyi bir fikir olup olmadığını merak ediyorum. İnsanların düşüncelerini ve bununla ilgili akademik dergilere veya akademik olmayan …

2
Lmer modelinde post-hoc test nasıl yapılır?
Bu benim veri çerçevem: Group <- c("G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3") Subject <- c("S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15","S1","S2","S3","S4","S5","S6","S7","S8","S9","S10","S11","S12","S13","S14","S15") Value <- c(9.832217741,13.62390117,13.19671612,14.68552076,9.26683366,11.67886655,14.65083473,12.20969772,11.58494621,13.58474896,12.49053635,10.28208078,12.21945867,12.58276212,15.42648969,9.466436017,11.46582655,10.78725485,10.66159358,10.86701127,12.97863424,12.85276916,8.672953949,10.44587257,13.62135205,13.64038394,12.45778874,8.655142642,10.65925259,13.18336949,11.96595556,13.5552118,11.8337142,14.01763101,11.37502161,14.14801305,13.21640866,9.141392359,11.65848845,14.20350364,14.1829714,11.26202565,11.98431285,13.77216009,11.57303893) data <- data.frame(Group, Subject, Value) Sonra "Konu" rasgele faktör olduğu "Grup" 3 Grup farkını karşılaştırmak için doğrusal karışık efektler modeli çalıştırın: library(lme4) library(lmerTest) model <- lmer (Value~Group + (1|Subject), data = data) summary(model) Sonuçlar: Fixed effects: Estimate …
18 r  lme4-nlme  post-hoc 

1
k-NN hesaplama karmaşıklığı
Saf arama yaklaşımı ile k- NN algoritmasının zaman karmaşıklığı nedir (kd ağacı veya benzeri yok)? K hiperparametresi de göz önünde bulundurularak zaman karmaşıklığıyla ilgileniyorum . Çelişkili cevaplar buldum: O (nd + kn); burada n , eğitim setinin temel niteliğidir ve d , her bir numunenin boyutudur. [1] O (ndk), burada …



3
Kullback-Leibler diverjansının analizi
Aşağıdaki iki olasılık dağılımını ele alalım P Q 0.01 0.002 0.02 0.004 0.03 0.006 0.04 0.008 0.05 0.01 0.06 0.012 0.07 0.014 0.08 0.016 0.64 0.928 eşit olan Kullback-Leibler ıraksamasını , genel olarak bu sayı bana ne gösteriyor? Genel olarak, Kullback-Leibler ıraksaması bana, birinin olasılık dağılımının diğerinden ne kadar uzak …

4
Bayesci yöntemler ne zaman Frequentist'e tercih edilir?
Gerçekten Bayesci teknikleri öğrenmek istiyorum, bu yüzden kendime biraz öğretmeye çalışıyorum. Ancak, Bayesian tekniklerini kullanırken Frequentist yöntemlere göre bir avantaj sağladığını görmekte zorlanıyorum. Örneğin: Literatürde bazılarının bilgilendirici öncelikleri nasıl kullandığını, bazılarının ise bilgilendirici olmayanları nasıl kullandığını gördüm. Ancak önceden bilgilendirici olmayan bir bilgi kullanıyorsanız (bu gerçekten yaygın görünüyor mu?) Ve …


1
R kare için koşullu beklenti
Basit doğrusal modeli düşünün: yy=X′ββ+ϵyy=X′ββ+ϵ\pmb{y}=X'\pmb{\beta}+\epsilon nerede ϵi∼i.i.d.N(0,σ2)ϵi∼i.i.d.N(0,σ2)\epsilon_i\sim\mathrm{i.i.d.}\;\mathcal{N}(0,\sigma^2) ve X∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p} ,p≥2p≥2p\geq2 veXXX bir sabit sütun içerir. Sorum verilir E(X′X)E(X′X)\mathrm{E}(X'X) , ββ\beta ve σσ\sigma , önemsiz olmayan üst üzerine bağlanmış bir formül olduğu E(R2)E(R2)\mathrm{E}(R^2) *? (modelin OLS tarafından tahmin edildiği varsayılarak). * Ben, bu yazma, farz olduğunu alma E(R2)E(R2)E(R^2) kendisi mümkün …

5
T istatistiklerim çok büyük olduğunda R-karem neden bu kadar düşük?
4 değişkenli bir regresyon çalıştırdım ve hepsi çok yüksek ve açıkça önemli olan T değerleri ≈7,9,26≈7,9,26\approx 7,9,26 ve 313131 ( ondalıkları dahil etmek önemsiz görünüyor çünkü ≈≈\approx söylüyorum) ile çok istatistiksel olarak anlamlıdır. Ama sonra R2R2R^2 sadece .2284'tür. Buradaki t değerlerini, olmadığı bir şeyi ifade etmek için yanlış mı yorumluyorum? …

1
Gama dağılımı ile Dirichlet dağılımı yapımı
Let olmak karşılıklı olarak bağımsız rastgele değişken parametreleri ile her biri bir gama dağılımı göstermektedir ki ,X1,…,Xk+1X1,…,Xk+1X_1,\dots,X_{k+1}αi,i=1,2,…,k+1αi,i=1,2,…,k+1\alpha_i,i=1,2,\dots,k+1Yi=XiX1+⋯+Xk+1,i=1,…,kYi=XiX1+⋯+Xk+1,i=1,…,kY_i=\frac{X_i}{X_1+\cdots+X_{k+1}},i=1,\dots,kDirichlet(α1,α2,…,αk;αk+1)Dirichlet(α1,α2,…,αk;αk+1)\text{Dirichlet}(\alpha_1,\alpha_2,\dots,\alpha_k;\alpha_{k+1}) Ortak PDF edin.Sonra ortak bulmak pdf / jacobian bulamıyorum yani(X1,…,Xk+1)=e−∑k+1i=1xixα1−11…xαk+1−1k+1Γ(α1)Γ(α2)…Γ(αk+1)(X1,…,Xk+1)=e−∑i=1k+1xix1α1−1…xk+1αk+1−1Γ(α1)Γ(α2)…Γ(αk+1)(X_1,\dots,X_{k+1})=\frac{e^{-\sum_{i=1}^{k+1}x_i}x_1^{\alpha_1-1}\dots x_{k+1}^{\alpha_{k+1}-1}}{\Gamma(\alpha_1)\Gamma(\alpha_2)\dots \Gamma(\alpha_{k+1})}(Y1,…,Yk+1)(Y1,…,Yk+1)(Y_1,\dots,Y_{k+1})J(x1,…,xk+1y1,…,yk+1)J(x1,…,xk+1y1,…,yk+1)J(\frac{x_1,\dots,x_{k+1}}{y_1,\dots,y_{k+1}})

2
Spline temeli görselleştirme
Ders kitapları genellikle konuyu açıklarken tekdüze spline tabanının güzel örnek grafiklerine sahiptir. Doğrusal bir spline için bir dizi küçük üçgen veya kübik bir spline için bir dizi küçük hörgüç gibi bir şey. Bu tipik bir örnektir: http://support.sas.com/documentation/cdl/en/statug/63033/HTML/default/viewer.htm#statug_introcom_a0000000525.htm Standart R fonksiyonlarını (bs veya ns gibi) kullanarak spline tabanını çizmenin kolay bir …

2
Çoklu regresyon katsayıları için standart hatalar?
Bunun çok temel bir soru olduğunun farkındayım, ama hiçbir yerde bir cevap bulamıyorum. Normal denklemleri veya QR ayrışmasını kullanarak regresyon katsayılarını hesaplıyorum. Her katsayı için standart hataları nasıl hesaplayabilirim? Genellikle standart hatalar olarak hesaplanmaktadır düşünüyorum: SEx¯ =σx¯n√SEx¯ =σx¯nSE_\bar{x}\ = \frac{\sigma_{\bar x}}{\sqrt{n}} Ne Her bir katsayı için? Bunu OLS bağlamında hesaplamanın …

1
LASSO varsayımları
LASSO regresyon senaryosunda, y= Xβ+ ϵy=Xβ+εy= X \beta + \epsilon , ve LASSO tahminleri aşağıdaki optimizasyon problemiyle verilir minβ| | y- Xβ| | +τ| | β| |1minβ||y-Xβ||+τ||β||1 \min_\beta ||y - X \beta|| + \tau||\beta||_1 \ Epsilon ile ilgili herhangi bir dağıtım varsayımı var εε\epsilonmı? Bir OLS senaryosunda, bağımsız ve normal …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.