İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
PCA biplotundaki dört eksen nedir?
PCA analizi için bir biplot oluşturduğunuzda, x ekseni üzerinde ana bileşen PC1 puanları ve y ekseninde PC2 puanları olur. Ancak ekranın sağındaki ve üstündeki diğer iki eksen nedir?
18 r  pca  biplot 

2
Kukla Özelliklerle (ve diğer Ayrık / Kategorik Özelliklerle) Anomali Tespiti
tl; Dr. discreteAnomali tespiti yaparken verilerle başa çıkmanın önerilen yolu nedir ? categoricalAnomali tespiti yaparken verilerle başa çıkmanın önerilen yolu nedir ? Bu yanıt , yalnızca sonuçları filtrelemek için ayrık verilerin kullanılmasını önerir. Belki de kategori değerini yüzdesel gözlem şansı ile değiştirebilir misiniz? giriş Bu benim ilk kez buraya gönderiyorum, …

2
svyglm vs glm'de ağırlık kullanımı
Ağırlıkların tedavi arasında nasıl farklılık gösterdiğini biliyorum istiyorum svyglmveglm twangAşağıdaki gibi ağırlık olarak kullanılan eğilim puanları oluşturmak için R paketi kullanıyorum (bu kod twangbelgelerden geliyor ): library(twang) library(survey) set.seed(1) data(lalonde) ps.lalonde <- ps(treat ~ age + educ + black + hispan + nodegree + married + re74 + re75, data …
18 r  survey 

1
Ayrık zamanlı sağkalım analizi hakkında temel sorular
Lojistik regresyon modelini kullanarak ayrık bir zaman hayatta kalma analizi yapmaya çalışıyorum ve süreci tamamen anladığımdan emin değilim. Birkaç temel soruyla ilgili yardımı çok takdir ediyorum. İşte kurulum: Beş yıllık bir zaman diliminde bir gruba üyeliğe bakıyorum. Her üyenin üye olduğu her ay için aylık üyelik kaydı vardır. Üyeliği beş …

4
Çapraz doğrulama ve parametre ayarlama
Herkes bana bir çapraz geçerlilik analizinin sonuç olarak tam olarak ne verdiğini söyleyebilir mi? Sadece ortalama doğruluk mu yoksa ayarlanmış parametrelerle herhangi bir model veriyor mu? Çünkü bir yerde, çapraz ayarlamanın parametre ayarı için kullanıldığını duydum.

4
Neden önemli rakamlar kullanmıyoruz?
İstatistiklerde neden önemli basamaklar kullanmadığımız hakkında bir fikrin var mı? Doğruluğu ile ilgili kurallar geçerli olmadığından, tahminler kullandığımız bir şey var;)?
18 reporting 

1
Doğrusal regresyonda kategorik değişken için istatistiksel önem nasıl test edilir?
Doğrusal bir regresyonda kategorik değişkenim varsa ... kategorik değişkenin durağan önemini nasıl bilebilirim? Diyelim ki faktörü X1X1X_110 seviyeye sahip ... bir faktör değişkeni şemsiyesi altında 10 farklı sonuç t-değeri olacak X1X1X_1... Bana öyle geliyor ki, istatistiksel anlamlılık faktör değişkeninin her seviyesi için test ediliyor mu? Hayır? @Macro: Önerinizi takiben aşağıdaki …

3
Çok sınıflı bir sınıflandırıcı oluşturmak birkaç ikili sınıflayıcıdan daha mı iyidir?
URL'leri kategorilere ayırmam gerekiyor. Diyelim ki her URL'yi sıfırlamayı planladığım 15 kategorim var. 15 yollu sınıflandırıcı daha mı iyi? Burada 15 etiket var ve her veri noktası için özellikler oluşturmak. Ya da 15 ikili sınıflandırıcı oluşturup, diyelim: Film ya da Film Dışı ve bir sınıflayıcı oluşturmak için bu sınıflandırmalardan aldığım …


1
Çok değişkenli normal posterior
Bu çok basit bir soru ama türetmeyi internette veya kitapta hiçbir yerde bulamıyorum. Bayesilerin çok değişkenli bir normal dağılımı nasıl güncellediğini görmek isterim. Örneğin: hayal edin P(x|μ,Σ)P(μ)==N(μ,Σ)N(μ0,Σ0).P(x|μ,Σ)=N(μ,Σ)P(μ)=N(μ0,Σ0). \begin{array}{rcl} \mathbb{P}({\bf x}|{\bf μ},{\bf Σ}) & = & N({\bf \mu}, {\bf \Sigma}) \\ \mathbb{P}({\bf \mu}) &= & N({\bf \mu_0}, {\bf \Sigma_0})\,. \end{array} {\ …

4
Hareketli ortalama modeli hata terimleri
Bu Box-Jenkins MA modellerinde temel bir sorudur. Anladığım kadarıyla, bir MA modeli temelde zaman serisi değerleri YYY önceki hata terimleri karşı doğrusal bir regresyonudur . . . , e t - net,...,et−net,...,et−ne_t,..., e_{t-n} . Yani, gözlemi YYYilk olarak önceki değerlerine karşı gerilemektedir . . . , Y, t - nYt−1,...,Yt−nYt−1,...,Yt−nY_{t-1}, …

1
Uydurma olasılık dağılımlarındaki MLE'ye karşı en küçük kareler
Okuduğum birkaç makaleye, kitaba ve makaleye dayanarak edindiğim izlenim, bir olasılık kümesi dağılımını bir veri kümesine yerleştirmenin önerilen yolunun, maksimum olasılık tahmini (MLE) kullanmak olmasıdır. Bununla birlikte, bir fizikçi olarak, daha sezgisel bir yol, modelin pdf'sini en az kareler kullanarak verilerin ampirik pdf'sine yerleştirmektir. O zaman neden MLE, olasılık dağılım …


2
Çok sınıflı SVM gerçekleştirmenin en iyi yolu
SVM'nin ikili bir sınıflandırıcı olduğunu biliyorum. Çok sınıflı SVM'ye genişletmek istiyorum. Bunu gerçekleştirmenin en iyi ve belki de en kolay yolu hangisidir? kod: MATLAB'da u=unique(TrainLabel); N=length(u); if(N>2) itr=1; classes=0; while((classes~=1)&&(itr<=length(u))) c1=(TrainLabel==u(itr)); newClass=double(c1); tst = double((TestLabel == itr)); model = svmtrain(newClass, TrainVec, '-c 1 -g 0.00154'); [predict_label, accuracy, dec_values] = svmpredict(tst, …

2
Lojistik regresyon katsayıları nasıl yorumlanır?
Aşağıdaki olasılık işlevim var: Prob=11+e−zProb=11+e−z\text{Prob} = \frac{1}{1 + e^{-z}} nerede z=B0+B1X1+⋯+BnXn.z=B0+B1X1+⋯+BnXn.z = B_0 + B_1X_1 + \dots + B_nX_n. Modelim şöyle görünüyor Pr(Y=1)=11+exp(−[−3.92+0.014×(gender)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(gender)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{gender})]\right)} Kesişimin (3.92) ne anlama geldiğini anlıyorum, ancak şimdi 0.014'ü nasıl yorumlayacağımdan eminim. Bunlar hala log oranları, garip oranlar mı, yoksa şimdi …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.