İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Kovaryans matrisi pozitif tanımlı olmadığında faktör analizi nasıl yapılır?
33 değişken (sütun) tarafından açıklanan 717 gözlem (satır) oluşan bir veri kümesi var. Veriler, tüm değişkenlerin z-skorlaması ile standartlaştırılmıştır. Hiçbir iki değişken doğrusal olarak bağımlı değildir ( ). Ayrıca çok düşük varyanslı ( az ) tüm değişkenleri kaldırdım . Aşağıdaki şekilde karşılık gelen korelasyon matrisi gösterilmektedir (mutlak değerlerde).r = 1r=1r=10.10.10.1 …

1
risk sınıflandırıcısı için hesaplama eşiği?
İki Sınıf ve özelliğine sahip olduğunu ve ve dağılımına sahip olduğunu varsayalım . aşağıdaki maliyet matrisi için eşit :C1C1C_1C2C2C_2xxxN(0,0.5)N(0,0.5) \cal{N} (0, 0.5)N(1,0.5)N(1,0.5) \cal{N} (1, 0.5)P(C1)=P(C2)=0.5P(C1)=P(C2)=0.5P(C_1)=P(C_2)=0.5 L=[010.50]L=[00.510]L= \begin{bmatrix} 0 & 0.5 \\ 1 & 0 \end{bmatrix} neden, minimum risk (maliyet) sınıflandırıcısının eşiği ?x0&lt;0.5x0&lt;0.5x_0 < 0.5 Bu yanlış anladığım not örneğidir (yani, …

1
Verileri fazla uydurmadan en uygun olanı nasıl seçerim? N normal fonksiyonlar, vb. İle bir bimodal dağılımın modellenmesi
Ben uymaya çalışıyorum değerleri bimodal açık bir dağıtım var. Veriler 2 normal fonksiyon (bimodal) veya 3 normal fonksiyon ile uyumlu olabilir. Ek olarak, verilerin 3'e uyması için makul bir fiziksel neden vardır. Ne kadar çok parametre eklenirse, uyum da o kadar mükemmel olur, yeterli sabitlerde olduğu gibi, bir kişi " …

3
“Tersine çevrilmiş” Shapiro – Wilk
Wikipedia'ya göre Sharipo-Wilk testi null hipotezini test eder ( ) "Popülasyon normal olarak dağıtılır".'H0'H0H_0 Ben benzer bir normallik testi için arıyorum "nüfus değil normal dağılımlı".'H0'H0H_0 Böyle bir test sahip, ben önem düzeyinde iff reddetmek için bir değeri hesaplamak istiyorum ; popülasyonumun normal olarak dağıldığını kanıtlıyorum.ppp'H0'H0H_0αα\alphap &lt; αp&lt;αp < \alpha Lütfen …


1
Null ve model sapmalarını kullanarak GLM modelini test edin
R'de bir glm modeli oluşturdum ve bir test ve eğitim grubu kullanarak test ettim, bu yüzden iyi çalıştığından eminim. R'nin sonuçları: Coefficients: Estimate Std. Error t value Pr(&gt;|t|) (Intercept) -2.781e+00 1.677e-02 -165.789 &lt; 2e-16 *** Coeff_A 1.663e-05 5.438e-06 3.059 0.00222 ** log(Coeff_B) 8.925e-01 1.023e-02 87.245 &lt; 2e-16 *** log(Coeff_C) -3.978e-01 …

1
Lav çıktısını nasıl yorumlayabilirim?
Kullanarak doğrulayıcı faktör analizi (CFA) deniyorum lavaan. Ürettiği çıktıyı yorumlamakta zorlanıyorum lavaan. Basit bir modelim var - toplanan anket verilerinden öğeler tarafından desteklenen 4 faktör. Faktörler, geçerli bir ölçüm olarak hizmet edebilecekleri muhtemel göründüğü ölçüde, maddeler tarafından ölçülenle uyumludur. Lütfen lavaan's tarafından üretilen aşağıdaki çıktıyı anlamama yardımcı olun cfa(): Number …


1
Hangi daha hızlı, ortalama veya medyan yakınsar?
Eğer iid değişkenlerini N (0,1) 'den çizersem, ortalama veya medyan daha hızlı birleşir mi? Ne kadar hızlı? Daha spesifik olmak gerekirse, x1,x2,…x1,x2,…x_1, x_2, \ldots N (0,1) 'den çizilen iid değişkenlerinin bir sırası olsun. ˉ x n = 1 tanımlayınx¯n=1n∑ni=1xix¯n=1n∑i=1nxi\bar{x}_n = \frac{1}{n}\sum_{i=1}^n x_ivex~nx~n\tilde{x}_n,nin medyanı olacaktır{x1,x2,…xn}{x1,x2,…xn}\{x_1, x_2, \ldots x_n\}. Hangisi 0'a daha …

2
Lojistik ve logit-lineer regresyon ile tahmin edilen katsayılar ne zaman farklılık gösterir?
Sürekli oranları modellerken (örn. Anket kadranlarındaki orantılı bitki örtüsü, veya bir aktiviteye katılan zamanın oranı), lojistik regresyon uygunsuz olarak kabul edilir (örn. Warton &amp; Hui (2011) Arksin asindir: ekolojideki oranların analizi ). Aksine, orantıların logit-transforme edilmesinden sonra OLS regresyonu veya belki de beta regresyonu daha uygundur. Hangi koşullar altında log …
11 r  regression  logistic 


1
Sıradan Verileri Görüntüleme - Araçlar, Medya ve Ortalama Sıralamalar
Normalde dağıtılmayan bazı sıralı verilerim var, bu yüzden Mann-Whitney U Testini kullanarak parametrik olmayan testler yapmaya karar verdim. Yedi puan için gruplar arasındaki farklılıklara bakıyorum - bu puanlar her konu için 0, 1, 2 veya 3'tür. Verilerimi nasıl görüntüleyeceğimi bulmakta zorlanıyorum! Verileri medyanları (ve medyanların IQR'sini) kullanarak sunarsam, farkların nerede …

2
Bartlett testi vs Levene testi
Şu anda ANOVA varsayımlarına yönelik ihlalleri ele almaya çalışıyorum. Normalliği test etmek için Shapiro-Wilk'ı kullandım ve hem Levene'nin hem de Bartlett'in varyans eşitliği testiyle uğraştım. O zamandan beri log eşit olmayan sapmaları denemek ve düzeltmek için verilerimi dönüştürdü. Bartlett'in log dönüştürülmüş veriler üzerindeki testini yeniden düzenledim ve yine de önemli …

1
R - Kement Regresyonu - regresör başına farklı Lambda
Aşağıdakileri yapmak istiyorum: 1) beta katsayılarını elde etmek için OLS regresyonu ( süresi yoktur) ; regresyon için kullanılan değişkenleri ifade eder. Bunu tarafından yapıyorum jb*jbj∗b_{j}^{*}jjj lm.model = lm(y~ 0 + x) betas = coefficients(lm.model) 2) Kriminal regresyon ceza süresi ile, seçim kriterleri tarafından verilen Bayes Bilgi Kriterleri (BIC) olacaktır. λj= …
11 r  regression  glmnet  lars 

1
Negatif Binom / Poisson Regresyonunda Aşırı Dağılım ve Yetersiz Dağılım
SAS'ta bir Poisson regresyonu yapıyordum ve Pearson ki-kare değerinin serbestlik derecelerine bölünmesinin 5 civarında olduğunu ve bu da aşırı fazla dağılma olduğunu gösterdi. Bu yüzden, proc genmod ile negatif bir binom model uydurdum ve Pearson ki kare değerinin serbestlik derecesine bölünmesinin 0.80 olduğunu buldum. Bu artık yetersiz dağıtılıyor mu? Eğer …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.