İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

5
Verilerin rastgele eksik olup olmadığını belirlemek için istatistiksel bir yaklaşım
Ben (Python scikit öğrenmek kullanarak) bir ikili sınıflandırma sorununa saldırmak için kullanacağım özellik vektörleri büyük bir set var. Öngörü hakkında düşünmeye başlamadan önce, eksik verilerin 'rastgele eksik' mi yoksa rastgele olmayan eksik mi olduğunu verinin kalan kısımlarından belirlemeye çalışmakla ilgileniyorum. Bu soruya yaklaşmanın mantıklı bir yolu nedir? Daha iyi bir …

3
İki normal dağılım arasındaki farkın dağılımı
Normal dağılımların iki olasılık yoğunluk fonksiyonuna sahibim: f1( x1|μ1, σ1) = 1σ12 π--√e−(x−μ1)22σ21f1(x1|μ1,σ1)=1σ12πe-(x-μ1)22σ12f_1(x_1 \; | \; \mu_1, \sigma_1) = \frac{1}{\sigma_1\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_1)^2}{2\sigma_1^2} } ve f2(x2|μ2,σ2)=1σ22π−−√e−(x−μ2)22σ22f2(x2|μ2,σ2)=1σ22πe-(x-μ2)22σ22f_2(x_2 \; | \; \mu_2, \sigma_2) = \frac{1}{\sigma_2\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_2)^2}{2\sigma_2^2} } Ben ve arasındaki ayrımın olasılık yoğunluk fonksiyonu arıyorum . Sanırım bu. …

2
Sırt regresyonunun varsayımları nelerdir ve nasıl test edilir?
Çoklu regresyon için standart modeli düşünün burada ε ∼ N ( 0 , σ 2 I n ) , böylece normallik, homoscedasticity ve hataların ilişkisizliği geçerlidir.Y=Xβ+εY=Xβ+εY=X\beta+\varepsilonε∼N(0,σ2In)ε∼N(0,σ2In)\varepsilon \sim \mathcal N(0, \sigma^2I_n) köşegeninin tüm elemanlarına aynı küçük miktarda ekleyerek bir sırt regresyonu gerçekleştirdiğimizi varsayalım :XXX βridge=[X′X+kI]−1X′Yβridge=[X′X+kI]−1X′Y\beta_\mathrm{ridge}=[X'X+kI]^{-1}X'Y Bazı değerler vardır , ancak sırt …


1
Mikro ortalamalı veya makro ortalamalı değerlendirme ölçütlerine dayanarak karar vermeli miyim?
Aynı veri kümesine sahip farklı ikili sınıflandırma algoritmaları üzerinde 10 kat çapraz doğrulama yaptım ve hem Mikro hem de Makro ortalamaları aldım. Bunun çok etiketli bir sınıflandırma sorunu olduğu belirtilmelidir. Benim durumumda, gerçek negatifler ve gerçek pozitifler eşit ağırlıklı. Bu, gerçek negatifleri doğru tahmin etmek, doğru pozitifleri doğru tahmin etmek …

1
GLM'deki yarı Poisson neden özel bir negatif binom vakası olarak değerlendirilmiyor?
Genelleştirilmiş doğrusal modelleri aşırı dağılmış olabilir veya olmayabilir saymak veri bazı kümeleri uydurmaya çalışıyorum. Burada geçerli olan iki kanonik dağılım, EV ve varyans ile Poisson ve Negatif Binom (Negbin)μμ\mu Va rP= μVbirrP=μVar_P = \mu Va rN-B= μ + μ2θVbirrN-B=μ+μ2θVar_{NB} = \mu + \frac{\mu^2}{\theta} glm(..,family=poisson)ve glm.nb(...)sırasıyla R kullanılarak takılabilir . quasipoissonAnladığım …

4
Karma veriler neden öklid tabanlı kümeleme algoritmaları için bir sorundur?
Klasik kümeleme ve boyutsallık azaltma algoritmalarının çoğu (hiyerarşik kümeleme, temel bileşen analizi, k-araçları, kendi kendini düzenleyen haritalar ...) özel olarak sayısal veriler için tasarlanmıştır ve girdi verileri bir öklid uzayında noktalar olarak görülür. Bu, elbette bir sorun, çünkü gerçek dünyadaki birçok soru karışık veriler içeriyor: örneğin otobüsleri incelersek, yükseklik ve …

3
Rastgele verilerin SVD sonuçlarındaki garip korelasyonlar; matematiksel bir açıklaması var mı yoksa LAPACK hatası mı?
Hem Matlab hem de R'de çoğaltılabileceğim rastgele verilerin SVD sonucunda çok garip bir davranış gözlemliyorum. LAPACK kütüphanesinde sayısal bir sorun gibi görünüyor; bu mu? Sıfır ortalama ve kimlik kovaryansına sahip boyutlu Gaussian'dan n=1000n=1000n=1000 örnek çiziyorum : . Onları veri matrisi . (İsteğe bağlı olarak merkezleyebilir ya da değil, aşağıdakileri etkilemez.) …


4
Dağıtımımın multimodal olup olmadığını nasıl test edebilirim?
Verilerimin bir histogramını çizdiğimde, iki tepe noktası var: Bu potansiyel bir çok modlu dağılım anlamına mı geliyor? Ben dip.testR ( library(diptest)) koştu ve çıktı: D = 0.0275, p-value = 0.7913 Verilerimin çoklu mod dağılımına sahip olduğu sonucuna varabilir miyim? VERİ 10346 13698 13894 19854 28066 26620 27066 16658 9221 13578 …

2
Basit doğrusal regresyonda, artıkların varyans formülü nereden geliyor?
Kullandığım bir metne göre, kalıntısının varyans formülü şu şekilde verilir:ithithi^{th} σ2(1−1n−(xi−x¯¯¯)2Sxx)σ2(1−1n−(xi−x¯)2Sxx)\sigma^2\left ( 1-\frac{1}{n}-\frac{(x_{i}-\overline{x})^2}{S_{xx}} \right ) kalıntı gözlenen değer ile takılan değer arasındaki fark olduğundan inanmak zor buluyorum ; biri farkın varyansını hesaplayacak olsaydı, en azından ortaya çıkan ifadede bazı "artılar" beklerdim. Türetmenin anlaşılmasında herhangi bir yardım takdir edilecektir.ithithi^{th}ithithi^{th}ithithi^{th}

3
AIC'de 'parametre sayısı' nın anlamı
AIC hesaplanırken, AIC=2k−2lnLAIC=2k−2lnLAIC = 2k - 2 ln L k 'parametre sayısı' anlamına gelir. Fakat parametre olarak ne sayılır? Yani örneğin modelde y=ax+by=ax+by = ax + b A ve b her zaman parametre olarak sayılır mı? Kesmenin değerini umursamıyorsam, görmezden gelebilir miyim yoksa hala sayılır mı? Farzedelim y=af(c,x)+by=af(c,x)+by = a …
21 aic 




Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.