İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
PCA'da tam olarak “temel bileşen” ne denir?
, tasarım matrisi X ile verinin projeksiyonunun varyansını maksimize eden vektör olduğunu varsayalım .uuuXXX Şimdi, aynı zamanda en büyük özdeğeri olan özvektör olan verinin (ilk) ana bileşeni olduğunu ifade eden materyaller gördüm .uuu Ancak, verilerin temel bileşeninin olduğunu da gördüm .XuXuX u Açıkçası, ve X u farklı şeylerdir. Burada bana …

2
PCA'daki düşük varyans bileşenleri, gerçekten sadece gürültü mi? Bunu test etmenin bir yolu var mı?
Bir PCA bileşeninin korunup korunmayacağına karar vermeye çalışıyorum. Örneğin burada veya burada tarif edilen ve karşılaştırılan özdeğer büyüklüğüne dayanan bir milyarlarca kriter vardır . Ancak benim başvurumda, küçük (est) öz değerin büyük (st) öz değere kıyasla küçük olacağını ve büyüklüğe dayalı kriterlerin hepsinin küçük (est) olanı reddedeceğini biliyorum. İstediğim bu …
18 pca 

1
Seyrek veri matrislerinde çalışan kümeleme algoritmaları [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 5 yıl önce kapalı . Kümeleme algoritmalarının bir listesini derlemeye çalışıyorum: R'de uygulandı SparseMatrix işlevi tarafından oluşturulanlar gibi seyrek veri matrislerini (benzerlik matrislerini değil) çalıştırın …
18 r  clustering  sparse 

1
MANOVA LDA ile nasıl ilişkilidir?
Birçok yerde, MANOVA'nın ANOVA artı lineer diskriminant analizi (LDA) gibi olduğunu iddia ettim, ancak her zaman elle sallanan bir şekilde yapıldı. Tam olarak ne anlama geldiğini bilmek istiyorum . MANOVA hesaplamalarının tüm ayrıntılarını açıklayan çeşitli ders kitapları buldum, ancak istatistikçi olmayan birisinin erişebileceği iyi genel tartışmaları (yalnız resimler ) bulmak …



9
Grafikler, diyagramlar ve çizim türleri galerisi
Kapsamlı bir veri sunumu teknikleri galerisi olarak ne önerirsiniz? Verilerinizi sunmanın daha iyi yollarını düşünürken başvurabileceğiniz bir kaynak? Aşağıdakileri belirledim, ancak sizinkini ekleyebilirseniz sevinirim: Çevrimiçi galeriler: http://www.mathworks.com/discovery/gallery.html http://www.idlcoyote.com/gallery/ https://developers.google.com/chart/interactive/docs/gallery?csw=1 http://www.walkingrandomly.com/?p=4788 http://en.wikipedia.org/wiki/Category:Statistic_charts_and_diagrams (tek sayfalık grafik galerisi sağlamaz) http://docs.ggplot2.org/current/ http://www.itl.nist.gov/div898/handbook/graphgal.htm http://scikit-learn.org/stable/auto_examples/index.html http://www.stata.com/support/faqs/graphics/gph/stata-graphs/ http://shiny.rstudio.com/gallery/ https://bl.ocks.org/ (etkileşimli ve vektör grafikleri) http://www.texample.net/tikz/examples/ (Kod ile TikZ …

3
Profil olasılığı ile güven aralıkları arasındaki ilişki nedir?
Bu grafiği yapmak için, ortalama = 0 ve sd = 1 olan normal bir dağılımdan farklı büyüklükte rastgele örnekler ürettim. Güven aralıkları daha sonra t.test () işleviyle .001 ile .999 (kırmızı çizgi) arasında değişen alfa kesimleri kullanılarak hesaplandı, profil olasılığı, aşağıdaki notlarda bulduğum kod kullanılarak hesaplandı (I can ' t …

5
Scrabble'daki bir çanta harfinden belirli bir kelimeyi çizme olasılığı
Her biri üzerinde bir harf bulunan nnn fayanslı bir çantanız olduğunu varsayalım . Orada nAnAn_A 'A' harfi ile çinileri nBnBn_B vb 'B' ile ve ve n∗n∗n_*'joker' karolar (Elimizdeki n=nA+nB+…+nZ+n∗n=nA+nB+…+nZ+n∗n = n_A + n_B + \ldots + n_Z + n_*). Sonlu sayıda kelimeden oluşan bir sözlüğünüz olduğunu varsayalım. kkk fayanslarını değiştirmeden …

2
Veri tabanlı çöp kutusu sınırlarının ki-kare uyum iyiliği testi üzerindeki etkisi?
Bu tür durumlarda ki-kare düşük gücünün bariz sorununu bir kenara bırakarak, verileri ikiye ayırarak, belirtilmemiş parametrelerle bazı yoğunluk için ki-kare testi iyiliği yaptığınızı hayal edin. Somutluk için, diyelim ki ortalaması bilinmeyen üstel dağılım ve örnek büyüklüğü 100 diyelim. Bölme başına makul sayıda beklenen gözlem elde etmek için verilerin bir kısmının …

3
Yüksek eğri veriler üzerinde t testi
On binlerce tıbbi maliyet verisi gözlemine sahip bir veri setim var. Bu veriler sağda çok eğri ve çok sayıda sıfır var. İki grup insan için bu gibi görünüyor (bu durumda her biri> 3000 obs olan iki yaş grubu): Min. 1st Qu. Median Mean 3rd Qu. Max. 0.0 0.0 0.0 4536.0 …

9
Çift yönlü Mahalanobis mesafeleri
Bir n×pn×pn \times p değişken matrisindeki her bir gözlem çifti arasındaki R'deki örnek Mahalanobis mesafesini hesaplamam gerekiyor . Ben, yani sadece verimli bir çözüm gerekir n(n−1)/2n(n−1)/2n(n-1)/2 mesafeleri hesaplanır ve tercihen de C / RCpp uygulanan / Fortran vb varsayalım ΣΣ\Sigma nüfus kovaryans matrisi bilinmemektedir, ve örnek kovaryans kullanımı yerine matris. …
18 r  algorithms  distance 


5
İstatistikçiler bir bitkinin aşırı sulanamayacağını mı yoksa sadece eğrisel regresyon için yanlış arama terimlerini mi kullanıyorum?
Ben, lineer regresyon ve GLM okumak neredeyse her şey bu kaynar: f ( x , β ) bir non-arttırılması ya da işlevini azalmayan x ve β Eğer tahmin parametresi ve bir testtir hakkında hipotezler. Y'yi f ( x'in doğrusal bir işlevi haline getirmek için düzinelerce bağlantı işlevi ve y ve …

1
Kümelenmiş standart hatalar ve çok düzeyli modelleme mi?
Birkaç kitap (Raudenbush & Bryk, Snijders & Bosker, Gelman & Hill, vb.) Ve birkaç makale (Gelman, Jusko, Primo & Jacobsmeier, vb.) kümelenmiş standart hataların kullanımı ile çok düzeyli modelleme arasındaki temel farklar. Eldeki araştırma sorusuyla ilgili kısımları anlıyorum; yalnızca çok düzeyli modellemeden alabileceğiniz belirli cevap türleri vardır. Ancak, örneğin, ilgi …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.