İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Ters bağımsız değişkenli regresyon
Diyelim ki bağımlı değişkenlerin vektörü ve bağımsız değişkenin vektör . Zaman karşı çizilir , ikisi arasında doğrusal bir ilişki (yukarı doğru bir eğilim) olduğunu görüyoruz. Şimdi, bu aynı zamanda ve arasında doğrusal bir düşüş eğilimi olduğu anlamına gelir .X Y 1NN-NHYYYNN-NXXXYYY YX1X1X\frac{1}{X}YYYXXX Şimdi, regresyonu çalıştırırsam: ve uygun değeriY = β …


1
Özvektörlerin görsel açıklaması hakkında karıştı: görsel olarak farklı veri kümeleri aynı özvektörlere nasıl sahip olabilir?
Birçok istatistik ders kitabı, bir kovaryans matrisinin özvektörlerinin neler olduğunu sezgisel bir şekilde göstermektedir: U ve z vektörleri özvektörleri oluşturur (çukur, özler). Bu mantıklı. Ama beni şaşırtan tek şey, özvektörleri ham verilerden değil korelasyon matrisinden çıkarmamızdır. Ayrıca, oldukça farklı olan ham veri kümelerinin özdeş korelasyon matrisleri olabilir. Örneğin, aşağıdakilerin her …

2
Lineer karışık modelde artık teşhis ve varyansların homojenliği
Bu soruyu sormadan önce sitemizde arama yaptım ve birçok benzer soru buldum ( burada , burada ve burada olduğu gibi ). Ancak ilgili soruların iyi yanıtlanmadığını veya tartışılmadığını hissediyorum, bu yüzden bu soruyu tekrar gündeme getirmek istiyorum. Bu tür soruların daha açık bir şekilde açıklanmasını isteyen çok sayıda izleyici olması …

3
K-kosinüs benzerlikleri anlamına gelir Öklid mesafesi (LSA)
Daha düşük boyutlu uzayda bir belge topluluğunu temsil etmek için gizli anlamsal analiz kullanıyorum. Bu belgeleri k-araçlarını kullanarak iki gruba ayırmak istiyorum. Birkaç yıl önce, bunu Python'un gensim'ini kullanarak ve kendi k-ortalama algoritmamı yazdım. Öklid mesafesini kullanarak küme sentroidlerini belirledim, ancak daha sonra her bir belgeyi sentroidin kosinüs benzerliğine dayanarak …

1
Rasgele eğimli karışık modelde sınıf içi korelasyon katsayısı
Katılımcılar ( ) ve öğeler ( ) için çapraz rastgele efektlerle m_plotdonatılmış aşağıdaki modele sahibim :lme4::lmerlfdncontent Random effects: Groups Name Variance Std.Dev. Corr lfdn (Intercept) 172.173 13.121 role1 62.351 7.896 0.03 inference1 24.640 4.964 0.08 -0.30 inference2 52.366 7.236 -0.05 0.17 -0.83 inference3 21.295 4.615 -0.03 0.22 0.86 -0.77 content …

2
Toplamı normal olmayan iki * ilişkili * normal değişken örneği
Marjinal olarak normal fakat ortak olarak normal olmayan ilişkili rastgele değişken çiftlerinin bazı güzel örneklerinin farkındayım. Bkz bu cevabı ile Dilip Sarwate ve bu bir tarafından Kardinal . Toplamı normal olmayan iki normal rastgele değişkenin bir örneğinin de farkındayım. Macro tarafından verilen bu cevaba bakınız . Ancak bu örnekte, iki …

1
Arabaların cinayet silahı olarak kullanıldığı istatistiksel olarak gösterilebilir mi?
Geçenlerde birisinin birisini öldürmek (ve ondan kurtulmak) isterse bunu arabalarıyla yapacağını söylediği bir hikaye duydum. Otobanla ilgili ölümlerin (yaya arabaları dahil) sayısıyla ilgili çeşitli istatistikler ve aslında her türlü suça mahkum edilen sürücülerin sayısı hakkında ek istatistikler verdiler ... falan, falan, falan. Sorum şu: Arabaların (istatistiksel olarak) cinayet işlemek için …

2
Küçük örneklem büyüklüğü verileri için eğitim, çapraz doğrulama ve test seti boyutları nasıl seçilir?
Küçük bir örnek boyutum olduğunu varsayalım, örneğin N = 100 ve iki sınıf. Makine öğrenimi için eğitim, çapraz doğrulama ve test seti boyutlarını nasıl seçmeliyim? Sezgisel olarak seçerdim Eğitim seti boyutu 50 Çapraz doğrulama seti boyutu 25 ve Boyutu 25 olarak test edin. Ama muhtemelen bu az ya da çok …

3
MCMC ve PyMC ile 2-Gauss karışım modeli çıkarımı
Sorun Basit bir 2-Gauss karışım popülasyonunun model parametrelerine uymak istiyorum. Bayesian yöntemleri çevresindeki tüm hype göz önüne alındığında, bu sorun için Bayesian çıkarım geleneksel uydurma yöntemleri daha iyi bir araç olup olmadığını anlamak istiyorum. Şimdiye kadar MCMC bu oyuncak örneğinde çok kötü bir performans sergiliyor, ancak belki de bir şeyleri …


2
Pearson Chi Squared İstatistiği bir Chi Squared Dağılımına nasıl yaklaşır?
Bu nedenle, tablosu için Pearson Chi Squared İstatistiği verilirse , formu şu şekildedir:1 × N1×N1 \times N Σi = 1n( Oben- Eben)2Eben∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} Daha sonra bu , n - 1 serbestlik dereceli Chi-Squared Dağılımına yakındır , çünkü numune boyutu N büyür. χ2n - 1χn−12\chi_{n-1}^2n - 1n−1n-1N-NN Anlamadığım şey, bu …

2
R randomForests'ta sınıflandırma eşiği nasıl değiştirilir?
Tüm Türler Dağıtım Modellemesi literatürü, olasılıkları (örneğin, RandomForests) çıkaran bir model kullanarak bir türün varlığını / yokluğunu tahmin ederken, bir türün varlığını veya yokluğunu gerçekte sınıflandırabilme eşik olasılığının seçilmesinin önemli olduğunu ve her zaman 0,5 varsayılanına bağlı değildir. Bu konuda yardıma ihtiyacım var! İşte benim kod: library(randomForest) library(PresenceAbsence) #build model …


2
Yuvalanmamış modeller için genelleştirilmiş günlük olabilirlik oranı testi
İki model A ve B ve A'nın B'de iç içe yerleştirilmiş olması durumunda, bazı veriler verildiğinde, MLE kullanarak A ve B parametrelerine uyabildiğimi ve genelleştirilmiş günlük olabilirlik oranı testini uygulayabileceğimi anlıyorum. Özellikle, testin dağılımı olmalıdır ile N serbestlik derecesi n bu parametrelerin sayısı arasındaki fark olan bir ve B sahiptir.χ2χ2\chi^2nnnnnnAAABBB …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.