İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
Dirichlet dağılımında simpleksi üçgen yüzey olarak göstermenin anlamı nedir?
Dirchilet dağılımını tanıtan ve daha sonra onunla ilgili rakamlar sunan bir kitaptan okuyorum. Ama bu rakamları gerçekten anlayamadım. Figürü buraya altına iliştirdim. Anlamadığım şey üçgenlerin anlamları. Normalde, bir kişi 2 değişkenli bir işlevi çizmek istediğinde, var1 ve va2 değerini alırsınız ve daha sonra bu iki değişkenin işlev değerinin değerini çizersiniz …

1
Farklılıklara İlişkin Veri Kurulumu
Fark regresyon modelindeki bir fark için hangi kurulum doğrudur? Yi'nin s t= α +γs∗ T+ λdt+ δ∗ ( T*dt) +εi'nin s tYbenst=α+γs*T+λdt+δ*(T*dt)+εbenstY_{ist} = \alpha +\gamma_s*T + \lambda d_t + \delta*(T*d_t)+ \epsilon_{ist} burada gözlem, tedavi grubundan geliyorsa T, 1'e eşit bir kukladır ve d, tedavi gerçekleştikten sonraki sürede 1'e eşit bir …


2
Birden çok uzamsal çözünürlük / ölçek içeren kaynaklardan zaman serisi bilgilerini birleştirme
Farklı sensörlerden birçok uydu tarama görüntüm var. Bunlardan, daha kaba olanların çok bol bir zamansal çözünürlüğü vardır. Orta çözünürlüklü rasterlerin edinim tarihleri ​​daha azdır, ancak yine de bir miktar bilgi mevcuttur. Daha ince olan çözünürlüklerin çok düşük bir zamansal çözünürlüğü vardır ve iki yılın altında gözlemlenen 2 ila 6 tarihleri …

1
RandomForest-sklearn'de sınıflandırma eşiği
1) Sklearn'deki RandomForest'te sınıflandırma eşiğini (varsayılan olarak 0,5 olduğunu düşünüyorum) nasıl değiştirebilirim? 2) sklearn'de nasıl yetersiz numune alabilirim? 3) RandomForest sınıflandırıcısından şu sonucu aldım: [[1635 1297] [520 3624]] precision recall f1-score support class 0 0.76 0.56 0.64 2932 class 1 0.74 0.87 0.80 4144 ort / toplam 0,75 0,74 0,73 …

1
İki binom dağılımı örneğinin aynı p'ye uygun olup olmadığını test edin
Diyelim ki yaptım: n1n1n_1 başarı oranı bilinmeyen bağımsız denemeler p1p1p_1 ve gözlendi k1k1k_1 başarılar. n2n2n_2 başarı oranı bilinmeyen bağımsız denemeler p2p2p_2 ve gözlendi k2k2k_2 başarılar. Şimdi, p1=p2=:pp1=p2=:pp_1 = p_2 =: p ama hala bilinmiyor, olasılık p(k2)p(k2)p(k_2) gözlemlemek k2k2k_2 belirli bir k1k1k_1(veya tam tersi) , bu yüzden için test etmek , …

1
Sıralı veriler için korelasyon katsayıları: Kendall's Tau vs Polychoric vs Spearman's rho
Araştırmacılar genellikle Polychoric Correlation ile ilgilenen düzenli ölçümlerle yönetmek gibi görünüyor . (Örneğin, Faktör Analizi yapmadan önce matris yapmak için.) Neden? Kendall Tau Sıra Korelasyon Katsayısı ve Spearman'ın sıra korelasyon katsayısı da sıralı veriler için uygundur. Bu korelasyon katsayıları için 'pro' ve 'contra' noktaları kabul edilir.

2
Nüfus istikrar endeksi - sıfıra bölme
Nüfus kararlılık endeksi, veri örneklerini iki zaman diliminde karşılaştırarak bir değişkenin dağılımındaki değişikliği ölçmektedir. Skorlardaki kaymaları ölçmek için yaygın olarak kullanılır. Aşağıdaki gibi hesaplanır: 1) Baz döneme ait numune ayrıktır. Genellikle ondalıklara bölünür 2) Hedef dönemden alınan örnek, ilk adım Burada: - i-th bin'in taban dönem içindeki payı. - i-th …

1
Scikit kümeleme atalet formülü öğrenmek
Pandalar ve scikit öğrenmek kullanarak python kümeleme bir kmeans kodlamak istiyorum. İyi k'yi seçmek için, Tibshirani ve al 2001'den ( Pdf ) Gap İstatistiğini kodlamak istiyorum . Scikit'ten inertia_ sonucunu kullanıp kullanamayacağımı ve tüm istatistik hesaplamasını yeniden kodlamak zorunda kalmadan boşluk istatistik formülünü uyarlayıp uyarlayamayacağımı bilmek istiyorum . Scikit / …

1
Normal bir örnekten minimum sipariş istatistiği için beklenen değer
GÜNCELLEME 25 Ocak 2014: hata düzeltildi. Yüklenen görüntüde Beklenen Değerin hesaplanan değerlerini dikkate almayın - bunlar yanlış - Görüntüyü silmiyorum çünkü bu soruya bir cevap oluşturdu. GÜNCELLEME 10 Ocak 2014: hata bulundu - kullanılan kaynaklardan birinde bir matematik yazım hatası. Düzeltme hazırlanıyor ... Koleksiyonundan minimum sipariş istatistiğinin yoğunluğu ED sürekli …

2
Kategorik nominal değişkenler arasındaki kategoriler arasındaki ilişki
İki kategorik nominal değişkenli bir veri setim var (her ikisi de 5 kategoride). Bu iki değişken arasındaki kategoriler arasındaki potansiyel korelasyonları tespit edip edemediğimi (ve nasıl) tanımak istiyorum. Başka bir deyişle, örneğin kategori sonuçlarının iii değişken 1'de belirli bir kategori ile güçlü bir korelasyon gösterir jjj 5 kategorili iki değişkenim …

1
R: Anova ve Doğrusal Regresyon
İstatistiklerde yeniyim ve ANOVA ile doğrusal regresyon arasındaki farkı anlamaya çalışıyorum. Bunu keşfetmek için R kullanıyorum. ANOVA ve regresyonun neden farklı ama yine de aynı olduğu ve nasıl görselleştirilebileceği vb. İle ilgili çeşitli makaleler okudum. Bence güzelim ama bir parça hala eksik. ANOVA'nın test edilen gruplardan herhangi biri arasında fark …
9 r  regression  anova 

4
Gecikme sırasını mı tercih ediyorsunuz?
Formun boyuna verilerine sahip olduğumu varsayalım Y =(Y1, … ,YJ) ∼ N( μ , Σ )Y=(Y1,…,YJ)∼N(μ,Σ)\mathbf Y = (Y_1, \ldots, Y_J) \sim \mathcal N(\mu, \Sigma)(Birden fazla gözlemim var, bu sadece tek bir form). İle ilgili kısıtlamalarla ilgileniyorumΣΣ\Sigma. KısıtlanmamışΣΣ\Sigma almaya eşdeğerdir Yj=αj+Σℓ = 1j - 1φℓ jYj - ℓ+εjYj=αj+∑ℓ=1j−1ϕℓjYj−ℓ+εj Y_j = …

1
İki boyutlu nokta dizileri arasındaki korelasyon katsayısı?
İki boyutlu 2B dizim var ve korelasyonlarını tahmin etmem gerekiyor. Hangi formülü kullanmalıyım? Dizilere örnek: X:((1,5),(2,5),(1,7),(4,1)),X:((1,5),(2,5),(1,7),(4,1)),X: ((1,5),(2,5),(1,7),(4,1)), Y:((3,4),(1,6),(4,6),(4,3)).Y:((3,4),(1,6),(4,6),(4,3)).Y: ((3,4),(1,6),(4,6),(4,3)).

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.