İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
Veri kümelerinin muhtemelen sıfır standart sapma ile Pearson korelasyonu?
Muhtemelen sıfır standart sapma ile veri kümelerinin pearson korelasyon katsayısını hesaplamakta bir sorun yaşıyorum (yani tüm veriler aynı değere sahiptir). Aşağıdaki iki veri kümesine sahip olduğumu varsayalım: float x[] = {2, 2, 2, 3, 2}; float y[] = {2, 2, 2, 2, 2}; Korelasyon katsayısı "r", aşağıdaki denklem kullanılarak hesaplanır: …

2
İyi bir Hibrit / Hamiltonian Monte Carlo algoritması tasarlamak hakkında ne bilmeliyim?
PyMC için bir Hibrid Monte Carlo örnekleme algoritması tasarlıyorum ve mümkün olduğunca sorunsuz ve genel olarak yapmaya çalışıyorum, bu yüzden bir HMC algoritması tasarımı konusunda iyi tavsiyeler arıyorum. Okudum Radford'un anket bölüm ve Beskos et. al. HMC'nin optimal (adım boyutu) ayarlamasıyla ilgili son makale ve ben aşağıdaki ipuçlarını topladım: Momentum …

1
Toplanan verileri tekrar tekrar test ederken genel tip I hatası
Sıralı grup yöntemleri hakkında bir sorum var . Wikipedia'ya göre: İki tedavi grubuyla yapılan randomize bir çalışmada, klasik grup sıralı testi aşağıdaki şekilde kullanılır: Her gruptaki n süjeler mevcutsa, 2n süjeler üzerinde bir ara analiz yapılır. İstatistiksel analiz iki grubu karşılaştırmak için yapılır ve alternatif hipotez kabul edilirse deneme sonlandırılır. …

2
Exp (X) ~ Gamma ise hızlı bir şekilde X örneği nasıl alınır?
İç döngü gibi görünüyor basit bir örnekleme sorunu var: v = sample_gamma(k, a) burada sample_gammabir Dirichlet örneği oluşturmak için Gama dağılımından örnekler. İyi çalışıyor, ancak k / a'nın bazı değerleri için bazı aşağı akış hesaplama akışları. Günlük alanı değişkenlerini kullanmak için uyarladım: v = log(sample_gamma(k, a)) Programın geri kalanının tümünü …

2
Model seçimi veya düzenlenmesi sonrasında GLM
Bu soruyu iki kısımda ele almak istiyorum. Her ikisi de genelleştirilmiş doğrusal bir modelle ilgilenir, ancak ilki model seçimi ile, diğeri de düzenlenme ile ilgilidir. Arka plan: Hem tahmin hem de açıklama için GLM'leri (doğrusal, lojistik, gama regresyonu) kullanıyorum. " Bir regresyon ile yapılan normal şeylere " atıfta bulunduğumda, büyük …

1
Çevrimiçi, ölçeklenebilir istatistiksel yöntemler
Bu, çok ilginç bulduğum Verimli çevrimiçi doğrusal regresyondan ilham aldı . Ana belleğe sığmayacak kadar büyük veri kümeleriyle hesaplamanın ve belki de etkili bir şekilde alt örneklemeye dönüştürülemeyen büyük ölçekli istatistiksel hesaplamaya ayrılmış metinler veya kaynaklar var mı? Örneğin, karma efekt modellerini çevrimiçi bir şekilde takmak mümkün müdür? MLE için …

5
Kullanılacak en iyi mesafe ölçüsü
bağlam Karşılaştırmak istediğim iki veri setim var. Her iki kümedeki her veri elemanı 22 açı içeren bir vektördür (hepsi −π−π-\pi ve arasında ππ\pi). Açılar belirli bir insan poz konfigürasyonuyla ilgilidir, bu nedenle poz 22 eklem açısı ile tanımlanır. Nihayetinde yapmaya çalıştığım iki veri kümesinin "yakınlığını" belirlemektir. Bir setteki her poz …

4
Sweave, R, Lateks, Eclipse StatET kurulumu [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 3 yıl önce kapalı . Birkaç gün önce bir kullanıcının SweaveR'nin nasıl kurulacağına dair bir yazı gördüm, bu da kullanıcının tablolar, grafikler vb. Talimatları tam …
12 r 


4
R ile rüzgar verilerinin analizi
Merhaba ben bir rüzgar türbininden enerji tahmin etmek için rüzgar verileri analiz ediyorum. 10 yıllık rüzgar verisi aldım ve bir histogram çizdim; ikinci aşamam veriye bir Weibull dağılımı yerleştirmekti. Weibul şeklini hesaplamak ve ölçek bu paket kullanılan R lmomkod ile R kullandım: >library(lmom) wind.moments<-samlmu(as.numeric(pp$WS)) moments<-pelwei(wind.moments) x.wei<-rweibull(n=length(pp$WS), shape=moments["delta"], scale=moments["beta"]) hist(as.numeric(pp$WS), freq=FALSE) …
12 r  distributions 

2
Tek bir değişkende eksik verilerin% 80'i
Verilerimde% 80 eksik verinin bulunduğu bir değişken var. Veriler, var olmama durumu nedeniyle eksiktir (örneğin, şirketin ne kadar banka borcuna sahip olduğu). Bu soruna çözüm olarak kukla değişken ayarlama yönteminin olduğunu söyleyen bir makaleye rastladım. Bu sürekli değişkeni kategorik biçime dönüştürmem gerektiği anlamına mı geliyor? Tek çözüm bu mu? Teorik …


2
Split-Plot ANOVA: R'de model karşılaştırma testleri
R'deki Xve Margümanlarıyla kullanım için uygun model karşılaştırmaları kullanarak Split-Plot ANOVA'daki efektleri nasıl test edebilirim anova.mlm()? Bildiğim kadar ?anova.mlmve Dalgaard (2007) [1]. Ne yazık ki sadece Split-Plot Tasarımları fırçalar. Bunu iki denek faktörü ile tamamen rastgele bir tasarımda yapmak: N <- 20 # 20 subjects total P <- 3 # …

1
Bir veri çerçevesini filtreleme
Hala R temel fonksiyonları öğrenme, Altküme fonksiyonu sadece bir koşul birden çok koşullu veya olmayan tek sütun dayalı filtre temel alıyor gibi görünüyor? Bir veri çerçevesinden verileri kolayca nasıl filtreleyebilirim? size birden fazla koşul verildiğinde Koşulun kullanılabilir sütunlara uygulanması gerektiğinde. Örnek: Şunları içeren bir veri çerçevesi verildi name D1 D2 …
12 r 


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.