İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

5
Ön düzelme daha iyi bir öngörücü model oluşturmaya yardımcı olur mu?
Yayık modelleme görevi için şunları düşünüyordum: Veriler için k kümelerini hesaplama Her küme için ayrı ayrı k modelleri oluşturun. Bunun mantığı, kanıtlayacak hiçbir şeyin olmaması, alt kuruluşların nüfusunun homojen olmasıdır, bu nedenle veri üreten sürecin farklı "gruplar" için farklı olabileceğini varsaymak mantıklıdır. Sorum şu, bu uygun bir yöntem mi? Herhangi …

2
PCA ya da faktör analizinde çarpık değişkenler
22 değişkene dayalı SPSS üzerinde temel bileşen analizi (faktör analizi) yapmak istiyorum. Ancak, bazı değişkenlerim çok eğri (SPSS'den hesaplanan çarpıklık 2-80 arasında!). Sorularım işte burada: Çarpık değişkenleri böyle tutmalı mıyım yoksa değişkenleri ana bileşen analizinde değiştirebilir miyim? Evetse, faktör puanlarını nasıl yorumlayabilirim? Ne tür bir dönüşüm yapmalıyım? log10 veya ln? …

4
Zaman serilerinde 20 yıllık günlük veriler nasıl çizilir
Aşağıdaki veri kümesi var: https://dl.dropbox.com/u/22681355/ORACLE.csv ve 'Tarih' ile 'Aç' günlük değişiklikleri çizmek istiyorum, bu yüzden aşağıdakileri yaptım: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") ve aşağıdakileri alıyorum: Şimdi bu açıkça en güzel arsa değil, bu yüzden böyle ayrıntılı verileri çizerken kullanmak için doğru yöntemin ne olduğunu merak ediyorum?

1
Modern olasılık teorisinde tecrübeli biri için sıkça istatistik referansları
Analiz ve modern olasılık teorisindeki titiz bir geçmişe dayanarak, Bayesian istatistiklerini basit ve anlaşılması kolay ve sıkça istatistiklerin inanılmaz derecede kafa karıştırıcı ve sezgisel olduğunu düşünüyorum. Sıklıkla motive edilmemiş veya dikkatle tanımlanmamış "gizli öncelikler" dışında, sık sık gerçekten bayes istatistikleri yapıyor gibi görünüyor. Öte yandan, her iki perspektifi de anlayan …

3
Güven aralığı mı, numune büyüklüğü mü?
İstatistikler ve güven aralıkları konusunda tamamen yeniyim. Yani bu çok önemsiz, hatta kulağa aptalca gelebilir. Bunu daha iyi açıklayan bir literatür / metin / blog'a yönlendirmeme yardımcı olabilir veya bana yönlendirebilirseniz sevinirim. CNN, Fox haberleri, Politico vb. CNN: Obama'nın popülaritesi + / -% x1 hata payı ile% X'dir. Örnek boyutu …

1
Doğrusal regresyon modelinin güven ve tahmin aralıkları
Tamam, ben lineer regresyonu anlamaya çalışıyorum. Bir veri setim var ve her şey yolunda görünüyor, ama kafam karıştı. Bu benim doğrusal model özeti: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 …
9 r  regression 

3
İnsidans oranlarını karşılaştırma
İki grup arasındaki insidans oranlarını karşılaştırmak istiyorum (biri hastalığı olmayan ve diğeri ile). İnsidans oranı oranını (IRR), yani insidans oranı grup B / insidans oranı grup A'yı hesaplamayı ve sonra bu oranın 1'e eşit olup olmadığını test etmeyi ve son olarak IRR için% 95 CI aralıklarını hesaplamayı planlıyordum. Bir kitapta% …

2
Bir gruptaki en büyük katılımcının belirlenmesi
İstatistikler hakkında fazla bir şey bilmiyorum, bu yüzden bana katlan. Diyelim ki 1000 kişilik bir işçim var. En zor çalışanın kim olduğunu bulmak istiyorum ama sadece bir saat değerinde 1-100 kişilik gruplar halinde yapılan iş miktarını ölçebilirim. Her bir işçinin her zaman aynı miktarda çalışma yaptığını varsayarsak, çok sayıda deneme …

1
Doğrusal ve lojistik regresyon için hata dağılımı
Sürekli verilerde, doğrusal bir regresyon hata teriminin dağıtıldığını N (0, ) varsayar.Y=β1+β2X2+ uY=β1+β2X2+uY=\beta_1+\beta_2X_2+uσ2σ2\sigma^2 1) Var'ın (Y | x) aynı şekilde ~ N (0, σ2σ2\sigma^2 ) olduğunu düşünüyor muyuz ? 2) Lojistik regresyonda bu hata dağılımı nedir? Veriler, vaka başına 1 kayıt biçiminde olduğunda, "Y" 1 veya 0 olduğunda, dağıtılan Bernoulli …

2
Sorun kümelerinin hesaplanması, yorumlanması ve model seçim prosedürü hakkında genel sorular
Kullanarak modelleri seçmek istiyorum regsubsets(). Olympiadaten adlı bir veri çerçevem ​​var (yüklenen veriler: http://www.sendspace.com/file/8e27d0 ). Önce bu veri çerçevesini ekleyin ve sonra analiz etmeye başlar, benim kod: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + Mortality + PopPoverty + PopTotal + ExpEdu …


1
Aşamalarda Yanlış Keşif Oranını Kontrol Etme
Üç boyutlu bir tablom var 6 × 6 × 816x6x816\times6\times81. Tablonun her hücresi bir hipotez testidir. Tabloyu üçüncü boyuta dilimlemek818181kümeler arasında bağımsız olan ancak kümeler içinde bağımlı olan hipotez testleri kümeleri. Aslında, aynı anda tüm hipotez testlerinde Benjamini-Hochberg prosedürünü kullanarak yanlış keşif oranını kontrol edebileceğimi düşünüyordum. Bu soruna saldırmanın makul …

3
Rastgele ödev: neden rahatsız oluyorsunuz?
Rastgele atama değerlidir, çünkü tedavinin potansiyel sonuçlardan bağımsız olmasını sağlar. Ortalama tedavi etkisinin tarafsız tahminlerine bu şekilde yol açar. Ancak diğer atama şemaları da tedavinin potansiyel sonuçlardan bağımsız olmasını sistematik olarak sağlayabilir. Öyleyse neden rastgele görevlendirmeye ihtiyacımız var? Başka bir deyişle, rastgele atamanın, tarafsız çıkarımlara yol açan rastgele olmayan atama …

3
R gbm dağılımı = “adaboost” ile nasıl kullanılır?
Belgeler, dağıtım = "adaboost" ile R gbm'nin 0-1 sınıflandırma problemi için kullanılabileceğini belirtir. Aşağıdaki kod parçasını düşünün: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) Tahmini belgede bulunabilir. Gbm Bir tahmin vektörü döndürür. Varsayılan olarak tahminler f …
9 r  gbm 

2
İlk bilgisayarım tarafından açıklanan varyans miktarı neden ortalama ikili korelasyona bu kadar yakın?
İlk temel bileşen (ler) ile korelasyon matrisindeki ortalama korelasyon arasındaki ilişki nedir? Örneğin, ampirik bir uygulamada, ortalama korelasyonun, birinci ana bileşenin (ilk özdeğer) varyansının toplam varyansa (tüm öz değerlerin toplamı) oranıyla neredeyse aynı olduğunu gözlemliyorum. Matematiksel bir ilişki var mı? Ampirik sonuçların şeması aşağıdadır. Korelasyonun, 15 günlük yuvarlanma penceresi üzerinde …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.