İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
2 ampirik ayrık dağılım arasındaki farkı test edin
Ampirik dağılımlar olarak kullandığım ayrık dağılımlardan birkaç büyük örneğimin olduğu test verilerim var. Dağılımların gerçekten farklı olup olmadığını ve aslında farklı olan dağıtımlar için ortalamalardaki farkın ne olduğunu test etmek istiyorum. Kesikli dağılımlar olduklarından, anlayışım Kolmogorov-Smirnov testinin altında yatan sürekli dağıtım varsayımı nedeniyle geçersiz olduğudur. Chi-Squared testi dağılımların gerçekten farklı …

4
Spearman korelasyonu için aşağıdaki iki formülün denkliğini kanıtlayın
Gönderen wikipedia , Spearman sıra korelasyon değişkenleri dönüştürerek hesaplanır ve sıralanmış değişkenlere ve ve sonra sırada değişkenler arasındaki Pearson korelasyon hesaplama:XiXiX_iYiYiY_ixixix_iyiyiy_i Bununla birlikte, makale ve değişkenleri arasında hiçbir bağ , yukarıdaki formülün eşdeğer olduğunu belirtmektedir.XiXiX_iYiYiY_i burada , sıralamadaki fark.di=yi−xidi=yi−xid_i = y_i - x_i Birisi bunun kanıtı olabilir mi lütfen? Vikipedi …

1
Çok modelli çıkarım konusunda Burnham-Anderson kitabı önerilebilir mi?
R'nin öngörme paketindeki AIC'den AICc'ye yapılan varsayılan model seçim istatistiğindeki son değişikliklerin motive ettiği gibi, ikincisinin gerçekten nerede olursa olsun geçerli olup olmadığını merak ediyorum. Bu konuda bir dizi sorum var ve işte birincisi. AIC'yi her yerde AICc ile değiştirmenin , burada özetlendiği gibi, Burnham ve Anderson'ın (istatistikçi olmayanlar ) …

4
Bayes olasılığı açısından,% 95 güven aralığı neden% 95 olasılıkla gerçek parametreyi içermiyor?
Güven aralıkları hakkındaki Wikipedia sayfasından : ... tekrarlanan (ve muhtemelen farklı) deneylerin birçok ayrı veri analizinde güven aralıkları oluşturulursa, parametrenin gerçek değerini içeren bu aralıkların oranı güven seviyesiyle eşleşecektir ... Ve aynı sayfadan: Bir güven aralığı yok değil parametrenin gerçek değeri aslında elde edilen veriler ışığında güven aralığı içinde olmanın …

1
Olabilirlik oranı testi - lmer R - İç içe olmayan modeller
Şu anda bazı çalışmaları gözden geçiriyorum ve aşağıdakilerle karşılaştım, ki bu benim için yanlış görünüyor. Lmer kullanılarak iki karışık model (R olarak) takılmıştır. Modeller iç içe değildir ve olasılık oranı testleri ile karşılaştırılır. Kısacası, burada sahip olduğum şeyin tekrarlanabilir bir örneği: set.seed(105) Resp = rnorm(100) A = factor(rep(1:5,each=20)) B = …

3
Kupon tahsilât probleminde n tahmini
Kupon toplayıcının sorununun bir varyasyonunda, kupon sayısını bilmiyorsunuz ve bunu verilere göre belirlemelisiniz. Bunu fal kurabiyesi sorunu olarak anlatacağım: Farklı servet çerez mesajlarının bilinmeyen sayıda göz önüne alındığında , tahmin çerezleri teker teker ve sayım kaç kez her fal görüntülenir örnekleme yoluyla. Ayrıca bu tahminde istenen bir güven aralığını elde …

3
Numune boyutundan, min ve maks değerlerinden normal bir dağılımı yeniden oluşturabilir miyim? Ortalamayı vekalet etmek için kullanabilirim
Bunun istatistiki olarak biraz ipucu olabileceğini biliyorum, ama bu benim sorunum. Bir dizi veri var, yani bir değişkenin minimum, maksimum ve örnek boyutu. Bu verilerden bazıları için bir ortalama var, ama çok değil. Her bir aralığın değişkenliğini ölçmek ve ayrıca araçları karşılaştırmak için bu aralıkları birbirleriyle karşılaştırmak istiyorum. Dağılımın ortalama …

3
Random Forest modelinde daha yeni verilerin ağırlıklandırılması
6 kategori arasında ayrım yapmak için Random Forest ile bir sınıflandırma modeli eğitimi alıyorum. İşlem verilerim yaklaşık 60k + gözlem ve 35 değişkene sahip. İşte yaklaşık olarak nasıl göründüğüne bir örnek. _________________________________________________ |user_id|acquisition_date|x_var_1|x_var_2| y_vay | |-------|----------------|-------|-------|--------| |111 | 2013-04-01 | 12 | US | group1 | |222 | 2013-04-12 | …


2
Eşitsiz örnek boyutları: Ne zaman çağrılır
Akademik bir dergi makalesini gözden geçiriyorum ve yazarlar, herhangi bir çıkarımsal istatistik raporlamamanın gerekçesi olarak aşağıdakileri yazdı (İki grubun doğasını tanımladım): Toplamda 2.349 katılımcıdan 25'i (% 1.1) X bildirmiştir . Biz uygun istatistiksel grup karşılaştırmak analizler sunarak kaçınmaya X grubu Y'ye bu sonuçların ağır bu nadir bir sonuç ile tesadüfen …

4
Doğrusal Regresyonlara Rastgele Orman Metodolojisi Uygulanabilir mi?
Rastgele Ormanlar, orijinal eğitim verilerinin önyükleme örneği (hem girdi değişkenlerinin hem de gözlemlerin örnekleri) kullanılarak her ağacın oluşturulduğu bir dizi karar ağacı oluşturarak çalışır. Benzer bir süreç doğrusal regresyon için de uygulanabilir mi? Her k regresyonu için rastgele bir bootstrap örneği kullanarak k lineer regresyon modelleri oluşturun "Rastgele regresyon" benzeri …

3
Polinom regresyonundan güven bandını anlamak
Aşağıdaki grafikte gördüğüm sonucu anlamaya çalışıyorum. Genellikle, Excel'i kullanmaya ve doğrusal regresyon çizgisine sahip olmaya eğilimliyim, ancak aşağıdaki durumda R kullanıyorum ve komutla polinom regresyonu alıyorum: ggplot(visual1, aes(ISSUE_DATE,COUNTED)) + geom_point() + geom_smooth() Yani sorularım bununla sınırlı: Mavi regresyon çizgisi etrafındaki gri alan (ok # 1) nedir? Bu, polinom regresyonunun standart …

3
P =% 5.0 anlamlı mı?
Bugün, 0.05'lik bir p değerinin (tam olarak) anlamlı kabul edilip edilmediği (alfa =% 5 verildi) soruldu. Cevabı bilmiyordum ve Google her iki yanıtı da ortaya koydu: (a) p% 5'in altındaysa sonuç önemlidir ve (b) p% 5'in altında veya% 5'e eşitse sonuç önemlidir. Tabii ki, bu web sitelerinin hiçbiri kimseden alıntı …

1
Ordinal ve sürekli değişken arasındaki korelasyon nasıl doğru bir şekilde değerlendirilir?
Arasındaki korelasyonu tahmin etmek istiyorum: Sıralı bir değişken: deneklerden 6 çeşit meyve için tercihlerini 1-5 ölçekte derecelendirmeleri istenir (çok iğrenç ila çok lezzetli arasında değişir) Ortalama deneklerde ölçeğin sadece 3 noktasını kullanın. Sürekli bir değişken: aynı kişilerden bu meyveleri hızlı bir şekilde tanımlamaları istenir, bu da 6 meyve için ortalama …

3
Her yaprakta lineer regresyon modelleri ile regresyon ağacı algoritması
Kısa versiyon: Karar ağacı oluşturabilen bir R paketi arıyorum, oysa karar ağacındaki her yaprak tam bir Doğrusal Regresyon modeli. AFAIK, kütüphane rpartbağımlı değişkenin her yaprakta sabit olduğu karar ağaçları oluşturur. Bu rpartağaçları inşa edebilecek başka bir kütüphane (veya farkında olmadığım bir ortam) var mı? Uzun sürüm: Bir eğitim veri kümesine …
14 r  regression  rpart  cart 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.