İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Python matplotlib kutu grafiğindeki keneler nasıl adlandırılır
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. Python matplotlib bir boxplot komutuna sahiptir . Normalde, grafiğin tüm kısımları sayısal olarak işaretlenir. Keneleri konumlar yerine adlarla nasıl değiştirebilirim? Örnek olarak, bu kutu grafiğinde olduğu gibi …


2
Kamalar, düzleştirilmiş kamalar ve gauss işlem emülatörlerini kullanmanın avantajları / dezavantajları nelerdir?
Polinom enterpolasyonuna bir alternatif öğrenmek (ve uygulamak) ile ilgileniyorum. Ancak, bu yöntemlerin nasıl çalıştığı, nasıl ilişkili oldukları ve nasıl karşılaştırıldığına dair iyi bir açıklama bulmakta sorun yaşıyorum. Bu yöntemlerin veya alternatiflerin yararlı olacağı artıları / eksileri / koşulları hakkındaki girdilerinizi takdir ediyorum, ancak metinlere, slaytlara veya podcast'lere bazı iyi referanslar …

3
Kare t değişkenlerinin toplamı nedir?
Let ile, bir Öğrenci t dağılımından iid çekilebilir orta büyüklükteki için, serbestlik derecesi (en az 100 say). tanımla neredeyse serbestlik derecesine sahip bir ki-kare olarak mı dağıtılıyor ? Kare rasgele değişkenlerin toplamı için Merkezi Limit Teoremi gibi bir şey var mı? n n T = ∑ 1 ≤ i ≤ …

6
ANOVA ve ANCOVA'yı anlamak için iyi bir kaynak mı?
Bir makale için deneyler yapıyorum ve ANOVA ve ANCOVA'nın nasıl çalıştığını doğru bir şekilde anlamak için ilginç bir kitap / web sitesi arıyorum. İyi bir matematik geçmişim var, bu yüzden kaba bir açıklamaya gerek yok. ANCOVA yerine ANOVA'nın ne zaman kullanılacağını nasıl belirleyeceğimi de bilmek istiyorum.

14
Kolay ve sağlam veri keşfi için yazılım
Elektronik tablo kargaşasıyla mücadele etme girişimlerimde, genellikle gerçek istatistik yazılımı (R, Stata ve benzeri) gibi daha sağlam araçlar için itiraz ediyorum. Son zamanlarda, sadece programlamayı öğrenmeyeceklerini belirten biri tarafından bu görüşe meydan okudum. Onlara programlama gerektirmeyen veri analizi araçları sunmak istiyorum (ancak ideal olarak daha sonra suya bir ayak parmağı …

2
Cezalandırılmış regresyon modelinden R-kare ve istatistiksel anlamlılığın tahmin edilmesi
Cezalandırılan R paketini , çok sayıda tahmin ediciye ve hangilerinin önemli olduğuna dair çok az bilgiye sahip olduğum bir veri kümesi için küçültülmüş katsayı tahminleri elde etmek için kullanıyorum. L1 ve L2 ayarlama parametrelerini seçtikten ve katsayılarımdan memnun kaldıktan sonra, modelin R-kare gibi bir şeyle özetlenmesinin istatistiksel olarak sağlam bir …

2
ROC eğrisi analizinde ortak değişkenler için ayarlama
Bu soru, ilişkili ölçeklerin varlığında ikili bir uç noktayı tahmin etmek için çok boyutlu bir tarama anketinde kesme puanlarının tahmin edilmesiyle ilgilidir. Alkolizm taraması için kullanılabilecek bir ölçüm ölçeğinin (kişilik özellikleri) her boyutunda kesme puanları oluştururken ilişkili alt puanları kontrol etmenin ilgisi soruldu. Yani, bu özel durumda, kişi, ortak değişkenlerle …
20 epidemiology  roc 

3
Birden çok imputation kullanılırken karma efekt modelinin bir varyans bileşeni için güven aralıkları nasıl birleştirilir
Çoklu impütasyonun (MI) mantığı, eksik değerleri bir kez değil birkaç kez (tipik olarak M = 5) katlanarak M tamamlanmış veri kümelerine neden olur. Daha sonra M tamamlanmış veri kümeleri, M tahminlerinin ve standart hatalarının, "genel" tahmin ve standart hatasını elde etmek için Rubin formülleri kullanılarak birleştirildiği tam veri yöntemleriyle analiz …

3
“Çekirdek numarası” nı doğrusal yöntemlere uygulamak?
Çekirdek hüner birkaç makine öğrenme modellerinde (örneğin kullanılır SVM ). İlk olarak 1964'te "Örüntü tanıma öğreniminde potansiyel işlev yönteminin teorik temelleri" makalesinde tanıtılmıştır. Wikipedia tanımı bunun orijinal doğrusal olmayan gözlemleri, daha sonra doğrusal sınıflandırıcının kullanıldığı daha yüksek boyutlu bir alana eşleyerek doğrusal olmayan bir problemi çözmek için doğrusal bir sınıflandırıcı …

4
Uygulamada kullanılan Metropolis-Hastings algoritmaları
Bugün Christian Robert'ın Blogunu okuyordum ve tartıştığı yeni Metropolis-Hastings algoritmasını çok beğendim. Uygulaması basit ve kolay görünüyordu. MCMC'yi her kodladığımda, günlük hareketlerinde bağımsız hareketler veya rastgele yürüyüşler gibi çok temel MH algoritmalarına bağlı kalmaya eğilimliyim. İnsanlar rutin olarak hangi MH algoritmalarını kullanıyor? Özellikle: Onları neden kullanıyorsun? Bir anlamda optimal olduklarını …

4
Uç durumlarda hassaslık ve geri çağırma için doğru değerler nelerdir?
Hassasiyet şu şekilde tanımlanır: p = true positives / (true positives + false positives) Gibi, bu doğru mu true positivesve false positiveshassas 1 yaklaşır yaklaşım 0? Hatırlama için aynı soru: r = true positives / (true positives + false negatives) Şu anda bu değerleri hesaplamam gereken bir istatistiksel test uyguluyorum …
20 precision-recall  data-visualization  logarithm  references  r  networks  data-visualization  standard-deviation  probability  binomial  negative-binomial  r  categorical-data  aggregation  plyr  survival  python  regression  r  t-test  bayesian  logistic  data-transformation  confidence-interval  t-test  interpretation  distributions  data-visualization  pca  genetics  r  finance  maximum  probability  standard-deviation  probability  r  information-theory  references  computational-statistics  computing  references  engineering-statistics  t-test  hypothesis-testing  independence  definition  r  censoring  negative-binomial  poisson-distribution  variance  mixed-model  correlation  intraclass-correlation  aggregation  interpretation  effect-size  hypothesis-testing  goodness-of-fit  normality-assumption  small-sample  distributions  regression  normality-assumption  t-test  anova  confidence-interval  z-statistic  finance  hypothesis-testing  mean  model-selection  information-geometry  bayesian  frequentist  terminology  type-i-and-ii-errors  cross-validation  smoothing  splines  data-transformation  normality-assumption  variance-stabilizing  r  spss  stata  python  correlation  logistic  logit  link-function  regression  predictor  pca  factor-analysis  r  bayesian  maximum-likelihood  mcmc  conditional-probability  statistical-significance  chi-squared  proportion  estimation  error  shrinkage  application  steins-phenomenon 


5
Bir regresyon modeli belirlemek için veri tabanlı ölçütleri ne zaman kullanabilirsiniz?
Birçok regresyon modeli spesifikasyonunun (örneğin, OLS'de) bir veri kümesi için olasılıklar olarak kabul edildiğinde, bunun çoklu karşılaştırma sorunlarına neden olduğunu ve p-değerleri ve güven aralıklarının artık güvenilir olmadığını duydum. Bunun en uç örneklerinden biri aşamalı regresyon. Modelin belirlenmesine yardımcı olması için verinin kendisini ne zaman kullanabilirim ve bu ne zaman …

6
Hava durumu görevlim doğru mu?
Bir süre beni rahatsız eden bir soru, nasıl ele alınacağını bilmiyorum: Her gün hava durumu görevlim yüzde bir yağmur şansı veriyor (diyelim ki 9000 basamağa hesaplandığını varsayalım ve asla bir sayıyı tekrarlamamış). Sonraki her gün yağmur yağar veya yağmur yağmaz. Yıllarca verim var - yağmur ya da değil vs pct …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.