İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
GLM neden dönüştürülmüş değişkenli LM'den farklı?
Bu ders notunda açıklandığı gibi (sayfa 1) , lineer bir model şu şekilde yazılabilir: y=β1x1+⋯+βpxp+εi,y=β1x1+⋯+βpxp+εi, y = \beta_1 x_{1} + \cdots + \beta_p x_{p} + \varepsilon_i, burada cevap değişkendir ve bir x_ {i} olan i ^ {inci} açıklayıcı değişken.yyyxixix_{i}ithithi^{th} Genellikle test varsayımlarını karşılamak amacıyla, yanıt değişkeni dönüştürülebilir. Örneğin, günlük işlevini …

1
Cezalandırılmış regresyondaki büzülme parametresi için olası olası değerler aralığı nedir?
Kement veya sırt regresyonunda, kişi genellikle veya α olarak adlandırılan bir büzülme parametresi belirtmelidir . Bu değer, genellikle en iyi, örneğin verir eğitim verileri ve görme farklı değerlerin bir grup kontrol çapraz doğrulama yoluyla seçilir R 2 test verileri ile. Kişinin kontrol etmesi gereken değer aralığı nedir? Öyle mi ( …

2
ACF ve PACF denetimi ile ARMA katsayılarını tahmin etme
ACF ve PACF grafiklerinin görsel muayenesi ile bir zaman serisi için uygun tahmin modelini nasıl tahmin edersiniz? Hangisi (yani ACF veya PACF) AR'ye veya MA'ya söyler (ya da her ikisini birden yapar)? Grafiklerin hangi kısmı size mevsimsel bir ARIMA için mevsimsel ve mevsimsel olmayan kısmı anlatır? Aşağıda gösterilen ACF ve …

2
R'de AIC “elle” hesaplanıyor
R doğrusal bir regresyon AIC hesaplamak denedim, ancak AICböyle bir işlevi kullanmadan : lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 Ancak, AICfarklı bir değer verir: AIC(lm_mtcars) [1] 190.7999 Biri bana neyi yanlış yaptığımı söyleyebilir mi?

1
GLM'deki log olasılığı küresel maksimumlara yakınsamayı garantiledi mi?
Sorularım: Genelleştirilmiş doğrusal modellerin (GLM'ler) küresel bir maksimuma yaklaşması garanti ediliyor mu? Öyleyse neden? Ayrıca, konveksliği sağlamak için link fonksiyonunda ne gibi kısıtlamalar vardır? GLM'leri anladığım, oldukça doğrusal olmayan bir olasılık fonksiyonunu en üst düzeye çıkarmalarıdır. Böylece, birkaç yerel maxima olduğunu ve yakınsama parametre kümesi optimizasyon algoritması için başlangıç ​​koşullarına …

2
Çıkarım için ARIMA hatalarıyla regresyon kullanmanın durağanlık gereksinimleri nelerdir?
Çıkarım için regresyonu ARIMA hatalarıyla (dinamik regresyon) kullanmanın durağanlık gereksinimleri nelerdir? Özellikle, sabit olmayan bir sürekli sonuç değişkeni , sabit olmayan bir sürekli belirleyici değişken ve bir kukla değişken tedavi serisi . Tedavinin sonuç değişkenindeki sıfır değişikliğinden iki standart hatadan daha fazla bir değişiklikle ilişkili olup olmadığını bilmek istiyorum.yyyxbirxbirx_axbxbx_b ARIMA …

1
Sıfır hipotezi altında değiştirilebilir örneklerin ardındaki sezgi nedir?
Permütasyon testleri (randomizasyon testi, yeniden randomizasyon testi veya kesin test olarak da adlandırılır) çok faydalıdır ve örneğin normal dağıtım varsayımı t-testkarşılanmadığında ve değerlerin parametrik olmayan test Mann-Whitney-U-test, daha fazla bilginin kaybolmasına neden olur. Bununla birlikte, bu tür bir test kullanılırken bir ve sadece bir varsayım göz ardı edilmemelidir, örneklerin sıfır …
16 hypothesis-testing  permutation-test  exchangeability  r  statistical-significance  loess  data-visualization  normal-distribution  pdf  ggplot2  kernel-smoothing  probability  self-study  expected-value  normal-distribution  prior  correlation  time-series  regression  heteroscedasticity  estimation  estimators  fisher-information  data-visualization  repeated-measures  binary-data  panel-data  mathematical-statistics  coefficient-of-variation  normal-distribution  order-statistics  regression  machine-learning  one-class  probability  estimators  forecasting  prediction  validation  finance  measurement-error  variance  mean  spatial  monte-carlo  data-visualization  boxplot  sampling  uniform  chi-squared  goodness-of-fit  probability  mixture  theory  gaussian-mixture  regression  statistical-significance  p-value  bootstrap  regression  multicollinearity  correlation  r  poisson-distribution  survival  regression  categorical-data  ordinal-data  ordered-logit  regression  interaction  time-series  machine-learning  forecasting  cross-validation  binomial  multiple-comparisons  simulation  false-discovery-rate  r  clustering  frequency  wilcoxon-mann-whitney  wilcoxon-signed-rank  r  svm  t-test  missing-data  excel  r  numerical-integration  r  random-variable  lme4-nlme  mixed-model  weighted-regression  power-law  errors-in-variables  machine-learning  classification  entropy  information-theory  mutual-information 

3
Online ve batch Learning arasındaki fark nedir?
Şu anda John Duchi ve Yoram Singer'ın Forward-Backward Splitting'i kullanarak Efficient Online ve Batch Learning makalesini okudum . 'Çevrimiçi' ve 'Toplu' terimlerinin kullanımıyla ilgili çok kafam karıştı. 'Çevrimiçi' ifadesinin, eğitim verilerinin bir birimini işledikten sonra ağırlık parametrelerini güncellediğimizi düşündüm. Ardından egzersiz verilerinin bir sonraki birimini işlemek için yeni ağırlık parametrelerini …


2
Doğru optimizasyon algoritması nasıl seçilir?
Bir fonksiyonun minimumunu bulmam gerekiyor. Http://docs.scipy.org/doc/scipy/reference/optimize.html adresindeki dokümanları okumak Aynı şeyi yapan, yani minimum olanı bulan birkaç algoritma olduğunu görüyorum. Hangisini seçmem gerektiğini nasıl bilebilirim? listelenen algoritmanın bazıları Yokuş aşağı simpleks algoritmasını kullanarak bir işlevi en aza indirin. BFGS algoritmasını kullanarak bir işlevi en aza indirin. Doğrusal olmayan eşlenik gradyan …

3
Çok değişkenli regresyona daha fazla değişken eklemek mevcut değişkenlerin katsayılarını değiştiriyor mu?
Diyelim ki 3 değişkenten oluşan çok değişkenli (birkaç bağımsız değişken) regresyon var. Bu değişkenlerin her birinin belirli bir katsayısı vardır. 4. değişkeni tanıtmaya ve regresyonu tekrar çalıştırmaya karar verirsem, 3 orijinal değişkenin katsayıları değişecek mi? Daha genel olarak: çok değişkenli (çoklu bağımsız değişkenler) regresyonda, belirli bir değişkenin katsayısı başka bir …

1
Kovaryans matrisini değişkenler için belirsizliklere dönüştürebilir miyim?
Ben ölçümü yoluyla kovaryans matrisi bir gürültü çıkaran bir GPS ünitesi var :ΣΣ\Sigma Σ=⎡⎣⎢σxxσyxσxzσxyσyyσyzσxzσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] ( dahil ancak bir saniye göz ardı edelim.)ttt Bir başkasına her yöndeki doğruluğun ( ) bir …

5
Numune ortalamalarının örnekleme dağılımı popülasyon ortalamalarına nasıl yaklaşıyor?
İstatistikleri öğrenmeye çalışıyorum çünkü doğru anlamadığım takdirde bazı şeyleri öğrenmemi yasaklayan o kadar yaygın olduğunu düşünüyorum. Örnek araçların örnekleme dağılımı kavramını anlamakta güçlük çekiyorum. Bazı kitapların ve sitelerin nasıl açıkladığını anlayamıyorum. Sanırım bir anlayışım var ama doğru olup olmadığından emin değilim. Aşağıda bunu anlama girişimim var. Normal bir dağılım gösteren …

3
Eksik değerler ve / veya düzensiz zaman serileri içeren R tahmin paketini kullanma
R forecastpaketinden ve örneğin zoodüzensiz zaman serileri ve eksik değerlerin enterpolasyonu için paketten etkilendim . Benim uygulama çağrı merkezi trafik tahmini alanında, bu nedenle hafta sonları (neredeyse) her zaman eksik, hangi güzel tarafından ele alınabilir zoo. Ayrıca, bazı ayrık noktalar eksik olabilir, bunun için sadece R kullanıyorum NA. Mesele şu: …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.