İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
Ortalama mutlak sapma, standart sapmadan daha küçüktür
Genel mutlak sapmayı standart sapma ile genel olarak bu tanım ile karşılaştırmak istiyorum: MA D =1n - 1Σ1n|xben- μ | ,SD =Σn1(xben- μ)2n - 1-----------√MAD=1n−1∑1n|xi−μ|,SD=∑1n(xi−μ)2n−1MAD = \frac{1}{n-1}\sum_1^n|x_i - \mu|, \qquad SD = \sqrt{\frac{\sum_1^n(x_i-\mu)^2}{n-1}} nerede μ =1nΣn1xbenμ=1n∑1nxi\mu =\frac{1}{n}\sum_1^n x_i. Bu doğru mu MA D ≤ SDMAD≤SDMAD \le SD herkes için {xben}n1{xi}1n\{x_i\}^n_1? …

3
Rastgele efektler model işleme yedekleri
Tekrarlanan ikili sonuçları kullanarak bir olay analizi ile uğraşmaya çalışıyorum. Etkinlik zamanının gün cinsinden ölçüldüğünü, ancak şu an için süreyi haftalara ayırdık. Tekrarlanan ikili sonuçları kullanarak bir Kaplan-Meier tahmincisine yaklaşmak istiyorum (fakat ortak değişkenlere izin vermek). Bu, dolambaçlı bir yol gibi görünecek, ancak bunun sıradan sonuçlara ve tekrarlayan olaylara nasıl …



1
Doğrusal regresyonda, regülasyon neden parametre değerlerini de cezalandırıyor?
Şu anda sırt regresyonunu öğreniyorum ve daha karmaşık modellerin (veya daha karmaşık bir modelin tanımının) cezalandırılması konusunda biraz kafam karıştı. Anladığım kadarıyla, model karmaşıklığı mutlaka polinom düzeni ile ilişkili değildir. Yani:2 + 3 + 4x2+ 5x3+ 6x42+3+4x2+5x3+6x4 2 + 3+ 4x^2 + 5x^3 + 6x^4 aşağıdakilerden daha karmaşık bir modeldir: …

2
Nasıl test edilir
Diyelim ki ortalama üç bağımsız grubum var μ1, μ2, μ3μ1, μ2, μ3\mu_1,~ \mu_2,~\mu_3 sırasıyla. Nasıl test edebilirim μ1&lt;μ2&lt;μ3μ1&lt;μ2&lt;μ3\mu_1 < \mu_2 <\mu_3 ya da kullanmamak n1, n2, n3n1, n2, n3n_1,~n_2,~n_3 her gruptan örnekler? Ayrıntılı hesaplama değil, bazı genel metodolojileri bilmek istiyorum. Hipotezimi nasıl ayarlayacağımı anlayamadımH0H0H_0 ve H1H1H_1.

2
olasılığı
ve parametresine sahip bağımsız geometrik rastgele değişkenler olduğunu varsayalım . olasılığı nedir ?X1X1X_1X2X2X_2pppX1≥X2X1≥X2X_1 \geq X_2 Bu soru hakkında kafam karıştı çünkü ve hakkında geometrik olanlardan başka bir şey söylemedik . Bu olmaz çünkü ve aralığında herhangi bir şey olabilir?X1X1X_1X2X2X_250%50%50\%X1X1X_1X2X2X_2 EDIT: Yeni deneme P(X1≥X2)=P(X1&gt;X2)+P(X1=X2)P(X1≥X2)=P(X1&gt;X2)+P(X1=X2)P(X1 ≥ X2) = P(X1 > X2) + …

3
Lojistik regresyon modeli için öngörücüler doğru şekilde nasıl azaltılır
Bu yüzden şu anki durumum ikili yanıt verilerine dayalı bir lojistik model yapmam gerektiğinden, modelleme üzerine bazı kitaplar (veya bunların bir kısmı) okuyordum (F. Harrell'in "Regresyon Modelleme Stratejileri"). Veri setimde sürekli, kategorik ve ikili veriler (tahmin ediciler) var. Temel olarak şu anda yaklaşık 100 tahmin edicim var, ki bu iyi …

2
Bir çokgenin kovaryans matrisi nasıl bulunur?
Bir koordinat kümesi tarafından tanımlanan bir çokgeniniz olduğunu ve kütle merkezinin olduğunu . Çokgene, çokgen bir sınır ile düzgün bir dağılım olarak davranabilirsiniz. (x1,y1)...(xn,yn)(x1,y1)...(xn,yn)(x_1,y_1)...(x_n,y_n)(0,0)(0,0)(0,0) Bir çokgenin kovaryans matrisini bulan bir yöntemden sonrayım . Bir çokgenin kovaryans matrisinin alanın ikinci anıyla yakından ilişkili olduğundan şüpheleniyorum , ancak eşdeğer olup olmadıklarından emin …


1
Bayesyan posterior neden KL ıraksamasının minimizatörü etrafında yoğunlaşıyor?
Bayesci posterior düşünün . Asimptotik, maksimum MLE tahmini oluşur sadece olasılığı en üst düzeye çıkarır, .İçeride ISTV melerin RWMAIWi'nin | Xθ∣X\theta\mid Xθ^θ^\hat \thetaargminθfθ( X)argminθfθ(X)\operatorname{argmin}_\theta\, f_\theta(X) Tüm bu kavramlar - Bayesian öncelikleri, olasılığı en üst düzeye çıkarıyor - kulağa süper ilkeli ve hiç de keyfi değil. Görünürde bir giriş yok. Yine …

2
Lojistik regresyon neden iyi kalibre edilmiştir ve kalibrasyonu nasıl mahvedilir?
Scikit'te olasılık kalibrasyonu ile ilgili belgeleri öğrenirler, lojistik regresyonu diğer yöntemlerle karşılaştırırlar ve rastgele ormanın lojistik regresyondan daha az iyi kalibre edildiğini belirtirler. Lojistik regresyon neden iyi kalibre edildi? Bir kişi, lojistik regresyonun kalibrasyonunu nasıl mahvedebilir (birinin bir egzersiz olarak istemeyeceği değil)?

1
Hiperparametreleri ayarlarken doğrulama verileri üzerindeki model performansını değerlendirirsem doğrulama verileriyle ilgili bilgiler neden sızdırılıyor?
François Chollet'in Python ile Derin Öğrenmesi'nde şöyle diyor: Sonuç olarak, modelin yapılandırmasını doğrulama setindeki performansına göre ayarlamak, modeliniz hiçbir zaman doğrudan doğrudan eğitilmemiş olsa bile, doğrulama setine aşırı takılmasına neden olabilir. Bu fenomenin merkezinde bilgi sızıntısı kavramı vardır. Modelinizin doğrulama parametresindeki performansına göre bir hiperparametreyi her ayarladığınızda, doğrulama verileri hakkında …

2
Örneklemeden yüksek boyutlu çıkarım problemlerinde belirsizlik tahmini?
Gradyan tabanlı optimizasyon ve genetik algoritmanın bir kombinasyonunu kullanarak log-posterior'un küresel maksimumunu bularak MAP tahminini sağlam bir şekilde gerçekleştirebileceğimiz yüksek boyutlu bir çıkarım problemi (yaklaşık 2000 model parametreleri) üzerinde çalışıyorum. MAP tahminini bulmanın yanı sıra, model parametreleri üzerindeki belirsizlikleri biraz tahmin edebilmek istiyorum. Log-posteriorun gradyanını parametrelere göre etkili bir şekilde …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.