İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Gereksiz ortalama parametre ayarı neden Gibbs MCMC'yi hızlandırıyor?
Gelman & Hill (2007) kitabında (Regresyon ve Çok Düzeyli / Hiyerarşik Modeller Kullanılarak Veri Analizi), yazarlar gereksiz ortalama parametreler eklemenin MCMC'yi hızlandırmaya yardımcı olabileceğini iddia etmektedir. Verilen örnek, içiçe yerleştirilmemiş bir "uçuş simülatörü" modelidir (Denk 13.9): yiγjδk∼N(μ+γj[i]+δk[i],σ2y)∼N(0,σ2γ)∼N(0,σ2δ)yi∼N(μ+γj[i]+δk[i],σy2)γj∼N(0,σγ2)δk∼N(0,σδ2) \begin{align} y_i &\sim N(\mu + \gamma_{j[i]} + \delta_{k[i]}, \sigma^2_y) \\ \gamma_j &\sim N(0, …

2
GLM ve GAM'deki spline'lar
Kamaların GLM modellerinde değil, yalnızca GAM modellerinde bulunması yanlış mıdır? Bunu bir süre önce duydum ve bunun sadece bir yanlış anlama mı yoksa bir gerçeği mi olduğunu merak ettim. İşte bir örnek:

2
Kaggle müsabakaları şans eseri mi kazanıldı?
Kaggle müsabakaları, kalıcı bir test setine göre son sıralamaları belirler. Bekletilen bir test seti bir örnektir; modellenen popülasyonu temsil etmeyebilir. Her sunum bir hipotez gibi olduğundan, rekabeti kazanan algoritma, toplam şans eseri, test setini diğerlerinden daha iyi eşleştirebilir. Başka bir deyişle, farklı bir test seti seçildiyse ve yarışma tekrarlandıysa, sıralama …

2
P değerine dayalı özellikler seçmek yanlış mıdır?
Özelliklerin nasıl seçileceği hakkında birkaç mesaj vardır . Yöntemlerden biri, t istatistiklerine dayalı özellik önemini açıklar. Standart özelliklere varImp(model)sahip doğrusal model üzerine uygulanan R'de , her model parametresi için t istatistik istatistiği kullanılır. Temel olarak, t istatistiklerine dayanarak bir özellik seçiyoruz, yani katsayının ne kadar kesin olduğu. Fakat katsayımın kesinliği …

2
Kalman filtresi nasıl kullanılır?
2B alanda (bir yüzey) bir nesnenin yörüngesi var. Yörünge bir (x,y)koordinat dizisi olarak verilir . Ölçümlerimin gürültülü olduğunu ve bazen belirgin aykırı değerlerim olduğunu biliyorum. Bu yüzden gözlemlerimi filtrelemek istiyorum. Kalman filtresini anladığım kadarıyla, tam olarak ihtiyacım olanı yapıyor. Bu yüzden kullanmaya çalışıyorum. Burada bir python uygulaması buldum . Ve …


2
QQ grafiği normal görünüyor ancak Shapiro-Wilk testi aksini söylüyor
R'de 348 önlemlik bir örneğim var ve normalde gelecekteki testler için dağıtıldığını varsayabilir miyim bilmek istiyorum. Temelde başka bir Stack cevabını takip ederek, yoğunluk grafiğine ve QQ grafiğine bakıyorum: plot(density(Clinical$cancer_age)) qqnorm(Clinical$cancer_age);qqline(Clinical$cancer_age, col = 2) İstatistikler konusunda güçlü bir deneyimim yok, ancak gördüğüm normal dağılım örneklerine benziyorlar. Sonra Shapiro-Wilk testini yapıyorum: …

3
Özellik sayısını azaltabildiğimizde neden öğrenme algoritmalarını hızlandırmak için PCA kullanıyoruz?
Bir makine öğrenimi dersinde, PCA'nın ( Temel Bileşen Analizi ) yaygın bir kullanımının diğer makine öğrenimi algoritmalarını hızlandırmak olduğunu öğrendim . Örneğin, bir lojistik regresyon modeli geliştirdiğinizi düşünün. İ için 1'den n'ye kadar bir eğitim setiniz ve x vektörünüzün boyutu çok büyükse (diyelim bir boyutlar), PCA'yı kullanarak daha küçük bir …

2
Deneyimin yeniden yürütülmesi neden ilke dışı algoritma gerektirir?
DQN "Atari'yi Derin Takviye Öğrenimi ile Oynamak " başlıklı makalede şunları söyledi: Deneyim tekrarıyla öğrenirken, Q-öğrenme seçimini motive eden politika dışı (mevcut parametrelerimiz örneği oluşturmak için kullanılanlardan farklı olduğu için) öğrenmenin gerekli olduğunu unutmayın. Ne anlama geldiğini tam olarak anlamadım. Ne Sarsa kullanmak ve eylemi hatırlamıyorsam a'biz almak olan eylem …

2
Degrade iniş, bu veri kümesindeki sıradan en küçük karelere çözüm bulamıyor mu?
Doğrusal regresyonu inceledim ve x'in evin alanını metre kare cinsinden ve y'nin fiyatı dolar cinsinden belirlediği {{x, y)} setinin altında denedim. Bu Andrew Ng Notes'taki ilk örnektir . 2104.400 1600.330 2400.369 1416.232 3000.540 Bir örnek kod geliştirdim ama çalıştırdığımda maliyet her adımda artıyor, her adımda azalıyor. Kod ve çıktı aşağıda …

2
Düzenlemeler ve Düzenleme nedir?
Makine öğrenimi üzerinde çalışırken bu kelimeleri gittikçe duyuyorum. Aslında, bazı insanlar denklemlerin düzenleri üzerinde çalışan Fields madalyası kazandılar. Sanırım bu, istatistiksel fizik / matematikten makine öğrenmesine kadar geçen bir terimdir. Doğal olarak, sorduğum bazı insanlar sezgisel olarak açıklayamadı. Düzenlemede bırakma yardımı gibi yöntemlerin biliyorum (=> aşırı sığmayı azalttığını söylüyorlar, ama …

2
Simpleks yöntemle en az mutlak sapmayı nasıl çözebilirim?
İlgili en az mutlak sapma sorunu:. LP problemi olarak aşağıdaki şekilde yeniden düzenlenebileceğini biliyorum:argminwL ( w ) = ∑ni = 1| yben- wTx |arg⁡minwL(w)=∑i=1n|yi−wTx| \underset{\textbf{w}}{\arg\min} L(w)=\sum_{i=1}^{n}|y_{i}-\textbf{w}^T\textbf{x}| min ∑ni = 1ubenmin∑i=1nui\min \sum_{i=1}^{n}u_{i} uben≥ xTw - ybeni = 1 , … , nui≥xTw−yii=1,…,nu_i \geq \textbf{x}^T\textbf{w}- y_{i} \; i = 1,\ldots,n uben≥ - …

2
Bir MCMC örneğinden Modun güvenilirliği
John Kruschke, Does Bayesian Veri Analizi adlı kitabında, R'den JAGS kullanırken ... bir MCMC örneğindeki modun tahmini oldukça kararsız olabilir çünkü tahmin, MCMC örneğindeki rastgele tümseklere ve dalgalanmalara duyarlı olabilen bir düzeltme algoritmasına dayanır. ( Bayesian Veri Analizi Yapma , sayfa 205, bölüm 8.2.5.1) Metropolis algoritmasını ve Gibbs örneklemesi gibi …
12 bayesian  mcmc  mode 

4
Oranlar için güven aralıkları nasıl hesaplanır?
0 ile 1 arasında bir oranı bir deney düşünün . Bu sorunun önceki bir sürümünde ayrıntılı olarak ele alınmış , ancak meta ile ilgili bir tartışmadan sonra anlaşılır olması için kaldırılmıştır .XbenXiX_i Bu deney kez tekrarlanırken , küçüktür (yaklaşık 3-10). bağımsız aynen dağılma olduğu varsayılır. Bunlardan ortalama hesaplayarak ortalamayı tahmin …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.