İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

7
“En iyi uyum” ve çapraz geçerlilik teriminde kullanılan “en iyi” tanımı nedir?
Bir dizi noktaya doğrusal olmayan bir işlev takarsanız (her apsis için sadece bir koordinat olduğu varsayılarak) sonuç aşağıdakilerden biri olabilir: küçük kalıntılarla çok karmaşık bir fonksiyon büyük artıklarla çok basit bir fonksiyon Çapraz doğrulama genellikle bu iki uç arasındaki "en iyi" uzlaşmayı bulmak için kullanılır. Peki "en iyi" ne anlama …

3
Parametrik olmayan tekrarlı ölçümler R'de çok yönlü Anova?
Aşağıdaki soru bir süredir benim için kutsal olanlardan biri, umarım birisi iyi bir tavsiyede bulunabilir. R kullanarak parametrik olmayan tekrarlanan ölçümler çok yönlü anova yapmak istiyorum. Bir süredir çevrimiçi arama ve okuma yapıyorum ve şimdiye kadar sadece bazı durumlar için çözümler bulabildim: parametrik olmayan tekrarlanan önlemler anova, {car} Anova fonksiyonu …


1
EM, sezgisel bir açıklama var mı?
EM prosedürü, başlatılmayanlara, az ya da çok kara büyü olarak görünür. Denetlenen verileri kullanarak bir HMM'nin parametrelerini (örneğin) tahmin edin. Ardından, etiketlenmemiş verilerin kodlarını, veriler aşağı yukarı etiketlenmiş gibi 'saymak' için ileri-geri kullanarak çözün. Bu neden modeli daha iyi hale getiriyor? Matematik hakkında bir şeyler biliyorum, ama onun bir tür …

4
Kayıp fonksiyonlarına kapsamlı bir bakış?
Makine öğrenimindeki bazı temel fikirler hakkında küresel bir bakış açısı elde etmeye çalışıyorum ve farklı kayıp kavramlarının (kare, günlük, menteşe, proxy, vb.) Kapsamlı bir tedavisi olup olmadığını merak ediyordum. John Langford'ın Kayıp İşlevi Semantiği hakkındaki mükemmel yazısının daha kapsamlı ve resmi bir sunum çizgisi boyunca bir şeyler düşünüyordum .


5
Eşleştirilmiş gözlemlerin varyansının karşılaştırılması
Ben gözlemleri (eşleştirilmiş , sonlu birinci ve ikinci anları vardır ve ortalama etrafında simetrik olan ortak bir bilinmeyen dağılımı çekilir).X i Y iNNNXiXiX_iYiYiY_i Let standart sapma (koşulsuz ) ve hipotezini test etmek istiyorum Y. I için aynı X Y σ YσXσX\sigma_XXXXYYYσYσY\sigma_Y σ X = σ YH0H0H_0 :σX=σYσX=σY\sigma_X = \sigma_Y H1H1H_1 …

5
Anlamlı olmayan sonuçların “trendler” olarak yorumlanması
Son zamanlarda, iki farklı iş arkadaşım benim için yanlış görünen koşullar arasındaki farklılıklar hakkında bir tür argüman kullanmışlardır. Bu iş arkadaşlarının her ikisi de istatistik kullanır, ancak bunlar istatistikçi değildir. İstatistikte bir acemiyim. Her iki durumda da, bir deneydeki iki durum arasında anlamlı bir fark olmadığı için, manipülasyon konusunda bu …


1
Stan
Buradan indirilebilen Stan belgelerini inceliyordum . Özellikle Gelman-Rubin teşhisini uygulamalarıyla ilgileniyordum. Orijinal Gelman ve Rubin kağıdı (1992) potansiyel ölçek azaltma faktörünü (PSRF) aşağıdaki gibi tanımlar: Let Xi,1,…,Xi,NXi,1,…,Xi,NX_{i,1}, \dots , X_{i,N} olduğu iii örneklenmiş inci Markov zinciri, ve genel olarak söz konusu olsun MMM örneklenmiş bağımsız zincirleri. Let X¯i⋅X¯i⋅\bar{X}_{i\cdot} ortalama olarak …

1
Yüksek boyutlu regresyon:
Yüksek boyutlu regresyon alanındaki araştırmaları okumaya çalışıyorum; zaman ppp daha büyüktür nnn , o, bir p>>np>>np >> n . Görünüşe göre logp/nlog⁡p/n\log p/n terimi, regresyon tahmin edicileri için yakınsama oranı açısından sıkça görülmektedir. Örneğin, burada , denklem (17) der kement uyum β^β^\hat{\beta} tatmin 1n∥Xβ^−Xβ∥22=OP(σlogpn−−−−−√∥β∥1).1n‖Xβ^−Xβ‖22=OP(σlog⁡pn‖β‖1). \dfrac{1}{n}\|X\hat{\beta} - X \beta\|_2^2 = O_P …

2
Zaman serilerinde eksik veriler nasıl doldurulur?
2 yıl boyunca her 10 dakikada bir kaydedilen çok sayıda kirlilik verisine sahibim, ancak verilerde bir takım boşluklar var (bazıları aynı anda birkaç hafta süren). Veriler oldukça mevsimsel gibi görünüyor ve gün boyunca değerlerin çok fazla değişmediği ve veri noktalarının daha düşük olduğu geceye göre büyük bir varyasyon var. Ben …

3
Beta dağılımı ile lojistik regresyon modeli arasındaki ilişki nedir?
Sorum şu: Beta dağılımı ile lojistik regresyon modelinin katsayıları arasındaki matematiksel ilişki nedir ? Örneklemek gerekirse: lojistik (sigmoid) fonksiyonu f(x)=11+exp(−x)f(x)=11+exp⁡(−x)f(x) = \frac{1}{1+\exp(-x)} lojistik regresyon modelindeki olasılıkları modellemek için kullanılır. Let AAA iki seçenekli bir olması (0,1)(0,1)(0,1) attı sonuç ve XXX bir tasarım matrisi. Lojistik regresyon modeli, P(A=1|X)=f(Xβ).P(A=1|X)=f(Xβ).P(A=1|X) = f(X \beta). …

2
Markov zincirleri ile Markov süreçleri arasındaki fark nedir?
Markov zincirleri ile Markov süreçleri arasındaki fark nedir? Çakışan bilgileri okuyorum: Bazen tanım, durum uzayının ayrık mı yoksa sürekli mi olduğuna, bazen de zamanın sürekli ayrıklığına dayanmasına dayanır. Bu dokümanın 20. slaytı : Durum alanı ayrık, yani sonlu veya sayılabilir alan ayrıksa, yani sonlu veya sayılabilir ise bir Markov işlemine …

1
Olasılık yoğunluğu fonksiyonundaki değişkenlerin değişiminin türetilmesi?
Kitap örüntü tanıma ve makine öğrenmesinde (formül 1.27), py(y)=px(x)∣∣∣dxdy∣∣∣=px(g(y))|g′(y)|py(y)=px(x)|dxdy|=px(g(y))|g′(y)|p_y(y)=p_x(x) \left | \frac{d x}{d y} \right |=p_x(g(y)) | g'(y) | burada,değişkenin değişmesine görekarşılık gelen.p x ( x ) p y ( y )x=g(y)x=g(y)x=g(y)px(x)px(x)p_x(x)py(y)py(y)p_y(y) Kitaplar bunun nedeni, aralığına düşen gözlemlerin , küçük değerleri için aralığa dönüştürüleceğini söylüyor .δ x ( y , …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.