İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Bir popülasyondaki rastgele bir üyenin farklı bir popülasyondaki rastgele bir üyeden “daha ​​iyi” olma olasılığını nasıl tahmin edebilirim?
İki farklı popülasyondan örneklemlerim olduğunu varsayalım. Her üyenin bir görev yapmasının ne kadar sürdüğünü ölçersem, her nüfusun ortalamasını ve varyansını kolayca tahmin edebilirim. Şimdi her bir popülasyondan bir kişi ile rastgele bir eşleşme varsayarsam, birincinin ikincisinden daha hızlı olma olasılığını tahmin edebilir miyim? Aklımda somut bir örnek var: ölçümler, A'dan …


2
'İleti geçirme yöntemi' nedir?
İleti geçirme yönteminin ne olduğu hakkında belirsiz bir fikrim var: tüm diğer faktörlerin tüm yaklaşımlarına bağlı olarak, dağıtım faktörlerinin her birinin yinelemeli yaklaşımlarını yineleyerek bir dağılıma yaklaşım oluşturan bir algoritma. Her ikisinin de Varyasyonel Mesaj Geçişi ve Beklenti Yayılımı örnekleri olduğuna inanıyorum . Mesaj geçirme algoritması daha açık / doğru …

1
ANOVA'nın R'deki araç paketi ile kontrastlarını nasıl kurabilir ve yorumlayabilirim?
Diyelim ki ANOVA yapmak istediğim basit bir 2x2 faktöriyel deneyim var. Bunun gibi, örneğin: d <- data.frame(a=factor(sample(c('a1','a2'), 100, rep=T)), b=factor(sample(c('b1','b2'), 100, rep=T))); d$y <- as.numeric(d$a)*rnorm(100, mean=.75, sd=1) + as.numeric(d$b)*rnorm(100, mean=1.2, sd=1) + as.numeric(d$a)*as.numeric(d$b)*rnorm(100, mean=.5, sd=1) + rnorm(100); Önemli bir etkileşim olmaması, varsayılan olarak (yani içinde contr.treatmentbir) çıkışının Anova()genel önemi olan …
15 r  anova  contrasts 


4
İtibarın oylamaya etkileri konusundaki analizimi nasıl geliştirebilirim?
Son zamanlarda itibarın upvotes üzerindeki etkilerini analiz ettim ( blog yazısına bakın ) ve daha sonra muhtemelen daha aydınlatıcı (veya daha uygun) analiz ve grafikler hakkında birkaç sorum vardı. Bu yüzden birkaç soru (ve özellikle herhangi birine cevap vermekten ve diğerlerini görmezden gelmekten çekinmeyin): Enkarnasyondaki akımında, posta numarasını ortalamak istemedim. …


1
Kantil normalizasyonu nasıl çalışır?
Mikrodizilerin kullanıldığı gen ekspresyon çalışmalarında, yoğunluk verilerinin normalleştirilmesi gerekir, böylece şiddetler bireyler arasında, genler arasında karşılaştırılabilir. Kavramsal ve algoritmik olarak, "kantil normalleşme" nasıl çalışır ve bunu istatistikçi olmayan bir kişiye nasıl açıklarsınız?

1
Matematiksel olarak algoritmik bir dağılım (simülasyonlar) hakkında öğrenmenin artıları ve eksileri nelerdir?
Matematiksel olarak bir dağılımın özelliklerini (bilgisayar simülasyonları yoluyla) öğrenmenin artıları ve eksileri nelerdir? Bilgisayar simülasyonları, özellikle matematikte güçlü hissetmeyen yeni öğrenciler için alternatif bir öğrenme yöntemi olabilir gibi görünüyor. Ayrıca kodlama simülasyonlarının, dağıtım kavramının daha erken ve daha sezgisel bir kavrayışını sunabileceği görülmektedir.

2
İki gama dağılımı arasındaki Kullback – Leibler ayrılığı
Gama dağılımını Γ(b,c)Γ(b,c)\Gamma(b,c) pdf g ( x ; b , c ) = 1 ile parametreleştirmeyi seçmeull(bq,cq)veΓ(bp,cp) arasındaki Kullback-Leibler sapması[1]g(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c) = \frac{1}{\Gamma(c)}\frac{x^{c-1}}{b^c}e^{-x/b}Γ(bq,cq)Γ(bq,cq)\Gamma(b_q,c_q)Γ(bp,cp)Γ(bp,cp)\Gamma(b_p,c_p) KLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−logbq−cq−logΓ(cq)+logΓ(cp)+cplogbp−(cp−1)(Ψ(cq)+logbq)+bqcqbpKLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−log⁡bq−cq−log⁡Γ(cq)+log⁡Γ(cp)+cplog⁡bp−(cp−1)(Ψ(cq)+log⁡bq)+bqcqbp\begin{align} KL_{Ga}(b_q,c_q;b_p,c_p) &= (c_q-1)\Psi(c_q) - \log b_q - c_q - \log\Gamma(c_q) + \log\Gamma(c_p)\\ &\qquad+ c_p\log b_p - (c_p-1)(\Psi(c_q) + \log b_q) + \frac{b_qc_q}{b_p} \end{align} Bunu tahmin ediyorum olan …

8
İstatistikler nasıl KULLANILMAZ
Bu bir tür açık uçlu bir soru ama net olmak istiyorum. Yeterli bir popülasyon göz önüne alındığında, bir şeyler öğrenebilirsiniz (bu açık kısımdır), ancak popülasyonunuz hakkında ne öğrenirseniz edin, nüfusun bir üyesi için ne zaman uygulanabilir? İstatistiklerden anladığım kadarıyla, hiçbir zaman bir popülasyonun tek bir üyesi için geçerli değildir, ancak …

1
GSVD tüm doğrusal çok değişkenli teknikleri uyguluyor mu?
Hervé Abdi'nin genel SVD hakkındaki makalesine rastladım . Yazar şunları söyledi: Genelleştirilmiş SVD (GSVD) dikdörtgen bir matrisi ayrıştırır ve matrisin satırlarına ve sütunlarına uygulanan kısıtlamaları dikkate alır. GSVD, belirli bir matrisin daha düşük dereceli bir matrisle ağırlıklı genelleştirilmiş en küçük karesel tahminini verir ve bu nedenle, yeterli kısıtlama seçimi ile …

2
“Karma Efekt Modellemesi” ile “Gizli Büyüme Modellemesi” arasındaki farklar nelerdir?
Karışık efekt modellerine (MEM) oldukça aşinayım, ancak bir meslektaşım kısa bir süre önce gizli büyüme modelleri (LGM) ile nasıl karşılaştırıldığını sordu. Biraz googling yaptım ve LGM'nin, en az bir rastgele etkinin her düzeyinde tekrarlanan önlemlerin alındığı koşullara uygulanan, böylece Zamanı modelde sabit bir etki yapan yapısal denklem modellemesinin bir varyantı …

2
R'deki özdeğerlerden ve özvektörlerden bir elips nasıl çizilir? [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 2 yıl önce kapalı . Birisi aşağıdaki matrisin 'nin özdeğerlerinden ve özvektörlerinden bir elips çizmek için R kodu ile gelebilir mi?A = ( 2,20.40.42.8)bir=(2.20.40.42.8) \mathbf{A} …

1
Durum uzayı zaman serisi analizinde hangi modelin daha iyi olduğunu nasıl kontrol edebilirim?
Durum uzayı yöntemleri ile zaman serisi veri analizi yapıyorum. Verilerimle, stokastik yerel seviye modeli deterministik modelden tamamen daha iyi performans gösterdi. Ancak deterministik seviye ve eğim modeli stokastik seviye ve stokastik / deterministik eğimden daha iyi sonuç verir. Bu normal bir şey mi? R'deki tüm yöntemler başlangıç ​​değerleri gerektirir ve …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.