İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Bilgisiz beta öncelikleri arasında seçim yapma
Bir binom işlemi (Hit / Miss) ile çalışmak için beta dağıtımı için bilgilendirici olmayan öncelikler arıyorum. İlk başta tek bir PDF oluşturan veya Jeffrey'den önce kullanmayı düşündüm . Ama aslında posterior sonuçlar üzerinde minimum etkiye sahip olan öncelikleri arıyorum ve sonra önce uygunsuz bir şekilde kullanmayı düşündüm . Buradaki sorun, …

2
Hipotez testi için neden T dağılımı doğrusal bir regresyon katsayısı kullanılır?
Uygulamada, lineer regresyon katsayısının önemini kontrol etmek için standart bir T testi kullanmak yaygın bir uygulamadır. Hesaplamanın mekaniği bana mantıklı geliyor. T-dağılımı neden doğrusal regresyon hipotez testinde kullanılan standart test istatistiğini modellemek için kullanılabilir? Standart test istatistiği Burada atıfta bulunuyorum: T0=βˆ−β0SE(βˆ)T0=β^−β0SE(β^) T_{0} = \frac{\widehat{\beta} - \beta_{0}}{SE(\widehat{\beta})}


3
Bayesian güncellemesi yeni verilerle
N veri noktasını gözlemledikten sonra önceki bir N ~ (a, b) ile bir posteriorun nasıl hesaplanacağı hakkında? Veri noktalarının örnek ortalamasını ve varyansını hesaplamamız ve posterioru öncekiyle birleştiren bir tür hesaplama yapmamız gerektiğini varsayıyorum, ancak kombinasyon formülünün neye benzediğinden emin değilim.

5
Kovaryans matrisinden bir “varyans” ölçüsü mü?
Veriler 1d ise, varyans veri noktalarının birbirinden ne kadar farklı olduğunu gösterir. Veriler çok boyutluysa, bir kovaryans matrisi alırız. Çok boyutlu veriler için veri noktalarının genel olarak birbirinden ne kadar farklı olduğunu gösteren bir ölçü var mı? Zaten birçok çözüm olabileceğini hissediyorum, ancak bunları aramak için kullanılacak doğru terimden emin …

3
Hangi glm ailesinin kullanılacağına nasıl karar verilir?
Birkaç farklı toplama teknikleri arasında karşılaştırmaya çalıştığım balık yoğunluğu verileri var, veriler çok sayıda sıfır var ve histogram yoğunlukları tamsayı olmadığı dışında bir poisson dağılımı için uygun vaugley görünüyor. GLM'ler için nispeten yeniyim ve son birkaç günü hangi dağıtımın kullanılacağını nasıl anlayacağımı öğrenmek için çevrimiçi olarak geçirdim, ancak bu kararı …

3
Negatif R kare ne demektir?
Diyelim ki bazı verilerim var ve sonra verileri bir modelle (doğrusal olmayan regresyon) sığdırıyorum. Sonra R-karesini ( ) hesaplıyorum .R2R2R^2 R kare negatif olduğunda, bu ne anlama geliyor? Bu, modelimin kötü olduğu anlamına mı geliyor? aralığının [-1,1] olabileceğini biliyorum . Ne zaman ortalama bunu da ne, 0 mı?R 2R2R2R^2R2R2R^2

3
Lojistik regresyon mu yoksa T testi mi?
Bir grup insan bir soruyu cevaplar. Cevap "evet" veya "hayır" olabilir. Araştırmacı, yaşın cevap türü ile ilişkili olup olmadığını bilmek istiyor. İlişki, yaşın açıklayıcı değişken olduğu ve cevap tipinin (evet, hayır) bağımlı değişken olduğu lojistik regresyon yapılarak değerlendirildi. Sırasıyla, "evet" ve "hayır" yanıtını veren grupların ortalama yaşlarını hesaplayarak ve ortalamaları …

2
Yönlendirilmiş asiklik grafiklerde etkileşim etkilerini temsil etme
Yönlendirilmiş asiklik grafikler (DAG'ler; örneğin, Grönland ve diğerleri, 1999) nedensellik kampının karşı-fiili yorumundan nedensel çıkarımın biçimciliğinin bir parçasıdır. Bu grafiklerde, değişken bir ok varlığı birbirA değişkeni BBB bu değişken iddia birbirA direkt olarak (bazı riski değişimi) değişken neden BBB , ve bu tür bir ok yokluğu bu değişken iddia birbirA …

2
Regresyon için yordayıcıları seçmek için korelasyon matrisi kullanmak doğru mu?
Birkaç gün önce, bir psikolog araştırmacım bana doğrusal regresyon modeline değişken seçme yöntemini anlattı. Sanırım iyi değil, ama emin olmak için bir başkasına sormam gerekiyor. Yöntem: Tüm değişkenler (Bağımlı Değişken Y dahil) arasındaki korelasyon matrisine bakın ve X'leri en çok Y ile ilişkilendiren bu yordayıcıları seçin. Herhangi bir kriterden bahsetmedi. …

2
P-değerlerinin QQ grafiğini yorumlama
Plink ( http://pngu.mgh.harvard.edu/~purcell/plink/download.shtml ) adlı bir yazılım kullanarak hastalıklar üzerine GWAS SNP ilişkilendirme çalışmaları yapıyorum . İlişkilendirme sonuçları ile analiz edilen tüm SNP'ler için p-değerleri elde ederim. Şimdi, çok düşük bir p değerinin p değerlerinin beklenen dağılımından (muntazam bir dağılım) farklı olup olmadığını göstermek için bu p değerlerinin bir QQ …
17 qq-plot 


1
Aynı anlara sahip dağılımların aynı olup olmadığı
Aşağıda, buradaki ve buradaki önceki yayınlara benzer ancak farklı Tüm siparişlerin momentlerini kabul eden iki dağılım göz önüne alındığında, iki dağılımın tüm momentleri aynı ise, aynı dağıtımlar ae mıdır? Moment üreten fonksiyonları kabul eden iki dağılım göz önüne alındığında, eğer aynı momentlere sahiplerse, moment üreten fonksiyonları aynı mıdır?

2
Bir regresyonda tarih değişkeni kullanmak mantıklı mı?
R'de tarih biçimindeki değişkenleri kullanmaya alışkın değilim. Doğrusal regresyon modelinde açıklayıcı değişken olarak bir tarih değişkeni eklemenin mümkün olup olmadığını merak ediyorum. Mümkünse, katsayıyı nasıl yorumlayabiliriz? Bir günün sonuç değişkeni üzerindeki etkisi mi? Yapmaya çalıştığım bir örnekle özlemimi görün .

4
Kümülatif tehlike fonksiyonu için sezgi (sağkalım analizi)
Aktüeryal bilimdeki (özellikle Cox Orantılı Tehlikeler Modeli için) ana işlevlerin her biri için sezgi almaya çalışıyorum. Şimdiye kadar sahip olduğum şey: f(x)f(x)f(x) : başlangıç ​​saatinden başlayarak, ne zaman öleceğinizin olasılık dağılımı. F(x)F(x)F(x) : sadece kümülatif dağılım. zamanındaTTT, nüfusun yüzde kaçı ölecek? S(x)S(x)S(x) :1−F(x)1−F(x)1-F(x) . zamanındaTTT, nüfusun yüzde kaçı hayatta kalacak? …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.