İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
İki-t-dağılımları arasındaki farkın dağılımı nedir
... ve neden ? Varsayarak , x 2 ortalama bağımsız rastgele değişkenler u 1 , μ 2 ve varyans σ 2 1 , σ 2 2 , sırasıyla. Temel istatistik kitabım bana X 1 - X 2 dağılımının aşağıdaki özelliklere sahip olduğunu söylüyor :X1X1X_1X2X2X_2μ1,μ2μ1,μ2\mu_1,\mu_2σ21,σ22σ12,σ22\sigma^2_1,\sigma^2_2X1−X2X1−X2X_1-X_2 E(X1−X2)=μ1−μ2E(X1−X2)=μ1−μ2E(X_1-X_2)=\mu_1-\mu_2 Var(X1−X2)=σ21+σ22Var(X1−X2)=σ12+σ22Var(X_1-X_2)=\sigma^2_1 +\sigma^2_2 Şimdi diyelim ki …

1
Bonferroni mi Tukey mi? Karşılaştırma sayısı ne zaman artar?
SPSS (3.Basım) Kullanarak Alanı Keşfetme İstatistikleri ANOVA'da post-hoc testlerden biraz etkilenmiştim. Tip I hata oranını kontrol etmek isteyenler için Bonferroni veya Tukey'i önerir ve şöyle der (s. 374): Bonferroni, karşılaştırma sayısı az olduğunda daha fazla güce sahipken, Tukey çok sayıda aracı test ederken daha güçlüdür. Az ve çok sayıda araç …

3
PTLOS alıştırmasını 4.1 çözen var mı?
Olasılık Teorisi: Bilimin Mantıkında verilen bu alıştırma Edwin Jaynes, 2003. Burada kısmi bir çözüm var . Daha genel bir kısmi çözüm buldum ve başka birinin çözüp çözmediğini merak ediyordum. Cevabımı göndermeden önce, başkalarına bir şans vermek için biraz bekleyeceğim. Tamam, varsayalım ki ile gösterilen birbirini dışlayan ve kapsamlı hipotezimiz var …

7
R'de kayan bir pencerenin ortalaması
Ben daha küçük bir slayt boyunca pencerelerde ortalama rapor etmek istiyorum değerlerin bir vektör var. Örneğin, aşağıdaki değerlerin bir vektörü için: 4, 5, 7, 3, 9, 8 3'lük bir pencere boyutu ve 2'lik bir slayt aşağıdakileri yapar: (4+5+7)/3 = 5.33 (7+3+9)/3 = 6.33 (9+8)/3 = 5.67 Ve bu değerlerin bir …
19 r 

1
Topluluğun Dördüncü Çeyrek'i ele geçirmesi nedir?
Black Swan şöhretinden (veya aldatmacadan) Nassim Taleb, kavramı üzerinde durdu ve “İstatistiklerin sınırlarının haritası” dediği şeyi geliştirdi . Temel argümanı, herhangi bir istatistiksel modelin kullanılmasının zararlı olduğu bir tür karar probleminin olmasıdır. Bunlar, yanlış karar vermenin sonucunun aşırı yüksek olabileceği ve altta yatan PDF'nin bilinmesinin zor olduğu herhangi bir karar …


2
MCMC ne zaman sıradan hale geldi?
MCMC'nin hangi yıl olağan hale geldiğini bilen var mı (yani Bayesci çıkarım için popüler bir yöntem)? Zaman içinde yayınlanan MCMC (dergi) makalelerinin sayısına bir bağlantı özellikle yararlı olacaktır.
19 bayesian  mcmc  history 


2
Posterior dağılımı zaten biliyorsak neden posterior dağılımdan numune almak gerekir?
Anladığım kadarıyla parametre değerlerini tahmin etmek için Bayesci bir yaklaşım kullanırken: Posterior dağılım önceki dağılım ve olasılık dağılımının kombinasyonudur. Bunu posterior dağılımdan bir örnek oluşturarak simüle ediyoruz (örneğin, değerleri oluşturmak için bir Metropolis-Hasting algoritması kullanarak ve posterior dağılıma ait olma olasılığının belirli bir eşiğinin üzerindeyse bunları kabul ediyoruz). Bu örneği …

6
Konvolüsyonel Katmanlar: Ped yapmak veya değil
AlexNet mimarisi, resimde gösterildiği gibi sıfır dolgu kullanır: Ancak, kağıtta bu dolgulamanın neden sunulduğuna dair bir açıklama yoktur. Standford CS 231n kursu, uzamsal boyutu korumak için dolgu kullandığımızı öğretir: Dolguya ihtiyacımız olan tek neden olduğunu merak ediyorum. Yani, uzamsal boyutu korumam gerekmiyorsa, sadece dolguları kaldırabilir miyim? Daha derin seviyelere doğru …

4
Kategorik verilerle, değişkenler ilişkili olmayan kümeler olabilir mi?
Küme analizlerini açıklamaya çalışırken, insanların süreci değişkenlerin ilişkili olup olmadığı ile ilgili olarak yanlış anlamaları yaygındır. İnsanları bu karışıklığı aşmanın bir yolu şöyledir: Bu, kümelerin olup olmadığı sorusu ile değişkenlerin ilişkili olup olmadığı sorusu arasındaki farkı açıkça göstermektedir. Ancak, bu sadece sürekli veri ayrımını gösterir. Kategorik verilerle bir analog düşünürken …

3
Bağımsız değişken olarak sıra kategorik değişken nasıl ele alınır
Logit model kullanıyorum. Bağımlı değişkenim ikili. Ancak kategorik ve yanıtları içeren bir bağımsız değişken vardır: 1.very good, 2.good, 3.average, 4.poor and 5.very poor. Bu yüzden sıralı ("nicel kategorik"). Bunu modelde nasıl kullanacağımdan emin değilim. Kullanıyorum gretl. [@Ttnphns'tan not: Her ne kadar soru modelin logit olduğunu söylese de (bağımlı olanın kategorik …

4
Hiyerarşik Kümelenmenin dezavantajları nasıl anlaşılır?
Birisi Hiyerarşik Kümelenmenin artılarını ve eksilerini açıklayabilir mi? Hiyerarşik Kümeleme, K ile aynı dezavantajlara sahip mi? Hiyerarşik Kümelemenin K'ye göre avantajları nelerdir? H ortalamalarını Hiyerarşik Kümeleme üzerinde ne zaman kullanmalıyız? Bu yazının cevapları k'ın çok iyi olduğu dezavantajlarını açıklıyor. K-araçlarının dezavantajları nasıl anlaşılır

2
Gradyan iniş dışbükey olmayan fonksiyonlara uygulanabilir mi?
Sadece optimizasyonu öğreniyorum ve dışbükey ve dışbükey olmayan optimizasyon arasındaki farkı anlamakta zorlanıyorum. Anladığım kadarıyla, dışbükey bir işlev, "işlevin grafiğindeki herhangi iki nokta arasındaki çizgi parçasının üstünde veya grafiğin üzerinde yer aldığı" bir işlevdir. Bu durumda, bir degrade iniş algoritması kullanılabilir, çünkü tek bir minimum vardır ve degradeler sizi her …

2
Student t testi Wald testi midir?
Student t testi Wald testi midir? Wasserman'ın Tüm İstatistikleri'nden Wald testleri açıklamasını okudum . Bana öyle geliyor ki Wald testi t-testleri içeriyor. Bu doğru mu? Değilse, t testini Wald testi değil yapan nedir?

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.