İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Parametrik olmayan kümeleme için PyMC: Gauss karışımının parametrelerini tahmin etmek için Dirichlet işlemi kümelenemiyor
Sorun kurulumu PyMC'yi uygulamak istediğim ilk oyuncak sorunlarından biri parametrik olmayan kümelenmedir: bazı veriler verildiğinde, Gauss karışımı olarak modelleyin ve kümelerin sayısını ve her kümenin ortalamasını ve kovaryansını öğrenin. Bu yöntem hakkında bildiklerimin çoğu, Michael Jordan ve Yee Whye Teh'in 2007'den beri (seyreklik öfke haline gelmeden önce) ve son birkaç …

2
Hata yayılımı SD'ye karşı SE
İki farklı koşulda (A ve B) kişi başına 3 ila 5 ölçüm özelliğim var. Her koşulda her birey için ortalama ve hata çubukları olarak standart hata ( yani , , = ölçüm sayısı) kullanıyorum. NSD / N--√SD/NSD/\sqrt{N}N-NN Şimdi A koşulunda ve B koşulunda kişi başına ortalama ölçü arasındaki farkı çizmek …

2
Tüm popülasyondan elde edilen veriler olduğunda güven aralıklarını hesaplamak ve hipotezleri test etmek mantıklı mıdır?
Tüm popülasyondaki veriler mevcut olduğunda güven aralıklarını hesaplamak ve hipotezleri test etmek mantıklı mıdır? Bence cevap hayır, çünkü parametrelerin gerçek değerlerini doğru bir şekilde hesaplayabiliriz. Ancak, orijinal popülasyondan yukarıda belirtilen teknikleri kullanmamıza izin veren maksimum veri oranı nedir?

6
Makine öğreniminde esnek ve esnek olmayan modeller
Esnek modellerin (yani splineların) esnek olmayan modellerin (örn. Doğrusal regresyon) farklı senaryolarda karşılaştırılmasıyla ilgili basit bir soru ile karşılaştım. Soru: Genel olarak, esnek bir istatistiksel öğrenme yönteminin performansının aşağıdaki durumlarda esnek olmayan bir yöntemden daha iyi veya kötü performans göstermesini bekleriz: belirteçlerinin sayısı son derece fazladır ve gözlem sayısı azdır? …


2
Uyum iyiliği testi: Anderson – Darling testi ve Cramér – von Mises kriteri hakkında soru
Anderson-Darling testine ve Cramér – von Mises kriterine geldiğimde , form iyiliği testleri için web sayfaları okuyorum . Şimdiye kadar amacım var; Anderson – Darling testi ve Cramér – von Mises kriteri benzer görünüyor, sadece farklı bir ağırlıklandırma fonksiyonuna dayanıyor . Ayrıca Watson testi olarak adlandırılan Cramér – von Mises …

1
İstatistikçiler neden karşılıklı bilgiyi bir birliktelik ölçüsü olarak kullanmıyor?
İstatistikçi olmayanlar tarafından, regresyon (veya eşdeğer / yakından ilişkili istatistiksel testler) yerine karşılıklı bilgi kullanarak korelasyon önlemlerini yeniden icat ettikleri birkaç konuşma gördüm. İstatistikçilerin bu yaklaşımı benimsemelerinin iyi bir nedeni olduğunu düşünüyorum. Layman'ın anlayışı entropi / karşılıklı bilgi tahmin edicilerinin problemli ve kararsız olma eğiliminde olduğudur. Sonuç olarak gücün de …

4
Bu durumda x'in y üzerindeki regresyonu x üzerindeki y'den açıkça daha mı iyidir?
Bir kişinin kanındaki glikoz seviyelerini ölçmek için kullanılan bir cihaz, 10 kişilik rastgele bir örnek üzerinde izlenir. Seviyeler ayrıca çok hassas bir laboratuvar prosedürü kullanılarak ölçülür. Alet ölçüsü x ile gösterilir. Laboratuvar prosedürü ölçüsü y ile gösterilir. Şahsen x'in y'nin daha doğru olduğunu düşünüyorum çünkü amaç laboratuvar okumalarını tahmin etmek …

3
Elastik ağ ile ilgili karışıklık
Elastik ağ ile ilgili bu makaleyi okuyordum. Elastik ağ kullandıklarını söylüyorlar çünkü sadece Kement kullanırsak, yüksek derecede korelasyonlu olan tahmin ediciler arasından sadece bir öngörücü seçme eğilimindedir. Ama istediğimiz bu değil. Demek istediğim, bizi çok doğrusallık sorunundan kurtarıyor, değil mi? Önerileriniz / açıklamalarınız var mı?

3
HATA, JAGS'da ağırlıklı genel regresyon
Burada , ağırlık parametresi aracılığıyla Rbir glmgerilemeyi "önceden ağırlıklandırabiliriz" . Örneğin: glm.D93 <- glm(counts ~ outcome + treatment, family = poisson(), weights=w) Bu bir JAGSveya BUGSmodelde nasıl yapılabilir ? Bunu tartışan bazı makaleler buldum, ancak hiçbiri bir örnek vermiyor. Esas olarak Poisson ve lojistik regresyon örnekleriyle ilgileniyorum.

2
Rastgele etki eklemek katsayı tahminlerini etkiler
Bana her zaman rastgele etkilerin sadece varyansı (hata) etkilediği ve sabit etkilerin sadece ortalamayı etkilediği öğretildi. Ama rastgele etkilerin ortalamayı da etkilediği bir örnek buldum - katsayı tahmini: require(nlme) set.seed(128) n <- 100 k <- 5 cat <- as.factor(rep(1:k, each = n)) cat_i <- 1:k # intercept per kategorie x …

4
Sinir ağı ağırlıklarının yakınsaması
Sinir Ağımın ağırlıklarının 500 tekrardan sonra bile yakınsamadığı bir duruma geldim. Sinir ağım 1 Giriş katmanı, 1 Gizli katman ve 1 Çıkış Katmanı içeriyor. Bunlar giriş katmanında yaklaşık 230, gizli katmanda 9 düğüm ve çıkış katmanında 1 çıkış düğümüdür. Erken durdurma koşulu yaparsam bilmek istedim (100 yinelemeden sonra sinir ağı …

2
Karışık modellerden tahminler yaparken belirsizliği rastgele etkilere dahil etmek neden zordur?
Birkaç konu vardır R-sig-ME kullanıyorsanız tahminler için güven aralıkları edinme konusunda lme4ve nlmeÖrneğin R. içinde burada ve burada Dougals Bates, hem paketlerin yazarlardan biri tarafından bazı açıklamalar dahil olmak üzere 2010 yılında. Ona kelimesi kelimesine alıntı yapmaktan çekinmeyin, çünkü bağlamdan çıkarılma korkusu, ama yine de yaptığı bir yorum "Parametreleri ve …


3
Özellik seçimi yalnızca eğitim verileri (veya tüm veriler) üzerinde mi yapılmalıdır?
Özellik seçimi yalnızca eğitim verileri (veya tüm veriler) üzerinde mi yapılmalıdır? Guyon (2003) ve Singhi ve Liu (2006) gibi bazı tartışmalar ve makalelerden geçtim , ancak yine de doğru cevaptan emin değilim. Deneme kurulumum şu şekildedir: Veri seti: 50 sağlıklı kontrol ve 50 hastalıklı hasta (hastalık tahmini ile ilgili olabilecek …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.