İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Aile açısından hata sınırı: Farklı bağımsız soru çalışmalarında veri kümelerinin yeniden kullanılması birden fazla test sorununa yol açar mı?
Bir araştırmacı ekibi belirli bir veri seti üzerinde çoklu (hipotez) testleri yaparsa, testler bağımsız olsa bile çoklu testler için bir çeşit düzeltme kullanmaları gerektiğini iddia eden bir literatür vardır. Sorum şu: aynı mantık aynı veri kümesinde hipotezleri test eden birden fazla takım için de geçerli mi? Başka bir deyişle - …

1
GLM'de kaç dağıtım var?
Ders kitaplarında GLM'nin 5 dağılımla (viz., Gama, Gauss, Binom, Ters Gauss ve Poisson) açıklandığı birden fazla yer belirledim. Bu, R'deki aile işlevinde de örneklenmiştir. Bazen ek dağıtımların dahil edildiği GLM referanslarına rastlarım ( örnek ). Birisi bu 5'in neden özel olduğunu veya her zaman GLM'de olduğunu ancak bazen başkalarının olduğunu …

1
Popülasyon ortalaması biliniyorsa popülasyonun varyansını tahmin edin
Bir popülasyonun varyansını tahmin etmek için kullandığımızı biliyorum . Khan Academy'den verilen sezginin tahmini ortalamamızın muhtemelen gerçek olanın biraz dışında olduğu bir video hatırlıyorum, bu nedenle mesafeleri daha büyük olurdu, bu yüzden daha az bölüyoruz ( yerine ) daha iyi bir değer elde etmek için daha büyük bir değer elde …
11 variance  sample 

1
PyMC3'te Bayesci model seçimi
Verilerimde Bayesian modellerini çalıştırmak için PyMC3 kullanıyorum. Bayesian modellemede yeniyim, ancak bu sitedeki bazı blog yayınlarına , Wikipedia ve QA'ya göre , verilerimi en iyi hangi modeli temsil edebileceğini seçmek için Bayes faktörünü ve BIC ölçütünü kullanmak geçerli bir yaklaşım gibi görünüyor. benim verim). Bayes faktörünü hesaplamak için karşılaştırmak istediğim …

2
Bayes logit modeli - sezgisel açıklama?
İtiraf etmeliyim ki, daha önce herhangi bir derste, lisans veya yüksek lisans derslerinde bu terimi duymadım. Lojistik regresyonun Bayesci olması ne anlama geliyor? Aşağıdaki gibi düzenli lojistik Bayesian lojistik geçiş ile bir açıklama arıyorum: Bu doğrusal regresyon modelindeki denklemdir: .E(y)=β0+β1x1+...+βnxnE(y)=β0+β1x1+...+βnxnE(y) = \beta_0 + \beta_1x_1 + ... + \beta_nx_n Bu, lojistik …

2
R'nin glmnet'ini kullanan Ridge regresyonu ile Python'un scikit-learn'u arasındaki farklar nelerdir?
James, Witten, Hastie, Tibshirani (2013) tarafından 'R'de Uygulamalarla İstatistiksel Öğrenmeye Giriş' kitabında Ridge Regresyon / Kement ile ilgili LAB bölümü §6.6'dan geçiyorum . Daha spesifik olarak, scikit-öğrenim Ridgemodelini R paketinden 'ISLR' 'Hitters' veri kümesine uygulamaya çalışıyorum . R kodunda gösterildiği gibi aynı özellik kümesini oluşturdum. Ancak, glmnet()modelden elde edilen sonuçlara …

3
Brownian Köprüsü kullanarak Brownian Gezi Simülasyonu?
(Her zaman pozitif olacak koşullanmış bir Brown hareketi sırasında bir Brown tur işlemini taklit etmek istiyorum için ile ). Bir Brownian gezi süreci her zaman pozitif olması koşullu bir Brownian köprüsü olduğundan, Brownian köprüsü kullanarak bir Brownian gezisinin hareketini simüle etmeyi umuyordum.0 t = 10<t<10<t<10 \lt t \lt 1000t=1t=1t=1 R'de, …

1
Toplam p değeri ve çift p değerleri?
Ben günlük olasılığı olan genel bir doğrusal model .L uy=β0+β1x1+β2x2+β3x3,y=β0+β1x1+β2x2+β3x3,y=\beta_0+\beta_1x_1+\beta_2x_2+\beta_3x_3,LuLuL_u Şimdi katsayıların aynı olup olmadığını test etmek istiyorum. İlk olarak, toplam testi: indirgenmiş modeli log olasılık olan L_r . Olabilirlik oranı testi ile, tam model p = 0.02 ile azaltılmış olandan önemli ölçüde daha iyidir .L r p = 0,02y=β0+β1⋅(x1+x2+x3)y=β0+β1⋅(x1+x2+x3)y=\beta_0+\beta_1\cdot(x_1+x_2+x_3)LrLrL_rp=0.02p=0.02p=0.02 …

2
Kısıtlanmış maksimum olasılık neden varyansın daha iyi (tarafsız) bir tahminini verir?
Ben karışık modellerin nitrit gritty daha iyi anlamak için R lme4 paketi üzerinde Doug Bates teori kağıdı okuyorum ve daha iyi anlamak istiyorum, varyans tahmin için sınırlı maksimum olabilirlik (REML) kullanma hakkında ilginç bir sonuç geldi . REML kriteri 3.3 numaralı bölümde, varyans tahmininde REML kullanımının, monte edilmiş doğrusal bir …

2
Medyanlar için güven aralıklarını bildirmek neden bu kadar nadirdir?
Uygulamalı bilimler makalelerinde bildirilen güven aralıklarını bulmak neden bu kadar nadirdir? Çoğunlukla Bilgisayar Bilimi üzerine çalışıyorum, ancak sıklıkla (Sosyal) Psikoloji, Sosyoloji ve Şehircilik ile ilgili makaleleri okuyorum. Bildirilen medyan için bir CI gördüğümü hatırlamıyorum. Aynı zamanda, güven aralıkları ve benzerlerini incelerken, medyanın bir kişinin verilerinin daha iyi bir tanımlayıcısı olduğu …

1
Chi kare testi ne tür özellik seçimi için kullanılabilir?
Burada başkalarının yaygın olarak denetimli öğrenmede özellik seçimi wrt sonucu için ki kare testi kullanmak için ne yaptıklarını soruyorum. Doğru anlarsam, her özellik ile sonuç arasındaki bağımsızlığı test eder ve her özellik için testler arasındaki p değerlerini karşılaştırırlar mı? In http://en.wikipedia.org/wiki/Pearson%27s_chi-squared_test , Pearson ki-kare testi, setler arasında gözlemlenen herhangi bir …


2
lmer'den serbestlik derecesi almak
Aşağıdaki ile bir lmer modeli uydurdum (çıktı da olsa): Random effects: Groups Name Std.Dev. day:sample (Intercept) 0.09 sample (Intercept) 0.42 Residual 0.023 Aşağıdaki formülü kullanarak her efekt için bir güven aralığı oluşturmak istiyorum: ( n - 1 ) s2χ2α / 2 , n - 1, ( n - 1 ) …

1
Örnekleme değişkenli karma efektli model tasarımı
lme4Deneysel tasarımım için doğrusal karma efekt modeli (ile ) için bir formül belirtmeye çalışıyorum , ancak doğru yaptığımdan emin değilim. Tasarım: temelde bitkiler üzerinde bir yanıt parametresi ölçüyorum. 4 tedavi seviyem ve 2 sulama seviyem var. Bitkiler, her parsel I örnek 4 alt parsel içinde 16 parsel halinde gruplandırılmıştır. Her …

2
Normal-Wishart posteriorunun derivasyonu
Normal-Wishart posteriorunun türetilmesi üzerinde çalışıyorum ama parametrelerden birinde takılı kaldım (ölçek matrisinin posterioru, altta bakınız). Sadece bağlam ve bütünlük için, işte model ve diğer türevler: xiμΛ∼N(μ,Λ)∼N(μ0,(κ0Λ)−1)∼W(υ0,W0)xi∼N(μ,Λ)μ∼N(μ0,(κ0Λ)−1)Λ∼W(υ0,W0)\begin{align} x_i &\sim \mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Lambda})\\ \boldsymbol{\mu} &\sim \mathcal{N}(\boldsymbol{\mu_0}, (\kappa_0 \boldsymbol{\Lambda})^{-1})\\ \boldsymbol{\Lambda} &\sim \mathcal{W}(\upsilon_0, \mathbf{W}_0) \end{align} Üç faktörün her birinin genişletilmiş formları (orantılılık sabitine kadar) şunlardır: …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.