İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Bilgi geometrisinde açıklama
Bu soru, Amari'nin Eğimli Üstel Ailelerin-Eğriliklerin ve Bilgi Kaybının Diferansiyel Geometrisi makalesi ile ilgilidir . Metin aşağıdaki gibi gider. Let bir olması , bir koordinat sistemi ile olasılık dağılımları boyutlu manifoldu , olduğu varsayılır ...Sn= { pθ}Sn={pθ}S^n=\{p_{\theta}\}nnnθ = ( θ1, … , Θn)θ=(θ1,…,θn)\theta=(\theta_1,\dots,\theta_n)pθ( x ) > 0pθ(x)>0p_{\theta}(x)>0 Her nokta kabul …

2
Aynı mı farklı mı? Bayes yolu
Aşağıdaki modele sahip olduğumu söyle: Poisson(λ)∼{λ1λ2if t<τif t≥τPoisson(λ)∼{λ1if t<τλ2if t≥τ\text{Poisson}(\lambda) \sim \begin{cases} \lambda_1 & \text{if } t \lt \tau \\ \lambda_2 & \text{if } t \geq \tau \end{cases} Ve verilerimden ve için posteriorları . Söylüyorum (veya ölçme) eğer bir Bayes yolu var mı ve olan aynı ya da farklı ?λ …

1
Birçok sol eğimli dağılımı görselleştirme
Göstermek istediğim bir dizi sol eğik / ağır kuyruklu dağılımım var. (Etiketli üç faktör arasında 42 dağılımları vardır A, Bve Caşağıda). Ayrıca, varyasyon faktör boyunca daralıyor B. Sahip olduğum sorun, dağılımların sonuç ölçeğinde (oran veya katlama değişikliği) farklılaştırılması zor olmasıdır: Verilerin günlüğe kaydedilmesi, sol çarpıklığı aşırı vurgulamaktadır ve kuyruklara daha …

1
Çok düzeyli modelleme için gösterim
Formula ihtiyaçları (kullanarak düzeyli modeli eğitim için belirtmek lmergelen lme4 Rkütüphanede) her zaman beni alır. Ben sayısız ders kitabı ve öğretici okudum, ama asla düzgün anlamadı. İşte bu öğreticiden bir denklemle formüle edilmiş görmek istediğim bir örnek . Ses frekansını cinsiyetin (dişilerin genel olarak erkeklerden daha yüksek perdeli sesi vardır) …

2
LASSO'nun ileri seçim / geriye doğru eliminasyona göre modelin çapraz doğrulama tahmini hatası açısından üstünlüğü
Orijinal bir tam modelden üç azaltılmış model kullanarak ileri seçim geriye doğru eleme L1 ceza tekniği (LASSO) İleri seçim / geri eleme kullanılarak elde edilen modeller için, mevcut CVlmpakette DAAGkullanılan çapraz doğrulanmış tahmin hatası tahminini elde ettim R. LASSO ile seçilen model için kullandım cv.glm. LASSO için tahmin hatası, diğerleri …


4
Sinir ağı, auto.arima ve ets ile R zaman serisi tahmini
Sinir ağlarını zaman serilerini tahmin etmek için kullanma hakkında biraz duydum. Zaman serilerimi tahmin etmek için hangi yöntemin (günlük perakende veriler) daha iyi olduğunu nasıl karşılaştırabilirim: auto.arima (x), ets (x) veya nnetar (x). Auto.arima'yı AIC veya BIC ile ets ile karşılaştırabilirim. Fakat onları sinir ağlarıyla nasıl karşılaştırabilirim? Örneğin: > dput(x) …

1
Bir regresyon modelinin performansını eğitim ve test setlerini kullanarak mı değerlendiriyorsunuz?
Sıklıkla bir test modelini uzatarak ve eğitim setinde bir model eğiterek bir sınıflandırma modelinin performansını değerlendirmeyi duyarım. Daha sonra biri tahmin edilen değerler ve diğeri gerçek değerler için olmak üzere 2 vektör oluşturuldu. Açıkçası bir karşılaştırma yapmak, kişinin F-Skoru, Kappa İstatistiği, Hassasiyet ve Geri Çağırma, ROC eğrileri vb. Bu, regresyon …

1
Bayesian ve Fisher'ın lineer diskriminant analizine yaklaşımları
LDA yapmak için 2 yaklaşım, Bayesci yaklaşım ve Fisher yaklaşımı biliyorum . Verilerin olduğunu varsayalım , burada , boyutlu tahmin edicidir ve , sınıflarının bağımlı değişkenidir .(x,y)(x,y)(x,y)xxxpppyyyKKK Tarafından Bayes yaklaşım , posterior hesaplamak , ve benzeri gibi Kitaplarda, olduğunu varsayalım , şimdi sınıfı için ayırıcı işlevimiz var , doğrusal olduğunu …

4
Ortalama fark neredeyse 0 ise t testi istatistiksel olarak nasıl anlamlı olabilir?
Tedaviler arasındaki farkın istatistiksel olarak anlamlı olup olmadığını söylemek için 2 popülasyondaki verileri karşılaştırmaya çalışıyorum. Veri kümeleri normalde iki küme arasında çok az fark olacak şekilde dağılmış görünmektedir. Ortalama fark 0.00017'dir. Ortalamalar arasında fark bulunmayan sıfır hipotezini reddedemeyeceğimi düşünerek eşleştirilmiş bir t testi yaptım, ancak hesaplanan t-değerim, kritik t-değerimden çok …

1
Mann-Whitney testini nasıl rapor edersiniz?
Tezimi yapıyorum ve birkaç test yapıyorum. Bir Kruskal-Wallis testi kullandıktan sonra, sonucu genellikle şöyle bildiririm: arasında önemli bir fark vardır ...(χ2(2)=7.448,p=.024)(χ(2)2=7.448,p=.024)(\chi^2_{(2)}=7.448, p=.024) Ama şimdi bir Mann-Whitney testi yaptım ve hangi değerleri sunacağımdan emin değilim. SPSS bana bir Mann-Whitney , Wilcoxon , ve değeri veriyor . Bu 4 değerin tümünü sunacak …

2
Neden Holm-Bonferroni üzerinde Bonferroni kullanıyorsunuz?
Neden Bonchroni düzeltmesi üzerinde Hochberg yöntemi gibi daha güçlü bir yöntem kullanamayacağınızı anlayabiliyorum, çünkü bu durumda hipotezlerin bağımsızlığı gibi ekstra varsayımlara sahip olabilirler, ancak neden Bonferroni düzeltmesini Holm'ın ardışık olarak yeniden modifikasyonu üzerinde kullanmayın, çünkü ikincisi daha güçlüdür ve Bonferroni'den daha fazla varsayım içermez. Bir şey kaçırdım mı?

2
Hiyerarşik Bayesci Modellerin güçlü yanlarını gösteren iyi bir benzetme nedir?
Bayes istatistikleri için nispeten yeniyim ve son zamanlarda farklı veri kümelerinde hiyerarşik bayes modelleri oluşturmak için JAGS kullanıyorum. Sonuçlardan çok memnunum (standart glm modellerine kıyasla), istatistikçi olmayanlara standart istatistiksel modellerle arasındaki farkın ne olduğunu açıklamam gerekiyor. Özellikle, HBM'lerin neden ve ne zaman daha basit modellerden daha iyi performans gösterdiğini göstermek …

3
'İstatistiksel olarak kanıtlanmış' kavramı
Haberler 'istatistiksel olarak kanıtlanmış' şeyler hakkında konuştuğunda, iyi tanımlanmış bir istatistik kavramını doğru kullanıyor, yanlış mı kullanıyor yoksa sadece bir oksimoron mu kullanıyorlar? Bir 'istatistiksel kanıt'ın aslında bir hipotezi ya da matematiksel bir kanıtı kanıtlamak için yapılan bir şey değil, daha çok bir' istatistiksel test 'olduğunu hayal ediyorum.
10 inference  proof 

1
Neden ( sansürlendi)
Bir problem setinde sonucu bana sezgisel olmayan bu "lemmayı" kanıtladım. , sansürlü bir modelde standart normal dağılımdır.ZZZ Resmi olarak, ve . Ardından, Dolayısıyla, kesik bir etki alanı üzerindeki beklenti formülü ile kesme noktasındaki yoğunluk arasında bir tür bağlantı vardır . Bunun arkasındaki sezgiyi açıklayan var mı?Z∗∼Norm(0,σ2)Z∗∼Norm(0,σ2)Z^* \sim Norm(0, \sigma^2)Z=max(Z∗,c)Z=max(Z∗,c)Z = …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.