İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Çapraz doğrulama (CV) ve genelleştirilmiş çapraz doğrulama (GCV) istatistikleri
Çapraz doğrulama (CV) istatistiği ve doğrusal bir model Y=Xβ+εY=Xβ+εY = X\boldsymbol\beta + \boldsymbol\varepsilon (normal, homoscedastic error vector \ ile) ile ilişkili genelleştirilmiş çapraz doğrulama (GCV) istatistiği için muhtemelen çelişkili tanımlar buldum. cıvataları \ varepsilonεε\boldsymbol\varepsilon ). Bir yandan, Golub, Heath ve Wahba GCV tahminini λ^λ^\hat{\lambda} olarak tanımladı (s. 216). arasında asgarileştirir …

1
Fisher dağıtımı için Fourier dönüşümünü tersine çevirmek
Fisher dağılımının karakteristik işlevi şudur: C ( t ) = Γ ( α + 1)F( 1 , α )F(1,α)\mathcal{F}(1,\alpha) buradaU,birleşik hipergeometrik fonksiyondur. Ben Fourier ters dönüşüm çözmeye çalışıyorumF-1t,xven-convolutiondeğişken yoğunluğunu kurtarmak içinx: olduğu F-1t,x(C(t)n) alma amacı ilenFisher dağıtılmış rasgele değişkenlerintoplamınındağılımı. Birisinin çözmesi çok zor gibi göründüğü bir fikri var mı merak …

1
Bir priori güç analizi esasen işe yaramaz mı?
Geçtiğimiz hafta Kişilik ve Sosyal Psikoloji Derneği toplantısına katıldım ; Uri Simonsohn tarafından örneklem büyüklüğünü belirlemek için priori güç analizi kullanmanın sonuçların varsayımlara karşı çok duyarlı olduğu iddiasıyla bir konuşma gördüm. Tabii ki, bu iddia benim yöntemler sınıfımda öğretildiklerime ve birçok önde gelen metodolojistin tavsiyelerine (en önemlisi Cohen, 1992 ) …

5
Şimdi sıfır hipotezi reddettiğimde sırada ne var?
Zaman ve tekrar reddetti veya boş hipotezi reddetmek için başarısız oldu . Davanın reddedilmemesi durumunda, reddedilmeniz için yeterli kanıt olmadığı ve “devam ettiğiniz” (yani, daha fazla veri toplamak, deneyi bitirmek vb.) Sonucuna varırsınız. Ancak, boş hipotezi “yaptığınız” zaman , alternatif hipotez için bazı kanıtlar sağlayarak , alternatif hipotezinizin gerçekten de …

7
Bonferroni ayarlarında yanlış olan ne?
Aşağıdaki makaleyi okudum: Perneger (1998) Bonferroni ayarlarında yanlış olan ne ? Yazar Bonferroni düzeltmesinin en iyi ihtimalle biyomedikal araştırmalarda sınırlı uygulamalara sahip olduğunu ve belirli hipotezlerle ilgili kanıtların değerlendirilmesinde kullanılmaması gerektiğini söyleyerek özetledi: Özet noktaları: Çalışma verilerinde yapılan testlerin sayısının istatistiksel olarak anlamlı hale getirilmesi - Bonferroni yöntemi - çözdüğünden …

2
ARMA kullanarak durağan olmayan bir süreci modellemenin sonuçları?
Durağan olmayan bir zaman serisinin modellenmesinde ARIMA'yı kullanmamız gerektiğini anlıyorum. Ayrıca, okuduğum her şey ARMA'nın sadece durağan zaman serileri için kullanılması gerektiğini söylüyor. Anlamaya çalıştığım şey, bir modeli yanlış sınıflandırırken ve d = 0durağan olmayan bir zaman serisini varsayırken pratikte ne olur ? Örneğin: controlData <- arima.sim(list(order = c(1,1,1), ar …

2
CHAID - CRT (veya CART)
Yaklaşık 20 tahminciye sahip bir veri setinde SPSS kullanarak bir karar ağacı sınıflandırması yapıyorum (birkaç kategoriyle kategorik). CHAID (Ki-kare Otomatik Etkileşim Algılama) ve CRT / CART (Sınıflandırma ve Regresyon Ağaçları) bana farklı ağaçlar veriyor. Herhangi biri CHAID'in CRT'ye olan göreceli değerini açıklayabilir mi? Bir yöntemi diğerine kullanmanın etkileri nelerdir?
23 spss  cart 

2
Konu modellerinde konu dengesi
Bir dizi açık uçlu makalenin içeriği hakkında biraz bilgi edinmek istediğim bir proje üzerinde çalışıyorum. Bu özel projede 148 kişi, daha büyük bir deneyin parçası olarak varsayımsal bir öğrenci organizasyonu hakkında yazılar yazdı. Alanımda (sosyal psikoloji), bu verileri analiz etmenin tipik yolu, makaleleri elle kodlamak olsa da, bunu nicel olarak …

4
Yanlış olan (bazı) sözde randomizasyonun nesi var
50 yaşın üzerindeki hastaların doğum yılına göre sahte rastgele seçildiği bir çalışmaya rastladım. Doğum yılı çift sayı ise, olağan bakım, tek sayı ise müdahale. Uygulaması daha kolaydır, altüst edilmesi daha zordur (hastanın hangi tedaviyi alması gerektiğini kontrol etmek kolaydır), hatırlaması kolaydır (ödev birkaç yıl devam etti). Ama yine de, hoşuma …


2
Test setinin dağılımı ile eğitim seti arasındaki fark nasıl ele alınır?
Makine öğrenmesi ya da parametre tahmininin temel varsayımlarından biri, görünmeyen verilerin eğitim seti ile aynı dağıtımdan geldiğidir. Bununla birlikte, bazı pratik durumlarda, test setinin dağılımı eğitim setinden neredeyse farklı olacaktır. Ürün tanımlarını yaklaşık 17.000 sınıfa sınıflandırmaya çalışan büyük ölçekli bir çok sınıflandırma problemi için söyleyin. Eğitim seti, eğrilmiş bir sınıf …

3
Gauss karışımı olarak Student t
Öğrenci t-dağılımını k>0k>0k > 0 serbestlik derecesi ile kullanma, yer parametresi lll ve yoğunluk parametresi sss yoğunluğu olan Γ(k+12)Γ(k2kπs2−−−−√){1+k−1(x−ls)}−(k+1)/2,Γ(k+12)Γ(k2kπs2){1+k−1(x−ls)}−(k+1)/2,\frac{\Gamma \left(\frac{k+1}{2}\right)}{\Gamma\left(\frac{k}{2}\sqrt{k \pi s^2}\right)} \left\{ 1 + k^{-1}\left( \frac{x-l}{s}\right)\right\}^{-(k+1)/2}, Öğrenci ttt dağılımının, Gauss dağılımlarının bir karışımı olarak X∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2) , ' nin bırakılması τ=1/σ2∼Γ(α,β)τ=1/σ2∼Γ(α,β)\tau = 1/\sigma^2\sim\Gamma(\alpha,\beta)ve eklem yoğunluğunun birleştirilmesiyle marjinal yoğunluğu elde …

2
Önce Bayesian vuruş ortalama
Beta dağıtımı sezgisiyle ilgili sorguya mükemmel bir cevaptan esinlenerek bir soru sormak istedim . Vuruş ortalaması için önceki dağıtım için türetme daha iyi anlamak istedim. Görünüşe göre David parametreleri ortalama ve aralıktan alıyor. Ortalama olduğu varsayımı altında ve standart sapmadır , sen geri dönebilirsin ve bu iki denklemleri çözerek: 0.270.270.270.180.180.18αα\alphaββ\betaαα+β=0.27α⋅β(α+β)2⋅(α+β+1)=0.182αα+β=0.27α⋅β(α+β)2⋅(α+β+1)=0.182\begin{equation} …
23 bayesian  prior 

4
Çok seyrek verilerle iyi çalışan bir Rastgele Orman uygulaması var mı?
Çok seyrek verilerle iyi çalışan bir R rasgele orman uygulaması var mı? Binlerce veya milyonlarca boole girdi değişkenine sahibim, ancak verilen herhangi bir örnek için yalnızca yüzlerce kadar TRUE olacaktır. R'ye nispeten yeniyim ve seyrek verilerle ilgilenmek için bir 'Matrix' paketi olduğunu fark ettim, ancak standart 'randomForest' paketi bu veri …

4
R'deki kümülatif dağılım nasıl hesaplanır?
Kilitli . Bu soru ve cevapları kilitli çünkü soru konu dışı, ancak tarihsel öneme sahip. Şu anda yeni cevaplar veya etkileşimler kabul etmiyor. Bir veri örneğinin kümülatif dağılım fonksiyonunu hesaplamam gerekiyor. R'deki hist () 'e kümülatif yoğunluk fonksiyonunu ölçen benzer bir şey var mı? Ecdf () denedim ama mantığı anlayamıyorum.
23 r  distributions  cdf 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.