İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Rasgele orman ağaçları için budama neden gerekli değildir?
Breiman, ağaçların budama olmadan büyüdüğünü söylüyor. Niye ya? Demek istediğim, rastgele ormandaki ağaçların budamamasının sağlam bir nedeni olmalı. Öte yandan, fazla oturmamak için tek bir karar ağacının budanması çok önemlidir. Bu nedenle okunabilecek bazı literatür var mı? Tabii ki ağaçlar birbiriyle ilişkili olmayabilir ancak yine de aşırı uyum olasılığı vardır.

4
Normal rv'nin basıklık ve çarpıklığını arttıracak dönüşüm
gözlemlerinin normal olarak dağıtıldığı gerçeğine dayanan bir algoritma üzerinde çalışıyorum ve algoritmanın bu varsayımın sağlamlığını ampirik olarak test etmek istiyorum.YYY Bunu yapmak için , normalliğini aşamalı olarak bozacak bir dizi dönüşüm . Örneğin s normal sahip oldukları çarpıklık ve basıklık , ve progresif olarak artırmaya dönüşümün bir dizi bulmaya iyi …

2
Pearson'un normallik ihlallerine olan korelasyon katsayısı ne kadar sağlamdır?
Belirli değişken türlerine ilişkin veriler, belirli popülasyonlarda ölçüldüğünde normal değildir (örn. Majör Depresif Bozukluğu olan bir popülasyonda depresyon seviyeleri). Pearson'un normallik olduğunu varsayarsak, normallik dışı koşullar altında test istatistiği ne kadar sağlamdır? Ben korelasyon katsayıları için istiyorum bir dizi değişken var, ama bu değişkenlerin bazıları için Z çarpıklığı p <.001 …

5
Eşleştirilmiş ve eşleştirilmemiş t testi
Farz edin ki 20 farem var. Fareleri bir şekilde eşleştiriyorum, böylece 10 çift elde ederim. Bu sorunun amacı için, rastgele bir eşleştirme olabilir, VEYA aynı çöpten, aynı cinsiyetten, benzer ağırlıkta fareleri eşleştirmeye çalışmak gibi mantıklı bir eşleştirme olabilir, VEYA kasten aptal bir eşleştirme olabilir fareleri olabildiğince eşit olmayan ağırlıklar ile …

3
Jüri üyeleri için temel istatistikler
Jüri görevine çağrıldım. İstatistiklerin bazı jüri duruşmalarıyla ilgisinin farkındayım. Örneğin, "taban ücret" kavramı ve olasılık hesaplamalarına uygulanması bazen - belki de her zaman - önemlidir. Durumumdaki bir kişi hangi istatistiksel konuları yararlı bir şekilde inceleyebilir ve geçmişim olan biri için hangi materyaller uygun olur? Bir "sert bilim" derecem var ve …

3
Yanıt 4. kök tarafından dönüştürüldüğünde regresyon katsayıları nasıl yorumlanır?
1/4Heterossedastisitenin bir sonucu olarak yanıt değişkenimde dördüncü root ( ) güç dönüşümü kullanıyorum . Ama şimdi regresyon katsayılarımı nasıl yorumlayacağımdan emin değilim. Geri dönüşümü yaparken katsayıları dördüncü güce götürmem gerektiğini varsayıyorum (regresyon çıktısının altına bakınız). Tüm değişkenler milyonlarca dolar cinsindendir, ancak milyarlardaki dolar değişimini bilmek istiyorum. Diğer bağımsız değişken sabit …


2
Çoklu impütasyondan sonra posterior araçları ve güvenilir aralıkları nasıl bir araya getirebilirim?
Bir dizi tamamlanmış veri kümesi elde etmek için çoklu gösterim kullandım. Bir parametre (rastgele etki) için posterior dağılımlar elde etmek için tamamlanmış veri kümelerinin her birinde Bayesian yöntemleri kullandım. Bu parametre için sonuçları nasıl birleştirebilirim / havuzlayabilirim? Daha fazla bağlam: Modelim okullarda kümelenmiş bireysel öğrenciler (öğrenci başına bir gözlem) anlamında …

4
Beta regresyonunda 0,1 değerlerle başa çıkmak
[0,1] 'de beta regresyonu ile analiz etmek istediğim verilerim var. Tabii ki 0,1 değerlerini karşılamak için bir şeyler yapılmalıdır. Bir modele uyacak şekilde veri değiştirmeyi sevmiyorum. Ayrıca sıfır ve 1 enflasyonun iyi bir fikir olduğuna inanmıyorum çünkü bu durumda 0'ın çok küçük pozitif değerler olduğunu düşünmeliyim (ama tam olarak hangi …

6
"Tam Bayesli" ve "Bayesli"
Bayesci istatistikleri öğreniyorum ve sık sık makalelerde okudum "Bayesci bir yaklaşımı benimsiyoruz" Veya benzeri. Ayrıca, daha az sıklıkla fark ettim: " tamamen Bayesci bir yaklaşım benimsiyoruz" (benim vurgu). Bu yaklaşımlar arasında herhangi bir pratik veya teorik anlamda bir fark var mı? FWIW, MCMCglmmilgili olması halinde R'deki paketi kullanıyorum .
20 bayesian 

2
Güç ve çapraz spektral yoğunlukların verildiği zaman serilerinin simülasyonu
Kovaryans matrisleri (güç spektral yoğunlukları (PSD'ler) ve çapraz güç spektral yoğunlukları (CSD'ler)) göz önüne alındığında bir dizi sabit renkli zaman serisi oluşturmakta sorun yaşıyorum. İki zaman serisi ve , güç spektral yoğunluklarını (PSD'ler) ve çapraz spektral yoğunluklarını (CSD'ler) ve Matlabda fonksiyonları, PSD'ler ve CSDs vb kovaryans matrisi oluşturan: yI(t)yI(t)y_{I}(t)yJ(t)yJ(t)y_{J}(t)psd()csd()C(f)=(PII(f)PJI(f)PIJ(f)PJJ(f)),C(f)=(PII(f)PIJ(f)PJI(f)PJJ(f)), \mathbf{C}(f) …

3
R'deki rollapply PCA'da “jumpy” yüklemeleri alıyorum.
28 farklı para birimi için 10 yıllık günlük getiri verilerim var. İlk temel bileşeni çıkarmak istiyorum, ancak PCA'yı 10 yıl boyunca çalıştırmak yerine, 2 yıllık bir pencere açmak istiyorum, çünkü para birimlerinin davranışları gelişiyor ve bu yüzden bunu yansıtmak istiyorum. Ancak büyük bir sorunum var, yani hem princomp () hem …
20 r  pca 

6
Gauss olmayan verilerin PCA'sı
PCA hakkında birkaç hızlı sorum var: PCA , veri kümesinin Gauss olduğunu varsayıyor mu? Doğası gereği doğrusal olmayan verilere bir PCA uyguladığımda ne olur? Bir veri kümesi verildiğinde, işlem ilk önce normalleştirmek, varyansı 1'e ayarlamak, bir SVD almak, sıralamayı azaltmak ve son olarak veri kümesini yeni düşük sıralı alanla eşlemektir. …
20 pca  svd 

1
Lojistik regresyon için tahmin aralıklarını hesaplama
Lojistik regresyon tahminleri için tahmin aralıklarının nasıl oluşturulacağını anlamak istiyorum . Collett'in Modelleme İkili Verileri , 2. Baskı s.98-99'daki prosedürleri izlemem önerildi. Bu prosedürü uyguladıktan ve R'lerle karşılaştırdıktan sonra predict.glm, aslında bu kitabın tahmin aralıklarını değil, güven aralıklarını hesaplama prosedürünü gösterdiğini düşünüyorum . Prosedürün Collett ile karşılaştırılması predict.glm, aşağıda gösterilmiştir. …

2
Hiperparametreleri tahmin etmek için ampirik Bayes'e karşı çapraz doğrulama
Hiyerarşik bir model verildiğinde, modele uyması için iki aşamalı bir işlem istiyorum. İlk olarak, bir avuç hiperparametre düzeltin ve daha sonra parametrelerinin geri kalanında Bayesian çıkarım yapın . Hiperparametreleri sabitlemek için iki seçenek düşünüyorum.θ ϕp ( x | ϕ , θ )p(x|ϕ,θ)p(x|\phi,\theta)θθ\thetaφϕ\phi Ampirik Bayes (EB) kullanın ve marjinal olasılığını en …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.