İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
Nüfusun herhangi bir niceliksel özelliği “parametre” midir?
İstatistik ve parametre terimleri arasındaki farkı çok iyi biliyorum. Bir istatistiği örnek verilere bir işlev uygulanmasından elde edilen değer olarak görüyorum. Bununla birlikte, çoğu parametre örneği bir parametrik dağılımın tanımlanması ile ilgilidir. Yaygın bir örnek, normal dağılımı veya doğrusal bir regresyonu parametreleştirmek için katsayıları ve hata varyansını parametreleştirmek için ortalama …

1
K-kat çapraz doğrulaması ile, tüm modellerini nihai modeli oluşturmak için ortalama mı kullanıyorsunuz?
K-kat çapraz doğrulaması gerçekleştirirken, bir kat dışındaki tüm katları işaret ederek doğruluk metriklerini elde ettiğinizi ve tahminlerde bulunduğunuzu ve bu işlemi kez tekrarladığınızı anlıyorum . Daha sonra tüm örneklerinizde doğruluk metrikleri çalıştırabilirsiniz (kesinlik, hatırlama, doğru olarak sınıflandırılan%), her seferinde bunları hesaplayıp aynı zamanda sonucun ortalamasını almanız gerekir (yanlışsam beni düzeltin).kkk …


4
Ağır kuyruklu dağıtımlar için boxplot eşdeğeri?
Yaklaşık olarak normal olarak dağıtılmış veriler için kutu grafikleri, medyanı ve verilerin yayılmasını ve ayrıca herhangi bir aykırı değerlerin varlığını hızlı bir şekilde görselleştirmenin harika bir yoludur. Bununla birlikte, daha ağır kuyruklu dağılımlar için, uç noktalar IQR'nin sabit faktörünün dışında olduğu tanımlandığından ve çok kuyruklu dağılımlarda elbette çok daha sık …

3
Fisher'ın z-dönüşümü ne zaman uygundur?
Örnek bir korelasyon p-değerlerini kullanarak anlam açısından test etmek istiyorum.rrr H0:ρ=0,H1:ρ≠0.H0:ρ=0,H1:ρ≠0.H_0: \rho = 0, \; H_1: \rho \neq 0. Bunu hesaplamak için Fisher'ın z-dönüşümünü kullanabileceğimi anladım zobs=n−3−−−−−√2ln(1+r1−r)zobs=n−32ln⁡(1+r1−r)z_{obs}= \displaystyle\frac{\sqrt{n-3}}{2}\ln\left(\displaystyle\frac{1+r}{1-r}\right) ve p değerini p=2P(Z>zobs)p=2P(Z>zobs)p = 2P\left(Z>z_{obs}\right) standart normal dağılımı kullanarak. Sorum şu: ne kadar büyük bu uygun bir transformasyon olması için olmalıdır? …


3
Bir başkasının sonucuna göre istatistiksel bir test seçmek (örn. Normalite)
Bu yüzden, bir diğerinin sonucuna dayanarak bir istatistiksel test seçmenin iyi bir fikir olmadığını söylediğini duydum. Bu bana garip geliyor. Örneğin, insanlar diğer bazı testler artıkların normal olarak dağıtılmadığını öne sürdüğünde parametrik olmayan bir test kullanmayı tercih eder. Bu yaklaşım oldukça geniş kabul görüyor ancak bu paragraftaki ilk cümleyle aynı …

1
Ayrı modelleme / doğrulama kümeleri kullanarak bir regresyon modeli oluştururken, doğrulama verilerini “yeniden dolaşıma sokmak” uygun mudur?
Diyelim ki modelleme / doğrulama gözlemleri arasında 80/20 ayrımı var. Modelleme veri kümesine bir model sığdırıyorum ve doğrulama veri kümesinde gördüğüm hatadan rahatım. Gelecekteki gözlemleri puanlamak için modelimi sunmadan önce,% 100 verilerinde güncellenmiş parametre tahminleri almak için doğrulamayı modelleme verileriyle birleştirmek uygun mudur? Bununla ilgili iki bakış açısı duydum: Gerçekleştirdiğim …


4
Panel verileriyle eğilim skoru eşleşmesi
Bireyler boylamsal bir veri setim var ve bazıları tedaviye tabi tutuldu, bazıları ise değildi. Tüm bireyler doğumdan 18 yaşına kadar örneklemdedir ve tedavi bu aralık arasında bir yaşta olur. Tedavinin yaşı vakalara göre değişebilir. Eğilim skoru eşleştirmesini kullanarak tedavi ve kontrol ünitelerini doğum yılında kesin eşleşmeyle çiftler halinde eşleştirmek istiyorum, …

1
Panel veri modellerinde bir grup içindeki standartlaştırılmış bağımlı değişken?
Tanımlayıcı grupta bağımlı bir değişkenin standardizasyonu anlamlı mı? Aşağıdaki çalışma belgesi (Yasal Amazon'da ormansızlaşma yavaşlaması; Fiyatlar veya Politikalar ?, pdf ) Brezilya'daki genel politika değişikliğinin ormansızlaşma üzerindeki etkisini analiz etmek için standartlaştırılmış bir bağımlı değişken kullanır. Standardizasyon aşağıdaki gibi yapılır: Ynewit=Yit−Yi¯¯¯¯¯sd(Yit)Yitnew=Yit−Yi¯sd(Yit) Y^{new}_{it} = \frac{Y_{it} - \overline{Y_i}}{sd(Y_{it})} Yazarlar, bunun "belediyelerdeki ormansızlaşma …

2
Rastgele Orman Modelleri kullanılırken Değişkenleriniz Ne Zaman Günlüğe Kaydedilir / Artırılır?
Çeşitli özelliklere dayalı fiyatları tahmin etmek için Random Forests kullanarak regresyon yapıyorum. Kod Python'da Scikit-learn kullanılarak yazılır. Regresyon modeline uyması için değişkenleri kullanmadan önce exp/ kullanmadan dönüştürüp dönüştürmemeye nasıl karar verirsiniz log? Rastgele Orman gibi bir Topluluk yaklaşımı kullanırken gerekli mi?

4
Haftalık anlamı koruyan influenza verilerinin enterpolasyonu
Düzenle Tam olarak ihtiyacım olan prosedürü açıklayan bir makale buldum . Tek fark, makalenin aylık ortalama verileri korurken, aylık ortalama verileri günlük olarak enterpolasyonlandırmasıdır. Yaklaşımı uygulamakta sorun yaşıyorum R. Herhangi bir ipucu takdir. orijinal Her hafta için aşağıdaki sayım verilerine sahibim (haftada bir değer): Doktor konsültasyon sayısı İnfluenza vakası sayısı …

3
R'de varimax döndürülmüş ana bileşenler nasıl hesaplanır?
PCA'yı 25 değişken üzerinde çalıştırdım ve kullanarak ilk 7 bilgisayarı seçtim prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) Daha sonra bu bileşenler üzerinde varimax rotasyonu yaptım. varimax7 <- varimax(prc$rotation[,1:7]) Ve şimdi varimax PCA döndürülmüş verileri döndürmek istiyorum (varimax nesnesinin bir parçası olmadığı için - sadece yükleme matrisi ve döndürme matrisi). …
13 r  pca  factor-rotation 

1
Büyük örnek asimtotik / teori - Neden ilgilenmeliyim?
Umarım bu soru "çok genel" olarak işaretlenmez ve umarım herkese yarar sağlayan bir tartışma başlar. İstatistiklerde, büyük örnek teorilerini öğrenmek için çok zaman harcıyoruz. Tahmincilerimizin asimptotik olarak tarafsız, asimptotik olarak verimli olmaları, asimptotik dağılımları vb. Asimptotik kelimesi, olduğu varsayımı ile güçlü bir şekilde bağlantılıdır .n→∞n→∞n \rightarrow \infty Ancak gerçekte her …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.