İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Bir seriyi sabit hale getirmek için fark yaratabilir miyim?
Zaman geçtikçe net bir şekilde artan bir veri setim var (bir para biriminin döviz kuru, 20 yıldan fazla aylık veri), sorum şu: Verileri detrend edebilir ve daha sonra, eğer detrending kendi içinde detrending olursa, sabit hale getirmek için de fark edebilir miyim bunu başaramaz mı? Ve eğer öyleyse, bu iki …

3
Korelasyon veya belirleme katsayısı, bir regresyon çizgisi boyunca düşen değerlerin yüzdesi ile ilgili mi?
Korelasyon, , iki değişken arasındaki doğrusal ilişkinin bir ölçüsüdür. Belirleme, katsayısı r 2 , diğer varyasyon "ile açıklanabilir" ne değişkenlik kadar olabilir tek değişkenli bir ölçüsüdür.rrrr2r2r^2 Örneğin, iki değişken arasındaki korelasyon ise, r 2 = 0.64'tür . Dolayısıyla, birindeki değişkenliğin% 64'ü diğerindeki farklılıklar ile açıklanabilir. Sağ?r = 0.8r=0.8r = 0.8r2= …


2
Tam yeterli istatistikler nelerdir?
Yeterli istatistiği tam olarak anlamakta sorun mu yaşıyorsunuz? Let yeterli istatistiği olabilir.T= Σ xbenT=ΣxiT=\Sigma x_i Eğer olasılık 1, bir fonksiyonu , daha sonra tam bir yeterli istatistik olur.E[ g( T) ] = 0E[g(T)]=0E[g(T)]=0ggg Peki bu ne anlama geliyor? Üniforma ve Bernoulli örnekleri gördüm (sayfa 6 http://amath.colorado.edu/courses/4520/2011fall/HandOuts/umvue.pdf ), ancak sezgisel değil, …

2
Özellik sayısının artırılması neden performansı düşürüyor?
Neden özellik sayısının artırılmasının performansı düşürebileceğine dair bir sezgi kazanmaya çalışıyorum. Şu anda belirli özellikler arasında daha iyi iki değişkenli ancak daha fazla özelliğe bakarken daha kötü performans gösteren bir LDA sınıflandırıcı kullanıyorum. Sınıflandırma doğruluğum tabakalı 10 kat xval kullanılarak gerçekleştirilir. Bir sınıflandırıcının bu yüksek boyutlarda neler olduğuna dair bir …

1
Sayım verilerinin mevsimsizleştirilmesi
Sayım verilerini trend, mevsimsel ve düzensiz bileşenlere ayırmak için R'de stl () kullandım. Ortaya çıkan trend değerleri artık tamsayı değildir. Aşağıdaki sorularım var: Stl () sayım verilerini mevsimsellikten arındırmak için uygun bir yöntem midir? Sonuçta ortaya çıkan eğilim artık tamsayı olarak değerlendirilmediğinden, trend bileşenlerini modellemek için lm () kullanabilir miyim?



1
Yuvalanmamış modeller için AIC: normalleştirme sabiti
AIC olarak tanımlanır , θ kestirim ve p parametre alanı boyutudur. Θ tahmini içinA IC= - 2 günlük( L ( θ^) ) + 2 pAIC=−2log⁡(L(θ^))+2pAIC=-2 \log(L(\hat\theta))+2pθ^θ^\hat\thetapppθθ\thetagenellikle yoğunluk sabit faktörünü ihmal eder. Bu, olasılığı basitleştirmek için parametrelere bağlı olmayan faktördür. Öte yandan, iç içe olmayan modelleri karşılaştırırken bu faktörün yaygın olmadığı …

2
Random Forest: bir değişkenin önemli olduğunu bilirsem
Anladığım kadarıyla, rasgele orman her karar ağacını oluşturmak için rastgele mtry değişkenlerini seçiyor . Yani mtry = ncol / 3 ise, her değişken ağaçların ortalama 1 / 3'ünde kullanılır. Ve ağaçların 2 / 3'ü onları kullanmayacak. Ama tek bir değişkenin muhtemelen çok önemli olduğunu bilersem, bu değişkenin her ağaçta seçilme …


3
Kolmogorov-Smirnov Testinin çoklu örnek versiyonu veya alternatifi var mı?
Bir arsanın tedavi diğerini kontrol aldığı altı çift parseldeki ağaçların boyut dağılımını karşılaştırıyorum. Her parsel çifti üzerinde Kolmogorov-Smirnov testi kullanarak ila arasında olduğunu görüyorum . KS testinin çoklu örnek uzantısı gibi tüm replikatlarla birlikte başa çıkmak için uygun yöntemler var mı veya uygun bir takip testi var mı? Ya da …

6
Varyasyon Katsayısı - IQR / medyan veya alternatif gibi sağlam (parametrik olmayan) bir ölçü?
Belirli bir veri kümesi için, yayılma genellikle standart sapma veya IQR (çeyrekler arası aralık) olarak hesaplanır. A standard deviationnormalleştiğinde (z-skorları vb.) Ve bu nedenle iki farklı popülasyondan yayılımı karşılaştırmak için kullanılabilirken, iki farklı popülasyondan alınan numunelerin oldukça farklı iki ölçekte değerleri olabileceğinden, bu IQR için geçerli değildir, e.g. Pop A: …

2
Sonlu Gauss karışımı ile Gaussian arasındaki mesafe nedir?
Bilinen ağırlıkları, ortalamaları ve standart sapmaları olan son derece fazla Gauss'lu bir karışımım olduğunu varsayalım. Araçlar eşit değildir. Tabii ki karışımın ortalama ve standart sapması hesaplanabilir, çünkü momentler bileşenlerin momentlerinin ağırlıklı ortalamalarıdır. Karışım normal bir dağılım değil, normalden ne kadar uzak? Yukarıdaki görüntü, standart sapma (bileşenlerin) ve aynı ortalama ve …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.