İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
R kullanarak zaman analizi yöntemi ve yöntemleri
Önümüzdeki 6 ay boyunca emtia (Petrol, Alüminyum, Kalay, vb.) Fiyatlarını tahmin etmeye çalıştığımız küçük bir proje üzerinde çalışıyorum. Tahmin edeceğim 12 değişkenim var ve Nisan, 2008 - Mayıs 2013 tarihleri ​​arasında verilerim var. Tahmin hakkında nasıl gitmeliyim? Aşağıdakileri yaptım: Timeseries veri kümesi olarak içe aktarılan veriler Tüm değişkenlerin mevsimsellik Trend'e …

1
Makine öğrenimi topluluğu kötüye kullanma “şartlı” ve “tarafından parametrelendirildi” mi?
Diyelim ki bağımlı . Titizlikle konuşursak,XXXαα\alpha Eğer ve hem de rasgele değişkenlerdir, yazabiliriz ;XXXαα\alphap(X∣α)p(X∣α)p(X\mid\alpha) ancak, rastgele bir değişken ve bir parametreyse, yazmamız gerekir .XXXαα\alphap(X;α)p(X;α)p(X; \alpha) Makine öğrenimi topluluğunun farklılıkları görmezden geldiğini ve terimleri kötüye kullandığını birkaç kez fark ettim . Örneğin, rastgele değişken yerine Dirichlet parametresidir.αα\alpha olmamalı mı ? LDA …

3
Hangisi daha iyi maksimum olasılık veya marjinal olabilirlik ve neden?
Regresyon yaparken şu tanımdan geçersek: Kısmi olasılık, profil olasılığı ve marjinal olasılık arasındaki fark nedir? O, Maksimum Olabilirlik L'yi maksimuma çıkaran β ve θ'yı bulun (β, θ | data). Öte yandan, Marjinal Olasılık θ koşullu β'nun olasılık dağılımını belirleyebileceğimiz gerçeğinden yararlanarak θ olasılık denkleminden bütünleştiriyoruz. Hangisini en üst düzeye çıkarmak …

1
Engle – Granger iki adımlı yöntem kullanarak iki zaman serisi arasında eşbütünleşme testi
İki zaman serisi arasındaki eşbütünleşmeyi test etmeye çalışıyorum. Her iki seri de ~ 3 yıla yayılan haftalık verilere sahiptir. Engle-Granger İki Adım Yöntemi'ni yapmaya çalışıyorum. Operasyonlarım takip ediyor. Artırılmış Dickey-Fuller aracılığıyla her zaman serisini birim kök için test edin. Her ikisinin de birim kökleri olduğu varsayılarak, OLS yoluyla ilişkinin doğrusal …

3
Wilcoxon test asimptotik nispi etkinliği neden normal dağıtılmış veriler için Student t-testine kıyasla?
Wilcoxon imzalı sıralama testinin asimptotik nispi verimliliğinin (ARE) , veriler normal olarak dağıtılmış bir popülasyondan alınmışsa, Student t testine kıyasla olduğu iyi bilinmektedir . Bu, hem temel tek örneklem testi hem de iki bağımsız örnek için varyant (Wilcoxon-Mann-Whitney U) için geçerlidir. Ayrıca normal veriler için ANOVA F testine kıyasla bir …

4
Bir iş ortamında istatistiksel analiz için iyi uygulama
(Bunun kesin olarak istatistiklerle ilgili olmadığını fark etsem de, istatistiklerin bir iş ortamında yayılmasıyla ilgili olduğunu, bu yüzden hala CV'nin konu aralığında olduğunu varsaydım) Kısa bir arka plan: İş ortamımız (ve diğer ortamlardan şüpheliyim) istatistiksel analiz ve araştırma konusunda uzmanlaşmış bir destek işlevine sahiptir. İş Zekası ile yakından çalışıyoruz ve …

2
Mann-Whitney U testi: etki büyüklüğü için güven aralığı
Fritz, Morris ve Richler'e (2011; aşağıya bakınız) göre , r = z formülü kullanılarak Mann-Whitney U testi için bir etki büyüklüğü olarak hesaplanabilir. rrr Bu benim için uygun, çünkür'yidiğer vesilelerle derapor ediyorum. Etki büyüklüğü ölçüsüne ek olarakriçin güven aralığını bildirmek istiyorum.r=zN−−√r=zN r = \frac{z}{\sqrt N} rrrrrr İşte benim şunlardır sorular …

1
R: doğrusal model kalıntılarının test normu - kalan kalıntılar
Normalliği kontrol etmek için doğrusal bir modelin kalıntıları üzerinde bir Shapiro Wilk'un W testi ve Kolmogorov-Smirnov testi yapmak istiyorum. Sadece bunun için hangi artıkların kullanılması gerektiğini merak ediyordum - ham artıklar, Pearson kalıntıları, öğrenci kalıntıları veya standart kalıntılar? Shapiro-Wilk'un W testi için, ham & Pearson kalıntıları için sonuçlar aynıdır, ancak …

5
Öğrenci belgelerinin notlandırılmasında farklı cömertlik düzeylerine sahip belirteçlerin etkileriyle en iyi nasıl başa çıkabilirim?
Yaklaşık 600 öğrencinin, iyi bir güvenilirlik / geçerliliğe sahip olduğu varsayılabilen kapsamlı bir değerlendirme parçası üzerinde bir puanı vardır. Değerlendirme 100 üzerinden değerlendirilir ve bilgisayar tarafından işaretlenmiş çoktan seçmeli bir testtir. Bu 600 öğrencinin ikinci, küçük bir değerlendirme parçasında da puanları vardır. Bu ikinci değerlendirmede, 11 farklı sınıflayıcıyla 11 gruba …

1
Gözlemler bağımsız olmadığında geçersiz çıkarım
Temel istatistiklerde, çıkarımların geçerli olabilmesi için genel bir doğrusal model ile gözlemlerin bağımsız olması gerektiğini öğrendim. Kümeleme gerçekleştiğinde, bağımsızlık artık hesaba katılmadıkça geçersiz çıkarımlara yol açmayabilir. Bu tür kümelenmeyi hesaba katmanın bir yolu karışık modeller kullanmaktır. Bunu açıkça gösteren simüle edilmiş ya da edilmemiş bir örnek veri kümesi bulmak istiyorum. …


2
Düzeltme paketi kullanılarak belirli eşik değerleri için karışıklık matrisleri elde etmek mümkün müdür?
Bir lojistik regresyon modeli (yoluyla elde ettik trainbir ikili yanıt için), ve ile lojistik karışıklık matrisi elde ettik confusionMatrixiçinde caret. Bana lojistik modeli karışıklık matrisi veriyor, ancak bunu elde etmek için hangi eşiğin kullanıldığından emin değilim. Nasıl kullanarak belirli eşik değerleri için karışıklık matrisi elde do confusionMatrixin caret?

1
Neden her zaman topluluk öğrenmesini kullanmıyorsunuz?
Bana öyle geliyor ki, topluluk öğrenimi her zaman tek bir öğrenme hipotezinden daha iyi tahmin performansı verecek. Peki, neden onları sürekli kullanmıyoruz? Benim tahminim belki hesaplama sınırlamaları yüzünden mi? (o zaman bile zayıf tahmin ediciler kullanıyoruz, bu yüzden bilmiyorum).

1
Bir dağıtımın bir güç yasasına uygun olup olmadığı nasıl test edilir?
Kaç kullanıcının kaç soru gönderdiğine dair verilerim var. Örneğin, [UserCount, QuestionCount] [2, 100] [9, 10] [3, 80] ... ... Bu, 2 kullanıcının her birinin 100 soru gönderdiğini, 9 kullanıcının her birinin 10 soru gönderdiğini vb. Peki, UserCount, QuestionCountdağıtımın bir güç yasasına uygun olup olmadığını nasıl belirleyebilirim ? PoweRlaw paketini buldum …

4
Çapraz doğrulamanın veri gözetlemesinden farkı nedir?
"İstatistiksel Öğrenime Giriş" i yeni bitirdim . Çeşitli makine öğrenme teknikleri için en iyi ayarlama parametrelerini bulmak için çapraz doğrulamanın kullanılmasının veri gözetlemesinden farklı olup olmadığını merak ettim. Ayar parametresinin hangi değerinin test setinde en iyi tahmin sonucuyla sonuçlandığını tekrar tekrar kontrol ediyoruz. Ulaştığımız ayar parametresi, bu özel test setini …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.