İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Kontur / ısı kaplaması olan saçılma grafiği
Kilitli . Bu soru ve cevapları kilitli çünkü soru konu dışı, ancak tarihsel öneme sahip. Şu anda yeni cevaplar veya etkileşimler kabul etmiyor. Bu grafiği yeni bir makalenin ekinde gördüm ve R'yi kullanarak yeniden üretmeyi çok isterdim. Bu bir saçılma grafiği, ancak aşırı lekeyi düzeltmek için kırmızıya karşılık gelen "mavi …

3
ARIMA modellerinin özel durumları olarak hangi yaygın tahmin modelleri görülebilir?
Bu sabah merak ederek uyandım (bu, dün gece fazla uyuyamadığım gerçeğinden kaynaklanıyor olabilir): çapraz doğrulama doğru zaman serisi tahmininin temel taşı gibi göründüğü için, normalde ne yapmalıyım? "karşı doğrulamak? Birkaç (kolay) olanla geldim ama kısa süre sonra hepsinin ARIMA modellerinin özel durumları olduğunu farkettim. Bu yüzden şimdi merak ediyorum ve …

2
Makine öğrenmesi teknikleri “yaklaşım algoritmaları” mı?
Son zamanlarda cstheory stackexchange üzerinde ML benzeri bir soru vardı ve Powell'ın yöntemini, gradyan inişini, genetik algoritmaları veya diğer "yaklaşım algoritmalarını" öneren bir cevap verdim . Bir yorumda, birisi bana bu yöntemlerin "yaklaşım algoritmaları" olmadığını ve "yaklaşım algoritmaları" olmadığını ve çoğu zaman teorik olarak en uygun duruma gelmediğini söyledi (çünkü …



3
Bir model için öngörülen olasılık kalibrasyonunun görselleştirilmesi
Her sınıf için her sınıf için bir olasılık üreten öngörücü bir modelim olduğunu varsayalım. Şimdi, sınıflandırma için bu olasılıkları kullanmak istersem böyle bir modeli değerlendirmenin pek çok yolu olduğunu kabul ediyorum (hassasiyet, hatırlama, vb.). Ayrıca, bir ROC eğrisinin ve altındaki alanın, modelin sınıflar arasında ne kadar iyi farklılaştığını belirlemek için …

4
Tukey HSD'nin parametrik olmayan bir eşdeğeri var mı?
Bitki örtüsü kapağındaki farklılıkları büyüme formundaki gruplarda (ağaçlar, çalılar, bitkiler vb.) Kontrolle yapılan üç işlemden önce ve sonra incelemek için kullanıyorum. Örneklem büyüklüğüm küçük (n = 5) ve dağıtımlarımın çoğu normalde dağılmıyor. Normal dağılımlar için, tedavi sonuçları arasındaki farkları (değişim yüzdesi) analiz etmek için ANOVA kullandım, sonra sonuç çiftleri arasındaki …

2
Bir gözlem seviyesi Mahalanobis mesafesinin dağılımı
Çok değişkenli normal iid örneğine sahipseniz X1,…,Xn∼Np(μ,Σ)X1,…,Xn∼Np(μ,Σ)X_1, \ldots, X_n \sim N_p(\mu,\Sigma) ve (sıralama vektörü örnek bir noktadan [kare] Mahalanobis mesafe olan matris kullanılarak ağırlığı için), dağılımı ne örnek (Mahalanobis mesafe örnek kovaryans matrisi kullanılarak ortalama )?a Ad2i(b,A)=(Xi−b)′A−1(Xi−b)di2(b,A)=(Xi−b)′A−1(Xi−b)d_i^2(b,A) = (X_i - b)' A^{-1} (X_i - b)aaaAAA ˉ X Sd2i(X¯,S)di2(X¯,S)d_i^2(\bar X,S)X¯X¯\bar XSSS …

4
Herhangi bir MLE problemi için her zaman maksimize edici var mı?
Herhangi bir maksimum (log-) olabilirlik tahmini problemi için her zaman maksimize edicinin olup olmadığını merak ediyorum. Başka bir deyişle, MLE probleminin maksimize edicisi olmayan bir dağılım ve bazı parametreleri var mı? Sorum, MLE'deki maliyet fonksiyonunun (olasılık veya log olabilirlik, hangisinin amaçlandığından emin değilim) her zaman içbükey olduğu ve bu nedenle …

3
Artıkların otokorelasyonu nasıl test edilir?
Çok fiyatı olan iki sütunlu bir matrisim var (750). Aşağıdaki resimde, aşağıdaki doğrusal regresyonun kalıntılarını çizdim: lm(prices[,1] ~ prices[,2]) Görüntüye bakmak, artıkların çok güçlü bir otokorelasyonu gibi görünüyor. Ancak, bu artıkların kendiliğinden korelasyonunun güçlü olup olmadığını nasıl test edebilirim? Hangi yöntemi kullanmalıyım? Teşekkür ederim!

3
İkili ve sürekli değişken arasında rasgele ilişkilendirilmiş veri üretmek
İki değişken oluşturmak istiyorum. Bunlardan biri ikili sonuç değişkenidir (başarı / başarısızlık) ve diğeri yıllardır. Yaşın başarı ile pozitif olarak ilişkili olmasını istiyorum. Örneğin, yüksek yaş segmentlerinde düşükten daha fazla başarı olması gerekir. İdeal olarak, korelasyon derecesini kontrol edebilecek konumda olmalıyım. Bunu nasıl yaparım? Teşekkürler

3
Prediktif modelleme yarışmaları için siteler
Kaggle , TunedIt ve CrowdAnalytix ile ilgili tahminli modelleme yarışmalarına katılıyorum . Bu sitelerin istatistik / makine öğrenimi için "alıştırma yapmak" için iyi bir yol olduğunu düşünüyorum. Bilmem gereken başka siteler var mı? Ev sahibinin rakiplerin sunumlarından kâr elde etmek istediği yarışmalar hakkında ne düşünüyorsunuz? / edit: İşte daha eksiksiz …

4
Gözden geçiren kişi olarak, dergi olmasa bile, talep eden verileri ve kodun kullanılmasını haklı kılabilir miyim?
Bilim, yeniden üretilebilir olması gerektiğinden, tanım gereği, veri ve kodun veri ve kod paylaşımı için Yale Roundtable tarafından tartışıldığı gibi, yeniden üretilebilirliğin temel bir bileşeni olduğu konusunda artan bir farkındalık vardır . Veri ve kod paylaşımı gerektirmeyen bir dergi için bir makaleyi gözden geçirirken, veri ve kodun kullanılabilir olmasını isteyebilir …


3
R'deki ARIMA modeli için parametrelerin p-değeri nasıl hesaplanır?
R'de zaman serileri araştırması yaparken arima , sadece takılan modelin katsayı değerlerini ve standart hatalarını sağladığını buldum . Ancak, ben de katsayıların p değerini almak istiyorum. Sığır eti anlamını sağlayan hiçbir fonksiyon bulamadım. Bu yüzden bunu kendim hesaplamak istiyorum, ancak katsayıların t veya chisq dağılımındaki serbestlik derecesini bilmiyorum. Öyleyse benim …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.