İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
AIC ve zaman serilerinde çapraz onaylama: küçük örneklem durumu
Bir zaman serisi ayarında model seçimi ile ilgileniyorum. Somutluk için, farklı gecikme sıralarına sahip bir ARMA model havuzundan bir ARMA modelini seçmek istediğimi varsayalım. Nihai amaç tahmin etmek . Model seçimi yapılabilir çapraz doğrulama, bilgi kriterlerinin kullanılması (AIC, BIC), diğer yöntemlerin yanı sıra. Rob J. Hyndman, zaman serileri için çapraz …

3
Koordinat ve gradyan inişine karşı
İki algoritma için farklı kullanım durumlarının ne olduğunu merak ediyordum, Koordinat İniş ve Degrade İniş . Koordinat iniş işlevinin düzgün olmayan işlevlerle problemleri olduğunu biliyorum, ancak SVM ve LASSO gibi popüler algoritmalarda kullanılıyor. Ancak gradyan inişi, özellikle YSA'ların yeniden dirilişi ile ve diğer birçok makine öğrenim görevi için daha yaygın …

4
Veri dağıtımımın simetrik olup olmadığını nasıl anlarım?
Medyan ve ortalamanın yaklaşık olarak eşit olması durumunda bunun simetrik bir dağılım olduğu anlamına geldiğini biliyorum ama bu özel durumda emin değilim. Ortalama ve ortanca oldukça yakın (sadece 0,487m / safra farkı) ve bu da simetrik bir dağılım olduğunu söylememe yol açacak ancak kutu çizgisine bakıldığında, sanki biraz pozitif olarak …

2
Neden Wilks'in 1938'i yanlış tanımlanmış modellerde işe yaramaz?
Ünlü 1938 makalesinde (" Karmaşık hipotezlerin test edilme olasılığı oranının büyük örneklem dağılımı ", Matematiksel İstatistik Annals, 9: 60-62), Samuel Wilks, ( oranı) ' nın asimptotik dağılımını türetmiştir. iç içe hipotezler için, daha büyük hipotezin doğru bir şekilde belirtildiği varsayımı altında. Sınırlayıcı dağılımı (ki-kare) ile serbestlik derecesini daha hipotez ve …

2
Sert marj SVM'nin kayıp fonksiyonu nedir?
İnsanlar yumuşak marj menteşe kaybı fonksiyonunu kullandığını söylüyor: . Bununla birlikte, yumuşak marjlı SVM'nin en aza indirmeye çalıştığı asıl amaç işlevi \ frac {1} {2} \ | w \ | ^ 2 + C \ sum_i \ max (0,1-y_i (w ^ \ intercal x_i + b) ) Bazı yazarlar \ …

2
Otokorelasyon süresinin tanımı (etkin örneklem büyüklüğü için)
Literatürde zayıf durağan bir zaman serisinin otokorelasyon süresi için iki tanım buldum: τbir= 1 + 2 ∑k = 1∞ρke karşıτb= 1 + 2 ∑k = 1∞| ρk|τa=1+2∑k=1∞ρkversusτb=1+2∑k=1∞|ρk| \tau_a = 1+2\sum_{k=1}^\infty \rho_k \quad \text{versus} \quad \tau_b = 1+2\sum_{k=1}^\infty \left|\rho_k\right| burada gecikmesindeki otokorelasyondur . kρk= Cov [ Xt, Xt + h]Var [ …

3
Maksimum Entropi Dağılımının istatistiksel yorumu
Çeşitli ortamlarda birkaç dağıtımın kullanımını doğrulamak için maksimum entropi ilkesini kullandım; Bununla birlikte, henüz bilgi teorik olarak, maksimum entropinin yorumlanmasının aksine bir istatistik formüle edebildim. Başka bir deyişle, entropiyi en üst düzeye çıkarmak, dağılımın istatistiksel özellikleri hakkında ne anlama geliyor? Kimsenin karşısına geçip veya belki de maks. Bilgiye hitap etmeyen, …

2
“Fiducial” ne demek (istatistik bağlamında)?
İçin Google’ı "fisher" "fiducial" ... çok fazla hit alıyorum ama takip ettiğim her şey tamamen anladığımın ötesinde. Bütün bu hitlerin ortak bir özelliği var gibi görünüyor: hepsi yünlü boya istatistikçilerine, teoriye, uygulamaya, tarihe ve istatistiklerin bilgisine iyice sarılmış insanlar için yazılmıştır. (Bu nedenle, bu hesapların hiçbiri, jargon okyanuslarına başvurmadan ve …

4
Araştırmacılar neden bir doğrulama setinde test yapmak yerine 10 kat çapraz doğrulama kullanıyor?
Duygusal sınıflandırma ve ilgili konular hakkında birçok araştırma makalesi okudum. Çoğu, sınıflandırıcıları eğitmek ve test etmek için 10 kat çapraz doğrulama kullanır. Bu, ayrı bir test / doğrulama yapılmadığı anlamına gelir. Neden? Özellikle araştırma yapanlar için bu yaklaşımın avantajları / dezavantajları nelerdir?

6
Test doğruluğu eğitimden daha yüksek. Nasıl yorumlanır?
Birçok özelliğe sahip (1000'den yüksek) en fazla 150 örnek (eğitim ve teste bölünmüş) içeren bir veri setine sahibim. Sınıflayıcıları karşılaştırmalı ve veriler üzerinde iyi performans gösteren özellik seçme yöntemlerini kullanmalıyım. Bu nedenle, farklı sınıflandırma yöntemleri (Greedy, BestFirst) ile üç sınıflandırma yöntemi (J48, NB, SVM) ve 2 özellik seçim yöntemi (CFS, …

1
Kesikli verilerle Kolmogorov-Smirnov: R'de dgof :: ks.test'in doğru kullanımı nedir?
Acemi sorular: İki ayrı veri setinin aynı dağıtımdan gelip gelmediğini test etmek istiyorum. Bana bir Kolmogorov-Smirnov testi önerildi. Conover ( Pratik Parametrik Olmayan İstatistik , 3d), Kolmogorov-Smirnov Testinin bu amaç için kullanılabileceğini söylüyor, ancak davranışı, ayrık dağılımlarla “muhafazakar” ve burada ne anlama geldiğinden emin değilim. DavidR'in başka bir soru üzerine …

4
PCA için eksik değerlerin tahmini
prcomp()Fonksiyonu, R'de bir PCA (temel bileşen analizi) gerçekleştirmek için kullandım. Ancak, bu fonksiyonda na.actionparametrenin çalışmadığı bir hata var . Stackoverflow konusunda yardım istedim ; iki kullanıcı, NAdeğerlerle baş etmek için iki farklı yöntem sundu . Bununla birlikte, her iki çözümde de sorun, bir NAdeğer olduğunda, bu sıranın PCA analizinde düşmemesi …

3
AIC ve BIC numarası yorumlama
AIC (Akaike bilgi kriteri) ve BIC (Bayesian bilgi kriteri) tahminlerinin nasıl yorumlanacağına dair örnekler arıyorum. BIC'ler arasındaki negatif fark, bir modelin diğerine göre arka oranları olarak yorumlanabilir mi? Bunu kelimelere nasıl koyabilirim? BIC Örneğin = -2 diğer model üzerinde daha iyi bir modeli oran yaklaşık ima edebilir ?e2= 7.4e2=7.4e^2= 7.4 …

2
Çok değişkenli regresyon için rastgele ormanlar
giriş özellikleri ve d y çıkışları ile çoklu çıkış regresyon problemim var . Çıktılar karmaşık, doğrusal olmayan bir korelasyon yapısına sahiptir.dxdxd_xdydyd_y Regresyonu yapmak için rastgele ormanları kullanmak istiyorum. Söyleyebileceğim kadarıyla, regresyon için rastgele ormanlar yalnızca tek bir çıktıyla çalışıyor, bu yüzden rastgele ormanlar - Her çıkış için bir tane. Bu …

4
İstatistiksel hesaplama için C ++ kütüphaneleri
C / C ++ 'ya taşımak istediğim belirli bir MCMC algoritması var. Pahalı hesaplamanın çoğu zaten Cython üzerinden C cinsindendir, ancak tüm örnekleyiciyi derlenmiş bir dilde yazmayı istiyorum, böylece Python / R / Matlab / için herhangi bir paketleyici yazabilirim. Etrafı dürttükten sonra C ++ 'a yaslanıyorum. Tanıdığım birkaç kitaplık …
23 mcmc  software  c++  computing 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.