İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Ardışık oranları görselleştirme
4 kategorisi olan bazı tüketici verilerini görselleştirmeye çalışıyorum. Kullanıcılar farklı kategoriler arasında geçiş yapmakta serbesttir. Her bir birey için son üç veya dört anahtarı görselleştirmek istiyorum. Bu nedenle, 4 yığın oranına sahip bir sütun içeren bir arsa ile başlayacağız. Bundan sonra, her kategori insanların önceki vesileyle yaptıkları şeylere ayrılırken 16'mız …


1
Belge özetlemesinde günlük olabilirlik oranı
Başlangıçta yığın taşması üzerine sordum ve bu siteye yönlendirildi, işte gidiyor: Bazı denetimsiz içerik seçimi / çıkarma tabanlı belge özetleme yöntemlerini uyguluyorum ve ders kitabımın "günlük olabilirlik oranı" olarak adlandırdığı şeyle ilgili kafam karıştı. Jurafsky & Martin'in Konuşma ve Dil İşleme kitabı kısaca şöyle anlatıyor: Genellikle lambda (w) olarak adlandırılan …


2
Karışık modeller için Çapraz Doğrulama?
Meslektaşım ve ben bir dizi doğrusal ve doğrusal olmayan karışık efekt modeli takıyoruz. Gözlenen etkilerin nispeten genelleştirilebilir olduğunu doğrulayabilmemiz için, takılan modeller üzerinde çapraz doğrulama yapmamız isteniyor. Bu normalde önemsiz bir görevdir, ancak bizim durumumuzda, tüm verileri bir eğitim bölümüne ve ortak seviyeleri paylaşmayan bir test bölümüne (CV amaçları için) …

3
GPS izlemede bir tahmin sorunu
Sorun: Her ikisi de birbirleriyle iletişim kuran GPS aygıtlarıyla donatılmış, lider ve takipçi adlandırılan iki aracı (nokta nesneleri olarak alınır) düşünün . Amacı, takip etmektir keyfi düzlemde ikinci hareket ettikçe mümkün olduğu kadar yakın. Tüm GPS cihazlarının, önceden belirlenmiş bir ortalama ve önceden belirlenmiş bir kovaryans matrisi bir Dairesel Hata …

2
Bir zaman serisinin sıfır ortalama bölümünü bulmak için en son teknoloji yöntem (ler)
Ben sıfır ortalama ile bu bölümlere ve sıfır ortalama olmayan bu bölümlere bölümlere gerekir gürültülü zaman serisi var. Sınırları olabildiğince doğru bulmak önemlidir (sınırın tam olarak yattığı yer biraz özneldir). Bence bir cusum varyantı bunu yapmak için uyarlanabilir, çünkü cusum öncelikle tüm segmentasyon stratejisini tamamen unutulmamış bırakan tek değişiklikler bulmakla …

1
PACF manuel hesaplama
SAS ve SPSS'nin kısmi otokorelasyon fonksiyonu (PACF) için yaptığı hesaplamayı çoğaltmaya çalışıyorum. SAS'ta Proc Arima aracılığıyla üretilir. PACF değerleri, ilgili dizinin serinin gecikmeli değerleri üzerinde otomatik olarak yeniden gerilmesinin katsayılarıdır. İlgi değişkenim satışlar, bu yüzden lag1, lag2 ... lag12'yi hesaplıyorum ve aşağıdaki OLS regresyonunu çalıştırıyorum: Yt=a0+a1Yt−1+a2Yt−2+a3Yt−3+…+a12Yt−12.Yt=a0+a1Yt−1+a2Yt−2+a3Yt−3+…+a12Yt−12.Y_t=a_0+a_1Y_{t-1}+a_2Y_{t-2}+a_3Y_{t-3}+\ldots+a_{12}Y_{t-12}. Ne yazık ki elde …

4
Olasılık yoğunluk aralıklarını bulma
Vektörüm var x <- c(1,2,3,4,5,5,5,6,6,6,6, 7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7, 7,7,7,7,7,7,7,7,8,8,8,8,9,9,9,10) (gerçek vektörümün uzunluğu> 10.000'dir) ve yoğunluğun% 90'ının bulunduğu aralıkları bulmak istiyorum. Mi quantile(x, probs=c(0.05,0.95), type=5), en uygun ya da başka bir yolu var mı?
9 r 

2
Şu anda hangi veri ve istatistik becerileri yüksek talep görüyor ve nerede yüksek talep görüyorlar?
Bu gönderi hızla değişen bir olayla ilgilidir. Finansta veri analizi yapan bir işim var. Şu anki işim, endüstrimin geri kalanında veya diğer endüstrilerde olan şeylere çok fazla maruz kalmayacağım. Bayesci istatistikler hakkında oldukça bilgim var. Kendimi pazarlanabilir tutmak istiyorum, bu yüzden şu anda hangi veri ve istatistik becerilerinin yüksek talep …
9 careers 


1
Değişken sayıda derecelendirmeyle R'de değerlendiriciler arası güvenilirlik hesaplanıyor mu?
Wikipedia, değerlendiriciler arası güvenilirliğe bakmanın bir yolunun, sınıf içi korelasyonu hesaplamak için rastgele bir etki modeli kullanmak olduğunu ileri sürmektedir . Sınıf içi korelasyon örneği, σ2ασ2α+σ2ϵσα2σα2+σϵ2\frac{\sigma_\alpha^2}{\sigma_\alpha^2+\sigma_\epsilon^2} bir modelden Yij=μ+αi+ϵijYij=μ+αi+ϵijY_{ij} = \mu + \alpha_i + \epsilon_{ij} "Y burada ij j inci gözlem i inci grubu, μ gözlemlenmeyen genel ortalama α olduğu …

1
ACF grafiğindeki kesik çizgiler: R
Cowpertwait ve Metcalfe'nin 'R ile Tanıtım Zamanı Serisi' kitabından geçiyorum. Sayfa 36 Satırlar şöyle diyor: . Burada satırları olduğunu R forum okudum . −1/n±2/n−−√−1/n±2/n-1/n \pm 2/\sqrt{n}±1.96/n−−√±1.96/n\pm 1.96/\sqrt{n} Aşağıdaki kodu koştum: b = c(3,1,4,1) acf(b) ve görüyorum ki çizgiler . Peki, kitap yanlış mı? Yoksa yazılanları yanlış mı okuyorum? Yazarlar biraz …
9 r  time-series 


1
Tekdüze bir dağılımın sipariş istatistikleri için nasıl hesaplanır ?
Tezim için bir problemi çözmeye çalışıyorum ve nasıl yapacağımı göremiyorum. Düzgün dağılımdan rastgele alınan 4 gözlemim var . olasılığını hesaplamak istiyorum . . Derece istatistiğidir (gözlemlerimin en küçükten en büyüğe sıralanması için sipariş istatistiği alıyorum). Daha basit bir dava için çözdüm ama burada nasıl yapılacağımı kaybettim.(0,1)(0,1)(0,1)3X(1)≥X(2)+X(3)3X(1)≥X(2)+X(3)3 X_{(1)}\ge X_{(2)}+X_{(3)}X(i)X(i)X_{(i)} Tüm yardım …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.