İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


1
Birden fazla gizli sınıf modelinden sonuçları görselleştirme
İkili değişkenler kümesine dayalı bir gözlem örneğini kümelemek için gizli sınıf analizi kullanıyorum. R ve poLCA paketini kullanıyorum. LCA'da, bulmak istediğiniz küme sayısını belirtmeniz gerekir. Pratikte, insanlar genellikle her biri farklı sayıda sınıf belirten birkaç model çalıştırır ve daha sonra verilerin hangisinin "en iyi" açıklaması olduğunu belirlemek için çeşitli kriterler …


2
Gauss-Markov teoremi: MAVİ ve OLS
Wikipedia'da Guass-Markov teoremini okuyorum ve birinin teoremin ana noktasını bulmama yardım edebileceğini umuyordum. Matris biçiminde doğrusal bir model olduğunu varsayıyoruz: ve biz MAVİ, arıyoruz .y=Xβ+ηy=Xβ+η y = X\beta +\eta βˆβ^ \widehat\beta Uygun olarak , bu , bir işaretleyebilecek ve "kalıntı" "hatası". (Yani Gauss-Markov sayfasındaki kullanımın tersi).η=y−Xβη=y−Xβ\eta = y - X\betaε=βˆ−βε=β^−β\varepsilon …

3
Fisher'ın kesin testindeki test istatistiği nedir?
2 2 ile ihtimal tablosundan, bazı bahsedilen Fisher'in kesin testi sayısı kullanan Test istatistik olarak tabloda (1,1), hücre içinde, ve sıfır hipotezi altında irade hipergeometrik dağılım gösterir.X1 , 1X1,1X_{1,1}X1 , 1X1,1X_{1,1} Bazıları test istatistiklerinin burada , null altındaki hipergeometrik dağılımın (yukarıda belirtilen) ortalamasıdır. Ayrıca p-değerlerinin hipergometrik dağılım tablosuna göre belirlendiği …

2
Eşitsiz varyans altında Mann-Whitney null hipotezi
Mann-Whitney U testinin geçersiz hipotezini merak ediyorum. Genellikle sıfır hipotezinin iki popülasyonun eşit dağılımlara sahip olduğunu ifade ettiğini görüyorum. Ama düşünüyorum - aynı ortalama ancak son derece eşit olmayan bir varyansa sahip iki normal popülasyonum olsaydı, Mann-Whitney testi muhtemelen bu farkı tespit etmezdi. Mann-Whitney testinin sıfır hipotezinin Pr ( X> …

1
Tip III karelerin toplamları
Bir kategorik değişken (erkek ve dişi) ve bir sürekli değişken ile doğrusal bir regresyon modelim var .birAABBB R ile kontrast kodları ayarladım options(contrasts=c("contr.sum","contr.poly")). Ve şimdi , için Tip III toplamları kareleri ve bunların etkileşimlerini (A: B) kullanıyorum .birAABBBdrop1(model, .~., test="F") Sıkıştığım şey için karelerin toplamının nasıl hesaplandığı . BenBBB öyle …

1
Lojistik regresyon modeli değişkenlerinin p-değerinin anlamı
Bu yüzden R'deki lojistik regresyon modelleri ile çalışıyorum. İstatistiklere hala yeniyim, ancak şimdiye kadar regresyon modelleri için biraz anlayışım var gibi hissediyorum, ama yine de beni rahatsız eden bir şey var: Bağlantılı resme baktığımda, oluşturduğum örnek bir model için özet R baskılarını görüyorsunuz. Model veri kümesindeki email refound veya olmasın …

1
EFA açıkça bir faktör destekliyor, önlem dahili olarak tutarlı, ancak CFA zayıf uyum var?
10 maddelik bir öz bildirim ölçüsünün psikometrik özelliklerini araştırıyorum. İki bağımsız örneklemde yaklaşık 400 vakam var. Maddeler 4'lü Likert skalalarında tamamlandı. Bir EFA açıkça tek faktörlü bir çözümü destekler (örneğin 6'nın üzerinde ilk özdeğer, 1'in altındaki tüm diğerleri) ve Cronbach alfa iyidir (ör. .90). Hiçbir öğenin öğe-toplam korelasyonu düşük değildir. …

2
O (1) güncelleme verimliliği ile sağlam ortalama tahmini
Belirli bir özelliğe sahip ortalamanın sağlam bir tahminini arıyorum. Bu istatistiği hesaplamak istediğim bir dizi unsurum var. Sonra, her seferinde bir tane yeni eleman ekliyorum ve her ek eleman için istatistiği (çevrimiçi algoritma olarak da bilinir) yeniden hesaplamak istiyorum. Bu güncelleme hesaplamasının hızlı olmasını, tercihen O (1), yani listenin boyutuna …

1
GPS tabanlı raporlardan bilinmeyen sayıda gerçek dünya yeri belirleme
Birkaç GPS tabanlı raporlardan gerçek dünya konumlarını (fe hız kameraları) belirlemesi gereken bazı yazılımlar üzerinde çalışıyorum . Bir kullanıcı bir konum bildirirken araç kullanıyor olacak, bu nedenle raporlar çok yanlış. Bu sorunu çözmek için aynı yerle ilgili raporları kümelendirmeli ve bir ortalama hesaplamalıyım. Sorum bu raporların nasıl kümeleneceği ile ilgili …

2
Sezonluk ve trendle ARIMA tahmini, garip sonuç
ARIMA modelleri ile öngörüye adım attığım için, ARIMA'nın mevsimsellik ve sapmaya uygun bir tahminini nasıl geliştirebileceğimi anlamaya çalışıyorum. Verilerim aşağıdaki zaman serisidir (3 yıldan fazla, açık eğilim yukarı ve görünür mevsimsellik ile, 12, 24, 36 gecikmelerde otokorelasyon tarafından desteklenmiyor gibi görünüyor). > bal2sum3years.ts Jan Feb Mar Apr May Jun Jul …


1
Dinamik Zaman Çözgü ve normalleştirme
Bir "sorgu" ve bir "şablon" eğrisi maç ve şimdiye kadar makul bir başarı elde etmek için Dinamik Zaman Çözgü kullanıyorum, ama bazı temel soruları var: DTW sonucunun sezgisel olarak bulduğum bir eşik değerden daha düşük olup olmadığını değerlendirerek bir "maç" ı değerlendiriyorum. DTW kullanarak bir “eşleşme” belirlemenin genel yaklaşımı bu …

2
Gerçek verilerden “demo” verileri oluşturma: şekil değiştirmeden gizleme
(Bunu ne ile etiketleyeceğime dair gerçek bir fikrim yok çünkü istatistikçi değilim ve bunun hangi alana girdiğini bilmiyorum. Daha uygun etiketler eklemekten çekinmeyin.) Veri analiz yazılımı üreten bir şirkette çalışıyorum ve en son ürünümüzü test etmek ve tanıtmak için iyi bir veri setine ihtiyacımız var. Veritabanını rastgele bir sayı üretecinin …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.