İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
vs -test
Çok saygın (popüler) bir bilim dergisinde (Alman Başbakanı, 02/2013, s.36) ilginç bir deney hakkında (ne yazık ki kaynaksız) okudum. Dikkatimi çekti çünkü sezgisel olarak sonucun öneminden şüphe ettim, ancak sağlanan bilgiler istatistiksel testi çoğaltmak için yeterliydi. Araştırmacılar soğuk havada soğuk almanın soğuk algınlığı olasılığını artırıp artırmadığını merak ettiler. Böylece 180 …

1
Olasılıkların oranı ve PDF'lerin oranı
Kümeleme sorununu çözmek için Bayes kullanıyorum. Bazı hesaplamalar yaptıktan sonra iki olasılık oranını elde etme ihtiyacım var: P(A)/P(B)P(A)/P(B)P(A)/P(B) elde edebilme . Bu olasılıklar, bu cevapta açıklandığı gibi iki farklı 2D çok değişkenli KDE'nin entegrasyonu ile elde edilir :P(H|D)P(H|D)P(H|D) P(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A)=∬x,y:f^(x,y)&lt;f^(ra,sa)f^(x,y)dxdyP(A) = \iint_{x, y : \hat{f}(x, y) < \hat{f}(r_a, s_a)} \hat{f}(x,y)\,dx\,dy P(B)=∬x,y:g^(x,y)&lt;g^(rb,sb)g^(x,y)dxdyP(B)=∬x,y:g^(x,y)&lt;g^(rb,sb)g^(x,y)dxdyP(B) …

5
Özyinelemeli (çevrimiçi) düzenli en küçük kareler algoritması
Birisi beni Tikhonov Düzenlemesi (düzenli en küçük kareler) için çevrimiçi (özyinelemeli) bir algoritma yönünde gösterebilir mi? Çevrimdışı bir ayarda, λ'nın n katlama çapraz doğrulaması kullanılarak bulunduğu orijinal veri β^=(XTX+λI)−1XTYβ^=(XTX+λI)−1XTY\hat\beta=(X^TX+λI)^{−1}X^TY kullanarak \ hat \ beta = (X ^ TX + λI) ^ {- 1} X ^ TY değerini hesaplardım λλλ. Y …



2
MLE her zaman verilerimizin altında yatan PDF'yi bildiğimiz anlamına mı gelir ve EM bilmediğimiz anlamına mı gelir?
MLE (Maksimum Olabilirlik Tahmini) ve varsa EM'ye (Beklenti Maksimizasyonu) hangi bağlantıya ilişkin açıklığa kavuşturmak istediğim bazı basit kavramsal sorularım var. Anladığım kadarıyla, birisi "MLE'yi kullandık" derse, bu otomatik olarak verilerinin PDF'sinin açık bir modeline sahip oldukları anlamına mı gelir? Bana öyle geliyor ki cevabı evet. Başka bir deyişle, herhangi bir …

2
T-dağılımları yoğunluk fonksiyonunun arkasındaki sezgi
Student t-dağılımı hakkında çalışıyorum ve t-dağılımları yoğunluk işlevini nasıl türeteceğini merak etmeye başladım (wikipedia, http://en.wikipedia.org/wiki/Student%27s_t-distribution'dan ): f(t)=Γ(v+12)vπ−−√Γ(v2)(1+t2v)−v+12f(t)=Γ(v+12)vπΓ(v2)(1+t2v)−v+12f(t) = \frac{\Gamma(\frac{v+1}{2})}{\sqrt{v\pi}\:\Gamma(\frac{v}{2})}\left(1+\frac{t^2}{v} \right)^{-\frac{v+1}{2}} burada , serbestlik derecesidir ve , gama işlevidir. Bu işlevin sezgisi nedir? Yani, binom dağılımının olasılık kütle işlevine bakarsam, bu bana mantıklı geliyor. Ama t-dağılımları yoğunluk fonksiyonu benim için hiçbir …

10
Belirli istatistiksel anlamları olan yaygın kelimeler
Ben istatistikçi değilim ama araştırmalarımda istatistikler (verileri analiz etme, literatür okuma vb.) Var. Burada yayınlanan sorularımdan birine yapılan bir yorumdan , istatistik alanında iyi uygulanmış kişiler için özellikle belirli anlamlara veya çağrışımlara sahip bazı ortak kelimeler olduğunu hatırlattım . Bu tür kelimelerin bir listesine sahip olmak yardımcı olacaktır ve bazı …

2
Önyüklenmiş p-değerlerini çarpma ile çarpan veri kümelerinde nasıl bir araya getirebilirim?
Ben çarpma impute (MI) verilerinden tahmini için p-değeri bootstrap istiyorum , ama bana p-değerleri MI kümeleri arasında nasıl birleştirileceği net değil.θθ\theta MI veri kümeleri için, tahminlerin toplam varyansına ulaşmak için standart yaklaşım Rubin'in kurallarını kullanır. MI veri kümelerinin havuzlanması için buraya bakınız . Toplam varyansın karekökü standart bir hata tahmini …

2
Neden bazı insanlar ham verileri üzerinde regresyon benzeri model varsayımlarını test ederken, diğer insanlar bunları artık üzerinde test ediyor?
Deneysel psikoloji doktora öğrencisiyim ve verilerimi nasıl analiz edeceğime ilişkin bilgi ve becerilerimi geliştirmek için çok uğraşıyorum. Psikoloji'deki 5. yılıma kadar, regresyon benzeri modellerin (örneğin, ANOVA) aşağıdakileri varsaydığını düşündüm: verilerin normalliği veriler için varyans homojenliği vb. Lisans derslerim, varsayımların verilerle ilgili olduğuna inanmamı sağlıyor. Ancak 5. sınıfımda bazı eğitmenlerim varsayımların …

5
Terim sıklığı / ters belge sıklığı (TF / IDF): ağırlıklandırma
1000 belgeyi ve içinde görünen tüm kelimeleri temsil eden bir veri setim var. Böylece satırlar belgeleri ve sütunlar kelimeleri temsil eder. Yani, örneğin, hücrede değer kez kelimenin açılımı belgede oluşur . Şimdi, tf / idf yöntemini kullanarak kelimelerin 'ağırlıklarını' bulmak zorundayım, ama aslında bunu nasıl yapacağımı bilmiyorum. Birisi bana yardım …

5
John Kerrich Coin-flip Verileri
2.Dünya Savaşı sırasında John Kerrich tarafından gerçekleştirilen 10.000 jetonun (yani, 10.000 baş ve kuyrukun) tüm sonuçlarını nereden elde edebileceğinizi önerebilir misiniz?


4
Çok büyük numune boyutları için uygunluk
Her gün çok büyük kategorik veri örnekleri (&gt; 1.000.000) topluyorum ve veri toplamadaki hataları tespit etmek için verilerin günler arasında "önemli ölçüde" farklı göründüğünü görmek istiyorum. Uygun bir test (özellikle bir G-testi) kullanmanın bunun için iyi bir seçim olacağını düşündüm. Beklenen dağılım, bir önceki günün dağılımı ile verilir. Ancak, örnek …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.