İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

6
Lisans öğrencilerine gösterilebilecek iyi örnekler nelerdir?
CS-odaklı lisans öğrencilerine bu dönemin ikinci yarısında istatistik asistanı olarak istatistik öğreteceğim. Öğrencilerin çoğu dersi aldılar ve konuyu öğrenmeye teşviki yoktu ve sadece büyük gereksinimler için aldı. Konuyu ilginç ve kullanışlı hale getirmek istiyorum, sadece B + 'yı geçmeyi öğrendikleri bir sınıf değil. Bir saf matematik doktora öğrencisi olarak gerçek …

2
Regresyon sonuçlarında beklenmeyen üst sınır var
Bir denge skoru tahmin etmeye çalıştım ve birkaç farklı regresyon yöntemini denedim. Fark ettiğim bir şey, tahmin edilen değerlerin bir çeşit üst sınıra sahip olduğu görünüyor. Yani, gerçek denge , ancak tahminlerim yaklaşık . Aşağıdaki grafik, gerçek ile tahmin edilen dengeyi göstermektedir (doğrusal regresyon ile tahmin edilir):[ 0.0 , 1.0 …

1
L2, bir posterior kaybın hesaplanması için iyi bir kayıp fonksiyonuna ne örnek olabilir?
L2 kaybı, L0 ve L1 kaybı ile birlikte, posterior beklenen minimum kayıp ile posterior özetlenirken kullanılan üç yaygın "varsayılan" kayıp fonksiyonudur. Bunun bir nedeni belki de hesaplanması nispeten kolaydır (en azından 1d dağılımları için), L0 modda, L1 medyanda ve L2 ortalamadadır. Öğretirken, L0 ve L1'in makul kayıp fonksiyonları olduğu senaryolar …

2
LeNet'te nöronların alıcı alanı
CNN'in alıcı alanlarını daha iyi anlamaya çalışıyorum. Bunu yapmak için LeNet'teki her bir nöronun alıcı alanını hesaplamak istiyorum. Normal bir MLP için oldukça kolaydır (bkz. Http://deeplearning.net/tutorial/lenet.html#sparse-connectivity ), ancak bir veya daha fazla kıvrımlı katmanı takip eden bir katmanda bir nöronun alıcı alanını hesaplamak daha zordur ve havuz katmanları. 2. evrişimsel …

1
Eğer
İşte üniversitemizde bir kaç yıl önce çözmek için mücadele ettiğim bir sınava giren bir problem. Eğer X1,X2X1,X2X_1,X_2 bağımsızlar ββ\beta yoğunluklu rastgele değişkenler β(n1,n2)β(n1,n2)\beta(n_1,n_2) ve β(n1+12,n2)β(n1+12,n2)\beta(n_1+\dfrac{1}{2},n_2) sırasıyla sonra göstermek X1X2−−−−−√X1X2\sqrt{X_1X_2} şu β(2n1,2n2)β(2n1,2n2)\beta(2n_1,2n_2). Yoğunluğunu elde etmek için Jacobian yöntemini kullandım. Y=X1X2−−−−−√Y=X1X2Y=\sqrt{X_1X_2} Şöyleki: fY(y)=4y2n1B(n1,n2)B(n1+12,n2)∫1y1x2(1−x2)n2−1(1−y2x2)n2−1dxfY(y)=4y2n1B(n1,n2)B(n1+12,n2)∫y11x2(1−x2)n2−1(1−y2x2)n2−1dxf_Y(y)=\dfrac{4y^{2n_1}}{B(n_1,n_2)B(n_1+\dfrac{1}{2},n_2)}\int_y^1\dfrac{1}{x^2}(1-x^2)^{n_2-1}(1-\dfrac{y^2}{x^2})^{n_2-1}dx Aslında bu noktada kayboldum. Şimdi, ana makalede, bir ipucu …

1
T-testinin normalite varsayımı hakkında soru
T-testleri için, çoğu metne göre popülasyon verilerinin normal olarak dağıtıldığı varsayımı vardır. Bunun neden olduğunu anlamıyorum. Bir t-testi, sadece numune araçlarının örnekleme dağılımının popülasyonun değil normal olarak dağıtılmasını gerektirmez mi? Eğer t-testinin sonuçta örnekleme dağılımında normallik gerektirmesi durumunda, nüfus herhangi bir dağılıma benzeyebilir, değil mi? Makul bir örnek boyutu olduğu …

3
R mevsimsel zaman serisi
decomposeFonksiyonu kullanıyorum ve Raylık zaman serilerimin (trend, mevsimsel ve rastgele) 3 bileşenini buluyorum. Grafiği çizersem veya tabloya bakarsam, zaman serisinin mevsimsellikten etkilendiğini açıkça görebilirim. Bununla birlikte, zaman serisini 11 mevsimsel kukla değişkene gerilediğimde, tüm katsayılar istatistiksel olarak anlamlı değildir, bu da mevsimsellik olmadığını gösterir. Neden iki farklı sonuç bulduğumu anlamıyorum. …

1
İki değişkenli karışım dağılımıyla EM Algoritmasından yakınsama
Bir veri kümesinin maksimum olabilirlik tahmincisini bulmak istediğim bir karışım modelim var xxxve kısmen gözlenen bir veri kümesi . Beklenen verilen negatif log olasılığını en aza indirmek için E adımını ( verilen beklentisini ve mevcut parametreleri hesaplayarak ) ve M adımını uyguladım .zzzzzzxxxθkθk\theta^kzzz Anladığım kadarıyla, her yineleme için maksimum olasılık …



2
Günlük (p (x, y)) noktası karşılıklı bilgileri nasıl normalleştirir?
Normalleştirilmiş karşılıklı bilgi formunu anlamaya çalışıyorum. npmi=pmi(x,y)log(p(x,y))npmi=pmi(x,y)log(p(x,y))npmi = \frac{pmi(x,y)}{log(p(x,y))} Günlük eklemi olasılığı, noktasal karşılıklı bilgiyi neden [-1, 1] arasında normalleştiriyor? Noktasal karşılıklı bilgi: pmi=log(p(x,y)p(x)p(y))pmi=log(p(x,y)p(x)p(y))pmi = log(\frac{p(x,y)}{p(x)p(y)}) p (x, y) [0, 1] ile sınırlıdır, bu nedenle log (p (x, y)) (, 0] ile sınırlıdır. pay, ama tam olarak nasıl olduğunu anlamıyorum.Ayrıca …

1
“Sıfır hipotez istatistiksel testi” ile başka bir test arasındaki fark nedir?
Yakın tarihli bir tartışma konusu, dergiye gönderilen makalelerden "sıfır hipotez istatistiksel test prosedürlerinin (NHSTP)" kullanımını yasaklayan bir dergiyle ilgilidir. Bu terimin bazı yazarlar tarafından kullanıldığını görüyorum, ancak hangi ayrımı yapmaya çalıştıklarını anlamıyorum. NHSTP "hipotez testi" veya "anlamlılık testi" nden farklı bir şey midir?

1
“Düz önce” olan Bayes tahmini, maksimum olabilirlik tahmini ile aynı mıdır?
Filogenetikte, filogenetik ağaçlar genellikle MLE veya Bayesian analizi kullanılarak oluşturulur. Çoğu zaman, Bayesci tahmininde düz bir öncül kullanılır. Anladığım kadarıyla, Bayesci bir tahmin, bir önceliği içeren bir olasılık tahminidir. Benim sorum şudur: Eğer daha önce bir daire kullanırsanız, olasılık analizi yapmaktan farklı mıdır?

1
Yerel Aykırı Faktör (LOF) algılama analizi için k-değeri seçme
Üç boyutlu veri kümesi var ve en benzersiz veya garip değerleri belirlemek için yerel aykırı faktör analizi kullanmaya çalışıyorum. LOF analizinde kullanılacak k-değerine nasıl karar verilir? K-değerinin ne belirlediğini anlıyorum ve bu yüzden farklı k'ler kullanarak biraz farklı sonuçlar gördüğüme şaşırmadım, ancak veri setimin beni başkaları üzerinde bir değere doğru …

2
Kesilmiş ortalama ve medyan
Acil servise yapılan tüm çağrıları ve ambulans departmanının yanıt sürelerini içeren bir veri setim var. Kayıt sürelerinde bazı hatalar olduğunu itiraf ettiler, çünkü kayıt yapmaya başlamadıkları (yani değer 0) ya da saati durduramadıkları (böylece değer çok yüksek olabilir). Merkezi eğilimi öğrenmek istiyorum ve aykırı değerlerden kurtulmak için ortanca veya kesilmiş …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.