İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Sınıflandırmada eğitim verilerinin üretilmesi için tabakalı ve rastgele örneklemenin faydaları
Orijinal veri kümesini sınıflandırma için eğitim ve test setine bölerken rastgele örnekleme yerine tabakalı örnekleme kullanmanın herhangi bir / bazı avantajları olup olmadığını bilmek istiyorum. Ayrıca, tabakalı örnekleme sınıflandırıcıya rastgele örneklemeden daha fazla yanlılık getirir mi? Veri hazırlama için tabakalı örnekleme kullanmak istediğim uygulama, orijinal veri kümesinin üzerinde eğitilmiş bir …

1
Otomatik kodlayıcılar için kayıp fonksiyonu
Biraz otomatik kodlayıcıları deniyorum ve tensorflow ile MNIST veri kümesini yeniden yapılandırmaya çalışan bir model oluşturdum. Ağım çok basit: X, e1, e2, d1, Y, burada e1 ve e2 katmanları kodlar, d2 ve Y katmanları çözer (ve Y yeniden yapılandırılmış çıktıdır). X'in 784 birimi, e1'in 100, e2'nin 50, d1'in tekrar 100 …

4
Keyfi bir kovaryans matrisi nasıl oluşturulur
Örneğin, içinde R, MASS::mvrnorm()işlev istatistiklerde çeşitli şeyleri göstermek için veri üretmek için kullanışlıdır. SigmaDeğişkenlerin kovaryans matrisini belirten simetrik bir matris olan zorunlu bir argüman alır . Rasgele girişlerle simetrik bir n×nn×nn\times n matrisi nasıl oluştururum ?

2
Her bir değeri vektörün toplamına bölebilsek de, softmax fonksiyonu olasılıkları hesaplamak için neden kullanılıyor?
Bir vektör üzerine softmax fonksiyonunun uygulanması, "olasılıklar" ve ile arasında değerler üretecektir . 000111 Ancak her bir değeri vektörün toplamına bölebiliriz ve bu da ile arasında olasılıklar ve değerler üretir .000111 Burada cevabı okudum ama her iki fonksiyon da farklı olsa da bunun nedeninin farklı olabileceğinden kaynaklandığını söylüyor.


5
İki değişkenli kütükler arasında doğrusal bir ilişkiye sahip olmanın sezgisel anlamı nedir?
Birbirine karşı çizildiğinde çok fazla korelasyon göstermeyen iki değişkenim var, ancak her bir değişkenin günlüklerini birbiriyle karşılaştırdığımda çok net bir doğrusal ilişki var. Böylece tür bir model ile sonuçlanır: log(Y)=alog(X)+blog⁡(Y)=alog⁡(X)+b\log(Y) = a \log(X) + b , ki bu matematiksel olarak harika ama normal bir doğrusal modelin açıklayıcı değerine sahip görünmüyor. …

1
lme () ve lmer () çakışan sonuçlar veriyor
Tekrarlanan ölçümlerle ilgili bazı problemleri olan bazı verilerle çalışıyorum. Arasındaki Bunu yaparken çok farklı davranış fark lme()ve lmer()benim test verileri kullanılarak ve neden bilmek istiyorum. Oluşturduğum sahte veri seti, her biri iki kez alınan 10 denek için boy ve kilo ölçümlerine sahiptir. Verileri, denekler arasında boy ve kilo arasında pozitif …

2
FPR (yanlış pozitif oran) - FDR (yanlış keşif oranı)
Aşağıdaki alıntı ünlü araştırma makalesinden gelmektedir. Storey & Tibshirani'nin (2003) genom geneli çalışmaları için istatistiksel önemi : Örneğin,% 5'lik bir yanlış pozitif oran, çalışmadaki gerçekten sıfır özelliklerin ortalama% 5'inin anlamlı olarak adlandırılacağı anlamına gelir. % 5'lik bir FDR (Yanlış Keşif oranı), önemli olarak adlandırılan tüm özellikler arasında, bunların% 5'inin ortalama …

9
Fazla takma ve takma
Aşırı takma ve yetersiz takma hakkında biraz araştırma yaptım ve tam olarak ne olduklarını anladım, ama nedenlerini bulamıyorum. Aşırı takma ve yetersiz takmanın başlıca nedenleri nelerdir? Bir model eğitiminde neden bu iki sorunla karşı karşıyayız?

3
Bu dağıtım için rasgele sayıları simüle etmenin bir yolunu bulma
Kümülatif dağıtım işlevi ile bir dağıtımdan sahte rasgele sayılar simüle R bir program yazmaya çalışıyorum: F(x)=1−exp(−ax−bp+1xp+1),x≥0F(x)=1−exp⁡(−ax−bp+1xp+1),x≥0F(x)= 1-\exp \left(-ax-\frac{b}{p+1}x^{p+1}\right), \quad x \geq 0 buradaa,b>0,p∈(0,1)a,b>0,p∈(0,1)a,b>0, p \in (0,1) Ters dönüşüm örneklemeyi denedim ama tersi analitik olarak çözülebilir görünmüyor. Bu soruna bir çözüm önerebilirseniz sevinirim

4
Ortalamanın (veya başka bir anın) olmadığı negatif olmayan ayrık dağılım örneği?
Scipy'de biraz iş yapıyordum ve negatif scipy grubunun bir üyesi olan bir konuşma, negatif olmayan ayrık rastgele bir değişkenin tanımlanmamış bir anı olup olmadığı ortaya çıktı. Doğru olduğunu düşünüyorum ama kullanışlı bir kanıtı yok. Herkes bu iddiayı gösterebilir / kanıtlayabilir mi? (veya bu hak talebinin doğru olmaması durumunda) Ayrık rasgele …

4
Günlük olasılık sadece bilinmeyenle başa çıkmanın bir yolu mu (burada kuantum fiziği konuşmak değil)?
Günlük olasılıkta (kuantum fiziği değil), olasılıklar gerçekten bilinmeyenlerin yerine geçiyor. Örneğin bir bozuk para alın. "Rastgele" diyoruz,% 50 kafa değişimi ve% 50 kuyruk şansı. Ancak, madalyonun yoğunluğunu, boyutunu ve şeklini tam olarak bilseydim; hava yoğunluğu; madalyonun ne kadar kuvvet çevirdiğini; tam olarak bu kuvvetin yerleştirildiği yer; madalyonun zemine mesafesi; vb., …

5
Olasılık ilkesinin * gerçekten * önemli olduğu bir örnek?
Orantılı olasılıklara sahip iki farklı savunulabilir testin, biri p-değerlerinin birbirinden büyüklük sırası olduğu, ancak alternatiflerin gücünün benzer olduğu, belirgin şekilde farklı (ve eşit derecede savunulabilir) çıkarımlara yol açabileceği bir örnek var mı? Gördüğüm tüm örnekler çok aptalca, bir binomu negatif bir binom ile karşılaştırıyor, burada birincinin p değeri% 7 ve …

3
Keras ile LSTM'deki input_shape parametresini anlama
"Sıra sınıflandırması için Yığılmış LSTM" (aşağıdaki kodu bakın) adlı Keras belgelerinde açıklanan örneği kullanmaya çalışıyorum ve input_shapeverilerim bağlamında parametre anlayamıyorum . Ben girdi olarak maksimum uzunluğu 31 dolgulu bir diziye tamsayılar kodlanmış 25 olası karakter dizisi bir matris var. Sonuç olarak, benim x_trainşekil (1085420, 31)anlamı vardır (n_observations, sequence_length). from keras.models …
20 lstm  keras  shape  dimensions 

4
Birden çok karşılaştırma “planlanmışsa”, yine de birden çok karşılaştırma için düzeltmeniz mi gerekiyor?
15'ten fazla 2x2 Chi Square testi yapan bir makaleyi inceliyorum. Birden fazla karşılaştırma için düzeltmeleri gerektiğini önerdim, ancak tüm karşılaştırmaların planlandığını söyleyerek cevap verdiler ve bu nedenle bu gerekli değil. Bunun doğru olmaması gerektiğini, ancak durumun bu olup olmadığını açıkça belirten herhangi bir kaynak bulamadığını düşünüyorum. Herkes bu konuda yardımcı …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.