İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
Ölçek parametreleri için zayıf bilgilendirici önceki dağılımlar
Ölçeğin ne olması gerektiği hakkında kaba bir fikrim olduğunda, ölçek parametreleri için normal dağılımları log (normal dağılımlar, t dağılımları vb.) Olarak kullanıyorum, Bu konuda çok fazla. Bunu kullanıyorum çünkü bu kullanım benim için sezgisel bir anlam ifade ediyor, ancak başkalarının kullandığını görmedim. Bunun gizli bir tehlikesi var mı?

3
MaxEnt, ML, Bayes ve diğer istatistiksel çıkarım yöntemleri arasındaki karşılaştırma
Ben bir istatistikçiyim (matematiksel istatistikte bir dersim vardı ama bundan daha fazlası yok) ve son zamanlarda bilgi teorisi ve istatistik mekaniği okurken "belirsizlik ölçüsü" / "entropi" denilen bir şeyle tanıştım. Bunun için Khinchin türevini bir belirsizlik ölçüsü olarak okudum ve bana anlamlı geldi. Mantıklıydı bir veya daha fazla fonksiyon aritmetik …

2
Belge Benzerliğini Ölçme
Belgeleri kümelemek için (metin), belge çiftleri arasındaki benzerliği ölçmek için bir yol gerekir. İki alternatif: Cosine Benzerliği - ve TF / IDF kullanarak terimleri ağırlık olarak kullanarak belgeleri vektörler olarak karşılaştırın . Her belgenin olasılık dağılımını f-diverjans kullanarak karşılaştırın, örn. Kullback-Leibler diverjansı Bir yöntemi diğerine tercih etmek için sezgisel bir …

2
Model seçiminden sonra Çapraz Doğrulama (hata genellemesi)
Not: Dava n >> p İstatistiksel Öğrenme Öğelerini okuyorum ve çapraz doğrulama yapmanın "doğru" yoluyla ilgili çeşitli görüşler var (örneğin sayfa 60, sayfa 245). Spesifik olarak sorum, son modelin (ayrı bir test seti olmadan) k-fold CV kullanarak veya bir model araması yapıldığında önyükleme kullanarak nasıl değerlendirileceğidir? Çoğu durumda (gömülü özellik …


2
Bir eğilim çizgisinin bir güç yasasına uyumunun iyiliği nasıl ölçülür / tartışılır?
Bir eğilim çizgisine uymaya çalıştığım bazı verilerim var. Verilerin güç yasasını takip edeceğine inanıyorum ve bu nedenle verileri düz bir çizgi arayan log-log eksenlerinde çizdim. Bu (neredeyse) düz bir çizgi ile sonuçlandı ve bu yüzden Excel'de bir güç yasası için bir eğilim çizgisi ekledim. Bir istatistik olarak yeni, sorum şu, …

2
Öğrenme algoritmaları arasında nasıl seçim yapılır
Bazı eğitim verilerine dayanarak kayıtları 2 kategoride (doğru / yanlış) sınıflandıracak bir program uygulamam gerekiyor ve hangi algoritmaya / metodolojiye bakmam gerektiğini merak ediyordum. Seçilebilecek birçoğu var - Yapay Sinir Ağı, Genetik Algoritma, Makine Öğrenmesi, Bayes Optimizasyonu vs., ve nereden başlayacağımı bilmiyordum. Yani benim sorularım: Sorunum için kullanmam gereken bir …

3
Belirleme Katsayısı (
Değişkenler arasındaki varyasyon miktarını tanımlayan kavramını tam olarak kavramak istiyorum . Her ağ açıklaması biraz mekanik ve geniş. Kavramı "almak" istiyorum, sadece sayıları mekanik olarak kullanmakla değil.r2r2r^2 Örn: Çalışılan saat vs. test puanı rrr = .8 r2r2r^2 = .64 Peki, bu ne anlama geliyor? Test puanlarının değişkenliğinin% 64'ü saatlerce açıklanabilir …



3
Kök ortalama kare hatası (RMSE) ve standart sapma nasıl yorumlanır?
Diyelim ki bana öngörülen değerleri veren bir modelim var. Bu değerlerin RMSE'sini hesaplıyorum. Ve sonra gerçek değerlerin standart sapması. Bu iki değeri (varyanslar) karşılaştırmak anlamlı mı? Bence, eğer RMSE ve standart sapma benzer / aynı ise modelimin hatası / sapması gerçekte olanla aynıdır. Ancak bu değerleri karşılaştırmak mantıklı değilse, bu …

3
K katlama çapraz doğrulaması kullanırken bir test setine ihtiyacımız var mı?
K-kat doğrulaması hakkında okuyordum ve nasıl çalıştığını anladığımdan emin olmak istiyorum. Muhafaza yöntemi için, verilerin üç sete ayrıldığını ve test setinin yalnızca modelin performansını değerlendirmek için kullanıldığını, doğrulama setinin hiperparametreleri ayarlamak için kullanıldığını biliyorum. K-katlama yönteminde, yine de son için bir test seti tutuyor muyuz ve kalan verileri yalnızca eğitim …

4
Görüntünün entropisi
Bir görüntünün entropisini hesaplamanın en bilgi / fizik-teorik doğru yolu nedir? Şu anda hesaplama verimliliğini umursamıyorum - teorik olarak mümkün olduğunca doğru olmasını istiyorum. Gri ölçekli bir görüntü ile başlayalım. Sezgisel bir yaklaşım, görüntüyü bir piksel torbası olarak düşünmek ve hesaplamaktır ; burada , gri seviye sayısıdır ve , gri …

2
Ters dönüşüm yöntemi nasıl çalışır?
Tersine çevirme yöntemi nasıl çalışır? Rasgele bir numune olması demek yoğunluğu ile boyunca ve bu nedenle ile . Sonra inversiyon yöntemi ile olarak dağılımını elde ederim . X1,X2,...,XnX1,X2,...,XnX_1,X_2,...,X_nf(x;θ)=1θx(1−θ)θf(x;θ)=1θx(1−θ)θf(x;\theta)={1\over \theta} x^{(1-\theta)\over \theta} 0&lt;x&lt;10&lt;x&lt;10<x<1FX(x)=x1/θFX(x)=x1/θF_X(x)=x^{1/\theta}(0,1)(0,1)(0,1)XXXF−1X(u)=uθFX−1(u)=uθF_X^{-1}(u)=u^\theta Peki dağılımına sahip mi? Tersine çevirme yöntemi böyle mi çalışır?uθuθu^\thetaXXX u&lt;-runif(n) x&lt;-u^(theta)

2
Tıbbi bir kitle için güvenilir aralıklar nasıl özetlenir
Stan ve frontend paketleriyle rstanarmveya brmsBayesian yolunu daha önce yaptığım gibi kolayca analiz edebilirim lme. Masamda Kruschke-Gelman-Wagenmakers-vb. Tarafından yazılan kitapların ve makalelerin çoğuna sahip olmama rağmen, bunlar bana Bayesian'ın Skylla'sı ile tıbbi gözden geçirenlerin Charybdisleri arasında parçalanmış bir tıbbi izleyici için sonuçları nasıl özetleyeceğimi söylemiyor. "Biz o dağınık şeyleri değil …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.