İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
Lojistik Regresyon, geleneksel işlev olmayan eğrileri nasıl üretebilir?
Lojistik regresyondaki işlevlerin nasıl çalıştığı (veya belki de bir bütün olarak işlev gördüğü) konusunda bazı temel karışıklıklarım olduğunu düşünüyorum. H (x) fonksiyonu görüntünün solunda görülen eğriyi nasıl üretir? Ben bu iki değişkenin bir komplo olduğunu görüyorum ama sonra bu iki değişken (x1 & x2) de fonksiyonun argümanları. Bir değişkenin bir …

5
Birleştirilmiş varyans "aslında" ne anlama geliyor?
Ben istatistiklerde bir çaylağım, bu yüzden lütfen bana burada yardımcı olabilir misiniz? Sorum şu: Havuzlanmış varyans aslında ne anlama geliyor? İnternette toplanmış varyans için bir formül aradığımda, aşağıdaki formülü kullanarak çok fazla literatür buluyorum (örneğin, burada: http://math.tntech.edu/ISR/Mathematical_Statistics/Introduction_to_Statistic_Tests/thispage/newnode19.html ): S2p=S21(n1−1)+S22(n2−1)n1+n2−2Sp2=S12(n1−1)+S22(n2−1)n1+n2−2\begin{equation} \label{eq:stupidpooledvar} \displaystyle S^2_p = \frac{S_1^2 (n_1-1) + S_2^2 (n_2-1)}{n_1 + n_2 …
15 variance  mean  pooling 

1
Çoklu impütasyondan sonra havuzlama kalibrasyon grafikleri
Çoklu impütasyondan sonra kalibrasyon grafiklerini / istatistiklerini birleştirme konusunda tavsiye istiyorum. Gelecekteki bir olayı tahmin etmek için istatistiksel modeller geliştirme ortamında (örneğin, hastaneden taburculuk sonrası hayatta kalmayı veya olayları tahmin etmek için hastane kayıtlarından elde edilen verileri kullanma), bazı çok fazla eksik bilginin olduğu hayal edilebilir. Birden fazla itimat, bu …

2
Beklenti Maksimizasyonu karışım modelleri için neden önemlidir?
Karışım modellerinde (Gauss Karışımı, Gizli Markov Modeli, vb.) Beklenen Maksimizasyon yöntemini vurgulayan birçok literatür vardır. EM neden önemlidir? EM, optimizasyon yapmanın bir yoludur ve degrade tabanlı yöntem (gradyan terbiyeli veya newton / yarı-newton yöntemi) veya BURADA tartışılan diğer gradyansız yöntem olarak yaygın olarak kullanılmaz . Buna ek olarak, EM'nin hala …


5
Bir regresyon modelini iyileştirmek için aykırı değerleri Ortalama Mutlak Hata kutu grafiğine göre düşürmek hile yapıyor mu?
Aşağıdaki kutu grafikte gördüğünüz gibi dört yöntemle test edilmiş bir tahmin modelim var. Modelin öngördüğü özellik 0-8 aralığındadır. Orada olduğunu fark edebilirsiniz biri üst sınır aykırı ve üç alt sınır aykırı tüm yöntemlerle gösterdi. Bu örnekleri verilerden kaldırmanın uygun olup olmadığını merak ediyorum. Yoksa bu tahmin modelini geliştirmek için bir …

5
olduğunda ortalama için güven aralığının yaklaşık hatası
Let {Xi}ni=1{Xi}i=1n\{X_i\}_{i=1}^n değerleri alınarak Rasgele değişkenlerin bir ailesi [0,1][0,1][0,1] bir ortalama sahip olan, μμ\mu ve varyans σ2σ2\sigma^2 . Ne zaman bilinirse kullanılarak ortalama için basit bir güven aralığı P ( | ˉ X - μ | > ε ) ≤ σ 2 ile verilir.σσ\sigmaP(|X¯−μ|>ε)≤σ2nε2≤1nε2(1).P(|X¯−μ|>ε)≤σ2nε2≤1nε2(1). P( | \bar X - \mu| …

1
Normal PCA ve olasılıklı PCA arasındaki fark nedir?
Normal PCA'nın gözlemlenen veriler için olasılık modelini takip etmediğini biliyorum. Peki PCA ve PPCA arasındaki temel fark nedir ? PPCA gizli değişken modelinde örneğin gözlenen değişkenleri , gizli (gözlemlenmeyen değişkenler x ) ve normal PCA'da olduğu gibi ortonormal olması gerekmeyen bir matris W bulunur . Normal PCA'yı düşünebileceğim bir başka …
15 pca 

3
Yüksek kayıp değerine rağmen iyi doğruluk
Basit bir sinir ağı ikili sınıflandırıcısının eğitimi sırasında çapraz entropi kullanarak yüksek bir kayıp değeri elde ederim. Buna rağmen, doğrulama setindeki doğruluk değeri oldukça iyi. Bunun bir anlamı var mı? Kayıp ve doğruluk arasında katı bir ilişki yok mu? Bu değerleri eğitim ve onaylama üzerine aldım: 0.4011 - acc: 0.8224 …

1
İki regresyon katsayısının oranının tarafsız bir tahmincisi mi?
Eğer uygun varsayalım doğrusal / lojistik regresyon , tarafsız bir tahmin amacı ile bir 1g(y)=a0+a1⋅x1+a2⋅x2g(y)=a0+a1⋅x1+a2⋅x2g(y) = a_0 + a_1\cdot x_1 + a_2\cdot x_2 . Hem çok eminizbir1vebir2Onların tahminlerine gürültü çok olumlu göredir.a1a2a1a2\frac{a_1}{a_2}a1a1a_1a2a2a_2 Eğer ortak kovaryansını varsa , sen hesaplamak ya da en azından bir cevap etkisi yaratabilir. Daha iyi yollar …

1
0 ile 1 arasında yanıt değişkeni olan karışık bir model nasıl takılır?
Ben lme4::glmer()ikili değil, ancak sıfır ile bir arasında sürekli bir değişken olan bir binom genelleştirilmiş karışık model (GLMM) sığdırmak için kullanmaya çalışıyorum . Bu değişken bir olasılık olarak düşünülebilir; aslında olan insan deneklerin (bir deney ben yardım analiz olarak) bildirilen olasılığı. Yani bu kadar değil bir "ayrık" fraksiyon, ancak sürekli …


4
Ne tür gerçek yaşam durumlarında çok kollu bir haydut algoritması kullanabiliriz?
Çok kollu haydutlar, seçenekleriniz olduğu ve hangisinin sağlığınızı en üst düzeye çıkaracağından emin olmadığınız durumlarda iyi çalışır. Algoritmayı bazı gerçek yaşam durumları için kullanabilirsiniz. Örnek olarak, öğrenme iyi bir alan olabilir: Bir çocuk marangozluk öğreniyorsa ve bu konuda kötü ise, algoritma ona muhtemelen devam etmesi gerektiğini söyleyecektir. Eğer bu konuda …

2
Biz frekansçılar gerçekten sadece örtük / farkında olmayan Bayesliler mi?
Belirli bir çıkarım problemi için, Bayesci bir yaklaşımın genellikle hem biçim olarak hem de fütürist bir yaklaşımdan kaynaklandığını biliyoruz. Sık sık (genellikle beni içerir) çoğu zaman yöntemlerinin bir önceliğe ihtiyaç duymadığına ve dolayısıyla "yargıya dayalı" olmaktan çok "veri güdümlü" olduğuna işaret eder. Tabii ki Bayesian bilgilendirici olmayan önceliklere işaret edebilir …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.