İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Uyum iyiliği ve doğrusal regresyon veya Poisson seçilecek model
Araştırmamda iki büyük ikilemle ilgili bazı tavsiyelere ihtiyacım var, bu da 3 büyük ilaç ve yenilik örneği. Yıllık patent sayısı bağımlı değişkendir. Sorularım İyi bir model için en önemli kriterler nelerdir? Daha fazla / daha az önemli olan nedir? Değişkenlerin çoğunun veya tamamının anlamlı olması mı? "F İSTATİSTİK" in sorunu …

3
K-ortalamaları için boşluk istatistiği, açıkça iki tane olmasına rağmen neden bir küme öneriyor?
Verilerimi kümelemek için K-araçlarını kullanıyorum ve "en uygun" küme numarasını önermek için bir yol arıyordum. Boşluk istatistikleri, iyi bir küme numarası bulmanın yaygın bir yolu gibi görünmektedir. Herhangi bir nedenle 1'i optimum küme numarası olarak döndürür, ancak verilere baktığımda 2 küme olduğu açıktır: Ben R boşluğu şöyle çağırır: gap <- …

5
SVM veya Sinir Ağı kullanılırken kategorik değişkeni sayısal değişkene yeniden kodlama
SVM veya Sinir Ağını kullanmak için, kategorik değişkenleri sayısal değişkenlere dönüştürmesi (kodlaması) gerekir, bu durumda normal yöntem 0-1 ikili değerleri, k. Kategorik değeri (0,0, .. olarak dönüştürülür) kullanmaktır. ., 1,0, ... 0) (1, k-th konumundadır). Bunu yapmak için başka yöntemler var mı, özellikle de 0-1 gösteriminin Sinir Ağı'nda oldukça istenen …

3
Örneklem büyüklüğü arttıkça t dağılımı neden daha normal hale geliyor?
Wikipedia'ya göre, örnekler normal olarak dağılmış bir popülasyonun gözlemleri olduğunda, t-dağılımının t-değerinin örnekleme dağılımı olduğunu anlıyorum. Ancak, bunun neden t-dağılımının şeklinin yağ kuyrukludan neredeyse mükemmel normale değişmesine neden olduğunu sezgisel olarak anlamıyorum. Normal bir dağılımdan örnek alıyorsanız, o zaman büyük bir örnek alırsanız bu dağılıma benzeyecektir, ancak neden yağ kuyruklu …

2
Yapısal Eşitlik Modelleri (SEM) ve Bayes Ağları (BN'ler)
Buradaki terminoloji bir karmaşa. "Yapısal eşitlik", "mimari köprü" kadar belirsizdir ve "Bayes ağı" özünde Bayes değildir . Daha da iyisi, nedensellik tanrısı Judea Pearl , iki model okulunun neredeyse aynı olduğunu söylüyor . Peki, önemli farklar nelerdir? (Benim için şaşırtıcı olan, SEM'ler için Wikipedia sayfası, bu yazıdan itibaren "ağ" kelimesini …

3
Normal olmayan numunenin örnek varyansının asimptotik dağılımı
Bu yarattığı konunun daha genel bir tedavidir bu soruya . Örnek varyansının asimptotik dağılımını türettikten sonra standart sapma için ilgili dağılıma ulaşmak için Delta yöntemini uygulayabiliriz. Boyutu bir örnek olsun IID bir normal olmayan rastgele değişken , ortalama ve varyans . Örnek ortalamasını ve örnek varyansını nnn{Xi},i=1,...,n{Xi},i=1,...,n\{X_i\},\;\; i=1,...,nμμ\muσ2σ2\sigma^2x¯=1n∑i=1nXi,s2=1n−1∑i=1n(Xi−x¯)2x¯=1n∑i=1nXi,s2=1n−1∑i=1n(Xi−x¯)2\bar x = …

5
“Olasılık, sadece çarpımsal orantılılık sabiti kadar tanımlanır” ne anlama gelir?
Yazarların görünüşte yeni başlayanlar için bir giriş olarak Bayes Teoremine yönelik maksimum olasılık tahmini tartışmasından yola çıktığı bir makale okuyorum . Bir olasılık örneği olarak, bir binom dağılımı ile başlarlar: p(x|n,θ)=(nx)θx(1−θ)n−xp(x|n,θ)=(nx)θx(1−θ)n−xp(x|n,\theta) = \binom{n}{x}\theta^x(1-\theta)^{n-x} ve sonra her iki tarafı da günlüğe kaydet ℓ(θ|x,n)=xln(θ)+(n−x)ln(1−θ)ℓ(θ|x,n)=xln⁡(θ)+(n−x)ln⁡(1−θ)\ell(\theta|x, n) = x \ln (\theta) + (n-x)\ln (1-\theta) …

1
Sıralı lojistik regresyonu çizmek ve yorumlamak
Ben 1 (kolay değil) 5 (çok kolay) arasında değişen bir sıralı bağımlı değişken, kolaylık var. Bağımsız faktörlerin değerlerindeki artışlar, artan kolaylık derecesi ile ilişkilidir. Bağımsız değişkenlerimden ikisi ( condAve condB) kategoriktir, her biri 2 seviyeli ve 2 ( abilityA, abilityB) süreklidir. R'de sıralı paketi kullanıyorum , burada inandığım şeyi kullanıyor …

2
Sinir ağının kara kutu olarak anlamı nedir?
İnsanların sinir ağları hakkında, ne yaptığını veya ne anlama geldiğini anlamadığınız bir kara kutu gibi konuştuğunu sık sık duyuyorum. Aslında bunun ne anlama geldiğini anlayamıyorum! Geri yaymanın nasıl çalıştığını anlarsanız, o zaman bir kara kutu nasıl olur? Onlar, ağırlıkların nasıl hesaplandığını veya neyi anlamadığımızı mı kastediyorlar?

2
Bir faktör / değişken için nasıl “kontrol” yaparsınız?
Anladığım kadarıyla, "Kontrol" istatistiğin iki anlamı olabilir. Kontrol grubu: Bir deneyde, kontrol grubu üyesine herhangi bir tedavi verilmez. Örn: Plasebo ve Uyuşturucu: "Kontrollü deney" olarak da adlandırılan diğer gruba (kontrol) değil, bir gruba ilaç verirsiniz. Bir değişken için kontrol: Belirli bir bağımsız değişkenin etkisini ayırma tekniği. Bu tekniklere verilen diğer …

4
Lme4 (> 1.0) ile donatılmış bir binom GLMM'nin uygunluğu nasıl değerlendirilir?
Ben bir binom dağılımı ve logit bağlantı fonksiyonu ile bir GLMM var ve verilerin önemli bir yönünün modelde iyi temsil olmadığını hissediyorum. Bunu test etmek için, verilerin logit ölçeğinde doğrusal bir fonksiyon tarafından iyi tanımlanıp tanımlanmadığını bilmek istiyorum. Bu nedenle, artıkların iyi davranıp davranmadığını bilmek istiyorum. Ancak, hangi artıkların arsa …

2
Fisher Information matrisi neden yarı yarıya pozitif?
Let θ ∈ Rnθ∈R,n\theta \in R^{n} . Fisher Bilgi Matrisi şu şekilde tanımlanır: ben( θ)ben , j,= - E[ ∂2günlük( f(X| θ ) )∂θben∂θj|||θ ]ben(θ)ben,j=-E[∂2günlük⁡(f(X|θ))∂θben∂θj|θ]I(\theta)_{i,j} = -E\left[\frac{\partial^{2} \log(f(X|\theta))}{\partial \theta_{i} \partial \theta_{j}}\bigg|\theta\right] Fisher Information Matrix'in pozitif semidefinite olduğunu nasıl kanıtlayabilirim?



2
R'deki lojistik büyüme eğrilerine uymanın en acısız yolu nedir?
Bu, Google için diğer bazı şeyler kadar kolay değil, açıkçası, kategorik değişkenleri tahmin etmek için regresyon kullanmak anlamında lojistik regresyondan bahsetmiyorum. Verilen veri noktalarına bir lojistik büyüme eğrisi yerleştirmekten bahsediyorum. Spesifik olarak, , 1958'den 2012'ye kadar verilen bir yıl ve y , x yılının Kasım ayında tahmini küresel CO2 ppm'dir …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.