İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


1
Sınıflandırıcı ve model ve tahminci
Sınıflandırıcı, model ve kestirimci arasındaki fark nedir? Ne söyleyebilirim: bir tahminci regresyon algoritmasından elde edilen bir yordayıcıdır bir sınıflandırıcı, bir sınıflandırma algoritmasından bulunan bir yordayıcıdır bir model hem bir tahmin edici hem de bir sınıflandırıcı olabilir Ancak çevrimiçi görünmekten, bu tanımların karışık olabileceği anlaşılıyor. Peki, makine öğrenimi bağlamındaki gerçek tanımlar …

2
Büzülme neden gerçekten işe yarıyor, 0 hakkında bu kadar özel olan ne?
Bu sitede aynı sorundan bahseden bir yazı zaten var: Büzülme neden işe yarıyor? Ancak, cevaplar popüler olmasına rağmen, sorunun özünün gerçekten ele alındığına inanmıyorum. Tahminde bazı yanlılıkların ortaya çıkmasının varyansta azalmaya neden olduğu ve tahmin kalitesini artırabileceği oldukça açıktır. Ancak: 1) Önyargı getirerek verilen hasar neden varyans kazancına kıyasla daha …

2
Marjinal dağılım / marjinal olasılık neden “marjinal” olarak tanımlanıyor?
Marjinal genellikle küçük bir etki, daha büyük bir sistemin dışında olan bir şey anlamına gelir. "Marjinal" olarak tanımlanan her şeyin önemini azaltma eğilimindedir. Peki bu, rastgele değişkenlerin bir alt kümesinin olasılığı için nasıl geçerlidir? Kelimelerin anlamları nedeniyle kullanıldığını varsayarsak, matematikte riskli bir öneri olabilir, bu yüzden burada mutlaka bir cevap …


3
Doğrusal regresyonun kantil regresyona göre avantajları nelerdir?
Doğrusal regresyon modeli varsayımları bir demet yapar dilim regresyon doğrusal regresyon varsayımları yerine getirilmesi halinde ve, sonra benim sezgi (ve bazı çok sınırlı deneyimi) medyan regresyon doğrusal regresyon olarak hemen hemen aynı sonuçları vereceğini olduğunu gelmez. Peki, lineer regresyonun ne gibi avantajları vardır? Kesinlikle daha tanıdık, ama bundan başka?

2
GLM'lerde aşırı dağılım testleri gerçekten * faydalı mıdır?
Bir GLM'deki 'aşırı dağılım' olgusu, yanıt değişkeninin varyansını kısıtlayan bir model kullandığımızda ortaya çıkar ve veriler model kısıtlamasının izin verdiğinden daha fazla varyans gösterir. Bu, sayı verilerini bir Poisson GLM kullanarak modellerken yaygın olarak ortaya çıkar ve iyi bilinen testlerle teşhis edilebilir. Testler, aşırı dağılımın istatistiksel olarak önemli bir kanıtı …

7
Yüzde verilerime ne tür bir eğri (veya model) sığdırmalıyım?
Viral kopyalar ve genom kapsama alanı (GCC) arasındaki ilişkiyi gösteren bir figür oluşturmaya çalışıyorum. Verilerim şöyle görünüyor: İlk başta, doğrusal bir gerileme planladım, ancak amirlerim bunun yanlış olduğunu ve sigmoidal bir eğri denememi söylediler. Bu yüzden geom_smooth kullanarak bunu yaptım: library(scales) ggplot(scatter_plot_new, aes(x = Copies_per_uL, y = Genome_cov, colour = …

1
İki karar ağacının toplamı tek bir karar ağacına eşit mi?
İki regresyon ağaçları (ağaç A ve ağaç B) bu harita giriş olduğunu varsayalım çıkışına . Let ağaç A ve için ağaç B için her bir ağaç ayırma işlevleri gibi hiperdüzlemleri ile, ikili böler kullanır.x ∈ Rdx∈R,dx \in \mathbb{R}^dy^∈ Ry^∈R,\hat{y} \in \mathbb{R}y^= fbir( x )y^=fbir(x)\hat{y} = f_A(x)fB( x )fB(x)f_B(x) Şimdi, ağaç …

2
Sayısal istatistiklerde rasgele sayı üretmenin bazı önemli kullanım alanları nelerdir?
Rasgele sayı üreteçleri (RNG'ler) hesaplama istatistiklerinde nasıl ve neden önemlidir? Her iki hipoteze karşı önyargıdan kaçınmak için birçok istatistiksel test için örnek seçerken rasgeleliğin önemli olduğunu anlıyorum, ancak rasgele sayı üreticilerinin önemli olduğu diğer hesaplama istatistiklerinin alanları var mı?

2
Karışık modellerde parametre kestirimi hakkında sezgi (varyans parametreleri ve koşullu modlar)
Rastgele efektlerin (BLUP'lar / koşullu modlar, örneğin özneler için) doğrusal bir karma efekt modelinin parametreleri olmadığını, bunun yerine tahmini varyans / kovaryans parametrelerinden türetilebileceğini birçok kez okudum. Örneğin, Reinhold Kliegl ve diğ. (2011) devlet: Rastgele etkiler, deneklerin genel ortalama RT'den sapmaları ve deneklerin sabit etki parametrelerinden sapmalarıdır. Bağımsız ve normal …

3
Basit chi kare testi yerine glm () kullanımı
glm()R'de kullanılan sıfır hipotezlerini değiştirmekle ilgileniyorum. Örneğin: x = rbinom(100, 1, .7) summary(glm(x ~ 1, family = "binomial")) olduğu hipotezini test eder . Boş değeri p = içinde rasgele bir değere değiştirmek istersem ne olur ? p=0.5p=0.5p = 0.5pppglm() Ben bu konuda da yapılabilir biliyorum prop.test()ve chisq.test()ama kullanma fikrini keşfetmek …

3
Bir değişkeni kontrol etmek ne zaman uygunsuz olur?
En az bir naif örnek düşünebilirim. X ve Z arasındaki ilişkiyi incelemek istediğimi varsayalım. Y'nin Z'yi etkilediğinden de şüpheliyim, bu yüzden Y'yi kontrol ediyorum. Y için, X ve Z arasındaki ilişkiyi "örtüyorum", çünkü X, Y verilen Z'den bağımsızdır. Şimdi, önceki örnekte, çalışmam gereken ilişkiler X ve Y ile Y ve …

3
Küçük bir Doğrulama seti kullanabilir miyim?
Verileri bir Test kümesine ve Doğrulama kümesine bölmenin arkasındaki nedeni anlıyorum. Ayrımın büyüklüğünün duruma bağlı olacağını, ancak genellikle 50/50 ila 90/10 arasında değişeceğini de anlıyorum. Yazımı düzeltmek ve ~ 5m cümlelerden oluşan bir veri kümesiyle başlamak için bir RNN oluşturdum. 500k cümle tıraş ettim ve kalan ~ 4.5m cümle ile …

5
Neden ?
Sanırım P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B)=P(A|B,C)∗P(C)+P(A|B,¬C)∗P(¬C)P(A|B) = P(A | B,C) * P(C) + P(A|B,\neg C) * P(\neg C) oysa doğru P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B)=P(A|B,C)+P(A|B,¬C)P(A|B) = P(A | B,C) + P(A|B,\neg C) yanlış. Ancak, daha sonra ilgili bir "sezgi" var, yani, iki vakayı (C veya C değil) bölerek P (A | B) olasılığını düşünürsünüz. Bu sezgi neden yanlış?

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.