İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Negatif olmayan sırt regresyonu nasıl yapılır?
Negatif olmayan sırt regresyonu nasıl yapılır? Negatif olmayan kement mevcuttur scikit-learn, ancak sırt için betaların olumsuzluklarını zorlayamam ve gerçekten de negatif katsayılar alıyorum. Bunun neden olduğunu bilen var mı? Ayrıca, en küçük kareler açısından sırt uygulayabilir miyim? Bunu başka bir soruya taşıdık: OLS regresyonu açısından sırt regresyonunu uygulayabilir miyim?

2
Davranışsal dizilerden işbirliği nasıl kanıtlanır
Durum: İki kuş (erkek ve dişi) yuvadaki yumurtalarını davetsiz misafirlere karşı korur. Her kuş koruma için saldırı veya tehdit kullanabilir ve mevcut veya yok olabilir. Verilerden ortaya çıkan, davranışın tamamlayıcı olabileceğine dair bir model vardır - kadın kullanım tehdidi sırasında erkek saldırıları ve bunun tersi. Sorum şu: Bu işbirliğini istatistiksel …

1
Derin öğrenme için ne kadar veri var?
Derin öğrenmeyi (özellikle CNN'leri) ve aşırı sığmayı önlemek için genellikle çok fazla veriyi nasıl gerektirdiğini öğreniyorum. Bununla birlikte, bir modelin kapasitesi ne kadar yüksekse, fazla takmayı önlemek için o kadar fazla veriye ihtiyaç duyulduğu söylendi. Bu nedenle, sorum şu: Neden sadece derin bir sinir ağında katman başına katman / düğüm …

2
Sırt regresyonunda “matris inversiyonunun sayısal kararlılığı” için açıklayıcı açıklama ve fazlalığı azaltmada rolü
En küçük kareler regresyon probleminde düzenlemeyi uygulayabileceğimizi anlıyorum. w∗=argminw[(y−Xw)T(y−Xw)+λ∥w∥2]w∗=argminw⁡[(y−Xw)T(y−Xw)+λ‖w‖2]\boldsymbol{w}^* = \operatorname*{argmin}_w \left[ (\mathbf y-\mathbf{Xw})^T(\boldsymbol{y}-\mathbf{Xw}) + \lambda\|\boldsymbol{w}\|^2 \right] ve bu sorunun şu şekilde kapalı bir çözümü olduğunu: w^=(XTX+λI)−1XTy.w^=(XTX+λI)−1XTy.\hat{\boldsymbol{w}} = (\boldsymbol{X}^T\boldsymbol{X}+\lambda\boldsymbol{I})^{-1}\boldsymbol{X}^T\boldsymbol{y}. 2. denklemde, düzenlileştirmenin, matris tersinin sayısal kararlılığını geliştirmek için yapılan \ boldsymbol {X} ^ T \ boldsymbol {X} ' un köşegenine …

1
SVM'nin hala üstün olduğu uygulamalar var mı?
SVM algoritması oldukça eskidir - 1960'larda geliştirilmiştir, ancak 1990'larda ve 2000'lerde son derece popülerdi. Makine öğrenimi kurslarının klasik (ve oldukça güzel) bir parçasıdır. Bugün medya işlemede (görüntüler, ses vb.) Sinir ağlarının tamamen baskın olduğu, diğer bölgelerde Gradient Boosting'in çok güçlü pozisyonları olduğu görülmektedir. Ayrıca, son veri yarışmalarında hiçbir SVM tabanlı …

3
Merkezi limit teoremi ve Pareto dağılımı
Birisi lütfen Pareto dağılımları ve Merkezi Limit Teoremi arasındaki ilişkinin basit (yalın bir kişi) açıklamasını sağlayabilir mi (örn. Geçerli mi? Neden / neden olmasın?)? Aşağıdaki ifadeyi anlamaya çalışıyorum: "Merkezi Limit Teoremi her dağıtımda işe yaramıyor. Bu sinsi bir gerçeğe bağlı - örnek araçlar varsa, altta yatan dağılımın ortalaması etrafında kümeleniyor. …

1
Kaynakların doğrusal, karesel ve Fisher'ın ayrımcı analizi üzerindeki anlaşmazlığı
Ayrımcı analiz çalışıyorum, ancak birkaç farklı açıklamayı uzlaştırmakta zorlanıyorum. Bir şeyleri kaçırmam gerektiğine inanıyorum, çünkü daha önce bu (görünüşte) tutarsızlıkla karşılaşmadım. Bununla birlikte, bu web sitesinde ayrımcı analiz ile ilgili soruların sayısı, karmaşıklığının bir kanıtı gibi görünmektedir. Çeşitli sınıflar için LDA ve QDA Ana ders kitabım Johnson & Wichern Uygulamalı …

1
Bir makalede “Temel bileşenlerin sayısını belirlemek için Monte Carlo simülasyonu” ifadesi yer almaktadır; o nasıl çalışır?
10304 voksel sayısı (piksel olarak düşünün) ve 236 saat noktası sayısı olan 10304x236 boyutunda bir matris üzerinde PCA gerçekleştirdiğim MRI verileri üzerinde bir Matlab analizi yapıyorum. PCA bana 236 Özdeğer ve ilgili katsayıları veriyor. Her şey yolunda. Bununla birlikte, kaç bileşenin tutulacağına karar verme zamanı geldiğinde, çoğalttığım kağıt aşağıdakileri söylüyor …

2
Negatif olmayan tamsayılarda ayrık dağılımdan nasıl örnek alınır?
Aşağıdaki bağımsız dağıtım var, burada bilinen sabitler:α , βα,β\alpha,\beta p ( x ; α , β) =Beta ( α + 1 , β+ x )Beta ( α , β)için x = 0 , 1 , 2 , ...p(x;α,β)=Beta(α+1,β+x)Beta(α,β)için x=0,1,2,... p(x;\alpha,\beta) = \frac{\text{Beta}(\alpha+1, \beta+x)}{\text{Beta}(\alpha,\beta)} \;\;\;\;\text{for } x = 0,1,2,\dots Bu dağıtımdan …

1
Bir grafikte takılı grafik ve gerçek gama dağılımı grafiği nasıl çizilir?
Gerekli paketi yükleyin. library(ggplot2) library(MASS) Gama dağılımına uygun 10.000 sayı oluşturun. x <- round(rgamma(100000,shape = 2,rate = 0.2),1) x <- x[which(x>0)] Olasılık yoğunluğu fonksiyonunu çizin, x'in hangi dağılımı taktığını bilmiyoruz. t1 <- as.data.frame(table(x)) names(t1) <- c("x","y") t1 <- transform(t1,x=as.numeric(as.character(x))) t1$y <- t1$y/sum(t1[,2]) ggplot() + geom_point(data = t1,aes(x = x,y = …

3
Rasgele olmayan numunenin randomizasyonu
Deneysel çalışmalara katılmak için psikolojik reklamlar gördüğüm için her zaman biraz şaşırdım. Elbette, bu reklamlara cevap veren insanlar rastgele örneklenmezler ve bu nedenle kendi seçtikleri bir nüfustur. Rasgeleleştirmenin kendi kendine seçim problemini çözdüğü bilindiğinden, rasgele olmayan bir numunenin randomizasyonunun gerçekten bir şey değiştirip değiştirmediğini merak ediyordum. Ne düşünüyorsun ? Ve …

1
ANOVA hangi soruyu cevaplıyor?
ANOVA öğrenmek istiyorum. Algoritmanın nasıl çalıştığını (hangi hesaplamaların yapılması gerektiğini) ve neden işe yaradığını öğrenmeye başlamadan önce, öncelikle ANOVA ile hangi sorunu gerçekten çözdüğümüzü veya hangi cevabı cevaplamaya çalışacağımızı bilmek istiyorum. Başka bir deyişle: Girdi nedir ve algoritmanın çıktısı nedir? Girdi olarak ne kullandığımızı anlıyorum. Bir dizi rakamımız var. Her …
10 anova 

3
Tekrarlayan Sinir Ağının Yapısı (LSTM, GRU)
RNN'lerin mimarisini anlamaya çalışıyorum. Çok yardımcı olan bu öğreticiyi buldum: http://colah.github.io/posts/2015-08-Anlama-LSTMs/ Özellikle bu görüntü: Bu, ileri beslemeli bir ağa nasıl uyar? Bu görüntü her katmandaki başka bir düğüm mü?

3
normal dağılıma göre daha ağır kuyruğa sahip t-dağılımı
Ders notlarımda şöyle diyor, t-dağılımı normal gibi gözükse de, biraz daha ağır kuyruklarla. Neden normal görüneceğini anlıyorum (Merkezi Limit Teoremi nedeniyle). Ancak, normal dağılımdan daha ağır kuyruklara sahip olduğunu matematiksel olarak nasıl kanıtlayacağımı ve normal dağılımdan ne kadar ağır olduğunu ölçmenin bir yolu olup olmadığını anlamakta zorlanıyorum.

2
Karşılıklı bilgi hesaplanırken çöp kutusu sayısı
Karşılıklı bilgiler kullanarak A ve B değişkenleri arasındaki ilişkiyi ölçmek istiyorum. Bunu hesaplamanın yolu gözlemleri bölmektir (aşağıdaki örnek Python koduna bakınız). Ancak, hangi sayıda kutunun makul olduğunu hangi faktörler belirler? Hızlı olmak için hesaplamaya ihtiyacım var, bu yüzden güvenli tarafta olmak için çok fazla kutu kullanamıyorum. from sklearn.metrics import mutual_info_score …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.