İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Destek Vektör Makineleri ve hiper düzlem için Sezgi
Projemde ikili sınıflandırmayı (1 veya 0) tahmin etmek için bir lojistik regresyon modeli oluşturmak istiyorum. 2'si kategorik olmak üzere 15 değişkenim var, geri kalanı sürekli ve ayrık değişkenlerin bir karışımı. Bir lojistik regresyon modeline uymak için SVM, algılayıcı veya doğrusal programlama kullanarak doğrusal ayrılabilirliği kontrol etmem önerildi. Bu, burada lineer …

3
ANOVA varsayımları (varyans eşitliği, artıkların normalliği) neden önemlidir?
Bir ANOVA yürütürken, veriler için geçerli olması için testin belirli varsayımlarının mevcut olması gerektiği söylenir. Testin çalışması için aşağıdaki varsayımların neden gerekli olduğunu hiç anlamadım: Bağımlı değişkeninizin (artıkların) varyansı tasarımın her hücresinde eşit olmalıdır Bağımlı değişkeniniz (artıklar) tasarımın her bir hücresi için yaklaşık normal olarak dağıtılmalıdır Bu varsayımların karşılanması gerekip …

5
Tipik set kavramı
I, tipik küme kavramı oldukça basit olduğu düşünülmektedir: uzunlukta bir sekans , tipik grubu ait olacaktır gelen dizisinin olasılığı yüksek olması durumunda. Bu nedenle, olası herhangi bir sekans . (Entropi ile ilgili biçimsel tanımdan kaçıyorum çünkü kalitatif olarak anlamaya çalışıyorum.)A ( n ) ϵ A ( n ) ϵnnnbir( n …


1
Bir sinir ağını eğitirken ne kadar az eğitim örneği çok azdır?
İlk projemi bir araya getirmeye çalışan bir acemiyim. Aklımda bir şarkı sınıflandırma projesi vardı, ancak elle etiketleme yapacağım için, sadece yaklaşık 1000 şarkı veya 60 saatlik müzikleri makul bir şekilde bir araya getirebilirdim. Birkaç sınıfla sınıflandıracağım, bu yüzden bir sınıfın eğitim setinde 50-100 kadar şarkıya sahip olması mümkündür - bu …

1
Ağırlıklı bir korelasyon gibi bir şey mi?
Akan en popüler müzik sanatçıları hakkında, bölgeye göre yaklaşık 200 kongre bölgesine bölünmüş ilginç verilerim var. Bir kişiyi müzikal tercihleri ​​hakkında sorgulamanın mümkün olup olmadığını görmek ve "Demokrat gibi dinliyor" ya da "Cumhuriyetçi gibi dinliyor" diye karar vermek istiyorum. (Doğal olarak bu hafif yürekli, ancak verilerde gerçek bir entropi var!) …

3
Gerçekten “ilgili tüm tahmin edicileri” dahil etmemiz gerekiyor mu?
Çıkarım için regresyon modellerini kullanmanın temel bir varsayımı, "tüm ilgili öngörücülerin" tahmin denklemine dahil edilmesidir. Bunun mantığı, önemli bir gerçek dünya faktörünün dahil edilmemesinin taraflı katsayılara ve dolayısıyla yanlış çıkarımlara (yani, atlanan değişken sapmaya) yol açmasıdır. Ancak araştırma pratiğinde, "tüm ilgili yordayıcılara" benzeyen herhangi bir şey içeren hiç kimseyi görmedim …

5
Gauss karışım modelinde tekillik sorunları
Örüntü tanıma ve makine öğrenimi kitabının 9. bölümünde Gauss karışım modeli hakkında bu kısım vardır: Dürüst olmak gerekirse, bunun neden tekillik yaratacağını gerçekten anlamıyorum. Bunu bana açıklayan var mı? Üzgünüm ama ben sadece bir lisans ve makine öğreniminde bir acemi değilim, bu yüzden sorum biraz aptalca gelebilir, ama lütfen bana …

3
Lojistik Regresyon: Scikit Learn vs glmnet
R'deki paketi sklearnkullanarak lojistik regresyon kütüphanesinden sonuçları çoğaltmaya çalışıyorum.glmnet Kaynaktan sklearnlojistik regresyon belgeleri , bu l2 cezası altında maliyet fonksiyonunu en çalışıyor minw,c12wTw+C∑i=1Nlog(exp(−yi(XTiw+c))+1)minw,c12wTw+C∑i=1Nlog⁡(exp⁡(−yi(XiTw+c))+1)\min_{w,c} \frac12 w^Tw + C\sum_{i=1}^N \log(\exp(-y_i(X_i^Tw+c)) + 1) Kaynaktan vignettes arasında glmnet, uygulanması biraz daha farklı bir maliyet fonksiyonu minimize minβ,β0−[1N∑i=1Nyi(β0+xTiβ)−log(1+e(β0+xTiβ))]+λ[(α−1)||β||22/2+α||β||1]minβ,β0−[1N∑i=1Nyi(β0+xiTβ)−log⁡(1+e(β0+xiTβ))]+λ[(α−1)||β||22/2+α||β||1]\min_{\beta, \beta_0} -\left[\frac1N \sum_{i=1}^N y_i(\beta_0+x_i^T\beta)-\log(1+e^{(\beta_0+x_i^T\beta)})\right] + \lambda[(\alpha-1)||\beta||_2^2/2+\alpha||\beta||_1] İkinci …


3
Doğrusal sınıflandırıcılar için, daha büyük katsayılar daha önemli özellikler ima ediyor mu?
Makine öğrenimi üzerinde çalışan bir yazılım mühendisiyim. Anladığım kadarıyla, doğrusal regresyon (OLS gibi) ve doğrusal sınıflandırma (lojistik regresyon ve SVM gibi), eğitimli katsayılar ve özellik değişkenleri arasındaki iç ürüne dayalı bir tahmin yapar :w⃗ w→\vec{w}x⃗ x→\vec{x} y^= f( w⃗ ⋅ x⃗ ) = f( ∑benwbenxben)y^=f(w→⋅x→)=f(∑iwixi) \hat{y} = f(\vec{w} \cdot \vec{x}) …

1
(Mini) toplu degrade düzgün degradelerin toplamı veya ortalaması? [çiftleme]
Bu sorunun zaten bir cevabı var : SGD'de ağırlık güncellemeleri için degradelerin ortalaması veya toplamı (1 cevap) 17 gün önce kapalı . Mini toplu degrade iyi uyguladığımda, eğitim toplu işindeki tüm örneklerin degradelerinin ortalamasını aldım. Ancak, şimdi en uygun öğrenme oranının çevrimiçi gradyan terbiyesinden çok daha yüksek olduğunu fark ettim. …

2
Mesafe korelasyon hesaplamalarını anlama
Anladığım kadarıyla, mesafe korelasyonu iki sayısal değişken arasında bir ilişki olup olmadığını kontrol etmenin sağlam ve evrensel bir yoludur. Örneğin, bir çift sayı grubumuz varsa: (x1, y1) (x2, y2) ... (xn, yn) iki değişken ( xve y) arasında herhangi bir (zorunlu olarak doğrusal olmayan) ilişki olup olmadığını kontrol etmek için …

2
Tek kullanımlık çapraz doğrulamada yüksek varyans
"Bir defaya mahsus bırak" çapraz doğrulamasının, eğitim kıvrımlarının büyük örtüşmesi nedeniyle yüksek varyansa sahip olduğunu tekrar tekrar okudum. Ancak bunun neden olduğunu anlamıyorum: Çapraz onaylamanın performansı, eğitim setleri neredeyse aynı olduğu için çok kararlı (düşük varyans) olmamalı mı? Yoksa "varyans" kavramını tamamen yanlış anlıyor muyum? Ayrıca LOO'nun nasıl tarafsız olabileceğini …

3
Veri artırımı ve tren-doğrulaması bölünmesi nasıl yapılır?
Makine öğrenimini kullanarak görüntü sınıflandırması yapıyorum. Bazı eğitim verilerim (resimlerim) olduğunu ve verileri eğitim ve doğrulama setlerine böldüğümü varsayalım. Ve ayrıca rastgele döndürmeler ve gürültü enjeksiyonu ile verileri (orijinallerinden yeni görüntüler üretmek) artırmak istiyorum. Güçlendirme çevrimdışı yapılır. Veri güçlendirmeyi yapmanın doğru yolu hangisidir? Önce verileri eğitim ve doğrulama kümelerine ayırın, …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.