İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
'Kıvrımlarla daha derine inme' bölümündeki DepthConcat işlemi nasıl çalışır?
Okuma Kıvrımlarla daha derine inerek , önerilen başlangıç ​​modüllerinin yapı taşı olan ve farklı büyüklükteki birden fazla tansörünün çıktısını birleştiren bir DepthConcat katmanıyla karşılaştım . Yazarlar buna "Filtre Birleştirme" adını vermektedir. Meşale için bir uygulama var gibi görünüyor , ama gerçekten ne yaptığını anlamıyorum. Birisi basit kelimelerle açıklayabilir mi?

1
Scikit predict_proba çıktı yorumu
Python'da scikit-learn kütüphanesi ile çalışıyorum. Aşağıdaki kodda, olasılığı tahmin ediyorum, ancak çıktıyı nasıl okuyacağımı bilmiyorum. Verileri test etme from sklearn.ensemble import RandomForestClassifier as RF from sklearn import cross_validation X = np.array([[5,5,5,5],[10,10,10,10],[1,1,1,1],[6,6,6,6],[13,13,13,13],[2,2,2,2]]) y = np.array([0,1,1,0,1,2]) Veri kümesini böl X_train, X_test, y_train, y_test = cross_validation.train_test_split(X, y, test_size=0.5, random_state=0) Olasılığı hesapla clf = …

1
LASSO'da normalleştirme parametresi için aralık ve ızgara yoğunluğunu seçme
Bu arada LASSO (en az mutlak büzülme ve seçim operatörü) okuyorum . Düzenleme parametresi için en uygun değerin çapraz doğrulama ile seçilebildiğini görüyorum. Ben de sırt regresyonunda ve regülasyonu uygulayan birçok yöntemde görüyorum, optimal regülasyon parametresini (ceza söyleyerek) bulmak için CV'yi kullanabiliriz. Şimdi sorum parametrenin üst ve alt sınırı için …



1
Fisher kesin testi düzgün olmayan p değerleri verir
Fisher'in kesin testini simüle edilmiş bir genetik problemde uygulamaya çalışıyorum, ancak p değerleri sağa eğik görünüyor. Bir biyolog olarak, sanırım her istatistikçi için açık bir şey eksik, bu yüzden yardımlarınız için çok minnettar olurum. Benim kurulumum şu şekildedir : (kurulum 1, marjinaller sabit değildir) R'de 0 ve 1'lerden oluşan iki …

3
Bilinmeyen ortalama ve varyans ile normal dağılım için Jeffreys Prior
Önceki dağılımları okuyorum ve Jeffreys'i, ortalama ve bilinmeyen varyansı bilinmeyen normal olarak dağıtılmış rasgele değişkenlerin bir örneği için hesapladım. Benim hesaplamalara göre, Jeffreys için aşağıdakiler daha önce geçerlidir: Burada,benFisher bilgi matristir.p ( μ , σ2) = de t ( I)-----√= de t ( 1 / σ2001 / ( 2 σ4))------------------√= …

1
Kısmi Should
mtcarsVeri kümesinden oluşturulan bir model aşağıdadır: > ols(mpg~wt+am+qsec, mtcars) Linear Regression Model ols(formula = mpg ~ wt + am + qsec, data = mtcars) Model Likelihood Discrimination Ratio Test Indexes Obs 32 LR chi2 60.64 R2 0.850 sigma 2.4588 d.f. 3 R2 adj 0.834 d.f. 28 Pr(> chi2) 0.0000 g …

1
Yanlış pozitif sayısı nasıl azaltılır?
Yaya tespiti olarak adlandırılan görevi çözmeye çalışıyorum ve iki kategori pozitif - insanlar, negatifler - arka plan üzerinde ikili clasifer eğitiyorum. Veri setim var: pozitif sayısı = 3752 negatif sayısı = 3800 Train \ test split 80 \ 20% ve RandomForestClassifier form scikit-learn parametrelerini kullanıyorum: RandomForestClassifier(n_estimators=100, max_depth=50, n_jobs= -1) Puanı …

2
Belirli bir yanıt değişkenine göre Optimal Binning
Belirli bir yanıt (hedef) ikili değişken ve sürekli olarak parametre olarak aralıkların maksimum sayısı ile sürekli değişken en iyi binning yöntemi (ayrıklaştırma) arıyorum. örnek: "yükseklik" (sürekli sayısal) ve "has_back_pains" (ikili) değişkenleri olan insanların gözlemleri bir dizi var. Yüksekliği en fazla 3 aralıkta (grup) ayrıştırmak istiyorum, bu yüzden algoritma gruplar arasındaki …

1
Neden her zaman güçlü regresyon olmasın?
Bu sayfanın örnekleri, basit regresyonun aykırı değerlerden önemli ölçüde etkilendiğini ve bunun güçlü regresyon teknikleriyle aşılabileceğini göstermektedir: http://www.alastairsanderson.com/R/tutorials/robust-regression-in-R/ . Ben lmrob ve ltsReg'in diğer güçlü regresyon teknikleri olduğuna inanıyorum. Basit regresyon (lm) yapmak yerine neden her zaman sağlam regresyon (rlm veya rq gibi) yapılmasın ki? Bu güçlü regresyon tekniklerinin dezavantajları …

2
Regresyon modellerinin VC boyutu
Verilerden Öğrenme ders serisinde profesör, VC boyutunun belirli bir modelin kaç noktayı parçalayabileceğine dair model karmaşıklığını ölçtüğünden bahseder. Bu nedenle, sınıflandırıcı k noktalarını etkili bir şekilde parçalayabiliyorsa N noktalarından söyleyebileceğimiz sınıflandırma modelleri için mükemmel bir şekilde çalışır. VC boyut ölçüsü K olacaktır. Ancak regresyon modelleri için bir VC boyutunu nasıl …


1
Rasgele bir değişkenin uzun dikdörtgen bir matrisle doğrusal dönüşümü
Diyelim ki , olasılık yoğunluk fonksiyonuna sahip bir dağılımdan alınan rastgele bir . Biz doğrusal bir tam-sıraya göre dönüştürmek ise matris almak , daha sonra yoğunluğu verilirX⃗ ∈RnX→∈Rn\vec{X} \in \mathbb{R}^nfX⃗ (x⃗ )fX→(x→)f_\vec{X}(\vec{x})n×nn×nn \times nAAAY⃗ =AX⃗ Y→=AX→\vec{Y} = A\vec{X}Y⃗ Y→\vec{Y}fY⃗ (y⃗ )=1|detA|fX⃗ (A−1y⃗ ).fY→(y→)=1|detA|fX→(A−1y→). f_{\vec{Y}}(\vec{y}) = \frac{1}{\left|\det A\right|}f_{\vec{X}}(A^{-1}\vec{y}). Şimdi dönüştürmek ki …

1
Düzenleme ile lagrange çarpanları yöntemi arasındaki bağlantı nedir?
İnsanların fazla uymasını önlemek için insanlar , doğrusal regresyonun maliyet fonksiyonuna bir düzenleme parametresi ile bir modelleme terimi (modelin parametrelerinin kare toplamıyla orantılı) ekler λλ\lambda. Bu parametresi λλ\lambdabir lagrange çarpanı ile aynı mıdır? Düzenleme, lagrange çarpanı yöntemiyle aynı mıdır? Veya bu yöntemler nasıl bağlanır?

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.