İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Boyut küfürü bazı modelleri diğerlerinden daha fazla etkiler mi?
Boyutsallık laneti hakkında okuduğum yerler, öncelikle kNN ve genel olarak doğrusal modellerle bağlantılı olarak açıklıyor. Veri kümesindeki 100k veri noktasına sahip binlerce özellik kullanarak Kaggle'daki en üst sıralayıcıları düzenli olarak görüyorum. Diğerleri arasında ağırlıklı olarak Artırılmış ağaçlar ve NN kullanırlar. Pek çok özellik çok yüksek görünüyor ve boyutsal lanetten etkileneceklerini …

1
VC boyutu bize derin öğrenme hakkında ne anlatıyor?
Temel makine öğreniminde aşağıdaki "temel kurallar" öğretilir: a) verilerinizin boyutu, hipotez kümenizin VC boyutunun boyutunun en az 10 katı olmalıdır. b) N bağlantılı bir sinir ağının VC boyutu yaklaşık N'dir. Yani derin bir öğrenme sinir ağı milyonlarca ünite dediğinde, bu milyarlarca veri noktasına sahip olmamız gerektiği anlamına mı geliyor? Lütfen …

2
Lrtest () neden anova ile eşleşmiyor (test = “LRT”)
Model uyumlarını karşılaştırmak için R'de bir olasılık oranı testi yapmanın yollarını arıyordum. İlk kendim kodlu, varsayılan hem bulundu anova()fonksiyonu ve aynı zamanda lrtest()içinde lmtestpaketin. Ancak kontrol ettiğimde anova(), 'test' parametresi "LRT" olarak ayarlanmış olsa bile, her zaman diğer ikisinden biraz farklı bir p değeri üretir. Is anova()aslında bazı ustaca farklı …


1
Glmnet lojistik regresyonu, kukla değişkenlere ihtiyaç duymadan faktör (kategorik) değişkenleri doğrudan işleyebilir mi? [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 3 yıl önce kapalı . Ben işlevlerle LASSO yöntemi kullanarak R lojistik regresyon inşa ediyorum cv.glmnetseçilmesi için lambdave glmnetnihai model için. Otomatik model seçimiyle ilgili …

1
Gamma ve ki kare dağılımı arasındaki ilişki
Eğer burada , yani tüm aynı varyanslı ortalama sıfır iid normal rasgele değişkenlerdir, sonraY=∑i=1NX2iY=∑i=1NXi2Y=\sum_{i=1}^{N}X_i^2Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2)XiXiX_iY∼Γ(N2,2σ2).Y∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). Ki kare dağılımının gama dağılımının özel bir durumu olduğunu biliyorum, ancak rastgele değişken için ki kare dağılımını . Herhangi bir yardım lütfen?YYY

1
Otokorelasyon nasıl yorumlanır
X ( x.ts) ve Y ( y.ts) konumlarına göre bir balığın hareket örüntüleri üzerindeki zaman serisi verileri üzerinde otokorelasyon hesapladım . R kullanarak, aşağıdaki işlevleri çalıştırdım ve aşağıdaki grafikleri ürettim: acf(x.ts,100) acf(y.ts,100) Benim sorum şu, bu grafikleri nasıl yorumlayabilirim? Herhangi bir modeli bildirmek için hangi bilgilere ihtiyaç vardır? Ben internette …

1
Verileri İstenen Ortalama ve Standart Sapmaya Dönüştürün
Veri kümemi geçerli ortalamasından standart sapmasından hedef ortalamaya ve standart sapmaya dönüştürmek için bir yöntem arıyorum. Temel olarak, dispersiyonu küçültmek / genişletmek ve tüm sayıları ortalamaya ölçeklemek istiyorum. Biri standart sapma için ve diğeri ortalama için olmak üzere iki ayrı doğrusal dönüşüm yapmak için işe yaramaz. Hangi yöntemi kullanmalıyım? Çözüm …


2
Dağıtımdaki serbestlik dereceleri için iyi bir ön dağıtım nedir?
Bayes modelinde kısa aralıklı varlık getirilerini modellemek için dağıtımda kullanmak istiyorum. Dağıtım için her iki serbestlik derecesini (modelimdeki diğer parametrelerle birlikte) tahmin etmek istiyorum. Varlık getirilerinin oldukça normal olmadığını biliyorum, ama bunun ötesinde çok fazla şey bilmiyorum. Böyle bir modeldeki serbestlik dereceleri için uygun, hafif bilgilendirici bir ön dağıtım nedir?

1
logloss vs gini / auc
İki model (h2o AutoML kullanarak ikili sınıflandırıcılar) eğittim ve kullanmak için bir tane seçmek istiyorum. Aşağıdaki sonuçlara sahibim: model_id auc logloss logloss_train logloss_valid gini_train gini_valid DL_grid_1 0.542694 0.287469 0.092717 0.211956 0.872932 0.312975 DL_grid_2 0.543685 0.251431 0.082616 0.186196 0.900955 0.312662 aucve loglosskolonlar çapraz doğrulama metriklerdir (çapraz doğrulama sadece eğitim verileri kullanır). …

1
Bir darboğaz katmanı sinir ağlarında ne anlama gelir?
FaceNet belgesini okuyordum ve giriş bölümünün 3. paragrafında şöyle diyor: Derin ağlara dayanan önceki yüz tanıma yaklaşımları, bilinen bir dizi yüz kimliği üzerinde eğitilmiş bir sınıflandırma katmanı kullanır ve daha sonra, eğitimde kullanılan kimlikler kümesinin ötesinde tanınmayı genelleştirmek için kullanılan bir temsil olarak bir ara darboğaz katmanını alır. Bir ara …

4
Makine öğrenme kanalında Özellik Seçimi ve Hiperparametre optimizasyonu nasıl sipariş edilmelidir?
Amacım sensör sinyallerini sınıflandırmak. Çözümümün şimdiye kadarki kavramı: i) Ham sinyalden mühendislik özellikleri ii) ReliefF ve kümeleme yaklaşımı ile ilgili özellikleri seçme iii) NN, Random Forest ve SVM uygulayın Ancak bir ikilemde sıkışıp kaldım. İi) ve iii) 'de, ReliefF için k-En Yakın Neigbours veya sensör sinyalinin değerlendirildiği pencere uzunluğu veya …


2
Scikit-öğrenme önyükleme işlevi neden test kümesini yeniden örnekliyor?
Model değerlendirmesi için bootstrapping kullanırken, her zaman kullanıma hazır örneklerin doğrudan bir test seti olarak kullanıldığını düşündüm. Ancak, bunun için durum olmadığı görülüyor kaldırılan scikit-öğrenmeBootstrap dışı torba veri alt kümeden değiştirme ile çizim test kümesi oluşturmak gibi görünüyor yaklaşımı,. Bunun arkasındaki istatistiksel mantık nedir? Bu tekniğin sadece torba dışı örnek …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.