İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
CalibratedClassifierCV ile sınıflandırıcıları kalibre etmenin doğru yolu
Scikit, modellerimizi belirli bir X, y çiftinde kalibre etmemizi sağlayan CalibratedClassifierCV'ye sahiptir . Ayrıca açıkça belirtiyor kidata for fitting the classifier and for calibrating it must be disjoint. Ayrılmaları gerekiyorsa, sınıflandırıcıyı aşağıdakilerle eğitmek meşru mudur? model = CalibratedClassifierCV(my_classifier) model.fit(X_train, y_train) Aynı eğitim setini kullanarak disjoint datakuralı ihlal ettiğimden korkuyorum . …

1
Bir lmer modeli için hangi çoklu karşılaştırma yöntemi kullanılır: lsmeans veya glht?
Bir veri setini bir sabit efekt (durum) ve iki rastgele efekt (katılımcı konu tasarımı ve çifti nedeniyle katılımcı) ile karışık efektler modeli kullanarak analiz ediyorum. Model ile oluşturulan lme4paket: exp.model<-lmer(outcome~condition+(1|participant)+(1|pair),data=exp). Sonra, bu modelin sabit etki (durum) olmadan modele karşı bir olasılık oranı testi yaptım ve önemli bir farkım var. Veri …

3
Sıralama algoritmalarını değerlendirme metrikleri
Sıralama algoritmaları için birkaç farklı metriğe bakmakla ilgileniyorum - Sıralama için wikipedia Öğrenme sayfasında listelenen birkaç tane var: • Ortalama ortalama hassasiyet (MAP); • DCG ve NDCG; • Hassasiyet @ n, NDCG @ n; burada "@n", metriklerin yalnızca ilk n belge üzerinde değerlendirildiğini gösterir; • Ortalama karşılıklı sıralama; • Kendall's …

3
İstatistiksel OLS ve scikit doğrusal regresyon arasındaki fark
Aynı işi yapan farklı kütüphanelerden iki farklı yöntem hakkında bir sorum var. Doğrusal regresyon modeli yapmaya çalışıyorum. OLS ile istatistik modeli kitaplığını kullandığım kod: X_train, X_test, y_train, y_test = cross_validation.train_test_split(x, y, test_size=0.3, random_state=1) x_train = sm.add_constant(X_train) model = sm.OLS(y_train, x_train) results = model.fit() print "GFT + Wiki / GT R-squared", …



2
L2 norm kaybı neden benzersiz bir çözüme sahiptir ve L1 norm kaybı muhtemelen birden fazla çözüme sahiptir?
http://www.chioka.in/differences-between-l1-and-l2-as-loss-function-and-regularization/ Bu yazının üst kısmına bakarsanız, yazar L2 normunun benzersiz bir çözüme sahip olduğunu ve L1 normunun muhtemelen birçok çözüme sahip olduğunu belirtir. Bunu normalleştirme açısından anlıyorum, ancak kayıp fonksiyonunda L1 normunu veya L2 normunu kullanma açısından değil. Skaler x (x ^ 2 ve | x |) işlevlerinin grafiklerine bakarsanız, …



2
“F regresyonuna” ve değerlerine dayalı özellik seçimi arasındaki fark nedir?
Özelliklerin F-regressionetiketle ilişkilendirilmesi ile aynı özellikleri kullanarak karşılaştırmak ve değerini gözlemlemek mi?R2R2R^2 Sık sık meslektaşlarımın F regressionmakine öğrenme kanalında bir özellik seçimi için kullandığını gördüm sklearn: sklearn.feature_selection.SelectKBest(score_func=sklearn.feature_selection.f_regression...)` Bazıları bana söyle - neden sadece etiket / bağımlı değişkenle ilişkilendirmekle aynı sonuçları veriyor? F_regressionÖzellik seçiminde kullanmanın avantajı bana açık değil . İşte …



2
Adam Optimizer ile eğitim kaybı ve iterasyondaki ani artışların açıklaması
İ) SGD ve ii) Adam Optimizer kullanarak bir sinir ağı eğitimi alıyorum. Normal SGD kullanırken, aşağıda görüldüğü gibi (kırmızı olan) iterasyon eğrisine karşı pürüzsüz bir eğitim kaybı yaşarım . Ancak, Adam Optimizer'ı kullandığımda, eğitim kaybı eğrisinde bazı artışlar var. Bu ani yükselişlerin açıklaması nedir? Model Detayları: 14 giriş düğümü -> …

1
RNN'ler: BPTT ne zaman uygulanır ve / veya ağırlıklar güncellenir?
Ben (diğerleri arasında) Graves 'foneme sınıflandırma 2005 makalesi üzerinden etiketleme RNNs üst düzey uygulama anlamaya çalışıyorum . Sorunu özetlemek gerekirse: Tek cümlelerin (giriş) ses dosyalarından ve (çıktı) uzman etiketli başlangıç ​​zamanlarından, durma zamanlarından ve tek tek telefon seslerinin etiketlerinden (sessizlik gibi birkaç "özel" telefonemden oluşan büyük bir eğitim setimiz var, …
16 lstm  rnn 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.