İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
Bekletme kümesi oluşturmanın daha uygun yolu nedir: bazı konuları kaldırmak veya her konudan bazı gözlemleri kaldırmak?
26 özellikli ve 31000 satırlı bir veri setim var. 38 deneğin veri kümesidir. Biyometrik bir sistem içindir. Bu yüzden konuları tanımlayabilmek istiyorum. Bir test setine sahip olmak için, bazı değerleri kaldırmam gerektiğini biliyorum. Peki ne yapmak daha iyi ve neden? (a) 30 kişiyi eğitim seti olarak saklayın ve 8 kişiyi …

1
Neden geniş bir K seçeneği çapraz doğrulama puanımı düşürüyor?
İle oynamak Boston Konut Verisetinin ve RandomForestRegressor(w / varsayılan parametreleri) Garip bir şey fark, scikit-öğrenme: ortalama çapraz doğrulama puanı azaldı My çapraz doğrulama stratejisi olarak oldu şu 10 öteye kıvrımları sayısını artırdı olarak: cv_met = ShuffleSplit(n_splits=k, test_size=1/k) scores = cross_val_score(est, X, y, cv=cv_met) ... neredeydi num_cvs. Ben set test_sizeiçin 1/num_cvsk …

1
Mclust model seçimi
R paketi mclustküme modeli seçimi için bir ölçüt olarak BIC kullanır. Anladığım kadarıyla, en düşük BIC'ye sahip bir model diğer modellere göre seçilmelidir (sadece BIC'yi önemsiyorsanız). Ancak, BIC değerlerinin tümü negatif olduğunda, Mclustişlev varsayılan olarak en yüksek BIC değerine sahip olan modeldir. Çeşitli denemelerden elde ettiğim genel anlayış, mclust"en iyi" …

4
Bağımsız lognormal rastgele değişkenlerin toplamı lognormal mı?
İki (veya daha fazla) lognormal rasgele değişkenin toplamının neden gözlem sayısını artırdıkça lognormal bir dağılıma yaklaştığını anlamaya çalışıyorum. Çevrimiçi baktım ve bununla ilgili herhangi bir sonuç bulamadım. Açıkça, ve bağımsız lognormal değişkenler ise, üslerin özellikleri ve gauss rastgele değişkenleri ile, değeri de lognormaldir. Bununla birlikte, de lognormal olduğunu öne sürmek …

3
Ters dönüşümden ziyade Ahrens ve Dieter (1972) yöntemini kullanarak üstel rasgele jeneratörün avantajları nelerdir?
Benim sorum R 'yerleşik üstel rasgele sayı üreteci, fonksiyonu esinlenerek rexp(). Üstel olarak dağıtılmış rasgele sayılar oluşturmaya çalışırken, birçok ders kitabı bu Wikipedia sayfasında ana hatlarıyla belirtildiği gibi ters dönüştürme yöntemini önerir . Bu görevi yerine getirmenin başka yöntemleri olduğunun farkındayım. Özellikle, R'nin kaynak kodu Ahrens & Dieter (1972) tarafından …


2
İki yöntemi karşılaştırmak için t testi yerine ANOVA kullanmak yanlış mıdır?
Maaş dağılımım var ve erkekler ve kadınlar için ortalamalar arasındaki farkı karşılaştırmak istiyorum. İki yöntemi karşılaştırmak için öğrenci T testi olduğunu biliyorum ama ANOVA'yı önerdikten sonra ANOVA'nın ikiden fazla yolu karşılaştırmak için olduğunu söyleyen bazı eleştiriler aldım. , (Varsa) 'dir yanlış sadece 2 vasıtanın karşılaştırılması için kullanarak?

3
Poisson GLM'm için bir ofset kullanmalı mıyım?
İki farklı sualtı görsel sayım yöntemi kullanırken balık yoğunluğu ve balık türü zenginliği farklılıklarına bakmak için araştırma yapıyorum. Verilerim aslında verileri sayıyordu, ancak genellikle bu balık yoğunluğuna değiştirildi, ancak hala umarım doğru olan bir Poisson GLM kullanmaya karar verdim. model1 <- glm(g_den ~ method + site + depth, poisson) 3 …

2
R'de sınıflandırma modelleri için artımlı öğrenme
Aşağıdaki kodu kullanarak sahtekarlık tespiti için bir sınıflandırıcı (Karar ağacı, rastgele orman, lojistik regresyon gibi standart sınıflandırıcılardan herhangi biri olabilir) varsayalım library(randomForest) rfFit = randomForest(Y ~ ., data = myData, ntree = 400) # A very basic classifier Say, Y is a binary outcome - Fraud/Not-Fraud Şimdi, görünmeyen bir veri …

2
Bireysel seviye paneli verileriyle farklar arasındaki fark
Bireysel seviye paneli verileriyle fark modelinde bir fark belirlemenin doğru yolu nedir? Kurulum: Birkaç yıl boyunca şehirlere gömülü bireysel düzey panel verilerim olduğunu ve tedavinin şehir yılı düzeyine göre değiştiğini varsayalım. Resmi olarak izin bireysel için sonucun şehir içinde ve yılı ve olsun müdahale etkilenen şehrin bir kukla olmak de …

2
3 boyutlu Çoklu Doğrusal Regresyon en uygun düzlem mi yoksa en uygun çizgi mi?
Profimiz, çoklu doğrusal regresyonun matematiğine, hatta geometrik temsilini ele geçirmiyor ve bu beni biraz karıştırdı. Bir yandan , daha yüksek boyutlarda bile, hala çoklu doğrusal regresyon denir . Öte yandan, örneğin ve ve için istediğimiz değerleri ekleyebilirsek , bu bize olası çözümlerin bir düzlemini vermez mi? ve bir çizgi değil?x1x2Y^= …

1
TBATS model sonuçları ve model teşhisi nasıl yorumlanır
Çok sezonluk bir zaman dizisi olan yarım saatlik talep verilerim var. Kullandığım tbatsiçinde forecastR paketin ve bunun gibi sonuçlar aldık: TBATS(1, {5,4}, 0.838, {<48,6>, <336,6>, <17520,5>}) Bu, serinin Box-Cox dönüşümünü kullanmak zorunda olmadığı ve hata teriminin ARMA (5, 4) ve 6, 6 ve 5 terimlerinin mevsimselliği açıklamak için kullanıldığı anlamına …

2
boyuna veriler için makine öğrenme teknikleri
Boyuna verileri modellemek için herhangi bir makine öğrenme tekniği (denetimsiz) olup olmadığını merak ediyordum. Her zaman karışık efekt modelleri kullandım (çoğunlukla doğrusal olmayan) ama bunu yapmanın başka bir yolu olup olmadığını merak ettim (makine öğrenimini kullanarak). Makine öğrenimi ile, rastgele orman, sınıflandırma / kümeleme, karar ağaçları ve hatta derin öğrenme …


4
Uygulamalı makine öğrenimi hakkında iyi örnekler / kitaplar / kaynaklar (sadece ML'nin kendisi değil)
Daha önce bir ML kursu aldım, ancak şimdi ML ML ile ilgili projelerle işimde çalıştığım için, aslında uygulamak için biraz uğraşıyorum. Eminim yaptığım şeyler daha önce araştırılmış / ele alınmıştır, ancak belirli konuları bulamıyorum. Çevrimiçi bulduğum tüm makine öğrenimi örnekleri çok basittir (örneğin Python'da bir KMeans modelinin nasıl kullanılacağı ve …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.