İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap



9
Bir sinir ağı tahmininin güvenini nasıl belirleyebilirim?
Sorumu açıklamak için, girişin bir dereceye kadar gürültüye sahip olduğu ancak çıkışın olmadığı bir eğitim setim olduğunu varsayalım; # Training data [1.02, 1.95, 2.01, 3.06] : [1.0] [2.03, 4.11, 5.92, 8.00] : [2.0] [10.01, 11.02, 11.96, 12.04] : [1.0] [2.99, 6.06, 9.01, 12.10] : [3.0] Burada çıktı, eğer girişsiz ise …

3
Dengesiz veriler için sınıflandırma / değerlendirme ölçütleri
Dolandırıcılık tespiti (kredi puanlama benzeri) sorunu ile ilgileniyorum. Dolayısıyla, hileli ve hileli olmayan gözlemler arasında oldukça dengesiz bir ilişki vardır. http://blog.revolutionanalytics.com/2016/03/com_class_eval_metrics_r.html , farklı sınıflandırma ölçümlerine harika bir genel bakış sağlar. Precision and Recallya da kappaher ikisi de iyi bir seçim gibi görünüyor: Bu tür sınıflandırıcıların sonuçlarını haklı göstermenin bir yolu, …

3
Bir sinir ağı ön eğitim nedir?
Eh soru her şeyi söylüyor. "Sinir ağının ön eğitimi" ile ne kastedilmektedir? Birisi basit basit İngilizce olarak açıklayabilir mi? Bununla ilgili herhangi bir kaynak bulamıyorum. Biri beni onlara yönlendirebilirse çok iyi olur.

2
Tüm makine öğrenme algoritmaları verileri doğrusal olarak ayırıyor mu?
Programlama ve makine öğrenmenin meraklısıyım. Sadece birkaç ay önce makine öğrenimi programlaması hakkında öğrenmeye başladım. Kantitatif bir bilim geçmişine sahip olmayan birçok kişi gibi, ben de yaygın olarak kullanılan ML paketindeki (caret R) algoritmalar ve veri setleri ile uğraşarak ML hakkında öğrenmeye başladım. Bir süre önce, yazarın ML'deki doğrusal regresyonun …

6
Olabilirlik - Neden çarpın?
Maksimum olabilirlik tahmini hakkında çalışıyorum ve olabilirlik fonksiyonunun her değişkenin olasılıklarının ürünü olduğunu okudum. Ürün neden? Neden toplam değil? Google’da arama yapmaya çalışıyorum ancak anlamlı bir cevap bulamıyorum. https://en.wikipedia.org/wiki/Maximum_likelihood

2
permütasyon testinin varsayımları nelerdir?
Permütasyon testlerinin varsayımları olmadığı sık sık bildirilmektedir, ancak bu kesinlikle doğru değildir. Örneğin, numunelerimin bir şekilde korelasyonu varsa, etiketlerine izin vermenin yapılacak doğru şey olmadığını hayal edebiliyorum. Bu sorun hakkında bulduğumun tek kelimesi wikipedia'dan gelen bu cümledir: "Bir permütasyon testinin arkasındaki önemli bir varsayım, gözlemlerin sıfır hipotezi altında değişebilir olmasıdır." …

1
Neden varyansın örnekleme dağılımı ki-kare dağılımı?
İfade Örnek varyans örnek dağılımı serbestlik derecesine sahip olan bir ki-kare dağılımı eşit olan , burada numune boyutu (ilgili rastgele değişken normal dağılım olduğu göz önüne alındığında) 'dir.nn - 1n−1n-1nnn Kaynak Sezgilerim Bana sezgisel olarak mantıklı geliyor 1) çünkü ki-kare testi kare ve 2'nin toplamına benziyor çünkü Ki-kare dağılımı sadece …

3
Kısmi bağımlılık parsellerinin y eksenini yorumlayabilme
Bu soru edildi göç o Çapraz doğrulanmış üzerinde yanıtlanabilir çünkü yığın taşması gelen. 5 yıl önce göç etti . Kısmi bağımlılık parselleri hakkındaki diğer konuları okudum ve bunların çoğu, onları nasıl doğru bir şekilde yorumlayabileceğinizi değil, onları farklı paketlerle nasıl çizdiğinizle ilgili. Adil miktarda kısmi bağımlılık grafiği okuyordum ve yaratıyorum. …

2
Ortalama mutlak ölçekli hatanın yorumlanması (MASE)
Ortalama mutlak ölçekli hata (MASE), Koehler ve Hyndman (2006) tarafından önerilen tahmin doğruluğunun bir ölçüsüdür . MASE=MAEMAEin−sample,naiveMASE=MAEMAEin−sample,naiveMASE=\frac{MAE}{MAE_{in-sample, \, naive}} burada gerçek durumunu ürettiği ortalama mutlak hatadır; ise MAE_ {in örnek, \, naif} (bir örneğin herhangi bir değiştirme durumu entegre saf bir tahmini ürettiği ortalama mutlak hata I (1) zaman serileri), …

2
Verilerimdeki bazı değişikliklere rağmen neden karışık modelimde rastgele bir etkinin sıfır farkını alıyorum?
Aşağıdaki sözdizimini kullanarak karma efektler lojistik regresyon uyguladık; # fit model fm0 <- glmer(GoalEncoding ~ 1 + Group + (1|Subject) + (1|Item), exp0, family = binomial(link="logit")) # model output summary(fm0) Konu ve Öğe rastgele etkilerdir. Konu terimi için katsayı ve standart sapma olan tuhaf bir sonuç alıyoruz; Generalized linear mixed …

5
Zaman serisi tahmini için veri kümesini nasıl bölerim?
Pastaneden tarihi satış verilerim var (günlük, 3 yıldan fazla). Şimdi gelecekteki satışları tahmin etmek için bir model oluşturmak istiyorum (hafta içi, hava değişkenleri vb. Özellikleri kullanarak). Modelleri yerleştirmek ve değerlendirmek için veri setini nasıl bölmeliyim? Kronolojik bir tren / validasyon / test bölümü olması gerekiyor mu? Daha sonra hiperparametreyi tren …

4
Fisher'ın LSD'si söyledikleri kadar kötü mü?
İki grup üzerinde deneyler yaptığımızda (küçük örneklem büyüklüklerinde (genellikle her tedavi grubu için örnek büyüklüğü yaklaşık 7 ~ 8'dir)), farklılığı test etmek için bir t-testi kullanırız. Bununla birlikte, bir ANOVA yaptığımız zaman (açıkça ikiden fazla grup için), Bonferroni (LSD / # ikili karşılaştırmalar) ya da Tukey'nin sıraları boyunca bir şey …

5
Büyük veri setlerinin keşif analizleri kontrol altında nasıl tutulur?
Büyük bir veri setinde (birçok örnek, birçok değişken) keşif analizine başladığımda, kendimi sık sık yüzlerce türetilmiş değişkenle ve tonlarca farklı grafikle ve nereye gittiğini izlemenin gerçek bir yolunu bulamıyorum. Kod spagetti gibi biter, çünkü en baştan bir yön yok ... Keşif analizini temiz ve düzenli tutmak için önerilen yöntemler var …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.