İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
“Gerçek kapsam olasılığı” hesaplanması, “güvenilir aralık” hesaplamasıyla aynı şey midir?
Giriş seviyesi istatistik ders kitabı okuyordum. Binom dağılımlı verilerde başarı oranının maksimum olasılık tahmini hakkındaki bölümde, bir güven aralığını hesaplamak için bir formül verdi ve daha sonra dikkatsizce bahsedildi Gerçek kapsama olasılığını, yani yöntemin gerçek parametre değerini yakalayan bir aralık üretme olasılığını göz önünde bulundurun. Bu, nominal değerden biraz daha …

3
Aynı popülasyonun çoklu örneklemesinden kesişme olasılığı
Örnek bir örnek: 10.000 maddelik bir nüfusa sahibim. Her öğenin benzersiz bir kimliği vardır. 100 öğe rastgele seçiyorum ve kimlikleri kaydediyorum 100 eşyayı tekrar nüfusa koydum 100 öğeyi tekrar rastgele seçiyorum, kimlikleri kaydediyorum ve değiştiriyorum. Toplamda, bu rastgele örneklemeyi 5 kez tekrar ediyorum 5 rasgele örneklemede sayısının öğe görülme olasılığı …

3
Bootstrap regresyonundan katsayıların p-değerleri nasıl elde edilir?
Robert Kabacoff en düşük Hızlı-R Ben # Bootstrap 95% CI for regression coefficients library(boot) # function to obtain regression weights bs <- function(formula, data, indices) { d <- data[indices,] # allows boot to select sample fit <- lm(formula, data=d) return(coef(fit)) } # bootstrapping with 1000 replications results <- boot(data=mtcars, statistic=bs, …

4
KNN neden “model tabanlı” değil?
ESL bölüm 2.4, lineer regresyonu "model tabanlı" olarak sınıflandırmaktadır, çünküf( x ) ≈ x ⋅ βf(x)≈x⋅βf(x) \approx x\cdot\betabuna karşılık, k yakın komşuları için benzer bir yaklaşım belirtilmemiştir. Ancak her iki yöntem def( x )f(x)f(x)? Daha sonra 2.4'te şöyle diyor: En küçük kareler varsayılır f( x )f(x)f(x) küresel olarak doğrusal bir …

1
İki örnek oranlarının karşılaştırılması, örnek büyüklüğü tahmini: R ve Stata
İki örnek oranlarının karşılaştırılması, örnek büyüklüğü tahmini: R ve Stata Örnek boyutları için aşağıdaki gibi farklı sonuçlar aldım: içinde R power.prop.test(p1 = 0.70, p2 = 0.85, power = 0.90, sig.level = 0.05) Sonuç: n = 160.7777n=160.7777n = 160.7777 (yani 161) her grup için. In Stata sampsi 0.70 0.85, power(0.90) alpha(0.05) …

1
Rastgele Ormanlar MNIST'teki% 2.8'lik test hatasından daha iyisini yapabilir mi?
Ben onları denemek düşündüm bu yüzden vb MNIST, cifar, STL-10, Rastgele Ormanları uygulanması ile ilgili herhangi literatürü bulamadı permütasyon değişmeyen MNIST kendim. İçinde R , I güvenilir: randomForest(train$x, factor(train$y), test$x, factor(test$y), ntree=500) Bu 2 saat sürdü ve% 2.8 test hatası aldı. Ben de denedim scikit-öğrenme ile, RandomForestClassifier(n_estimators=2000, max_features="auto", max_depth=None) 70 …


2
Bağımsızlık testi ve homojenlik testi
Temel bir istatistik dersi veriyorum ve bugün iki kategori için ki-kare bağımsızlık testini ve homojenlik testini ele alacağım. Bu iki senaryo kavramsal olarak farklıdır, ancak aynı test istatistiği ve dağılımını kullanabilir. Bir homojenlik testinde, kategorilerden biri için marjinal toplamların tasarımın bir parçası olduğu varsayılır - her deney grubu için seçilen …

2
Sadece bir sınıf için sınıflandırıcı
Basit bir sınıflandırmada iki sınıfımız vardır: sınıf-0 ve sınıf-1. Bazı verilerde yalnızca sınıf-1 için değerler var, bu nedenle sınıf-0 için hiçbiri yok. Şimdi sınıf-1'in verilerini modellemek için bir model yapmayı düşünüyorum. Dolayısıyla, yeni veriler geldiğinde, bu model yeni verilere uygulanır ve yeni verilerin bu modele ne kadar uygun olduğunu belirten …




1
Çekirdek yöntemlerinin sınırlamaları nelerdir ve çekirdek yöntemlerinin ne zaman kullanılması gerekir?
Çekirdek yöntemleri birçok denetimli sınıflandırma görevinde çok etkilidir. Peki, çekirdek yöntemlerinin sınırlamaları nelerdir ve çekirdek yöntemlerinin ne zaman kullanılması gerekir? Özellikle büyük ölçekli veri döneminde, çekirdek yöntemlerinin ilerlemeleri nelerdir? Çekirdek yöntemleri ile çoklu örnek öğrenme arasındaki fark nedir? Veri ise 500x10000, 500numunelerin sayısı ve 10000biz çekirdek yöntemlerini kullanabilirsiniz, bu durum …


1
GLM için Günlük Olasılığı
Aşağıdaki kodda glm ve "elle" mle2 kullanarak gruplandırılmış veriler üzerinde lojistik regresyon gerçekleştiriyorum. Neden R'deki logLik işlevi bana bir günlük olasılığı verir logLik (fit.glm) = - 2.336 birinden farklı logLik (fit.ml) = - 5.514 Elle alıyorum? library(bbmle) #successes in first column, failures in second Y <- matrix(c(1,2,4,3,2,0),3,2) #predictor X <- …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.