İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Bootstrap: aşırı uyum sorunu
Çizerek bir gerçekleştirir sözde parametrik olmayan önyükleme varsayalım boyutu örnekleri , n orijinal her n yerine gözlemler. Bu yordamın ampirik cdf tarafından kümülatif dağılım işlevini tahmin etmeye eşdeğer olduğuna inanıyorum:BBBnnnnnn http://en.wikipedia.org/wiki/Empirical_distribution_function ve daha sonra arka arkaya tahmini cdf B sürelerinden gözlemleri simüle ederek bootstrap örneklerinin elde edilmesi .nnnBBB Eğer bu …

2
k-k-medyan mı?
K-ortalamaları kümeleme algoritması ve k-medyan olduğunu biliyorum. Biri ortalamayı kümenin merkezi olarak, diğeri medyanı kullanır. Sorum şu: hangisi ne zaman / nerede kullanılır?

4
Jüri seçiminde önyargı?
Bir arkadaş, jüri seçiminin ırksal olarak önyargılı göründüğü bir ceza davasından sonra temyizde bulunan bir müşteriyi temsil etmektedir. Jüri havuzu 4 ırksal grupta 30 kişiden oluşuyordu. Savcılık, bu kişilerin 10'unu havuzdan çıkarmak için kalıcı zorluklar kullandı. Her bir ırksal gruptaki kişi sayısı ve gerçek zorlukların sayısı sırasıyla: A: 10, 1 …

3
Lojistik regresyon katsayılarının bir anlamı var mı?
Çeşitli özelliklerden ikili bir sınıflandırma sorunum var. (Düzenli) lojistik regresyon katsayılarının yorumlanabilir bir anlamı var mı? Özelliklerin önceden normalleştirildiği göz önüne alındığında, etkinin boyutunu gösterebileceklerini düşündüm. Ancak benim sorunumda katsayılar hassas bir şekilde seçtiğim özelliklere bağlı görünüyor. Katsayıların işareti bile girdi olarak seçilen farklı özellik kümeleri ile değişir. Katsayıların değerini …

2
Frekansçı İstatistiklerde Öznellik
Bayesian istatistiklerinin oldukça öznel olabileceği iddiasını sık sık duyuyorum. Bu temel çıkarım, bir öncekinin seçimine bağlıdır (bir öncekini seçmek için maksimum entropi kayıtsızlık ilkesini kullanabilmesine rağmen). Buna karşılık iddia, sıklık istatistikleri genel olarak daha objektiftir. Bu açıklamada ne kadar gerçek var? Ayrıca, bu beni meraklandırıyor: Özellikle sübjektif olabilen ve Bayesçi …

1
Gelman ve Rubin yakınsama teşhisi, vektörlerle çalışmak nasıl genelleştirilir?
Gelman ve Rubin teşhisi, paralel olarak çalışan çoklu mcmc zincirlerinin yakınsamasını kontrol etmek için kullanılır. Zincir içi varyansı zincirler arası varyansla karşılaştırır, açıklama aşağıdadır: Adımlar (her parametre için): Aşırı dağılmış başlangıç ​​değerlerinden 2n uzunluğunda m ≥ 2 zincirleri çalıştırın. Her zincirdeki ilk n çekişi atın. Zincir içi ve zincirler arası …


1
Karl Pearson ki-kare istatistiği nasıl ortaya çıktı?
Pearson, 1900'de aşağıdaki Pearson ki-kare istatistiklerini nasıl buldu? K∼χ2K= ∑ ( Oben j- Eben j)2Eben jK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} ki K∼ χ2K∼χ2 K \sim \chi^2 Ki-kare akılda tutuldu mu ve metrik (aşağıdan yukarıya yaklaşım) tasarladı mı, yoksa istatistiği tasarladı ve daha sonra ki-kare dağılımını (yukarıdan aşağıya) takip ettiğini …

1
Makine öğrenimi sınıflandırıcıları big-O veya karmaşıklık
Yeni bir sınıflandırıcı algoritması performansını değerlendirmek için, doğruluk ve karmaşıklığı karşılaştırmaya çalışıyorum (eğitim ve sınıflandırmada big-O). Gönderen Machine Learning: Bir yorum Ben algoritmalar arasında ayrıca bir doğruluk tablosunu tam denetimli sınıflandırıcılar listesini almak ve 44 test problemi UCI veri repositoy . Ancak, gibi ortak sınıflandırıcılar için big-O ile bir inceleme, …

3
Ampirik olasılık yoğunlukları arasındaki çakışma nasıl hesaplanır?
İki örnek arasındaki benzerlik ölçüsü olarak, R iki çekirdek yoğunluk tahminleri arasındaki örtüşme alanını hesaplamak için bir yöntem arıyorum. Açıklamak için, aşağıdaki örnekte, morumsu örtüşen bölgenin alanını ölçmem gerekir: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), value=c(rnorm(50), runif(30, 0, 3))) ggplot(d, aes(value, fill=variable)) + geom_density(alpha=.4, color=NA) Benzer bir soru …

1
Regresyon katsayıları ile kısmi regresyon katsayıları arasındaki fark nedir?
Okuduğum Abdi (2003) 'de olduğu Bağımsız değişkenler çift dikey olduğunda, her birinin regresyondaki etkisi, bu bağımsız değişken ile bağımlı değişken arasındaki regresyon eğimi hesaplanarak değerlendirilir. Bu durumda (yani IV'lerin dikliği), kısmi regresyon katsayıları regresyon katsayılarına eşittir. Diğer tüm durumlarda, regresyon katsayısı kısmi regresyon katsayılarından farklı olacaktır. Bununla birlikte, belge daha …

1
Bağlamsal haydutlar için maliyet fonksiyonları
Bağlamsal bir haydut sorunu çözmek için vowpal wabbit kullanıyorum . Kullanıcılara reklamları gösteriyorum ve reklamın gösterildiği bağlam hakkında oldukça fazla bilgiye sahibim (ör. Kullanıcının kim olduğu, hangi sitede olduğu vb.). Bu, John Langford tarafından tarif edildiği gibi oldukça klasik bir bağlamsal eşkıya sorunu gibi görünüyor . Benim durumumda, bir kullanıcının …

3
Hayatta kalma analizi probleminde eğitim, test, validasyon
Burada çeşitli konulara göz atıyorum, ancak tam sorumun cevaplandığını sanmıyorum. Yaklaşık 50.000 öğrenciden oluşan bir veri setim ve ayrılma zamanlarım var. Çok sayıda potansiyel ortak değişkenle orantılı tehlike regresyonu yapacağım. Ayrıca okuldan ayrılmak / kalmak için lojistik regresyon yapacağım. Ana hedef, yeni öğrenci grupları için tahmin olacaktır, ancak geçen yılki …

3
PowerPoint ile kullanılacak en iyi açık kaynaklı veri görselleştirme yazılımı
En iyi açık kaynaklı veri görselleştirme yazılımı nedir? Aşağıdakileri istiyorum: Microsoft Excel'den veri alabilir (Oracle veritabanlarından veri almak da iyi olurdu, ancak bu zorunlu değildir). Yazılım tarafından oluşturulan grafikler Microsoft PowerPoint'e aktarılabilir (kopyala ve yapıştır benimle iyidir). Açık kaynak kodlu ve kullanımı kolaydır.


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.