İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Normal karışım dağılımı oluşturmak için tüm olası çiftlerin kullanıldığı yoğunluk tahmin yönteminin adı nedir?
Sadece bir boyutlu yoğunluk tahminleri oluşturmanın düzgün (mutlaka iyi değil) bir yolunu düşündüm ve sorum şu: Bu yoğunluk tahmin yönteminin bir adı var mı? Değilse, literatürde başka bir yöntemin özel bir örneği midir? İşte yöntem: Tahmin etmek istediğimiz bilinmeyen bir dağılımdan alındığını düşündüğümüz bir vektörünüz var . Bunu yapmanın bir …

3
Artırma yöntemi neden aykırı değerlere duyarlıdır?
Artırma yöntemlerinin aykırı değerlere duyarlı olduğunu söyleyen birçok makale buldum, ancak nedenini açıklayan bir makale yok. Deneyimlerime göre aykırı değerler herhangi bir makine öğrenimi algoritması için kötüdür, ancak artırma yöntemleri neden özellikle hassastır? Aşağıdaki algoritmalar aykırı değerlere duyarlılık açısından nasıl sıralanır: boost ağacı, rastgele orman, sinir ağı, SVM ve lojistik …

3
İki veri kümesi arasındaki benzerliğin nicelleştirilmesi
Özet : En iyi yöntemi bulmaya çalışmak, tek bir değer kullanarak hizalanmış iki veri kümesi arasındaki benzerliği özetler. Ayrıntılar : Sorum en iyi bir diyagramla açıklanıyor. Aşağıdaki grafikler etiketli değerleri ile iki farklı veri setleri, her gösterir nfve nr. X ekseni boyunca noktalar, ölçümlerin alındığı yeri temsil eder ve y …

2
Güven aralığı aslında bir parametre tahmininin belirsizliğinin bir ölçüsünü sağlıyor mu?
İstatistikçi William Briggs tarafından bir blog yazısı okuyordum ve aşağıdaki iddia en azını söylemekle ilgilendi. Bundan ne çıkarıyorsun? Güven aralığı nedir? Elbette, verileriniz için bir aralık sağlayacak olan bir denklemdir. Parametre tahmininin belirsizliğini ölçmek içindir. Şimdi, elinizde olan CI hakkında söyleyebildiğiniz tek şey, kesinlikle varsaydığımız frekansçı teoriye göre, parametrenin gerçek …

1
ANOVA: grup başına çok az örnek içeren birçok grup için normallik varsayımının test edilmesi
Aşağıdaki durumu varsayalım: küçük grup büyüklüğünde (örn. n = 3) çok sayıda (örn. 20) var. Tekdüze dağılımdan değerler üretirsem, hata dağılımı tekdüze olsa bile artıkların yaklaşık normal görüneceğini fark ettim. Aşağıdaki R kodu bu davranışı gösterir: n.group = 200 n.per.group = 3 x <- runif(n.group * n.per.group) gr <- as.factor(rep(1:n.group, …

2
MCMC ne zaman yararlıdır?
MCMC yaklaşımının hangi durumda gerçekten yararlı olduğunu anlama konusunda sorun yaşıyorum. "Bayesian Veri Analizi Yapmak: R ve BUGS ile Öğretici" adlı Kruschke kitabından bir oyuncak örneği alıyorum. Şimdiye kadar anladığım şey , örneğine sahip olmak için ile orantılı bir hedef dağılımına ihtiyacımız var . Bununla birlikte, bana öyle geliyor ki …
12 mcmc 

2
Ridge, satır büyütme kullanarak GLM'leri cezalandırdı mı?
Sırtı regresyonunun, her veri bağımlı değişkenler için 0 ve bağımsız değişkenler için kkk veya sıfırın kare kökü kullanılarak oluşturulduğu orijinal veri matrisine veri satırları eklenerek elde edilebileceğini okudum . Daha sonra her bağımsız değişken için bir satır eklenir. Lojistik regresyon veya diğer GLM'ler de dahil olmak üzere tüm vakalar için …


3
Muhafaza yöntemi (verileri eğitim ve teste bölme) neden klasik istatistiklerde kullanılmıyor?
Sınıfta veri madenciliğine maruz kalmamda, tutma yöntemi model performansını değerlendirmenin bir yolu olarak tanıtıldı. Ancak, birinci sınıfımı doğrusal modeller üzerine aldığımda, bu model onaylama veya değerlendirme aracı olarak tanıtılmadı. Çevrimiçi araştırmam da herhangi bir kavşak göstermiyor. Muhafaza yöntemi klasik istatistiklerde neden kullanılmıyor?

3
Sürekli değişkenin koşullu olasılığı
Rastgele değişken 0 ve 10 parametreleriyle sürekli bir Düzgün dağılım izlediğini varsayalım (yani )U ∼ U ( 0 , 10 )UUUU∼U(0,10)U∼U(0,10)U \sim \rm{U}(0,10) Şimdi A'yı = 5 ve B olarak ifade eden ve veya 6'ya eşit olduğu olayını gösterelim. Anladığım kadarıyla, her iki olayın da sıfır olma olasılığı vardır.U 5UUUUUU555 …

1
Erkek ve Kadın Satranç Oyuncuları - Dağıtım Kuyruklarında Beklenen Tutarsızlıklar
2009 tarihli bu makalenin bulgularıyla ilgileniyorum: (En iyi) kadınlar neden satrançta bu kadar iyi? Entelektüel alanlara katılım oranları ve cinsiyet farklılıkları Bu makale en iyi erkek satranç oyuncularının neden en iyi kadın oyunculardan daha iyi göründüğünü açıklamaya çalışmaktadır (kadınlar dünyanın en iyi 1000 oyuncusunun sadece% 2'sini oluşturmaktadır). Özellikle, en iyi …

1
Jackknifing'in çağdaş kullanımları var mı?
Soru: Bootstrapping jackknifing'ten üstündür ; Ancak, jackknifing'in parametre tahminlerindeki belirsizliği karakterize etmek için tek veya en azından uygulanabilir bir seçenek olup olmadığını merak ediyorum. Ayrıca, pratik durumlarda önyüklemeye göre önyargılı / yanlış jackknifleme vardır ve jackknife sonuçları daha karmaşık bir bootstrap geliştirilmeden önce ön fikir verebilir mi? Bazı bağlamlar: Bir …

1
Varsayılan lme4 optimizer, yüksek boyutlu veriler için çok sayıda yineleme gerektirir
TL; DR: lme4optimizasyon varsayılan olarak model parametreleri sayısında lineer olarak görünmektedir ve bir yolu eşdeğer daha yavaş glmgruplar için kukla değişkenlerle modeli. Hızlandırmak için yapabileceğim bir şey var mı? Oldukça büyük bir hiyerarşik logit modeli (~ 50k satır, 100 sütun, 50 grup) sığdırmaya çalışıyorum. Verilere normal bir logit modeli takmak …

1
Ofsetleri olan Poisson rasgele efekt modellerinde aşırı dağılım ve modelleme alternatifleri
Denek içi bir deney kullanarak deneysel araştırmalardan elde edilen sayım verilerini modellerken bir dizi pratik soru ile karşılaştım. Denemeyi, verileri ve şimdiye kadar yaptığım şeyleri kısaca açıklıyorum, ardından sorularımı takip ediyorum. Katılımcıların bir örneğine sırayla dört farklı film gösterildi. Her filmden sonra, RQ (tahmin edilen sayım değişkeni) için ilgi çekici …

1
k-ortalamalar || aka Ölçeklenebilir K-Ortalamalar ++
Bahman Bahmani ve diğ. k-means ++ 'nın daha hızlı bir sürümü olan k-means ||' ı tanıttı. Bu algoritma 4. sayfasında alınır onların kağıt , Bahmani, B., Moseley, B., Vattani, A., Kumar, R., & Vassilvitskii, S. (2012). Ölçeklenebilir k-++ anlamına gelir. VLDB Vakası Bildirileri , 5 (7), 622-633. Ne yazık ki …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.