İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Aynı kutu ve bıyık arsa ile Anscombe benzeri veri setleri (ortalama / std / median / MAD / dak / max)
EDIT: Bu soru şişirildiği için bir özet: aynı karma istatistiklere sahip (anlamlı, ortalama, orta derece ve ilişkili dağılımları ve gerileme) farklı anlamlı ve yorumlanabilir veri kümeleri bulmak. Anscombe dörtlüsü (bkz . Yüksek boyutlu verileri görselleştirme amacı? ), Aynı marjinal ortalama / standart sapma (dört ve dört , ayrı ayrı) ve …


2
Dengesiz veriler için lojistik regresyona ağırlık ekleme
Dengesiz verilerle lojistik bir regresyon modellemek istiyorum (9: 1). glmR işlevindeki ağırlıklar seçeneğini denemek istedim , ancak ne yaptığından% 100 emin değilim. Çıktı değişkenimin olduğunu söyleyelim c(0,0,0,0,0,0,0,0,0,1). şimdi "1" e 10 kat daha fazla ağırlık vermek istiyorum. bu yüzden ağırlık tartışmasını yapıyorum weights=c(1,1,1,1,1,1,1,1,1,1,1,10). Bunu yaptığımda, maksimum olasılığın hesaplanmasında dikkate alınacaktır. …

1
Bootstrapping vs Bayesian Bootstrapping kavramsal olarak?
Bayesian Bootstrapping işleminin ne olduğunu ve bunun normal bootstrapping işleminizden ne şekilde farklı olacağını anlamada sorun yaşıyorum. Ve eğer biri sezgisel / kavramsal bir inceleme ve ikisinin karşılaştırmasını sunabilirse, bu harika olurdu. Bir örnek alalım. Diyelim ki [1,2,5,7,3] bir veri kümemiz var. X boyutuna eşit numune boyutları oluşturmak için birçok …

4
“Yarı denetimli öğrenme” - bu çok mu fazla?
Bir Kaggle yarışmasının ( Malware Classification ) kazanan çözümünün raporunu okuyordum . Rapor bu forum gönderisinde bulunabilir . Sorun, tren setinde 10000 element, test setinde 10000 element olan bir sınıflandırma problemiydi (dokuz sınıf, metrik logaritmik kayıptı). Yarışma sırasında, modeller test setinin% 30'una karşı değerlendirildi. Bir diğer önemli unsur, modellerin çok …

3
Sonuç sadece eğitim durumundaki olumlu vakalarla nasıl tahmin edilir?
Sadelik adına, spam / spam olmayan e-postaların klasik örneği üzerinde çalışıyorum diyelim. 20.000 e-posta setim var. Bunlardan 2000'in spam olduğunu biliyorum ama spam olmayan e-postalardan hiçbir örneğim yok. Kalan 18000’in spam olup olmadığını tahmin etmek istiyorum. İdeal olarak, aradığım sonuç, e-postanın spam olma olasılığı (veya bir p değeri). Bu durumda …

1
ROC eğrilerinin analizi için bir Bayesian metodu icat ettim mi?
önsöz Bu uzun bir yazı. Bunu tekrar okuyorsanız, arka plan materyali aynı kalmasına rağmen, soru bölümünü gözden geçirdiğimi lütfen unutmayın. Ek olarak, soruna bir çözüm geliştirdiğime inanıyorum. Bu çözüm gönderinin altında görünür. Özgün çözümümün (bu yazıdan düzenlenmiş; bu çözüm için düzenleme geçmişine bakın) mutlaka yanlı tahminler ürettiğine işaret ettiği için …

2
Genel veri setleri için veri büyütme teknikleri?
Birçok makine öğrenim uygulamasında, veri yükseltme yöntemleri daha iyi modeller oluşturmaya izin verdi. Örneğin, kedi ve köpek görüntüsünün eğitim setini alın . Döndürmek, yansıtmak, kontrastı ayarlamak, vb. İle orijinallerinden ek görüntüler elde etmek mümkündür.100100100 Görüntüler durumunda, veri arttırma nispeten basittir. Ancak, (örneğin) birinin örnek bir eğitim seti ve farklı şeyleri …

2
güvenirlik aralıklarının düzenli tahminlerle karşılanması
Bir tür düzenli tahminler kullanarak bazı yüksek boyutlu verilerden çok sayıda parametre tahmin etmeye çalıştığımı varsayalım. Düzenleyici, tahminlere bir miktar önyargı getirir, ancak varyanstaki düşüşün telafi etmekten daha fazla olması gerektiği için hala iyi bir denge olabilir. Sorun, güven aralıklarını tahmin etmek istediğimde ortaya çıkıyor (örn. Laplace yaklaşımı veya önyükleme …

2
Bu ayrık dağılımın bir adı var mı?
Bu ayrık dağılımın bir adı var mı? İçini∈1...Ni∈1...Ni \in 1...N f(i)=1N∑Nj=i1jf(i)=1N∑j=iN1jf(i) = \frac{1}{N} \sum_{j = i}^N \frac{1}{j} Bu dağılıma aşağıdakilerden rastladım: Bazı faydalı işlevlere göre sıralanmış öğelerinin bir listesine sahibim . Rastgele bir listeyi seçmek istiyorum, listenin başlangıcına doğru eğilimliyim. Bu yüzden ilk önce 1 ile arasında eşit bir indisi …

1
Poisson vs. geometrik - negatif binom GLM'leri sayı verileri için ne zaman kullanılır?
Sayma verileriyle hangi regresyon tipinin (geometrik, Poisson, negatif binom), GLM çerçevesi dahilinde (8 GLM dağılımının sadece 3'ü kullanılsa da, sayım verileri için kullanılsa da) uygun olduğunda kendime yerleşmeye çalışıyorum. Negatif binom ve Poisson dağılımlarının merkezlerini okudum). Poisson vs. geometrik - negatif binom GLM'leri sayı verileri için ne zaman kullanılır? Şimdiye …

2
Regresyon çizgisini tahmin etmek için neden artıkların normalliği “hiç de önemli değil”?
Gelman ve Hill (2006) p46'ya şunu yazmaktadır: Genel olarak en az önemli olan regresyon varsayımı, hataların normal olarak dağılmış olmasıdır. Aslında, regresyon çizgisini tahmin etmek amacıyla (bireysel veri noktalarının tahmin edilmesine kıyasla), normallik varsayımı hiç de önemli değildir. Bu nedenle, birçok regresyon ders kitabının aksine, regresyon artıklarının normalliğinin teşhisini önermiyoruz. …

1
loglog lojistik regresyonun tahminlerini yorumlayabilme
Birisi bana bir tıkanıklık bağlantısı kullanarak bir lojistik regresyondan elde edilen tahminleri nasıl yorumlayabileceğimi söyleyebilir mi? Aşağıdaki modeli yerleştirdim lme4: glm(cbind(dead, live) ~ time + factor(temp) * biomass, data=mussel, family=binomial(link=cloglog)) Örneğin, zaman tahmini 0.015'tir. Birim zaman başına ölüm oranlarının exp (0.015) = 1.015113 (birim zaman başına ~% 1.5 artış) ile …

3
Kırık bir çubuğun en büyük parçasının dağılımı (boşluklar)
1 uzunluğundaki bir çubuğun rastgele eşit olarak fragmanları halinde kırılmasına izin verin . En uzun parçanın uzunluğunun dağılımı nedir?k + 1k+1k+1 Daha resmi olarak, IID olsun ve ilişkili ilişkili sipariş istatistikleri olsun, yani sadece sipariş verelim. örnek, . Let .( U1, … Uk)(U1,...Uk)(U_1, \ldots U_k)U( 0 , 1 )U(0,1)U(0,1)( U( …

2
Granger's ve Pearl'ün nedensellik çerçeveleri arasındaki temel farklar nelerdir?
Son zamanlarda, Granger nedensellikten bahseden birkaç makale ve çevrimiçi kaynağa rastladım . İlgili Vikipedi makalesinde kısaca gezinti , bu terimin zaman serileri (veya daha genel olarak stokastik süreçler ) bağlamında nedensellik anlamına geldiği izlenimini bıraktı . Dahası, bu güzel blog yazısını okumak, bu yaklaşımın nasıl görüntüleneceği konusunda ek bir karışıklık …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.