İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Hatalı bir önceki, uygun bir posterior dağılıma nasıl yol açar?
Önceden uygun bir dağıtım durumunda, P(θ∣X)=P(X∣θ)P(θ)P(X)P(θ∣X)=P(X∣θ)P(θ)P(X)P(\theta \mid X) = \dfrac{P(X \mid \theta)P(\theta)}{P(X)} ∝P(X∣θ)P(θ)∝P(X∣θ)P(θ) \propto P(X \mid \theta)P(\theta) . Bu adım için olağan gerekçelendirme, , in marjinal dağılımının açısından sabittir ve böylece posterior dağılımı elde ederken göz ardı edilebilir olmasıdır.XXXP(X)P(X)P(X)θθ\theta Ancak, uygunsuz bir öncelik durumunda, posterior dağılımın gerçekten var olduğunu nereden …

3
Neden maksimum olabilirlik ve beklenmeyebilir?
Parametrelerin maksimum olasılık tahminlerini elde etmek neden bu kadar yaygındır, ancak neredeyse beklenen olasılık parametresi tahminlerini hiç duymazsınız (yani, bir olasılık olabilirlik fonksiyonu modundan ziyade beklenen değere dayanarak )? Bu öncelikle tarihsel nedenlerden mi, yoksa daha temel teknik veya teorik nedenlerden mi dolayı? Azami olabilirlik tahminleri yerine beklenen olasılık tahminlerini …

2
İkili bir matrisin kümelenmesi
250k x 100 boyutunda ikili özelliklerin yarı küçük bir matrisine sahibim. Her satır bir kullanıcıdır ve sütunlar bazı kullanıcı davranışlarının örneğin "likes_cats" gibi ikili "etiketleri" dir. user 1 2 3 4 5 ... ------------------------- A 1 0 1 0 1 B 0 1 0 1 0 C 1 0 0 …

3
Simpson'ın paradoksunu anlama: Andrew Gelman'ın cinsiyet ve boy üzerindeki gelirini gerileme örneği
Son blog yazılarından Andrew Gelman diyor ki: Simpsonların paradoksu için karşı tarafların ya da potansiyel sonuçların gerekli olduğunu düşünmüyorum. Bunu söylüyorum, çünkü biri manipüle edilemeyen veya manipülasyonların doğrudan ilgilenmediği değişkenlerle Simpson'un paradoksunu kurabilir. Simpson'un paradoksu, daha fazla yordayıcı eklerseniz, regresyon coef'lerinin değiştiği daha genel bir sorunun bir parçasıdır, işaretin saygısızlığı …


2
Elastik net lojistik regresyonda optimal alfa seçimi
0'dan 1'e birglmnet ızgarası üzerinde lambda değerleri seçerek R'deki paketi kullanarak sağlık veri setinde elastik-net bir lojistik regresyon yapıyorum. Kısaltılmış kodum aşağıda:αα\alpha alphalist <- seq(0,1,by=0.1) elasticnet <- lapply(alphalist, function(a){ cv.glmnet(x, y, alpha=a, family="binomial", lambda.min.ratio=.001) }) for (i in 1:11) {print(min(elasticnet[[i]]$cvm))} bu, her bir alfa değeri için ortalama çaprazlama hatasını bir …

2
Regresyonda Wald testi (OLS ve GLM'ler): t - z dağılımı
(: Örn Wasserman (2006) Ben regresyon katsayıları için Wald testi asimptotik tutan aşağıdaki özelliği dayanmaktadır anlıyoruz İstatistik All , sayfa 153, 214-215): βregresyon katsayısı gösterir^se(β)regresyon katsayısı standart hata gösterir veβ, 0(ilgili bir değerdirβ0genellikle 0 katsayının 0'dan önemli ölçüde farklı olup olmadığını test etmek için). Boyutu * YaniαWald testidir: reddetmekH0zaman| W| …

3
Lars ve Glmnet neden Kement sorununa farklı çözümler sunuyor?
Daha iyi R paketleri anlamaya isteyen Larsve Glmnet: Kement sorunu çözmek için kullanılır, ( Değişkenler ve örnekleri için, bkz. www.stanford.edu/~hastie/Papers/glmnet.pdf , sayfa 3)m i n( β0β) ∈ Rp + 1[ 12 NΣi = 1N-( yben- β0- xTbenβ)2+ λ | | β||l1]mbenn(β0β)∈R,p+1[12N-Σben=1N-(yben-β0-xbenTβ)2+λ||β||l1]min_{(\beta_0 \beta) \in R^{p+1}} \left[\frac{1}{2N}\sum_{i=1}^{N}(y_i-\beta_0-x_i^T\beta)^2 + \lambda||\beta ||_{l_{1}} \right]pppN-N-N Bu …

8
K-araçlarının (veya yakın akrabalarının) kümelemeyi, sadece nokta-özellik verileriyle değil, yalnızca bir mesafe matrisiyle kümelemeyi gerçekleştirin.
Sahip olduğum nesnelere K-aracı kümelemesi yapmak istiyorum, ancak nesneler uzayda nokta, yani objects x featuresveri kümesi tarafından tanımlanmadı . Ancak, herhangi iki nesne arasındaki mesafeyi hesaplayabiliyorum (benzerlik işlevine dayanıyor). Bu yüzden mesafe matrisini elden çıkarıyorum objects x objects. Daha önce K-araçları kullandım, ancak bu nokta veri kümesi girdisiydi; ve uzaklık …

4
Angry Birds'ü oynamak için nasıl bir makine öğrenme sistemi tasarlarsınız?
Çok fazla Angry Birds oynadıktan sonra kendi stratejilerimi izlemeye başladım. Her seviyede 3 yıldız almak için çok özel bir yaklaşım geliştirdiğim ortaya çıktı. Bu beni Angry Birds oynayabilecek bir makine öğrenme sistemi geliştirmenin zorlukları hakkında merak etti. Oyun ile etkileşime girme ve kuşları başlatma önemsizdir. Ancak sahip olduğum tek soru …

1
Etkileşim için sınıf içi korelasyon (ICC)?
Her sitedeki her konu için bazı ölçümler aldığımı varsayalım. Konu ve alan olmak üzere iki değişken bilgisayar içi korelasyon (ICC) değerleri açısından ilgi çekicidir. Genelde lmerR paketindeki işlevi kullanırdım lme4ve çalıştırırım. lmer(measurement ~ 1 + (1 | subject) + (1 | site), mydata) ICC değerleri, yukarıdaki modeldeki rastgele etkiler için …


2
Daha sonra bir kutu grafiği üretebileceğim çok sayıda örneği tanımlayan bir istatistik kümesi biriktirmek mümkün mü?
Bir istatistikçi değil pratik bir yazılım geliştirici olduğumu ve üniversite istatistik sınıfımın çok uzun zaman önceydi ... Bununla birlikte, bir grup münferit örneklerin depolanmasını gerektirmeyen bir kutu grafiği üretmek için kullanılabilecek bir dizi tanımlayıcı istatistik biriktirmek için bir yöntem olup olmadığını bilmek istiyorum. Yapmaya çalıştığım, karmaşık çok sıralı bir işlem …

5
Dağılımlardaki farklılıkların önemini değerlendirme
İki veri grubum var. Her biri farklı değişkenlere sahip farklı dağılımlara sahip. Bu iki grubun dağılımının istatistiksel olarak anlamlı bir şekilde farklı olup olmadığını belirlemeye çalışıyorum. Veriler hem ham formda, hem de her birinde frekans sayıları olan ayrık kategorilerle uğraşmak için daha kolay toplandım. Bu iki grubun önemli ölçüde farklı …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.