İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
KNN için optimum K seçimi
KNN için optimal K'yi seçmek için 5 kat CV yaptım. Görünüşe göre K büyüdükçe hata küçülüyor ... Maalesef bir efsanem yoktu, ancak farklı renkler farklı denemeleri temsil ediyor. Toplam 5 var ve aralarında çok az değişiklik var gibi görünüyor. K büyüdükçe hata her zaman azalır. Peki en iyi K'yi nasıl …


2
Eşit olmayan varyanslarla t testinde tamsayı serbestlik derecesi açıklaması
SPSS t-Test prosedürü, 2 bağımsız aracı karşılaştırırken 2 analiz, bir varsayı eşit varyanslı ve bir varsayı varyanslı değil olarak karşılaştırır. Eşit varyansların varsayıldığı zaman serbestlik derecesi (df) her zaman tamsayı değerleridir (ve eşit n-2). Eşit varyanslar varsayılmadığında df tamsayı değildir (örn. 11.467) ve hiçbir yerde n-2'ye yakın değildir. Ben bu …

4
Gizli özelliklerin anlamı?
Tavsiye sistemleri için matris çarpanlara ayırma modellerini anlamaya çalışıyorum ve her zaman 'gizli özellikleri' okuyorum, ama bu ne anlama geliyor? Bir özelliğin bir eğitim veri kümesi için ne anlama geldiğini biliyorum, ancak gizli özellikler fikrini anlayamıyorum. Konuyla ilgili bulabildiğim her makale çok sığ. Düzenle: en azından beni fikri açıklayan bazı …

3
Uygulamada Kullback-Leibler Diverjansını hesaplayın.
KL Divergence'ı 2 ve arasındaki farklılığın bir ölçüsü olarak kullanıyorum .P Qp.m.f.p.m.f.p.m.f. PPPQQQ =-∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))DKL(P||Q)=∑i=1Nln(PiQi)PiDKL(P||Q)=∑i=1Nln⁡(PiQi)PiD_{KL}(P||Q) = \sum_{i=1}^N \ln \left( \frac{P_i}{Q_i} \right) P_i =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=-\sum P(X_i)ln\left(Q(X_i)\right) + \sum P(X_i)ln\left(P(X_i)\right) Eğer sonra kolayca hesaplayabilir P ( X i ) l n ( Q ( X i ) ) = 0 P ( X i …

4
Sabit etkiler modelinde zamanla değişmeyen değişkenler nasıl tutulur
On yıldır büyük bir İtalyan firmasının çalışanları hakkında verilerim var ve erkek-kadın kazançlarındaki cinsiyet farklılığının zaman içinde nasıl değiştiğini görmek istiyorum. Bu amaçla toplanmış OLS çalıştırıyorum: burada günlük , , kişiye ve zamana göre farklılık gösteren ortak değişkenler içerir, yıl mankenleridir ve , bir işçi erkek ise ve aksi halde …

2
Sürekli ve ikili verileri doğrusal SVM ile mi karıştırıyorsunuz?
Bu yüzden SVM'lerle oynuyorum ve bunun iyi bir şey olup olmadığını merak ediyorum: Ben sürekli özellikleri (0-1) bir dizi ve ben kukla değişkenlere dönüştürdü kategorik özellikleri bir dizi var. Bu özel durumda, kukla değişkente ölçüm tarihini kodlarım: Veri aldığım 3 dönem var ve onlar için 3 özellik numarası ayırdım: 20: …

1
Çok değişkenli biyolojik zaman serileri: VAR ve mevsimsellik
Etkileşen biyolojik ve çevresel değişkenler (artı muhtemelen bazı ekzojen değişkenler) dahil olmak üzere çok değişkenli bir zaman serisi veri setim var. Mevsimsellik dışında, verilerde uzun vadeli net bir eğilim yoktur. Amacım, hangi değişkenlerin birbiriyle ilişkili olduğunu görmek. Tahmin gerçekten aranmaz. Zaman serileri analizinde yeni olan birkaç referans okudum. Anladığım kadarıyla, …

1
Çapraz Entropi Nedir?
Bu soru , formülü açısından çapraz entropinin nicel bir tanımını vermektedir. Daha kavramsal bir tanım arıyorum, wikipedia diyor ki: Bilgi teorisinde, iki olasılık dağılımı arasındaki çapraz entropi , "gerçek" dağılım p yerine belirli bir olasılık dağılımına q dayalı bir kodlama şeması kullanılırsa , bir dizi olasılıktan bir olayı tanımlamak için …


1
Neden glmer (family = binomial) çıktıyı Gauss-Newton algoritmasının manuel uygulamasıyla eşleştiremiyorum?
Lmer'in (gerçekten parıldayan) çıktılarını bir oyuncak binomial örneğiyle eşleştirmek istiyorum. Vinyetleri okudum ve neler olduğunu anladığımı düşünüyorum. Ama görünüşe göre değil. Sıkıştıktan sonra, "gerçeği" rastgele etkiler açısından sabitledim ve sadece sabit etkilerin tahmin edilmesinden sonra gittim. Bu kodu aşağıya ekliyorum. + Z %*% b.kYasal olduğunu görmek için yorum yapabilir ve …


1
İlişkileri çoklu doğrusal modelden görsel olarak sunmanın en iyi yolu
Yaklaşık 6 öngörücü içeren doğrusal bir modelim var ve tahminler, F değerleri, p değerleri vb. cevap değişkeni? Dağılım grafiği? Koşullu Arsa? Etkiler arsa? vb? Bu komployu nasıl yorumlayabilirim? Bunu R'de yapacağım, bu yüzden mümkünse örnekler vermekten çekinmeyin. EDIT: Ben öncelikle herhangi bir öngörücü ve yanıt değişkeni arasındaki ilişkiyi sunmakla ilgileniyorum.

1
Hessen lojistik fonksiyon
Nesnel fonksiyonun Hessian türetmek için zorluk lojistik regresyon, olan: l ( θ )l(θ)l(\theta)l ( θ )l(θ)l(\theta)l ( θ ) = ∑i = 1m[ ybengünlük( sθ( xben) ) + ( 1 - yben) günlüğü( 1 - sa.θ( xben) ) ]l(θ)=∑i=1m[yilog⁡(hθ(xi))+(1−yi)log⁡(1−hθ(xi))] l(\theta)=\sum_{i=1}^{m} \left[y_{i} \log(h_\theta(x_{i})) + (1- y_{i}) \log (1 - h_\theta(x_{i}))\right] X …
15 logistic 

2
MCMC Metropolis-Hastings varyasyonları ile karıştırılır: Random-Walk, Random-Walk, Bağımsız, Metropolis
Son birkaç haftadır MCMC'yi ve Metropolis-Hastings algoritmalarını anlamaya çalışıyorum. Ne zaman anlasam yanlış olduğumu anlıyorum. On-line bulmak kod örnekleri çoğu açıklama ile tutarlı olmayan bir şey uygulamak. yani: Metropolis-Hastings'i uyguladıklarını söylüyorlar ama aslında rastgele yürüyüş metropolü uyguluyorlar. Diğerleri (neredeyse her zaman), Simetrik bir teklif dağıtımı kullandıkları için Hastings düzeltme oranının …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.