İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Gibbs örneklemesi ile ilgili karışıklık
Gibbs örnekleminde her örneğin kabul edildiğini söyleyen bu makaleye rastladım . Biraz kafam karıştı. Kabul ettiği her numune sabit bir dağılıma yakınsa ne olur? Genel olarak Metropolis Algoritması, min (1, p (x *) / p (x)) olarak kabul ediyoruz; burada x *, numune noktasıdır. X * 'nin bizi yoğunluğun yüksek …

2
Lojistik regresyonda çarpık veri kümeleri için ağırlık ekleme
Giriş değişkenlerimi ikili çıkış değişkenlerine sığdırmak için standart bir lojistik regresyon sürümü kullanıyorum. Ancak benim sorunumda, negatif çıktılar (0s) pozitif çıktılardan (1s) çok daha fazla. Oran 20: 1'dir. Bu yüzden bir sınıflandırıcıyı eğittiğimde, pozitif bir çıktı olasılığını güçlü bir şekilde öne süren özelliklerin bile karşılık gelen parametreleri için hala çok …

1
R / düzeltme: tren ve test setleri ile çapraz validasyon mu?
Bu belki de aptalca bir soru olabilir, ancak caret ile bir model oluştururken LOOCVveya veya (hatta daha da fazlası) gibi bir şey kullanırken LGOCV, aslında çapraz doğrulama adımının bu olması durumunda verileri tren ve test setlerine bölmenin yararı nedir? neyse? İlgili soruların bazılarını okudum ve çapraz onaylama yöntemlerinden bazılarının (örneğin …

1
Merkezlenmiş değişkenler hiyerarşik regresyon analizi kullanarak etkileşim terimi? Hangi değişkenleri merkezlemeliyiz?
Hiyerarşik bir regresyon analizi yürütüyorum ve bazı şüphelerim var: Etkileşimli terimi ortalanmış değişkenleri kullanarak hesaplıyor muyuz? Bağımlı değişken hariç, veri kümesindeki sürekli değişkenlerin TÜMÜ'nü ortalamamız gerekiyor mu? Bazı değişkenleri günlüğe kaydetmemiz gerektiğinde (sd ortalamalarından çok daha yüksek olduğu için), daha önce günlüğe kaydedilen değişkeni mi yoksa ilk değişkeni mi ortalıyoruz? …

4
Ben pek çok olumlu, önemsiz sonuçlar varsa “en azından, ben test edebilirsiniz Bu sonuçların olumlu”?
Diyelim ki 100 farklı birey için aynı gerilemeyi ayrı olarak yürüttüm. İlgilenilen katsayılarım pozitif (ve birbirinden oldukça farklı) ama 100 sonuçta da istatistiksel olarak anlamsız (her p değeri = 0.11 diyelim). Bu p değerlerini "bu sonuçlardan en az 80'i pozitif" sonucunu p = 0.11'den daha büyük bir önemle birleştirmek için …

2
Bir meta analizde alt puanları en iyi nasıl ele alabilirim?
Metafor paketini kullanarak R etki boyutlarının d meta-analizini yapıyorum . d , hastalar ile sağlıklı arasındaki bellek puanlarındaki farklılıkları temsil eder. Bununla birlikte, bazı çalışmalar sadece ilgili d ölçümünün alt skorlarını rapor etmektedir (örneğin, birkaç farklı bellek skoru veya üç ayrı bellek testi bloğundan alınan skorlar). Lütfen çalışmaların etki boyutlarını …

4
Standart sapma formülünde “N” örnek sayısı için karekök neden alınır?
Çok temel bir standart sapma kavramını anlamaya çalışıyorum. Formül kaynaktanσ=∑i=1n(xi−μ)2N−−−−−−−−−−⎷σ=∑i=1n(xi−μ)2N\sigma= \sqrt{ \dfrac{ \sum\limits_{i=1}^n (x_i-\mu)^2} N } Niçin "N" popülasyonunu yarıya indirmemiz gerektiğini anlamıyorum, yani {N ^ 2} yapmadığımızda neden \ sqrt {N} almak istiyoruz ? Bu düşündüğümüz nüfusu çarpıtmıyor mu?N−−√N\sqrt{N}N2N2{N^2} Formül olmamalı σ=∑i=1n(xi−μ)2−−−−−−−−−√Nσ=∑i=1n(xi−μ)2N\sigma= \dfrac{ \sqrt{ \sum\limits_{i=1}^n (x_i-\mu)^2} } {N}

2
Önceden üniform bir ünite, maksimum olasılık ve posterior modundan aynı tahminlere nasıl yol açar?
Farklı nokta tahmin yöntemleri üzerinde çalışıyorum ve MAP vs ML tahminleri kullanırken, "tekdüze bir önceki" kullandığımızda tahminlerin aynı olduğunu okudum. Birisi "tekdüze" önceliğin ne olduğunu açıklayabilir ve MAP ve ML tahmincilerinin ne zaman aynı olacağına dair bazı (basit) örnekler verebilir mi?

3
Gauss süreci regresyon oyuncak sorunu
Gauss Süreci regresyonu için bazı sezgi kazanmaya çalışıyordum, bu yüzden denemek için basit bir 1D oyuncak problemi yaptım. I aldı girdi olarak ve yanıt olarak. ( 'İlham Alındı' )xben= { 1 , 2 , 3 }xben={1,2,3}x_i=\{1,2,3\}yben= { 1 , 4 , 9 }yben={1,4,9}y_i=\{1,4,9\}y=x2y=x2y=x^2 Regresyon için standart bir kare üstel çekirdek …

2
Lojistik regresyonda oran ve olasılık oranları
Bir lojistik regresyon açıklamasını anlamakta güçlük çekiyorum. Lojistik regresyon sıcaklık ile ölen ya da ölmeyen balıklar arasındadır. Lojistik regresyonun eğimi 1,76'dır. Daha sonra balığın ölme ihtimali exp (1.76) = 5.8 kat artmaktadır. Başka bir deyişle, balıkların ölme olasılığı, sıcaklıktaki 1 santigrat derecedeki her değişiklik için 5,8 kat artar. 2012'de% 50 …

2
Uyarlanabilir bir kopula nedir?
Temel sorum şu: Uyarlanabilir bir kopula nedir? Bir sunumdan slaytlarım var (ne yazık ki, slaytların yazarına uyarlamalı kopulalar hakkında soru soramıyorum) ve bunun ne anlama geldiğini anlamıyorum. bu ne için iyi? Slaytlar şunlardır: Sonra slaytlar bir değişim noktası Testi ile devam eder. Bunun ne olduğunu ve neden kopulalarla bağlantılı olarak …


1
Düzeltilmiş R-kare, r-kare sabit puan veya rasgele puan popülasyonu tahmin etmeye çalışıyor mu?
Nüfus r-kare ρ2ρ2\rho^2 sabit puanlar veya rastgele puanlar varsayılarak tanımlanabilir: Sabit puanlar: Örnek büyüklüğü ve öngörücülerin belirli değerleri sabit tutulur. Böylece,ρ2fρf2\rho^2_f yordayıcı değerleri sabit tutulduğunda popülasyon regresyon denklemi tarafından elde edilen sonuçta açıklanan varyans oranıdır. Rastgele skorlar: Öngörücülerin belirli değerleri bir dağılımdan alınmıştır. Böylece,ρ2rρr2\rho^2_r Burada, "prediktör değerlerinin" prediktörlerin popülasyon dağılımına …

3
Rademacher rasgele değişkenlerin Ürünlerinin Toplamı
İzin Vermek x1…xa,y1…ybx1…xa,y1…ybx_1 \ldots x_a,y_1 \ldots y_b değerleri alan bağımsız rasgele değişkenler olmak +1+1+1 veya −1−1-1her biri 0,5 olasılıkla. Toplamı düşününS=∑i,jxi×yjS=∑i,jxi×yjS = \sum_{i,j} x_i\times y_j. Olasılığı üst sınırlandırmak istiyorumP(|S|>t)P(|S|>t)P(|S| > t). Şu an sahip olduğum en iyi sınır2e−ctmax(a,b)2e−ctmax(a,b)2e^{-\frac{ct}{\max(a,b)}}burada evrensel bir sabittir. Bu, basit Chernoff sınırlarının uygulanmasıyla ve olasılığını daha düşük …

1
Satış tahmininde benzersiz (?) Fikir
Bir ürünün toplam satışını tahmin etmek için bir model geliştirmeye çalışıyorum. Yaklaşık bir buçuk yıllık rezervasyon verilerim var, bu yüzden standart bir zaman serisi analizi yapabilirim. Ancak, kapalı ya da kayıp olan her 'fırsat' (potansiyel satış) hakkında da çok fazla veri var. 'Fırsatlar' bir boru hattının kapanana veya kaybedilene kadar …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.