İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Basit doğrusal regresyon sonuçlarının raporlanması: hangi bilgiler dahil edilmelidir?
Genstat'ta bazı (çok) basit doğrusal regresyon gerçekleştirdim ve raporumdaki çıktının özlü ve anlamlı bir özetini eklemek istiyorum. Tam olarak ne veya ne kadar bilgi içermem gerektiğinden emin değilim. Genstat çıkışımın ana bitleri şöyle görünür: Summary of analysis Source d.f. s.s. m.s. v.r. F pr. Regression 1 8128935. 8128935. 814.41 <.001 …


1
İnsanlar neden “kanıt ağırlığı” terimini kullanıyorlar ve “noktaya dayalı karşılıklı bilgiler” den farkı nedir?
Burada, "kanıt ağırlığı" (WOE) yayınlanmış bilimsel ve politika belirleme literatüründe, çoğunlukla risk değerlendirmesi bağlamında görülen ve aşağıdakilerle tanımlanan yaygın bir terimdir: w ( e : h ) = günlükp ( e | h )p ( e | h¯¯¯)w(e:h)=log⁡p(e|h)p(e|h¯)w(e : h) = \log\frac{p(e|h)}{p(e|\overline{h})} burada kanıttır, hipotezdir.heeehhh Şimdi PMI ile ana farkın …

2
Faktörden R = kapalı değişkene dönüştürme sorunu [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Soruyu , Çapraz Doğrulanmış için konuyla ilgili olacak şekilde güncelleyin . 7 yıl önce kapalı . Bir faktör değişkeni sayısal bir dönüştürmek istiyorum ama as.numericbeklediğim bir etkisi yok. Aşağıda, orijinal değişkene dayalı olarak değişkenin …


1
Güven aralığı ve güvenilir aralığın çakıştığı zaman örnekleri
Güvenilir Aralık hakkındaki wikipedia makalesinde şöyle diyor: Tek bir parametre ve tek bir yeterli istatistikte özetlenebilecek veriler söz konusu olduğunda, bilinmeyen parametre bir konum parametresi ise (yani ileri olasılık fonksiyonunun forma sahip olması durumunda) güvenilir aralığın ve güven aralığının çakışacağı gösterilebilir Pr (x | μ) = f (x - μ)), …


1
GLM için ne tür artıklar ve Cook mesafesi kullanılıyor?
Cook mesafesinin formülünün ne olduğunu bilen var mı? Orijinal Cook'un mesafe formülü öğrenci kalıntılarını kullanır, ancak R neden std kullanıyor? Cook'un bir GLM için mesafe grafiğini hesaplarken Pearson kalıntıları. Öğrenci kalıntılarının GLM'ler için tanımlanmadığını biliyorum, ancak Cook'un mesafesini hesaplamak için formül nasıl görünüyor? Aşağıdaki örneği varsayalım: numberofdrugs <- rcauchy(84, 10) …

2
Sütun dizinini R [kapalı] içinde adına göre bulma
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Soruyu , Çapraz Doğrulanmış için konuyla ilgili olacak şekilde güncelleyin . 6 yıl önce kapalı . Bir veri çerçevesinde, sütunun dizin adıyla almak istiyorum. Örneğin: x <- data.frame(foo=c('a','b','c'),bar=c(4,5,6),quux=c(4,5,6)) "Bar" için sütun dizini bilmek istiyorum. …
11 r 

1
Belirsizliklerin nasıl toplandığını görselleştirmek için hangi grafik yöntemler yararlıdır?
İçinde belirsizliklerin biriktiği bir dizi sistemim var. Bunlar her zaman tamamen katkı maddesi değildir - bazen öyledir, bazen değildir. Hayran grafiklerini, güven aralıklı çubuk grafiklerini ve tekil öğeleri iletmek için kutu grafiklerini kullanmada biraz başarılı oldum. Ancak, belirsizliklerin nasıl biriktiğini ve birleştirildiğini nasıl gösterirken, belirsizliklerin etrafında durduğu veri noktalarını da …


1
ARIMA (1,1,0) serilerinin simülasyonu
ARIMA modellerini orijinal zaman serisine yerleştirdim ve en iyi model ARIMA (1,1,0). Şimdi diziyi bu modelden simüle etmek istiyorum. Basit AR (1) modelini yazdım, ancak ARI (1,1,0) modelindeki farkı nasıl ayarlayacağımı anlayamadım. AR (1) serisi için aşağıdaki R kodu: phi= -0.7048 z=rep(0,100) e=rnorm(n=100,0,0.345) cons=2.1 z[1]=4.1 for (i in 2:100) z[i]=cons+phi*z[i-1]+e[i] …
11 r  time-series  arima 

2
İki ağırlıklı rasgele değişkenin varyansı
İzin Vermek: Rasgele değişken A'nın standart sapması = σ 1 = 5A=σ1=5A=σ1=5A =\sigma_{1}=5 Rastgele değişken B'nin standart sapması = σ 2 = 4B=σ2=4B=σ2=4B=\sigma_{2}=4 O zaman A + B'nin varyansı: Var(w1A+w2B)=w21σ21+w22σ22+2w1w2p1,2σ1σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} Nerede: iki rasgele değişken arasındaki korelasyondur.p1,2p1,2p_{1,2} , rastgele değişken A ağırlığıdırw1w1w_{1} rastgele değişken B ağırlığıdırw2w2w_{2} w1+w2=1w1+w2=1w_{1}+w_{2}=1 Aşağıdaki şekil …

4
K-araçlarının bir uygulamasını nasıl test edersiniz?
Feragatname: Bu soruyu Stackoverflow'a gönderdim, ancak belki de bu platform için daha uygun olduğunu düşündüm. Çok boyutlu veri kümeleri için kendi k-araç uygulamanızı nasıl test edersiniz? Veriler üzerinde zaten var olan bir uygulamayı (yani Matlab) çalıştırmayı ve sonuçları algoritmamla karşılaştırmayı düşünüyordum. Ancak bu, her iki algoritmanın da kabaca aynı olandan …

4
Büyük numunelerle t-testi nasıl yapılır?
Biri N = 38,704 (gözlem sayısı) ve diğeri N = 1,313,662 olan iki popülasyonum var. Bu veri kümelerinin tümü ~ 25 değişkendir. Her veri kümesindeki her birinin ortalamasını aldım ve formülünü kullanarak test istatistiklerini hesapladım t = ortalama fark / std hatası Sorun özgürlük derecesidir. Df = N1 + N2-2 …
11 t-test 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.