İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Değişkenlerin bir vektörü bir hiper düzlemi nasıl temsil edebilir?
İstatistiksel Öğrenmenin Unsurlarını okuyorum ve sayfa 12'de (bölüm 2.3) doğrusal bir model şöyle belirtiliyor: Yˆ= XTβˆY^=XTβ^\widehat{Y} = X^{T} \widehat{\beta} ... ki burada , öngörücülerin / bağımsız değişkenlerin / girişlerin bir sütun vektörünün devrik olmasıdır. (O kadar değil bu marka ediyorum "bütün vektörler sütun vektörleri olduğu varsayılır" önceki devletler X , …

1
Örnek kovaryans matrisi ters çevrilemezse ne yapmalı?
Bazı kümeleme teknikleri üzerinde çalışıyorum, burada belirli bir d-boyut vektörleri kümesi için çok değişkenli normal dağılım varsayıyorum ve örnek d-boyutlu ortalama vektörü ve örnek kovaryans matrisini hesaplıyorum. Sonra yeni, görünmeyen, d boyutlu bir vektörün bu kümeye ait olup olmadığına karar vermeye çalışırken mesafesini şu ölçü ile kontrol ediyorum: ( Xben- …

1
Çok boyutlu noktalar arasındaki varyans nasıl bulunur?
Diyelim ki p ile n olan bir X matrisine sahibim, yani n gözlemine sahip, her gözlem p-boyutlu uzayda. Bu n gözlemlerin varyansını nasıl bulurum? P = 1 olduğu durumda, sadece normal varyans formülünü kullanmam gerekiyor. P> 1 olan durumlar ne olacak?
12 variance 

3
Bildirilecek önemli basamak sayısı
Oldukça standart olan bir durumda ortalama veya güven aralığı için raporlanacak anlamlı basamak sayısını belirlemenin daha bilimsel bir yolu var mı - örneğin, üniversitedeki birinci sınıf sınıfı. Bir tabloya koymak için önemli rakamların sayısını gördüm , Neden önemli basamakları ve chi kare uyumunda anlamlı rakamlar kullanmıyoruz , ancak bunlar parmağını …

4
Kütük Doğrusal Modeller
Birisi Log Logear Modelleri'ni neden çok yalın terimlerle kullandığımızı açıklayabilir mi? Mühendislik geçmişinden geliyorum ve bu gerçekten benim için zor bir konu, yani istatistikler. Bir cevap için minnettar olacağım.

1
İstatistiksel bir model için uygun ve öngörülen değerleri bulma
Diyelim ki aşağıdaki verilerim var ve bir regresyon modeli kullanıyorum: df=data.frame(income=c(5,3,47,8,6,5), won=c(0,0,1,1,1,0), age=c(18,18,23,50,19,39), home=c(0,0,1,0,0,1)) Bir yandan, geliri tahmin etmek için doğrusal bir model çalıştırıyorum: md1 = lm(income ~ age + home + home, data=df) İkinci olarak, kazanılan değişkeni tahmin etmek için bir logit modeli çalıştırıyorum: md2 = glm(factor(won) ~ age …
12 r 

4
Birisi nasıl bağımlılık ve sıfır kovaryans olabileceğini gösterebilir mi?
Birisi Greg'in yaptığı gibi gösterebilir, ancak daha ayrıntılı olarak, rastgele değişkenler nasıl bağımlı olabilir, ancak sıfır kovaryansa sahip olabilir mi? Greg, ben bir poster, bir daire kullanarak bir örnek verir burada . Birisi bu işlemi birkaç aşamada gösteren bir dizi adım kullanarak daha ayrıntılı olarak açıklayabilir mi? Ayrıca, psikolojiden bir …

6
R'nin ur.df (Dickey-Fuller birim kök testi) sonuçlarını yorumlama
Aşağıdaki birim kök testini (Dickey-Fuller) paketteki ur.df()fonksiyonu kullanarak bir zaman serisinde çalıştırıyorum urca. Komut: summary(ur.df(d.Aus, type = "drift", 6)) Çıktı: ############################################### # Augmented Dickey-Fuller Test Unit Root Test # ############################################### Test regression drift Call: lm(formula = z.diff ~ z.lag.1 + 1 + z.diff.lag) Residuals: Min 1Q Median 3Q Max -0.266372 …

1
GLM'de kanonik bağlantı fonksiyonunun hesaplanması
Kanonik bağ fonksiyonunun g(⋅)g(⋅)g(\cdot) üstel ailenin doğal parametresinden geldiğini düşündüm . Diyelim ki f ( y , θ , ψ ) = exp { y θ - b ( θ ) ailesini düşünün f(y,θ,ψ)=exp{yθ−b(θ)a(ψ)−c(y,ψ)}f(y,θ,ψ)=exp⁡{yθ−b(θ)a(ψ)−c(y,ψ)} f(y,\theta,\psi)=\exp\left\{\frac{y\theta-b(\theta)}{a(\psi)}-c(y,\psi)\right\} sonraθ=θ(μ)θ=θ(μ)\theta=\theta(\mu)standart bağlantı işlevidir. Örnek olarakBernoulli dağılımınıelealalım, P(Y=y)=μy(1−μ)1−y=exp{ylogμ1−μ+log(1−μ)}P(Y=y)=μy(1−μ)1−y=exp⁡{ylog⁡μ1−μ+log⁡(1−μ)} P(Y=y)=\mu^{y}(1-\mu)^{1-y}=\exp\left\{y\log\frac{\mu}{1-\mu}+\log{(1-\mu)}\right\} Yani, kanonik bağlantı fonksiyonug(μ)=logμ1−μg(μ)=log⁡μ1−μg(\mu)=\log\frac{\mu}{1-\mu} Ama bu slaydı …

1
Çok değişkenli zaman serileri için önyükleme bloğuna alternatif
Şu anda R'de çok değişkenli bir zaman serisini önyüklemek için aşağıdaki işlemi kullanıyorum: Blok boyutlarını belirlemek - fonksiyonu çalıştırmak b.stariçinde npher bir seri için bir blok boyutu üreten paket Maksimum blok boyutunu seçin tsbootSeçili blok boyutunu kullanarak herhangi bir seride çalıştırın Çok değişkenli zaman serilerini yeniden yapılandırmak için bootstrap çıktısından …

1
Ondan bir çekilişin, önceden belirlenmiş başka bir dağılımdan bir çekişme ile ilişkili olacak şekilde bir dağılım nasıl tanımlanır?
Nasıl bir rastgele değişkenin dağılımını tanımlarım örneğin bir çekme olduğu bir ilişki vardır ile , kümülatif dağılım fonksiyonu ile bir dağılımdan tek beraberlik ? Y ρ x 1 x 1 F X ( x )YYYYYYρρ\rhox1x1x_1x1x1x_1FX(x)FX(x)F_{X}(x)

5
SE katılımcılarının “çok yönlü” ölçüsü nasıl ölçülür?
Stack Exchange, hepimizin bildiği gibi, çeşitli konulara sahip Soru-Cevap sitelerinin bir koleksiyonudur. Bir kullanıcının sahip olduğu istatistikler göz önüne alındığında, her sitenin birbirinden bağımsız olduğu varsayılarak, bir sonraki adama kıyasla "çok yönlü" ifadesi nasıl hesaplanır? Kullanmam gereken istatistiksel araç nedir? Dürüst olmak gerekirse, "iyi yuvarlaklığı" matematiksel olarak nasıl tanımlayacağımı tam …




Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.