İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
2D normal dağılım yarıçapının örnekleme dağılımı
Ortalama ile iki değişkenli normal dağılım ve kovaryans matrisi olabilir kutupsal koordinatlarda yazılı yeniden yarıçapı ile ve açı . Sorum şu: örnek dağılımı nedir bir noktaya gelen mesafenin olduğu, tahmin merkezi için örnek kovaryans matrisi verilmiş ?μμ\muΣΣ\Sigmarrrθθ\thetar^r^\hat{r}xxxx¯x¯\bar{x}SSS Arka plan: gerçek mesafe bir noktadan x anlamına μ bir şu Hoyt dağılımı …

1
Beklenti Maksimizasyon Açıklama
EM algoritması ile ilgili çok faydalı bir eğitim buldum . Örnek ve öğretici resim sadece parlak. Olasılıkların hesaplanması ile ilgili soru Beklenti maksimizasyonu nasıl çalışır? Öğreticide açıklanan teorinin örneğe nasıl bağlanacağıyla ilgili başka bir sorum var. E aşaması sırasında, EM bir işlev seçer bu alt sınır , her yerde, ve …

2
Laplace yumuşatma ve Dirichlet önceki
Açık Ara maddesi Laplace yumuşatma (ya da katkı maddesi düzgünleştirme) arasında, söz konusu olan bir görüş Bayes açıdan, bu, önceki olarak parametresiyle simetrik bir Dirichlet dağılımı kullanarak posterior dağılımın beklenen değerine karşılık gelir .αα\alpha Bunun nasıl doğru olduğu konusunda şaşkınım. Birisi bu iki şeyin nasıl eşdeğer olduğunu anlamama yardımcı olabilir …

3
Newman'ın ağ modülerliği imzalı, ağırlıklı grafikler için çalışıyor mu?
Bir grafiğin modülerliği Wikipedia sayfasında tanımlanır . Bir de farklı bir yazı , biri komşuluk matrisi çünkü bu modüler kolayca ağırlıklı ağlar için hesaplanan (ve maksimize) olabilir açıklandığı hem de değerli bağlarını içerebilir. Bununla birlikte, bunun örneğin -10 ila +10 arasında değişen işaretli, değerli kenarlarla da çalışıp çalışmayacağını bilmek istiyorum. …

1
AIC değerleri düşük ve yaklaşık olarak eşit olduğunda ne yapmalıyım?
Okuduğum birçok kaliteli kitabı ve makalesi olan Chris Chatfield, (1) 'de aşağıdaki tavsiyelerde bulunur: Örneğin, AIC'nin düşük ve yaklaşık olarak eşit değerlerine sahip ARIMA zaman serisi modelleri arasında seçim yapılması, muhtemelen en az AIC'yi vermek değil, en son yıl verilerinin en iyi tahminlerini vermek için yapılmalıdır. Bu tavsiyenin mantığı nedir? …

4
Bir katsayıyı düzeltme ve regresyon kullanarak diğerlerine uyma
El ile belirli bir katsayı çözmek isteriz derler , tüm diğer öngördü- sonra uygun katsayılar, tutma sırasında modelinde.β 1 = 1,0β1=1.0β1=1.0\beta_1=1.0β1=1.0β1=1.0\beta_1=1.0 R kullanarak bunu nasıl başarabilirim? Mümkünse özellikle LASSO ( glmnet) ile çalışmak istiyorum . Alternatif olarak, bu katsayıyı belirli bir aralıkla nasıl kısıtlayabilirim ?0.5≤β1≤1.00.5≤β1≤1.00.5\le\beta_1\le1.0

2
Gerçek dünyadaki bir ağdaki / grafikteki tüm kenarların istatistiksel olarak şans eseri olması muhtemeldir?
Bu yazıda özetlenen omurga ağ çıkarma yöntemini kullanıyorum: http://www.pnas.org/content/106/16/6483.abstract Temel olarak, yazarlar, grafikteki her kenar için, kenarın tesadüfen gerçekleşmiş olabileceği olasılığını üreten istatistiklere dayanan bir yöntem önermektedir. 0,05'lik tipik istatistiksel anlamlılık kesimini kullanıyorum. Bu yöntemi birkaç gerçek dünya ağına uyguluyorum ve ilginç bir şekilde bazı ağlar önemli derecede kenarsız. Bunun …

2
İstatistikçi olmayan bir kişiye genelleştirilmiş anlar yöntemini açıklama
Genelleştirilmiş Moment Yöntemlerini nasıl açıklarım ve istatistikçi olmayanlara nasıl kullanıldığını nasıl anlarım? Şimdiye kadar gidiyorum: topladığımız örneklere dayalı ortalamalar ve varyasyon gibi koşulları tahmin etmek için kullandığımız bir şey. Varyansı en aza indirgeyerek parametre vektörünü tahmin ettiğiniz kısmı nasıl açıklayabilirim?

1
2 persentil kullanarak lognormal dağılım için ortalama ve standart sapma nasıl hesaplanır
Lognormal dağılım için 2 persentilden ortalama ve standart sapmayı hesaplamaya çalışıyorum. X = mean + sd * ZOrtalama ve sd kullanarak normal dağılım için hesaplama yapmayı başardım . Aynı şeyi lognormal bir dağılım için yapmaya çalıştığımda denklem eksik olduğunu düşünüyorum. Wikipedia'ya baktım ve kullanmaya çalışıyorum ln(X) = mean + sd …
11 r  lognormal 

2
Boyuna değişiklikleri belirlemek / tahmin etmek için kesit verilerini kullanmak Neden Kötü Bir Şey?
Var olduğunu umduğum bir kağıt arıyorum, ama olup olmadığını bilmiyorum. Boylamsal değişiklikleri ortaya çıkarmak / tahmin etmek için kesitsel verilerin kullanılmasının neden Kötü Bir Şey olabileceği (yani zorunlu olarak değil, ancak olabilir) hakkında bir dizi vaka çalışması ve / veya olasılık teorisinden bir argüman olabilir. Birkaç büyük yolla yapılan hatayı …


1
Küme doğrulaması için bilgi (VI) metriğinin varyasyonunun ardındaki sezgi nedir?
Benim gibi istatistikçi olmayanlar için, VIMarina Melia'nın " Kümelenmeleri karşılaştırmak - bilgiye dayalı bir mesafe " tarafından ilgili makaleyi okuduktan sonra bile metrik (bilgi değişimi) fikrini yakalamak çok zordur (Journal of Çok Değişkenli Analiz, 2007). Aslında, kümelenme şartlarının çoğuna aşina değilim. Aşağıda bir MWE ve kullanılan farklı metriklerde çıktının ne …

2
T-dağıtılmış rasgele değişkenlerin karelerinin toplamının dağılımı
Kuyruk üssü ile T dağıtılmış rastgele değişkenlerin karelerinin toplamının dağılımına bakıyorum . X, rv olduğunda, , için Fourier dönüşümü bana önceki kare için bir çözüm verir . αα\alphaX2X2X^2F(t)F(t)\mathscr{F}(t)F(t)nF(t)n\mathscr{F}(t)^nF( t ) = ∫∞0tecrübe( bentx2) ⎛⎝⎜⎜⎜( αα + x2)α + 12α--√ B ( α2, 12)⎞⎠⎟⎟⎟g xF(t)=∫0∞exp⁡(itx2)((αα+x2)α+12α B(α2,12))dx\mathscr{F}(t)=\int_0^{\infty } \exp \left(i\, t\, x^2\right)\left(\frac{\left(\frac{\alpha …

4
Lojistik Regresyon ve Çekme Noktası
İkili sonuç ve bazı ortak değişkenler içeren verilerimiz var. Verileri modellemek için lojistik regresyon kullandım. Sadece basit bir analiz, olağanüstü bir şey değil. Nihai çıktının, belirli bir eş değişken için olasılığın nasıl değiştiğini gösterdiğimiz bir doz-yanıt eğrisi olması gerekiyordu. Bunun gibi bir şey: Lojistik regresyonu seçmek için dahili bir gözden …

2
Merkez sansürlü Normal örneklerin tahmini varyansı
Normal olarak dağıtılmış, varyansı tahmin etmek için kullanmak istediğim küçük örnekleri ( n tipik olarak 10-30) aldığım işlemlerim var. Ancak sık sık numuneler birbirine çok yakındır, merkezin yakınındaki bireysel noktaları ölçemeyiz. Bu belirsiz anlayışı, sipariş edilen örnekleri kullanarak verimli bir tahminci oluşturabilmemiz gerektiğini anlıyorum: Örneğin, numunenin 20 puan içerdiğini bildiğimde …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.