İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Matematikçi olmayanlar için Clopper-Pearson
Herkes bana Clopper-Pearson CI'nin ötesindeki sezgiyi oranlar için açıklayabilir mi diye merak ediyordum. Bildiğim kadarıyla, her CI içinde bir varyans içerir. Bununla birlikte, oranlar için, oranım 0 veya 1 olsa bile (% 0 veya% 100), Clopper-Pearson CI hesaplanabilir. Formüllere bakmayı denedim ve Binom dağılımının yüzdelikleri ile bir şey olduğunu anlıyorum …

2
Anketten yararsız soruların belirlenmesi
Bir anket geliştiriyorum. Güvenilirliğini ve geçerliliğini artırmak için istatistiksel yöntemler kullanmak istiyorum. Cevapları hep aynı olan soruları ortadan kaldırmak istiyorum. Bu, neredeyse tüm katılımcıların bu sorulara aynı cevapları verdiği anlamına gelir. Şimdi sorularım: Kullanım bağlamından bağımsız olarak cevapları her zaman aynı olan bu işe yaramaz soruların teknik terimi nedir? Bu …

4
Belirsizlikleri içeren çekirdek yoğunluğu tahmini
Tek boyutlu verileri görselleştirirken, yanlış seçilmiş çöp gözlerini hesaba katmak için Çekirdek Yoğunluğu Tahmini tekniğini kullanmak yaygındır. Tek boyutlu veri kümemde ölçüm belirsizlikleri olduğunda, bu bilgileri dahil etmenin standart bir yolu var mı? Örneğin (ve anlayışım safsa beni affet) KDE, Gauss profilini, gözlemlerin delta fonksiyonları ile birleştirir. Bu Gauss çekirdeği …

1
Karma efektli sayım verileri için iyi bir model bulmakta sorun - ZINB veya başka bir şey?
Yalnız arı bolluğu ile ilgili çok küçük bir veri setim var, analiz etmekte zorlanıyorum. Sayım verileri ve neredeyse tüm sayımlar bir tedavide, diğer tedavide sıfırların çoğu ile. Ayrıca çok yüksek birkaç değer vardır (altı alanın ikisinde birer tane), bu nedenle sayımların dağılımı son derece uzun bir kuyruğa sahiptir. R'de çalışıyorum. …

4
Çapraz doğrulama ile temel gerçeği olmayan bir veri kümesinde farklı kümeleme yöntemlerini karşılaştırabilir misiniz?
Şu anda, temel gerçeği olmayan bir metin belgesi veri kümesini analiz etmeye çalışıyorum. Farklı kümeleme yöntemlerini karşılaştırmak için k-kat çapraz doğrulamayı kullanabileceğiniz söylendi. Ancak, geçmişte gördüğüm örnekler temel bir hakikat kullanır. Sonuçlarımı doğrulamak için bu veri kümesinde k-katlama araçlarını kullanmanın bir yolu var mı?

1
Berry inversiyonu
ABD'de şarap satışlarına ilişkin büyük bir toplam pazar verilerim var ve bazı yüksek kaliteli şaraplara olan talebi tahmin etmek istiyorum. Bu pazar payları temel olarak X'in gözlemlendiği dahil olduğu biçiminde rastgele bir yarar modelinden türetilmiştir. ürün özellikleri, p ürün fiyatlarını gösterir, ξUijt=X′jtβ−αpjt+ξjt+ϵijt≡δjt+ϵjtUijt=Xjt′β−αpjt+ξjt+ϵijt≡δjt+ϵjtU_{ijt} = X’_{jt}\beta - \alpha p_{jt} + \xi_{jt} + …

2
Kitleler için Pizza İstatistikleri
NY Times web sitesine kısa bir giriş ABD'de pizza tüketiminin Gerçekleri ve Rakamları sağlar . Genel kitlelere bilgi sağlamak için istatistiklerin nasıl kullanıldığına (veya kötüye kullanıldığına) dair geçici bir ilgim var ve sunulan istatistiklere dayanarak birkaç soru ortaya çıktı: 8 Amerikalıdan 1'i bugün pizza yiyecekse, bu ortalama Amerikalıların her 8 …

1
Genelleştirilmiş doğrusal olmayan en küçük kareler regresyonu (nlme) için günlük olasılığını “elle” hesaplayın
Ben tarafından optimize edilmiş işlevi için genelleştirilmiş doğrusal olmayan en küçük kareler regresyonu için günlük olasılığını hesaplamaya çalışıyorum R paketin fonksiyon , (Brown hareketi varsayarak aa filogenetik ağaç mesafe tarafından meydana varyans kovaryans matrisi kullanılarak gelen paket). Aşağıdaki yeniden üretilebilir R kodu, gnls modeline x, y verileri ve 9 taksonlu …

4
Regresyon artık dağılım varsayımları
Dağılım varsayımını hatalara neden koymak gerekir? ϵ i ∼ N ( 0 , σ 2 )yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , .ϵi∼N(0,σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) Neden yazmıyorsun y ı ~ N ( X, β , σ 2 )yi=Xβ+ϵiyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , ,yi∼N(Xβ^,σ2)yi∼N(Xβ^,σ2)y_i \sim \mathcal{N}(X\hat{\beta},\sigma^{2}) burada her iki durumda da …

1
Lojistik regresyon için şapka matrisinden bilgi
Benim için açık ve birden fazla sitede, şapka matrisinin diyagonalindeki değerlerin doğrusal regresyon için verdiği bilgileri açıklıyor. Lojistik regresyon modelinin şapka matrisi bana daha az açık. Lineer regresyon uygulayarak şapka matrisinden aldığınız bilgilerle aynı mı? Bu, başka bir CV konusunda (kaynak 1) bulduğum şapka matrisinin tanımıdır: H=VX(X′VX)−1X′VH=VX(X′VX)−1X′VH=VX ( X'V X)^-1 …

1
Bağımlı değişkenin bir "kesilmesi" olduğunda modelleme
Kullandığım terminolojilerden herhangi biri yanlışsa önceden özür dileriz. Herhangi bir düzeltmeyi memnuniyetle karşılarım. "Kesim" olarak tanımladığım şey farklı bir isme sahipse, bana bildirin ve soruyu güncelleyebilirim. İlgilendiğim durum şu: bağımsız değişkenleriniz var ve tek bağımlı değişken . Bunu belirsiz bırakacağım, ancak bu değişkenler için iyi bir regresyon modeli almanın nispeten …

5
Bir dağılımın basıklığı, yoğunluk fonksiyonunun geometrisi ile nasıl ilişkilidir?
Basıklık, bir dağılımın dorukluğunu ve düzlüğünü ölçmektir. Varsa, dağılımın yoğunluk fonksiyonu bir eğri olarak görülebilir ve şekliyle ilgili geometrik özelliklere (eğrilik, dışbükeylik, ...) sahiptir. Bir dağılımın basıklığının, kurtozun geometrik anlamını açıklayabilen yoğunluk fonksiyonunun bazı geometrik özellikleri ile ilişkili olup olmadığını merak ediyorum.

1
Gauss lineer modellerde F testi neden en güçlü?
Y= μ + σG,Y=μ+σGY=\mu+\sigma Gμμ\muWWWG,GGR,nRn\mathbb{R}^nFFFH0:{μ∈U}H0:{μ∈U}H_0\colon\{\mu \in U\}U⊂WU⊂WU \subset Wf=ϕ(2logsupμ∈W,σ>0L(μ,σ|y)supμ∈U,σ>0L(μ,σ|y)).f=ϕ(2log⁡supμ∈W,σ>0L(μ,σ|y)supμ∈U,σ>0L(μ,σ|y)).f=\phi\left( 2\log \frac{\sup_{\mu \in W, \sigma>0} L(\mu, \sigma | y)}{\sup_{\mu \in U, \sigma>0} L(\mu, \sigma | y)} \right). Bu istatistiğin için en güçlü testi sağladığını nasıl (belki de olağandışı özel durumlar sonra)? Bu Neyman-Pearson teoreminden kaynaklanmaz, çünkü bu teorem, olasılık oranı testinin …

3
Leptokurtik dağılımı normalliğe nasıl dönüştürebilirim?
Diyelim ki normalliğe dönüştürmek istediğim leptokurtik bir değişkenim var. Bu görevi hangi dönüşümler yapabilir? Verilerin dönüştürülmesinin her zaman arzu edilmeyebileceğinin farkındayım, ancak akademik bir uğraş olarak, verileri normalliğe "çekmek" istediğimi varsayalım. Ayrıca, çizimden de anlayabileceğiniz gibi, tüm değerler kesinlikle pozitiftir. Çeşitli dönüşümler denedim ( , vb. olmak üzere daha önce …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.