İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Çok sınıf için lojistik regresyon
Tarafından verilen çoklu sınıf için lojistik regresyon modelini aldım P( Y= j | X( i )) = exp( θTjX( i ))1 + ∑km = 1tecrübe( θTmX( i ))P(Y=j|X(i))=exp⁡(θjTX(i))1+∑m=1kexp⁡(θmTX(i)) P(Y=j|X^{(i)}) = \frac{\exp(\theta_j^TX^{(i)})}{1+ \sum_{m=1}^{k}\exp(\theta_m^T X^{(i)})} burada k sınıf sayısı theta'nın tahmin edilecek parametredir j jth sınıfıdır Xi eğitim verileri Alamadım bir şey, …

1
Gözlenen alel frekansı tahmin edilenden önemli ölçüde daha düşük mü?
Soru : Gözlenen "dağ" -aleli frekansının (Şekil 1), ortadan güney dağlara, ekolojik seçim modeli tarafından tahmin edilenden (Şekil 2) önemli ölçüde daha düşük olup olmadığını belirlemek için nasıl bir test yapabilirim ( ayrıntılar için aşağıya bakın )? Sorun : İlk düşüncem, model artıklarını enlem: boylam ve irtifaya (sadece enlem ve …

1
Asenkron (düzensiz) Zaman Serisi Analizi
İki hisse senedi fiyatının zaman serileri arasındaki gecikmeyi analiz etmeye çalışıyorum. Düzenli zaman serileri analizinde Cross Correlaton, VECM (Granger Causality) yapabiliriz. Bununla birlikte, düzensiz aralıklı zaman serilerinde bu nasıl ele alınır. Hipotez, araçlardan birinin diğerine öncülük etmesidir. Mikrosaniye için her iki sembol için veri var. RTAQ paketine baktım ve ayrıca …

1
Poly () ve poly () ile karşılaştırıldığında neden çılgınca farklı sonuçlar alıyorum?
Bazı verilerimde (yaş + kohort = periyot) büyük oranda eş zamanlı olan iki farklı zaman değişkenini modellemek istiyorum. Bunu yaparken lmerve bazı etkileşimlerle karşılaştım poly(), ama muhtemelen bununla sınırlı değil lmer, nlmeIIRC ile aynı sonuçları aldım . Açıkçası, poly () işlevinin ne yaptığına dair anlayışım eksik. Ne yaptığını anlıyorum poly(x,d,raw=T)ve …

1
Ters kovaryans matrisi üzerinde hipotez testi
Diyelim ki iid ve test etmek vech a uyumlu matris ve vektör . Bu sorun üzerinde bilinen bir çalışma var mı?xi∼N(μ,Σ)xi∼N(μ,Σ)x_i \sim \mathcal{N}\left(\mu,\Sigma\right)H0:A H0:A H_0: A\ (Σ−1)=a(Σ−1)=a\left(\Sigma^{-1}\right) = aAAAaaa Bariz (bana göre) bir olasılık oranı testi yoluyla olurdu, ancak kısıtlamalarına tabi olma olasılığını en üst düzeye çıkarmak bir SDP çözücüsü …


2
Negatif binom regresyonu kullanılırken küme seçeneğine eşdeğer R
Bir meslektaşımın çalışmalarını çoğaltmaya çalışıyorum ve analizi Stata'dan R'ye taşıyorum. Çalıştığı modeller, standart hataları kümelemek için nbreg işlevi içindeki "küme" seçeneğini çağırıyor. Bu seçeneğin ne ve nedeninin oldukça eksiksiz bir açıklaması için http://repec.org/usug2007/crse.pdf adresine bakın. Sorum şu: R içinde negatif binomiyal regresyon için aynı seçeneği nasıl çağırırım? Makalemizdeki birincil model …

3
İstatistik ve bilişim arasındaki fark nedir?
Her zaman istatistiğin sadece verilerle uğraştığını söylüyoruz. Ancak bilişimin de veri analizinden bilgi aldığını biliyoruz. Örneğin, biyoinformatik insanlar tamamen biyoistatistik olmadan gidebilirler. İstatistik ve bilişim arasındaki temel farkın ne olduğunu bilmek istiyorum.

1
Pillai izi ve Hotelling-Lawley izi genellemesi var mı?
Çok değişkenli çoklu regresyon (vektör regresörü ve regresyonu) ortamında, genel hipotez için dört ana testin (Wilk's Lambda, Pillai-Bartlett, Hotelling-Lawley ve Roy'un En Büyük Kökü) matrisinin öz değerlerine bağlıdır. , burada ve 'açıklanmış' ve 'toplam' varyasyon matrisleridir.HE−1HE−1H E^{-1}HHHEEE Pillai ve Hotelling-Lawley istatistiklerinin her ikisinin de olarak ifade edilebileceğini fark etmiştim. sırasıyla, …

1
Spline ve spline olmayan terimlerin etkileşimleri ne anlama geliyor?
Ben böyle bir şey ile benim veri sığdırmak ise lm(y~a*b)R sentaks ile, abir ikili değişkendir ve bsayısal bir değişkendir, daha sonra a:betkileşim terimi eğimi arasındaki farktır y~bde a0 = ve en a= 1. Şimdi, hadi arasındaki ilişkiyi söylemek yve beğrisel olduğunu. Şimdi uyuyorsanız lm(y~a*poly(b,2)), o a:poly(b,2)1değişimin değişimdir y~bseviyesine koşullu ayukarıdaki …

1
Fare (veya klavye) tıklamalarının şekli ve bilgisayar kullanıcısının etkinliğini tahmin etme
Sadece fare tıklamalarının zamansal desenine (tıklama sürelerinin bir listesi ) dayanarak , bilgisayar kullanıcısının etkinliğini tahmin etmek mümkün müdür?[ t1, t2, t3, … ][t1,t2,t3,…][t_1,t_2,t_3,\ldots] Örneğin: Facebook'ta vakit geçirmek, fotoğraf izlemek, bilgisayar oyunu oynamak. Daha ince tahminler varsa (örneğin StarCraft vs Counter Strike vs SimCity oynamak) o zaman ben de ilgileniyorum. …

2
Düzenleme normu ve normu ampirik çalışması
gerçekleştirmek için birçok yöntem vardır - , ve normuna dayalı düzenlileştirme. Göre Friedman Hastie ve Tibsharani yani gerçek hedef fonksiyonu, kullanılan özel olarak, sinyal-gürültü oranı doğası ve örnek büyüklüğü: En iyi regularizer sorununa bağlı olarak değişir.L0L0L_0L1L1L_1L2L2L_2 Çeşitli düzenleme yöntemlerinin performansını ve performansını karşılaştıran ampirik araştırmalar var mı?

6
İkili bir sonucun kategorik belirleyicileri kümesinin tahmin gücü nasıl değerlendirilir? Olasılıkları mı yoksa lojistik regresyonu mu hesaplıyorsunuz?
Basit olasılıkların sorunum için işe yarayıp yaramayacağını ya da lojistik regresyon gibi daha sofistike yöntemleri kullanmanın (ve öğrenmenin) daha iyi olup olmayacağını belirlemeye çalışıyorum. Bu problemdeki yanıt değişkeni bir ikili yanıttır (0, 1). Tüm kategorik ve sırasız birçok öngörücü değişkenim var. Hangi belirteç değişkenlerinin kombinasyonlarının 1'lerin en yüksek oranını verdiğini …

3
Öncelikleri ortaya çıkarmak… para ile!
Varsayalım ki bazı değişkenlerinde daha önce bir dağıtım yapmak istediğim 'uzmanlarım var . Onları gerçek parayla motive etmek istiyorum . Fikir, öncelikleri ortaya çıkarmak, rasgele değişken gerçekleşmelerini gözlemlemek , daha sonra, önceden belirlenmiş bazı 'çantaları' uzmanların arasında, önceliklerinin kanıtlarla ne kadar iyi eşleştiğine göre ayırmaktır. Öncelikleri ve kanıtları ödeme vektörüne …
10 bayesian  prior 

2
Üç yollu tekrarlanan önlemler ANOVA için geçerli bir post-hoc analiz nedir?
Üç yönlü tekrarlanan ölçümler ANOVA yaptım; hangi post-hoc analizler geçerlidir? Bu, denekler içinde tekrarlanan bir ölçüye sahip faktörlerden biri ile tamamen dengeli bir tasarımdır (2x2x2). R'de tekrarlanan ölçümler ANOVA için çok değişkenli yaklaşımların farkındayım, ancak ilk içgüdüm basit bir aov () tarzı ANOVA ile devam etmektir: aov.repeated <- aov(DV ~ …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.