İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Karışık modeller için parametrik, yarı parametrik ve parametrik olmayan önyükleme
Bu makaleden aşağıdaki greftler alınmıştır . Ben bootstrap için acemi ve R bootpaket ile doğrusal karışık model için parametrik, yarı parametrik ve parametrik olmayan bootstrapping bootstrapping uygulamaya çalışıyorum . R Kodu İşte benim Rkod: library(SASmixed) library(lme4) library(boot) fm1Cult <- lmer(drywt ~ Inoc + Cult + (1|Block) + (1|Cult), data=Cultivation) fixef(fm1Cult) …
9 r  mixed-model  bootstrap  central-limit-theorem  stable-distribution  time-series  hypothesis-testing  markov-process  r  correlation  categorical-data  association-measure  meta-analysis  r  anova  confidence-interval  lm  r  bayesian  multilevel-analysis  logit  regression  logistic  least-squares  eda  regression  notation  distributions  random-variable  expected-value  distributions  markov-process  hidden-markov-model  r  variance  group-differences  microarray  r  descriptive-statistics  machine-learning  references  r  regression  r  categorical-data  random-forest  data-transformation  data-visualization  interactive-visualization  binomial  beta-distribution  time-series  forecasting  logistic  arima  beta-regression  r  time-series  seasonality  large-data  unevenly-spaced-time-series  correlation  statistical-significance  normalization  population  group-differences  demography 

1
Belirleyici değişkeni eksik olan çoklu regresyon
Bize ve şeklinde bir dizi veri verildiğini varsayalım . Biz tahmin görevi verilmiştir değerlerine dayalı . İki regresyon tahmin ediyoruz, burada: ( y,x1,x2, ⋯ ,xn)(y,x1,x2,⋯,xn)(y,x_{1},x_{2},\cdots, x_{n})( y,x1,x2, ⋯ ,xn - 1)(y,x1,x2,⋯,xn−1)(y,x_{1},x_{2},\cdots, x_{n-1})yyyxxxyy=f1(x1, ⋯ ,xn - 1,xn)=f2(x1,⋯ ,xn -1)(1)(2)(1)y=f1(x1,⋯,xn−1,xn)(2)y=f2(x1,⋯,xn−1) \begin{align} y &=f_{1}(x_{1},\cdots, x_{n-1}, x_{n}) \tag{1} \\ y &=f_{2}(x_{1},\cdots, x_{n-1}) \tag{2} \end{align} …

3
Rasgele orman regresyonunda tepki dağılımına bağlı yanlılık
Regresyon için R (R sürüm 2.13.1, randomForest sürüm 4.6-2) randomForest paketini kullanıyorum ve sonuçlarımda önemli bir önyargı fark ettim: tahmin hatası yanıt değişkeninin değerine bağlıdır. Yüksek değerler az tahmin edilir ve düşük değerler fazla tahmin edilir. İlk başta bunun verilerimin bir sonucu olduğundan şüphelendim, ancak aşağıdaki basit örnek bunun rastgele …


3
Bir veri kümesinde beklenen en iyi performans
Diyelim ki bir sınıflandırma gibi basit bir makine öğrenme problemim var. Görme veya ses tanıma konusunda bazı ölçütlerle, ben, bir insan olarak, çok iyi bir sınıflandırıcıyız. Bu nedenle bir sınıflandırıcının ne kadar iyi olabileceğine dair bir sezgim var. Ancak çok fazla veriyle bir nokta, eğittiğim sınıflandırıcının ne kadar iyi olduğunu …

2
Rastgele bir eğim ve kesişme noktasıyla Poisson GLM karma modelinin takılması
Şu anda sayıların nasıl elde edildiğindeki (bir tanı testinden diğerine geçme) bir değişimin zaman içindeki diğer eğilimleri kontrol ederken ( hastalık insidansı). Birkaç farklı siteye ilişkin verilerim var. Ben de GAM'larla uğraşırken, zaman eğilimleri olan bir dizi oldukça basit GLM'ye uyuyorum, ardından sonuçları bir araya getiriyorum. Bunun kodu SAS'ta şöyle …

1
Zorlu bir veri seti için hangi model? (çok fazla yuvaya sahip yüzlerce zaman serisi)
Analiz etmek için oldukça karmaşık bir veri setim var ve bunun için iyi bir çözüm bulamıyorum. Işte burada: 1. ham veri aslında şarkı kayıtları böcek. Her şarkı birkaç parçadan ve her parça alt birimlerden oluşur. Tüm bireyler 5 dakika boyunca kaydedildi. Seri çekim sayısı ve kayıttaki konumları bireyler arasında ve …

3
Genel katkı maddesi Poisson modeli probleminde spline df seçimi
SAS'ları kullanarak Poisson genel katkı modeli kullanarak bazı zaman serisi verileri uydurdum PROC GAM. Genel olarak konuşursak, yerleşik genelleştirilmiş çapraz doğrulama prosedürünün, tek bir parametrik terimle birlikte doğrusal olmayan bir zaman fonksiyonu olan tek spline için en azından iyi bir "başlangıç ​​noktası" oluşturmasını sağladım. gerçekten ilgileniyorum). Şimdiye kadar, veri setlerimden …

1
Lojistik regresyon: gruplandırılmış ve gruplandırılmamış değişkenler (R kullanarak)
A. Agresti (2007), Kategorik Veri Analizine Giriş , 2. okuyorum . ve bu paragrafı (s.106, 4.2.1) doğru bir şekilde anladığımdan emin değilim (kolay olsa da): Önceki bölümde horlama ve kalp hastalığı ile ilgili Tablo 3.1'de, her gece 30'u kalp hastalığı olan 254 kişi horlama bildirmiştir. Veri dosyası ikili verileri gruplandırdıysa, …

3
RMSE denilen ortalama gözlemlenen değer ile normalize edilir?
Root Mean Squared ErrorBir model kullanarak öngörülen değerlerin doğruluğunu ölçmek için (RMSE) kullanıyorum. Döndürülen değerin ölçülerimin birimlerini kullandığını (yüzde yerine) anlıyorum. Ancak değerlerimi yüzde olarak belirtmek istiyorum. Benim aldığım yaklaşım, RMSEgözlemlerimin ortalama değeri ile normalleştirmektir . İçin bir terim var mı RMSE/mean?

1
Bradley-Terry – Luce modelini karmaşık formül olmadan R'ye nasıl takabilirim?
Bradley – Terry – Luce (BTL) modeli, ; burada , j nesnesinin "daha iyi" olduğuna karar verme olasılığıdır , ağır, vs, nesneden daha ı ve \ delta_i ve \ delta_j parametrelerdir.pj ben= l o gbent- 1(δj-δben)pjben=lÖgbent-1(δj-δben)p_{ji} = logit^{-1}(\delta_j - \delta_i)pben jpbenjp_{ij}jjjbenbeniδbenδben\delta_iδjδj\delta_j Bu, glm fonksiyonu için bir aday gibi görünüyor, aile …

3
auto.arima std hatasıyla üretilen NaN'leri uyarır
Verilerim, istihdam edilen nüfusun zaman dizisi, L ve zaman aralığı, yıl. n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 In-sample error …
9 r  regression  arima 

2
Tahmin yapmak için bir regresyon modeli kullanma: Ne zaman durmalı?
Tahminler yapmak için deney ölçümlerimden basit bir doğrusal regresyon modeli hesapladım. Mevcut verilerden çok uzak olan noktalara ilişkin tahminleri hesaplamamanız gerektiğini okudum. Ancak, ne kadar ileri gidebileceğimi bilmeme yardımcı olacak herhangi bir rehber bulamadım. Örneğin, 50GB disk boyutu için okuma hızını hesaplarsam sonuç sanırım gerçeğe yakın olur. 100GB, 500GB disk …

2
R'de tekrarlanan ölçümlerin çok değişkenli sonuçları nasıl simüle edilir?
@whuber, bir zaman noktası için çok değişkenli sonuçların ( , ve ) nasıl simüle edileceğini göstermiştir .y1y1y_1y2y2y_2y3y3y_3 Bildiğimiz gibi, boyuna veriler genellikle tıbbi çalışmalarda ortaya çıkar. Sorum, R'de çok değişkenli sonuçların tekrarlanan ölçümlerin nasıl simüle edileceğidir? Örneğin, iki farklı tedavi grubu için 5 farklı zaman noktasında , ve tekrar tekrar …

1
Ofset ile GLM poissonunu tahmin edin
Bunun muhtemelen temel bir soru olduğunu biliyorum ... Ama cevabı bulamıyorum. Ben bir Poisson ailesi ile bir GLM takıyorum ve daha sonra tahminlere bir göz atmaya çalıştım, ancak ofset dikkate alınmış gibi görünüyor: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, type="response") Oranları değil davaları alıyorum ... Ben de denedim model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003)+ …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.