İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Lmer modeli yakınsama yapmıyor
Verilerim burada açıklanmıştır Tekrarlanan önlemler ANOVA takarken aov "Hata () modeli tekil hata" neden olabilir? lmerBenim temel durum kullanarak kullanarak bir etkileşimin etkisini görmeye çalışıyorum : my_null.model <- lmer(value ~ Condition+Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) my.model <- lmer(value ~ Condition*Scenario+ (1|Player)+(1|Trial), data = my, REML=FALSE) Çalıştırmak anovabana önemli sonuçlar …
12 r  lme4-nlme 

5
Çok sayıda veri noktasındaki değerlerin gösterimi nasıl yapılır?
Çok büyük bir veri setim var ve yaklaşık% 5 rasgele değerler eksik. Bu değişkenler birbiriyle ilişkilidir. Aşağıdaki örnek R veri kümesi sadece yapay korelasyonlu verilere sahip bir oyuncak örneğidir. set.seed(123) # matrix of X variable xmat <- matrix(sample(-1:1, 2000000, replace = TRUE), ncol = 10000) colnames(xmat) <- paste ("M", 1:10000, …
12 r  random-forest  missing-data  data-imputation  multiple-imputation  large-data  definition  moving-window  self-study  categorical-data  econometrics  standard-error  regression-coefficients  normal-distribution  pdf  lognormal  regression  python  scikit-learn  interpolation  r  self-study  poisson-distribution  chi-squared  matlab  matrix  r  modeling  multinomial  mlogit  choice  monte-carlo  indicator-function  r  aic  garch  likelihood  r  regression  repeated-measures  simulation  multilevel-analysis  chi-squared  expected-value  multinomial  yates-correction  classification  regression  self-study  repeated-measures  references  residuals  confidence-interval  bootstrap  normality-assumption  resampling  entropy  cauchy  clustering  k-means  r  clustering  categorical-data  continuous-data  r  hypothesis-testing  nonparametric  probability  bayesian  pdf  distributions  exponential  repeated-measures  random-effects-model  non-independent  regression  error  regression-to-the-mean  correlation  group-differences  post-hoc  neural-networks  r  time-series  t-test  p-value  normalization  probability  moments  mgf  time-series  model  seasonality  r  anova  generalized-linear-model  proportion  percentage  nonparametric  ranks  weighted-regression  variogram  classification  neural-networks  fuzzy  variance  dimensionality-reduction  confidence-interval  proportion  z-test  r  self-study  pdf 

2
Tahmin aralıklarıyla olasılıksal açıklamalar yapabilir miyiz?
Güven aralıklarının ve tahmin aralıklarının yorumlanması ile ilgili sitede birçok mükemmel tartışmayı okudum, ancak bir kavram hala biraz kafa karıştırıcı: OLS çerçevesini düşünün ve uygun modelini aldık . Bize bir verildi ve yanıtını tahmin etmemiz istendi. değerini hesaplıyoruz ve bir bonus olarak, tahminimiz etrafında% 95 tahmin aralığı sağlıyoruz, a la …


2
Varyans-Kovaryans matris yorumu
Doğrusal bir modelimiz olduğunu Model1ve vcov(Model1)aşağıdaki matrisi verdiğimizi varsayalım : (Intercept) latitude sea.distance altitude (Intercept) 28.898100 -23.6439000 -34.1523000 0.50790600 latitude -23.643900 19.7032500 28.4602500 -0.42471450 sea.distance -34.152300 28.4602500 42.4714500 -0.62612550 altitude 0.507906 -0.4247145 -0.6261255 0.00928242 Bu örnek için, bu matris gerçekte ne gösteriyor? Modelimiz ve bağımsız değişkenleri için güvenle hangi varsayımlarda …

1
Doğrusal karma etkiler modelinin sonuçlarının raporlanması
Doğrusal karışık efekt modelleri biyolojimin köşesinde yaygın olarak kullanılmıyor ve yazmaya çalıştığım bir makalede kullandığım istatistiksel testi bildirmem gerekiyor. Çok düzeyli modelleme bilincinin biyo-bilimlerin bazı alanlarında ortaya çıkmaya başladığını biliyorum ( Bağımlılığa bir çözüm: iç içe verileri barındırmak için çok düzeyli analiz kullanma ), ancak yine de sonuçlarımı nasıl raporlayacağımı …

2
Bu dağılım neden tekdüze?
Bayesian istatistik testlerini araştırıyoruz ve garip (en azından benim için) bir fenomenle karşılaşıyoruz. Şu durumu düşünün: Hangi popülasyonun (A veya B) daha yüksek dönüşüm oranına sahip olduğunu ölçmek istiyoruz. Bir sağlık kontrolü için, , yani dönüşüm olasılığı her iki grupta da eşit. Bir binom modeli kullanarak yapay veriler , örneğinpbir= …

1
İki numunenin ortalamalarını karşılaştırmak için bir bootstrap testi nasıl yapılır?
Ben iki ağır çarpık örnekleri var ve t-istatistik kullanarak araçlarını karşılaştırmak için bootstrapping kullanmaya çalışıyorum. Bunu yapmak için doğru prosedür nedir? Kullandığım süreç Bunun normal olarak dağıtılmadığını bildiğimde, son adımda orijinal / gözlemlenen verilerin standart hatasını kullanmanın uygunluğu konusunda endişeliyim. İşte adımlarım: Bootstrap - yedekli rastgele örnek (N = 1000) …

1
HMM'leri sınıflandırma için nasıl eğitebilirim?
Bu yüzden sınıflandırma için HMM'leri eğittiğinizde standart yaklaşımın: Veri kümelerinizi her sınıf için veri kümelerine ayırın Sınıf başına bir HMM eğitin Test setinde, her pencerenin her pencereyi sınıflandırma olasılığını karşılaştırın Ama HMM'yi her sınıfta nasıl eğitebilirim? Sadece bir sınıfa ait verileri birleştirir miyim? Ama zaman serisi verileri sıralı olması anlamına …

2
İstihbarat Kare Puanlama ve Kazanan Belirleme
Intelligence Squared adında bir NPR podcast'i var. Her bölüm, "İkinci değişiklik artık alakalı değil" veya "Üniversite kampüslerine yapılan olumlu ayrımcılık yarardan çok zarar veriyor" gibi tartışmalı bir ifade üzerinde canlı bir tartışma yayınlıyor. Dört temsilci tartışıyor - ikisi hareket için ve ikisi karşı. Hangi tarafın kazanacağını belirlemek için, izleyici tartışmadan …
12 bayesian  rating 

3
Teori, uyum veya başka bir şeye göre dağılımları seçmek daha mı iyi?
Bu felsefi bir soruyla sınırlıdır, ancak daha fazla deneyime sahip olanların dağıtım seçimi hakkında nasıl düşündükleri ile ilgileniyorum. Bazı durumlarda, teorinin en iyi şekilde çalışabileceği açıktır (farelerin kuyruk uzunlukları muhtemelen normal olarak dağılmıştır). Birçok durumda, muhtemelen bir veri kümesini tanımlamak için hiçbir teori yoktur, bu yüzden başlangıçta açıklamak için geliştirilen …

3
Kutu grafiğindeki varyansı çıkarma
Bir boxplot kullanarak bir değişkenin varyansını nasıl çıkaracağımı merak ediyordum. En azından iki değişkenin kutu grafiğini gözlemleyerek aynı varyansa sahip olup olmadığına karar vermek mümkün mü?
12 variance  boxplot 

1
Test istatistiği dağılımı bimodal ise, p değeri bir şey ifade ediyor mu?
P-değeri, sıfır hipotezinin doğru olduğu varsayılarak, en azından gözlemlendiği kadar aşırı bir test istatistiği elde etme olasılığı olarak tanımlanır. Diğer bir deyişle, Peki ya test istatistiği dağılımda bimodal ise? p değeri bu bağlamda bir şey ifade ediyor mu? Örneğin, ben R bazı bimodal verileri simüle edeceğim:P( X≥ t | 'H0)P(X≥t|H0)P( …

2
Genelleştirilmiş doğrusal modellerde kalıntıların normallik açısından kontrol edilmesi
Bu makale , verileri analiz etmek için genelleştirilmiş doğrusal modeller (hem binom hem de negatif binom hata dağılımları) kullanmaktadır. Ama sonra yöntemlerin istatistiksel analiz bölümünde bu ifade var: ve ikincisi Lojistik Regresyon Modelleri kullanılarak varlık verilerini ve Genelleştirilmiş Doğrusal Model (GLM) kullanarak yiyecek arama zamanı verilerini modelleyerek. Toplayıcı zaman verilerinin …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.