İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


3
Değişkenleri eşleştirme ve istatistiksel olarak kontrol etme gibi yöntemler arasındaki bağlantı nedir?
Sık sık okuduğunuz araştırma makalelerinde araştırmacılar belirli değişkenleri kontrol etmişlerdir. Bu, eşleme, engelleme vb. Yöntemlerle yapılabilir. Ama her zaman değişkenleri kontrol etmenin, etki edebilecek çeşitli değişkenleri ölçerek ve bunlar üzerinde hem gerçek hem de yarı deneylerde yapılabilecek bazı istatistiksel analizler yaparak istatistiksel olarak yapılan bir şey olduğunu düşündüm. Örneğin, bağımsız …

1
İki boyutlu uzayda bir dizi nokta verildiğinde, SVM için bir tasarım kararı nasıl işlev görebilir?
Birisi bana bir SVM karar fonksiyonu tasarlama konusunda neler yapabileceğini açıklayabilir mi? Ya da beni somut bir örneği tartışan kaynağa yönlendirin. DÜZENLE Aşağıdaki örnekte, denkleminin sınıfları maksimum marjla ayırdığını görebiliyorum . Fakat aşağıdaki formda hiperplanlar için ağırlıkları nasıl ayarlayabilir ve denklemleri nasıl yazabilirim.X2=1.5X2=1.5X_2 = 1.5 H1:w0+w1x1+w2x2≥1H2:w0+w1x1+w2x2≤−1forYi=+1forYi=−1.H1:w0+w1x1+w2x2≥1forYi=+1H2:w0+w1x1+w2x2≤−1forYi=−1.\begin{array}{ll} H_1 : w_0+w_1x_1+w_2x_2 \ge …
10 svm 

1
Lme4'te çok değişkenli karışık bir modelin katsayıları genel kesinti olmadan nasıl yorumlanır?
Çok değişkenli (yani, çoklu yanıt) karışık bir model yerleştirmeye çalışıyorum R. ASReml-rVe SabreR(harici yazılım gerektiren) paketlerinin yanı sıra , bunun sadece mümkün olduğu görülmektedir MCMCglmm. Olarak kağıt birlikte MCMCglmmpaketi (pp.6), Jarrod'ın Hadfield, bir uzun biçim değişken birden çok tepki değişkenleri yeniden şekillendirilmesi ve sonra genel kesişme bastırma benzerleri gibi bir …

3
Poisson regresyonunda sağlam standart hatalar ne zaman kullanılır?
Ben sayım verileri için bir Poisson regresyon modeli kullanıyorum ve nedenleri olup olmadığını merak ediyorum değil parametre tahminleri için sağlam standart hata kullanılır? Özellikle, sağlam olmayan tahminlerimin bazıları önemli olmadığından (örneğin, p = 0.13), ancak güçlü olan tahminlerimin önemli olmasından endişe duyuyorum (p <0.01). SAS'ta bu, proc genmod(örn repeated subject=patid;.) …

2
Çoklu karşılaştırmalar için hiyerarşik modeller - çoklu sonuçlar bağlamı
Gelman'ı (yeniden) okudum Neden (genellikle) birden fazla karşılaştırma konusunda endişelenmek zorunda değiliz . Özellikle "Birden fazla sonuç ve diğer zorluklar" bölümünde, aynı kişi / üniteden farklı zamanlarda / koşullarda birden fazla ilgili önlemin bulunduğu durumlar için hiyerarşik bir model kullanılmıştır. Bir dizi istenen özelliğe sahip olduğu görülmektedir. Bunun mutlaka Bayesci …

2
Önyükleme kullanabilir miyim, neden ya da neden olmasın?
Şu anda uydu görüntülerini kullanarak biyokütle tahminleri üzerinde çalışıyorum. Sorumun arka planını hızlı bir şekilde tanımlayacağım ve üzerinde çalıştığım istatistiksel soruyu açıklayacağım. Arka fon Sorun Fransa'da bir bölgede biyokütle tahmin etmeye çalışıyorum. Benim yanıt steamwood hacim yoğunluğudur (içinde biyokütle daha fazla ya da daha az orantılıdır) (... ahşap yoğunlukları bağlı …
10 bootstrap 

2
BUGS / JAGS / STAN ile bir oranı nasıl modelleyebilirim?
Yanıtın bir oran olduğu bir model oluşturmaya çalışıyorum (aslında bir partinin seçim bölgelerinde aldığı oyların payıdır). Dağıtımı normal değil, bu yüzden bir beta dağıtımı ile modellemeye karar verdim. Ayrıca birkaç tahmin edicim var. Ancak, HATA / JAGS / STAN'da nasıl yazacağımı bilmiyorum (JAGS benim en iyi seçimim olurdu, ama gerçekten …

1
İstatistiksel test önerisi
Aşağıdakiler üzerinde uygun bir istatistiksel test (olasılık oranı testi, t-testi, vb.) Bulmam gerekiyor: Let , bir rasgele vektörün bir iid numune olduğu ( X , Y ) ve olduğunu varsayalım ( Y X ) ~ N- [ ( μ 1 μ 2 ) , ( 1 .5 .5 1 ) …

1
Üst düzey anlarla Gauss benzeri dağıtım
Ortalama ve varyansı bilinmeyen Gauss dağılımı için standart üstel aile formundaki yeterli istatistikler . olan bir dağıtım var , burada N tür bir tasarım parametresi gibi. Bu tür yeterli istatistik vektörü için karşılık gelen bilinen bir dağılım var mı? Bu dağıtımdan örneklere ihtiyacım var, bu yüzden dağıtımdan kesin örnekler almak …

1
Hastalıksız sağkalım analizinde ölümle nasıl başa çıkılır?
Hastalıksız sağkalım verilerim (belirli bir hastalığın teşhis edilip edilmediği veya takip edilecek kayıp veya takip kaybı ile tanımlanmış olarak tanımlanır) ve ayrıca genel sağkalım verilerim varsa, hastalık olayı? Bunlar sansürlenmiş mi yoksa bu hastaları hastalıksız sağkalım (dfs) analizinden hariç tutmalı mıyım? Birkaç hastalık türü için ayrı ayrı dfs analizleri yapmayı …

3
Sıfır hipotezi
H0:p=0H0:p=0H_0: p = 0 , vs ile binom verilerinden tek bir örnek için bir güç analizi yapmak istiyorum H1:p=0.001H1:p=0.001H_1: p = 0.001, burada ppp popülasyondaki başarıların oranıdır. Eğer 0&lt;p&lt;10&lt;p&lt;10 < p <1 , bir binom normal yaklaşım ya kullanabilir veya olabilir χ2χ2\chi^2 -testi, fakat p=0p=0p =0 , bu iki başarısız …

2
Hem efekt değiştirici hem de karıştırıcı işlevi gören bir değişkene sahip olmak mümkün müdür?
Belirli bir risk-sonuç ilişkisi çifti için hem etki (ölçüm) değiştiricisi hem de karıştırıcı işlevi gören bir değişken olması mümkün müdür? Ayrımdan hala emin değilim. Farkı anlamama yardımcı olmak için grafik notasyona baktım ama notasyondaki farklar şaşırtıcı. İkisinin grafiksel / görsel açıklaması ve ne zaman çakışabileceği yararlı olacaktır.

1
Anova () ve drop1 () neden GLMM'ler için farklı cevaplar verdi?
Formun bir GLMM var: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) Kullandığımda , araç paketinden veya drop1(model, test="Chi")kullandığımdan farklı sonuçlar alıyorum . Bu son ikisi aynı cevapları verir.Anova(model, type="III")summary(model) Bir grup uydurma veri kullanarak, bu iki yöntemin normalde farklı olmadığını gördüm. Dengeli doğrusal …
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 

2
Birinci mertebe Markov zincirlerinin kümelerinin değerlendirilmesi
Birkaç bin birinci dereceden Markov zincirinin veri setini yaklaşık 10 kümeye kümeledim. Bu kümeleri nasıl değerlendirebileceğim ve kümelerdeki öğelerin neler paylaştığını ve diğer kümelerden nasıl farklılaşabileceğini nasıl öğrenebileceğim konusunda önerilen bir yol var mı? Böylece, "A kümesindeki süreçler, oraya ulaştıklarında Y durumunda kalmaya eğilimlidirler, bu da diğer kümelerdeki süreçler için …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.