İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Bir olayın “eninde sonunda gerçekleştiğini” söylemek ne anlama geliyor?
tamsayılarında başlangıç ​​durumuna sahip 1 boyutlu rastgele bir yürüyüş düşünün :ZZ\mathbb{Z}x∈Zx∈Zx\in\mathbb{Z} Sn=x+∑i=1nξiSn=x+∑i=1nξi\begin{equation} S_n=x+\sum^n_{i=1}\xi_i \end{equation} burada artışları , öyle ki .ξiξi\xi_iP{ξi=1}=P{ξi=−1}=12P{ξi=1}=P{ξi=−1}=12P\{\xi_i=1\}=P\{\xi_i=-1\}=\frac{1}{2} Biri kanıtlanabilir (1) Px{Sn reaches +1 eventually}=1Px{Sn reaches +1 eventually}=1\begin{equation} P^x{\{S_n \text{ reaches +1 eventually}\}} = 1 \end{equation} burada alt simge başlangıç ​​konumunu belirtir. Let durumuna ilk geçiş zamanı . …

4
Degrade artırıcı makine doğruluğu, yineleme sayısı arttıkça azalır
Gradyan arttırıcı makine algoritmasını caretR'deki paket üzerinden deniyorum. Küçük bir kolej veri kümesi kullanarak, aşağıdaki kodu koştu: library(caret) ### Load admissions dataset. ### mydata <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") ### Create yes/no levels for admission. ### mydata$admit_factor[mydata$admit==0] <- "no" mydata$admit_factor[mydata$admit==1] <- "yes" ### Gradient boosting machine algorithm. ### set.seed(123) fitControl <- trainControl(method = …
15 machine-learning  caret  boosting  gbm  hypothesis-testing  t-test  panel-data  psychometrics  intraclass-correlation  generalized-linear-model  categorical-data  binomial  model  intercept  causality  cross-correlation  distributions  ranks  p-value  z-test  sign-test  time-series  references  terminology  cross-correlation  definition  probability  distributions  beta-distribution  inverse-gamma  missing-data  paired-comparisons  paired-data  clustered-standard-errors  cluster-sample  time-series  arima  logistic  binary-data  odds-ratio  medicine  hypothesis-testing  wilcoxon-mann-whitney  unsupervised-learning  hierarchical-clustering  neural-networks  train  clustering  k-means  regression  ordinal-data  change-scores  machine-learning  experiment-design  roc  precision-recall  auc  stata  multilevel-analysis  regression  fitting  nonlinear  jmp  r  data-visualization  gam  gamm4  r  lme4-nlme  many-categories  regression  causality  instrumental-variables  endogeneity  controlling-for-a-variable 

1
Çok düzeyli karma efektler modeli için matematiksel denklemi yazma
CV Sorusu Karma efektler modelinin (a) ayrıntılı ve özlü matematiksel temsilini vermeye çalışıyorum. lme4Paketi R'de kullanıyorum . Modelim için doğru matematiksel gösterim nedir? Veri, Bilim Sorusu ve R Kodu Veri setim farklı bölgelerdeki türlerden oluşuyor. Bir türün yaygınlığının bir yokolmaya yol açan sürede değişip değişmediğini (yok olmaların kalıcı olması gerekmez; …

2
ABC ve MCMC'nin uygulamalarında farkı nedir?
Anladığım kadarıyla, Yaklaşık Bayessel Hesaplama (ABC) ve Markov Zinciri Monte Carlo'nun (MCMC) çok benzer amaçları var. Aşağıda bu yöntemleri ve bunların gerçek hayat verilerine uygulanmasındaki farklılıkları nasıl algıladığımı anlıyorum. Yaklaşık Bayes Hesaplaması ABC parametre örnekleme de oluşur θθ\theta yoluyla, bir önceki sayısal simülasyon işlem bir istatistik xixix_i bazı gözlenen ile …

1
İstatistiksel algoritma geliştirici adayları için iyi görüşme soruları nelerdir?
İstatistik / makine öğrenimi / veri madenciliği bağlamında algoritma geliştirici / araştırmacı pozisyonu için insanlarla röportaj yapıyorum. Özellikle bir adayın temel teoriye aşinalığını, anlayışını ve akışkanlığını, örneğin beklenti ve varyansın temel özellikleri, bazı yaygın dağılımları, vb. Belirlemek için sorulacak sorular arıyorum. Şu anki sorularım: " Tahmin etmek istediğimiz bilinmeyen bir …

2
Uygunsuz Dağıtımdan Örnekleme (MCMC kullanarak ve başka şekilde)
Temel sorum şu: Yanlış bir dağıtımdan nasıl örnek alırdınız? Uygun olmayan bir dağılımdan numune almak bile mantıklı mı? Xi'an'ın buradaki yorumu soruya cevap veriyor, ancak bu konuda daha fazla ayrıntı arıyordum. MCMC'ye daha spesifik: MCMC hakkında konuşurken ve makaleleri okurken, yazarlar uygun posterior dağılımlar elde ettikleri üzerinde dururlar. Yazarın posteriorun …

2
Çanta Dışı Hatası Rastgele Ormanlarda CV'yi gereksiz kılıyor mu?
Rastgele ormanlarda oldukça yeniyim. Geçmişte, hep doğruluğunu karşılaştırdık testi vs oturması karşı trenle vs oturması herhangi overfitting algılamak için. Ama burada sadece şunu okudum : "Rasgele ormanlarda, test seti hatasının tarafsız bir tahminini elde etmek için çapraz validasyona veya ayrı bir test setine gerek yoktur. Dahili olarak, çalışma sırasında tahmin …

2
BSTS modelinden (R cinsinden) tahminler tamamen başarısız oluyor
Bayes yapısal zaman serisi modelleri hakkındaki bu blog yazısını okuduktan sonra , bunu daha önce ARIMA için kullandığım bir sorun bağlamında uygulamaya bakmak istedim. Bilinen bazı (ancak gürültülü) mevsimsel bileşenlerle ilgili bazı verilerim var - bunun kesinlikle yıllık, aylık ve haftalık bileşenleri ve ayrıca özel günlerden (federal veya dini bayramlar …
15 r  time-series  bayesian  mcmc  bsts 


2
Bayesian Çıkarımdaki posterior dağılım genellikle neden zorlanır?
Bayesian Çıkarımın neden zor sorunlara yol açtığını anlamakta sorun yaşıyorum. Sorun genellikle şu şekilde açıklanır: Anlamadığım şey, bu integralin neden ilk etapta değerlendirilmesi gerektiğidir: Bana göre, integralin sonucu sadece normalleştirme sabiti (veri kümesi D verildiği gibi). Neden sadece posterior dağılımı sağ tarafın payı olarak hesaplayıp sonra bu normalizasyon sabitini posterior …

3
Bernoulli işlemindeki olasılığı 10 hataya kadar örnekleyerek tahmin etme: önyargılı mı?
10 başarısızlıkla karşılaşıncaya kadar örnekleme yaptığımız başarısızlık olasılığı q olan bir Bernoulli sürecimiz olduğunu varsayalım (ki bu küçük olacaktır, örneğin q ≤ 0.01 ) . Bu suretle olarak başarısızlık olasılığının tahmini q : = 10 / K burada N numune sayısıdır.qqqq≤0.01q≤0.01q \leq 0.01101010q^:=10/Nq^:=10/N\hat{q}:=10/NNNN Soru : mi q bir önyargılı tahmin …

5
İki Formula 1 kalifikasyon formatında istatistiksel varyasyon
Formül 1'deki niteleme biçimi hakkındaki bu BBC makalesini yeni okudum . Organizatörler, yeterliliği daha az öngörülebilir kılmak, yani sonuçtaki istatistiksel çeşitliliği artırmak istemektedir. Birkaç ilgisiz ayrıntıya bakarak, şu anda sürücüler en iyi tek turla (somutluk için) iki denemeden sıralanıyor. Bir F1 şefi Jean Todt, sürücülerin ortalama iki turla derecelendirilmesinin istatistiksel …
15 variance 

1
Bir değişken diğerlerinin lineer bir kombinasyonu olmasına rağmen, bu regresyon neden mükemmel çoklu doğrusallık nedeniyle başarısız DEĞİLDİR?
Bugün, küçük bir veri kümesiyle oynuyordum ve mükemmel çoklu bağlantı nedeniyle başarısız olmasını beklediğim basit bir OLS regresyonu yaptım . Ancak, olmadı. Bu, çoklu bağlantı konusundaki anlayışımın yanlış olduğunu ima ediyor. Sorum şu: Nerede yanılıyorum? Değişkenlerimden birinin diğerlerinin doğrusal bir kombinasyonu olduğunu gösterebileceğimi düşünüyorum. Bu, tam sıralaması olmayan bir regresör …

2
“Standart hata” ve “Güven aralıkları” ölçümün hassasiyetini ölçüyorsa, doğruluk ölçümleri nelerdir?
40. sayfadaki "Aptallar için biyoistatistik" kitabında okudum: Standart hata (SE kısaltması), bir şeyin tahmini veya ölçümünün ne kadar kesin olduğunu göstermenin bir yoludur. ve Güven aralıkları, bir tahminin kesinliğini veya bir şeyin ölçümünü belirtmek için başka bir yol sağlar. Ancak ölçümün doğruluğunu nasıl belirleyeceği konusunda hiçbir şey yazılı değildir. Soru: …

2
Bir modelin rafine edilmesi ne zaman durdurulur?
Son 3 yıldır birçok kitaptan istatistik okuyorum ve bu site sayesinde çok şey öğrendim. Yine de benim için temel bir soru hala cevaplanmamış. Çok basit veya çok zor bir cevabı olabilir, ancak kesin bir istatistik anlayışı gerektirdiğinden eminim. Bir modeli veriye, sık veya Bayesci bir yaklaşım olarak yerleştirirken, olabilirlik, önceki …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.