İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
Pearson'u nasıl hesaplayabilirim
Olabilirlik oranı (aka sapma) G2G2G^2istatistiksel ve uyumsuzluk (veya uyum iyiliği) testi, glm(..., family = binomial)R'de bir lojistik regresyon modeli ( işlevi kullanarak uyum) elde etmek için oldukça basittir. Ancak, bazı hücre sayımlarının yeterince düşük olması kolay olabilir. testin güvenilir olmadığını. Uyum eksikliği için olasılık oranı testinin güvenilirliğini doğrulamanın bir yolu, …

1
R doğrusal regresyon kategorik değişkeni “gizli” değer
Bu sadece birkaç kez karşılaştığım bir örnektir, bu yüzden örnek verilerim yok. R'de doğrusal regresyon modeli çalıştırmak: a.lm = lm(Y ~ x1 + x2) x1sürekli bir değişkendir. x2kategoriktir ve üç değeri vardır, örneğin "Düşük", "Orta" ve "Yüksek". Bununla birlikte, R tarafından verilen çıktı aşağıdaki gibi olacaktır: summary(a.lm) Estimate Std. Error …
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 

1
Birden çok zaman serisini birleştirirken hangi sorunlara dikkat etmeliyim?
Diyelim ki bir dizi zaman serim var, örneğin bir bölgedeki çeşitli istasyonlardan bir dizi sıcaklık kaydı. Bölgesel iklimin yönlerini tanımlayabildiğim tüm bölge için tek bir sıcaklık kaydı almak istiyorum. Sezgisel yaklaşım, her bir zaman dilimindeki tüm istasyonların ortalamasını almak olabilir, ancak istatistiksel örümcek algım (ki henüz henüz iyi bir şekilde …


2
Hatanın lojistik büyüme verileri etrafındaki dağılımı nedir?
Ekolojide genellikle lojistik büyüme denklemini kullanırız: Nt=KN0ertK+N0ert−1Nt=KN0ertK+N0ert−1 N_t = \frac{ K N_0 e^{rt} }{K + N_0 e^{rt-1}} veya Nt=KN0N0+(K−N0)e−rtNt=KN0N0+(K−N0)e−rt N_t = \frac{ K N_0}{N_0 + (K -N_0)e^{-rt}} burada taşıma kapasitesidir (ulaşılan maksimum yoğunluk), başlangıç ​​yoğunluğu, büyüme oranıdır, başlangıçtan beri geçen süredir.KKKN0N0N_0rrrttt değerinin yumuşak bir üst sınırı ve bir alt sınırı …
10 r  distributions  pdf  ecology 

2
R'de çok değişkenli sonuçlar nasıl simüle edilir?
Çoğu durumda, yalnızca gibi bir sonuç / yanıt değişkeni ile ilgileniriz . Bununla birlikte, bazı senaryolarda, özellikle klinik verilerde, sonuç değişkenleri yüksek boyutlu / çok değişkenli olabilir. Mesela , içerir , ve değişkenleri ve bu sonuçların her ilişkilidir. Eğer tedavi temsil ediyorsa (evet / hayır), bu tür verileri R cinsinden …

2
Her konu için birden çok veri noktasına doğru davranma
Şu anda her konu için birden çok ölçümle veriyi doğru bir şekilde nasıl tedavi edeceğimi tartışıyorum. Bu durumda, her bir süjenin farklı koşulları için kısa bir süre içinde her süje için veri toplanmıştır. Tüm ölçümler tam olarak aynı değişkeni toplar, sadece çoklu. Şimdi bir seçenek, verileri sadece koşullara göre gruplandırmak …

3
Koşullu geçiş olasılığı olan Markov modelleri
Öncelikle, istatistik ve matematikte olmak istediğim kadar bilgili olmadığımı kabul edeyim. Bazıları tehlikeli olmak için yeterli bilgiye sahip olduğunu söyleyebilir. : DI terminolojiyi doğru şekilde kullanmazsam özür dileriz. Bir durumdan diğerine geçiş yapan bir sistemin olasılıklarını modellemeye çalışıyorum. Basit bir Markov modeli iyi bir başlangıçtır. (Durum kümesi, başlangıç ​​durum olasılıkları …

3
Doğrusal çoklu regresyon denklemindeki tüm IV'ler arasındaki paylaşılan varyans nerede?
Doğrusal bir çoklu regresyon denkleminde, eğer beta ağırlıkları her bir bağımsız değişkenin katkısını diğer tüm IV'lerin katkısının üzerine ve üstüne yansıtırsa, regresyon denkleminde DV'yi öngören tüm IV'lerin paylaştığı varyans nedir? Örneğin, aşağıda gösterilen Venn şeması (ve buradaki CV'nin 'yaklaşık' sayfasından alınmışsa: https://stats.stackexchange.com/about ), yıldız işaretli alanın gireceği 3 IV ve …

3
PCA üzerinden Mahalanobis mesafesi
Benim bir n×pn×pn\times p matris, nerede ppp gen sayısı ve nnnhasta sayısıdır. Bu tür verilerle çalışan herkes şunu bilir:ppp her zamankinden daha büyük nnn. Özellik seçimini kullanarak aldımppp ancak daha makul bir sayıya ppp hala daha büyük nnn. Hastaların genetik profillerine dayanarak benzerliklerini hesaplamak istiyorum; Öklid mesafesini kullanabilirim, ancak Mahalanobis …

2
Ordinal lojistik regresyonda AUC
2 çeşit lojistik regresyon kullanıyorum - biri ikili sınıflandırma için basit tip, diğeri sıralı lojistik regresyon. İlkinin doğruluğunu hesaplamak için çapraz doğrulama kullandım, burada her kat için AUC'yi hesapladım ve ortalama AUC'yi hesapladım. Sıralı lojistik regresyon için nasıl yapabilirim? Çok sınıflı öngörücüler için genelleştirilmiş ROC'yi duydum, ancak nasıl hesaplanacağından emin …

4
Normal dağılmış rastgele değişkenlerin oranlarında önemli fark olup olmadığını test edin
İlgili değişkenler oranlarını analiz ve nasıl iki normal dağılım değişkenlerin oranı, ya da bir tersini parameterize? . Her biri kabaca normal olduğunu kabul edebileceğimiz dört farklı sürekli rasgele dağılımdan birkaç örneğim olduğunu varsayalım. Benim durumumda, bunlar hem şifrelemeli hem de şifrelemesiz iki farklı dosya sisteminin (örneğin, ext4 ve XFS) bazı …

3
Hem işbirlikçi filtreleme hem de içerik özelliklerini entegre eden bir tavsiye sistemi nasıl oluşturulur?
Bir Tavsiye Sistemi oluşturuyorum ve hem "benzer" kullanıcıların derecelendirmelerini hem de öğelerin özelliklerini dahil etmek istiyorum. Çıktı tahmin edilen bir derecelendirmedir [0-1]. Böylece girdiler, öğelerin özelliklerinin ve her kullanıcının derecelendirmelerinin birleşimidir. Madde A ve kullanıcı 1 için, sistem birleştirilmiş veriler A1 üzerinde eğitilebilir. Bu bir eğitim örneği olacaktır. Kullanıcı 1 …

1
JAGS'de yanıt değişkeninde eksik değerler
Gelman & Hill (2006) diyor ki: Bugs'ta, bir regresyondaki eksik sonuçlar sadece veri vektörü, NA'lar ve hepsi dahil edilerek kolayca ele alınabilir. Hatalar, sonuç değişkenini açıkça modellemektedir ve bu nedenle, bu modeli, her yinelemede eksik değerleri etkilemek için kullanmak önemsizdir. Bu, tahmin yapmak için JAGS kullanmanın kolay bir yolu gibi …

1
Rasgeleleştirmeye itirazlar
In Klinik çalışmalarda - metodolojik bir perspektiften Steven Piantadosi yazıyor (Ch.13, s 334).: Bölüm 2'de Abel ve Koch (1997) ve Urbach (1993) tarafından randomize edilmeye yönelik itirazlara dikkat çektim ve endişelerini ve olası hatalarını incelemenin değerini belirttim. Randomizasyonu bir bazı istatistiksel testleri geçerli kılmak, nedensel çıkarımın temeli, maskelemenin kolaylaştırılması ve …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.