İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Karışık efekt modellerinde tahmin: rastgele efektlerle ne yapmalı?
Bu varsayımsal veri kümesini ele alalım: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) Kullanabileceğimiz lmerastgele bir etki modeli ile tepkisini modellemek için: require(nlme) model <- lme(response …

1
Homoscedasticity varsayımının ihlal edildiği regresyonlarda önyükleme standart hataları ve güven aralıkları uygun mu?
Standart OLS regresyonlarında iki varsayım ihlal edilirse (hataların normal dağılımı, eşcinsellik), önyükleme standart hataları ve güven aralıkları, regresör katsayılarının önemi açısından anlamlı sonuçlara ulaşmak için uygun bir alternatif mi? Önyükleme yapılan standart hatalar ve güven aralıkları ile önem testleri hâlâ hetero-esneklikle çalışır mı? Evetse, bu senaryoda kullanılabilecek geçerli güven aralıkları …

1
Bir beklenmedik durum tablosunda koşul nedir?
Merriam-Webster sözlüğü tanımlar şarta olay ya da durumun olarak 1 : likely but not certain to happen : possible 2 : not logically necessary; especially : empirical 3 a : happening by chance or unforeseen causes b : subject to chance or unseen effects : unpredictable c : intended for …

3
R'deki Büyük Verileri Kümele ve Örnekleme Alakalı mı?
Veri biliminde yeniyim ve R'de 200.000 satır ve 50 sütun içeren bir veri kümesinde kümeleri bulmakta sorun yaşıyorum. Verilerin hem sayısal hem de nominal değişkenleri olduğundan, Öklid uzaklık ölçüsü kullanan K-araçları gibi yöntemler uygun bir seçim gibi görünmemektedir. Bu yüzden bir mesafe matrisini girdi olarak kabul eden PAM, agnes ve …


3
Bir yakar top takımının oyuncularının kazanma geçmişine göre kazanma olasılığını nasıl tahmin edebilirim?
Dünyada 80 yakar top oyuncusu olduğunu düşünün. Her biri diğer 79 oyuncu ile binlerce dodgeball oyununu az çok rastgele sırada oynadı. Bu, takımları olmayan bir dünyadır (örneğin, her oyuncunun her oyunda her iki takıma da hazırlık şansı vardır). Her oyuncunun bir önceki kazanma oranını biliyorum (örneğin, bir önceki tüm oyunların% …

4
Ortalamayı bir histogramda çizmek uygun mudur?
Ortalama değeri görselleştirmek için bir histograma dikey bir çizgi eklemek "iyi" midir? Benim için iyi görünüyor, ama bunu hiç ders kitaplarında ve benzerlerinde görmedim, bu yüzden bunu yapmamak için bir çeşit sözleşme olup olmadığını merak ediyorum? Grafik bir dönem ödevi içindir, sadece yanlışlıkla önemli olmayan bazı sözlü istatistik kurallarını çiğnemediğimden …

3
İki bağımsız gama rasgele değişkeninin toplamı
Gama dağılımı hakkındaki Wikipedia makalesine göre : Eğer ve , burada ve bağımsız bir rastgele değişkenler, daha sonra .Y ~ G bir m, m, bir ( b , θ ) X, Y, X + Y ~ G bir m, m, bir ( a + b , θ )X∼Gamma(a,θ)X∼Gamma(a,θ)X\sim\mathrm{Gamma}(a,\theta)Y∼Gamma(b,θ)Y∼Gamma(b,θ)Y\sim\mathrm{Gamma}(b,\theta)XXXYYYX+Y∼Gamma(a+b,θ)X+Y∼Gamma(a+b,θ)X+Y\sim \mathrm{Gamma}(a+b, \theta) …

3
F istatistiği, F-kritik değeri ve P-değeri
Bu alanda çok yeniyim ve ANOVA tablosunun sonuçlarına dayanarak sıfır hipotezini reddetme kavramını anlamakta güçlük çekiyorum. Hesaplanan F ve kritik değer p-değeri ile nasıl ilişkilidir? Ve hesaplanan F 1'den büyükse, bu p değeri alfadan küçük olsa bile sıfır hipotezinin reddedilmesi gerektiğini her zaman gösterir mi? Bu sorular cehaletimin işaretleri ise …
13 anova 


2
Rastgele bir matris için SVD hiçbir şeyi açıklamamalı mı? Neyi yanlış yapıyorum?
Tamamen rastgele verilerden oluşan bir 2-D matris oluşturursam, PCA ve SVD bileşenlerinin temelde hiçbir şeyi açıklamamasını beklerdim. Bunun yerine, ilk SVD sütunu verilerin% 75'ini açıklıyor gibi görünüyor. Bu nasıl olabilir? Neyi yanlış yapıyorum? İşte konu: İşte R kodu: set.seed(1) rm(list=ls()) m <- matrix(runif(10000,min=0,max=25), nrow=100,ncol=100) svd1 <- svd(m, LINPACK=T) par(mfrow=c(1,4)) image(t(m)[,nrow(m):1]) …
13 r  pca  svd 

2
Otokorelasyon ile anlaşma nedir?
Önceden, oldukça derin bir matematik geçmişim var, ama asla zaman serileri veya istatistiksel modelleme ile hiç ilgilenmedim. Bu yüzden bana karşı çok nazik olmak zorunda değilsin :) Ticari binalarda enerji kullanımının modellenmesi hakkındaki bu makaleyi okuyorum ve yazar bu iddiayı öne sürüyor: [Otokorelasyon varlığı] ortaya çıkar çünkü model doğal olarak …

1
Lojistik regresyon tahminlerini anlama
Bir lojistik regresyon modelinden (R'de glm) gelen tahminlerim beklediğim gibi 0 ile 1 arasında sınırlı değil. Lojistik regresyon anlayışım, giriş ve model parametrelerinizin doğrusal olarak birleştirilmesi ve yanıtın logit link işlevi kullanılarak bir olasılığa dönüştürülmesidir. Logit işlevi 0 ile 1 arasında sınırlandığından, tahminlerimin 0 ile 1 arasında sınırlanmasını bekledim. Ancak …

1
AIC / BIC: bir permütasyon kaç parametre sayıyor?
Diyelim ki bir model seçim problemim var ve modelleri değerlendirmek için AIC veya BIC kullanmaya çalışıyorum . Bu, bir miktar gerçek değerli parametrelere sahip modeller için kolaydır .kkk Bununla birlikte, modellerimizden birinin (örneğin, Mallows modeli ) bir permütasyonu ve sadece gerçek değerli parametreler yerine bazı gerçek değerli parametreleri varsa ne …

1
LDA Cebiri. Bir değişkenin Fisher ayrım gücü ve Doğrusal Ayırım Analizi
Görünüşe göre, Fisher analizi, sınıf içi dağılımı en aza indirirken aynı zamanda sınıflar arası ayrımı en üst düzeye çıkarmayı amaçlamaktadır. Bu nedenle, bir değişkenin ayrımcılık gücünün yararlı bir ölçüsü, diyagonal miktar ile verilir: .Bii/WiiBii/WiiB_{ii}/W_{ii} http://root.cern.ch/root/htmldoc/TMVA__MethodFisher.html p x p( B ) ve Sınıf İçi ( W ) Arasındaki matrislerin boyutunun ( …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.