İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
kolay kanıt ?
Let bağımsız standart normal rasgele değişkenler. Orada birçok (uzun) kanıt var.Z1,⋯,ZnZ1,⋯,ZnZ_1,\cdots,Z_n ∑i=1n(Zi−1n∑j=1nZj)2∼χ2n−1∑i=1n(Zi−1n∑j=1nZj)2∼χn−12 \sum_{i=1}^n \left(Z_i - \frac{1}{n}\sum_{j=1}^n Z_j \right)^2 \sim \chi^2_{n-1} Birçok kanıt oldukça uzundur ve bazıları indüksiyon kullanır (örn. Casella Statistical Inference). Bu sonucun kolay bir kanıtı olup olmadığını merak ediyorum.




2
OLS kullanarak artıklardaki hatalar azaltılırken eğim neden her zaman tam olarak 1'dir?
R'deki bazı basit simülasyonları kullanarak hatalar ve artıklar arasındaki ilişkiyi deniyordum. Bulduğum bir şey, örnek boyutuna veya hata varyansına bakılmaksızın , modele uyduğunuzda eğim için her zaman tam olarak elde ediyorum.111 errors∼β0+β1×residualserrors∼β0+β1×residuals {\rm errors} \sim \beta_0 + \beta_1 \times {\rm residuals} İşte yaptığım simülasyon: n <- 10 s <- 2.7 …

1
Kement tasarım matrisi boyutuyla nasıl ölçeklenir?
tasarım matrisim varsa , burada boyut gözlemlerinin sayısı ise, için çözmenin karmaşıklığı nedir? LASSO, wrt ve ? Cevabın , başka türlü hissetmedikçe, yineleme sayısının (yakınsama) nasıl ölçeklendiğinden ziyade, bir LASSO yinelemesinin bu parametrelerle nasıl ölçeklendiğini belirtmesi gerektiğini düşünüyorum .X∈ Rn × dX∈Rn×dX\in\mathcal{R}^{n\times d}d β = argmin β 1nnndddNdβ^= argminβ12 n| …

3
Veri bilimcisi görüşme sorusu: Doğrusal regresyon düşük ve ne yapardınız
Röportaj yapanın bana fiyat esnekliği modeli için çok düşük olduğunu (% 5 ila 10 arasında) varsayalım diye bir iş için bir görüşme sorusuyla karşılaştım . Bu soruyu nasıl çözersiniz?R2R2R^2 Neyin yanlış gittiğini veya doğrusal olmayan herhangi bir yöntemin uygulanması gerekip gerekmediğini görmek için regresyon teşhisi yapacağım dışında başka bir şey …

1
Manuel polinom genişlemesi ve R `poli` fonksiyonunu kullanmak için neden farklı tahminler alıyorum?
Manuel polinom genişlemesi ve R polyfonksiyonunu kullanmak için neden farklı tahminler alıyorum ? set.seed(0) x <- rnorm(10) y <- runif(10) plot(x,y,ylim=c(-0.5,1.5)) grid() # xp is a grid variable for ploting xp <- seq(-3,3,by=0.01) x_exp <- data.frame(f1=x,f2=x^2) fit <- lm(y~.-1,data=x_exp) xp_exp <- data.frame(f1=xp,f2=xp^2) yp <- predict(fit,xp_exp) lines(xp,yp) # using poly function …

1
Eğilim skoru ağırlıklandırmasında tedavi ağırlıklarının (IPTW'ler) ters olasılığı için sezgisel açıklama?
eğilim puanlarını kullanarak ağırlıkları hesaplamanın mekaniğini anlıyorum : ve ardından bir regresyon analizinde ağırlıkların uygulanması ve ağırlıkların tedavi ve kontrol grubu popülasyonlarındaki ortak değişkenlerin etkilerini "kontrol etmek" veya sonuç değişkeni ile ayırmak.p ( xben)p(xben)p(x_i)wi , j = t r e a twi , j = c o n t r …


1
Rasgele orman sonuçlarım neden bu kadar değişken?
Ben rastgele ormanın 2 grup arasında örnekleri sınıflandırma yeteneğini test etmeye çalışıyorum; Sınıflandırma için kullanılan 54 örnek ve değişen sayıda değişken vardır. 50.000 ağaç kullandığımda bile çanta dışı (OOB) tahminlerin neden birbirinden% 5 kadar değişebileceğini merak ediyordum. Bu önyüklemenin yardımcı olabileceği bir şey mi?


1
Zaman serisi tahmini için Rastgele Orman regresyonu
Bir kağıt fabrikasının performansı hakkında tahminlerde bulunmak için RF regresyonunu kullanmaya çalışıyorum. Girişler için dakika dakika verilerim var (odun hamurunun oranı ve miktarı vb ...) ve aynı zamanda makinenin performansı (üretilen kağıt, makinenin çektiği güç) ve 10 dakika tahminlerde bulunmak istiyorum performans değişkenleri üzerinde. 12 aylık verilerim var, bu yüzden …

3
LASSO'nun (düzenlileşme) nasıl çalıştığını gerçekten anlamadığımızı söylediklerinde istatistikçiler ne anlama geliyor?
Son zamanlarda Kement üzerinde birkaç istatistik görüşmesi yaptım (düzenlileştirme) ve ortaya çıkmaya devam eden bir nokta, Kement'in neden çalıştığını veya neden bu kadar iyi çalıştığını gerçekten anlamamamız. Bu ifadenin ne anlama geldiğini merak ediyorum. Açıkçası, Lasso'nun teknik olarak neden çalıştığını, parametrelerin daralmasıyla aşırı sığmayı önleyerek, ama böyle bir ifadenin arkasında …

2
Tensorflow tf.train.Optimizer` gradyanları nasıl hesaplar?
Tensorflow mnist eğitimini takip ediyorum ( https://github.com/tensorflow/tensorflow/blob/master/tensorflow/examples/tutorials/mnist/mnist_softmax.py ). Öğretici kullanır tf.train.Optimizer.minimize(özellikle tf.train.GradientDescentOptimizer). Degradeleri tanımlamak için hiçbir yere aktarılan bir argüman görmüyorum. Tensör akışı varsayılan olarak sayısal türev kullanıyor mu? Sizin gibi degradeleri geçirmenin bir yolu var mı scipy.optimize.minimize?

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.