İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Bootstrap örneğinin örnek ortalamasının varyansı
Let ayrı gözlemler (hayır bağları) olmak. Let anlamında olabildikleri, bir ön yükleme örneği (deneysel CDF bir numune) ve izin . ve bulun .X1, . . . ,XnX1,...,XnX_{1},...,X_{n}X*1, . . . ,X*nX1*,...,Xn*X_{1}^{*},...,X_{n}^{*}X¯*n=1nΣni = 1X*benX¯n*=1nΣben=1nXben*\bar{X}_{n}^{*}=\frac{1}{n}\sum_{i=1}^{n}X_{i}^{*}E(X¯*n)E(X¯n*)E(\bar{X}_{n}^{*})V a r (X¯*n)Vbirr(X¯n*)\mathrm{Var}(\bar{X}_{n}^{*}) Şimdiye kadar ne olması olan olasılığı her yüzden ve ki verir X*benXben*X_{i}^{*}X1, . .. …

2
İstatistikte üç açık felsefi sorun
Geçenlerde istatistiklerin tarihi hakkında eğlenceli bir kitap olan The Lady Tasting Tea'yi okumayı bitirdim . Kitabın sonunda, yazar David Salsburg , istatistiklerde üç açık felsefi sorun öneriyor, bu çözümlerin istatistiksel teorinin bilime uygulanması için daha büyük etkileri olacağını savunuyor. Bu sorunları daha önce hiç duymamıştım, bu yüzden başkalarının bunlara verdiği …

3
Bir normallik testinin gücünü değerlendirme (R'de)
R'deki farklı örnek büyüklüklerine göre normallik testlerinin doğruluğunu değerlendirmek istiyorum (normallik testlerinin yanıltıcı olabileceğinin farkındayım ). Örneğin, Shapiro-Wilk testine bakmak için, aşağıdaki simülasyonu yapıyorum (sonuçları çizerken) ve örnek boyutu arttıkça boş değerlerin reddedilme olasılığının azaldığını umuyorum: n <- 1000 pvalue_mat <- matrix(NA, ncol = 1, nrow = n) for(i in …

2
IID Rastgele Değişkenlerin Toplamlarının Bölüm Beklentisi (Cambridge Üniversitesi çalışma sayfası)
Temel olasılık hakkında iyi bir bilgi gerektiren bir röportaja hazırlanıyorum (en azından röportajın kendisinden geçebilmek için). Öğrenci günlerimden aşağıdaki tabloyu revizyon olarak çalışıyorum. Çoğunlukla oldukça açıktı, ama tamamen 12. soruya düşüyorum. http://www.trin.cam.ac.uk/dpk10/IA/exsheet2.pdf Herhangi bir yardım mutluluk duyacağız. Düzenleme: soru: nin ve ile bağımsız olarak aynı şekilde dağıtılmış pozitif rastgele değişkenler …

1
Zamana bağlı değişkenlerle tekrarlanan olay verileri için veri yapısı ve fonksiyon çağrısı
2 ilacın ( drug1, drug2) hastanın düşme olasılığı üzerindeki etkisini tahmin etmeye çalışıyorum ( event). Hastalar bir kereden fazla düşebilir ve herhangi bir noktada ilaçlara konabilir veya çıkarılabilir. Benim sorum, verinin zaman dilimi (günler), özellikle de günler arasında çakışma olması gerekip gerekmediğine göre nasıl yapılandırılması gerektiğidir. Yapımın yanlış olduğunu düşündüğüm …
9 r  survival  cox-model 

4
Futbol skorları için modelleme
Dixon, Coles ( 1997 ) 'de, futboldaki skorları modellemek için (4.3)' te değiştirilmiş iki bağımsız Poisson modeli için maksimum olabilirlik tahminini kullanmışlardır. Alfa ve beta yanı sıra ev etkisi parametreleri (s. 274, Tablo 4) herhangi bir paket kullanmadan (her zamanki gibi bağımsız Poisson modelleri kullanarak çok iyi) "çoğaltmak" için R …

3
Lojistik regresyon: gerçek pozitifleri en üst düzeye çıkarmak - yanlış pozitifler
Bir lojistik regresyon modelim var (elastik net regülasyonlu R'de glmnet ile uyumlu) ve gerçek pozitifler ve yanlış pozitifler arasındaki farkı en üst düzeye çıkarmak istiyorum. Bunu yapmak için aşağıdaki prosedür akla geldi: Standart lojistik regresyon modeline uygun Tahmin eşiğini 0,5 olarak kullanarak, tüm pozitif tahminleri belirleyin Olumlu tahmin edilen gözlemler …

3
Bayes Tahmin Tahminlerini Anlama
Bayes'e Giriş kursuna katılıyorum ve tahmine dayalı dağılımları anlamakta zorluk çekiyorum. Neden faydalı olduklarını anlıyorum ve tanıma aşinayım, ama tam olarak anlamadığım bazı şeyler var. 1) Yeni gözlemlerin bir vektörü için doğru tahmini dağıtım nasıl elde edilir bir örnekleme modeli ve önceki bir varsayalım . Gözlemler varsayın verilen şartlı bağımsızdır …

1
Olay tahmini için gizli Markov modeli
Soru : Aşağıdaki kurulum bir Gizli Markov modelinin mantıklı bir uygulaması mı? 108,000(100 gün 2000boyunca alınan) bir veri setim ve tüm gözlem süresi boyunca yaklaşık olaylarım var. Veriler, gözlenen değişkenin 3 ayrık değer alabileceği ve kırmızı sütunların olay sürelerini vurguladığı aşağıdaki şekle benzer , yani 'ler:[1,2,3][1,2,3][1,2,3]tEtEt_E Şekilde kırmızı dikdörtgenlerle gösterildiği …

6
Panel verileri ile vektör otoregresyon ve dürtü yanıtlama işlevi nasıl tahmin edilir
77 çeyrek boyunca 33 kişiyle panel verilerine dayalı vektör otomatik regresyon (VAR) ve dürtü yanıt işlevi (IRF) tahmini üzerinde çalışıyorum. Bu tür bir durum nasıl analiz edilmelidir? Bu amaçla hangi algoritmalar var? Bu analizleri R'de yapmayı tercih ederim, bu yüzden herhangi biri R kodu veya bu amaç için tasarlanmış bir …

2
Arabuluculuk modeline uyacak şekilde veri simülasyonu
Belirli bir uyumlulaştırma modeliyle tutarlı verileri simüle etmek için bir prosedür bulmakla ilgileniyorum. Barron ve Kenny'nin (1986) ilk önce özetlediği ve Judd, Yzerbyt ve Muller (2013) gibi başka yerlerde açıklanan arabuluculuk modellerinin test edilmesine yönelik genel doğrusal yapısal denklem modeli çerçevesine göre , sonucu için arabuluculuk modelleri , arabulucu \ …


1
Zaman Serisi Tahmin Performansının Değerlendirilmesi
Birkaç geçici değişken üzerinde eğitilmiş bir Dinamik Naive Bayes Modelim var. Modelin çıktısı P(Event) @ t+1, her biri için tahmin edilen tahminidir t. Arsa P(Event)karşı timeolarak aşağıdaki şekilde verilmiştir. Bu şekilde, siyah çizgi temsil P(Event)benim model tarafından tahmin; kırmızı yatay çizgi olay meydana gelme olasılığını önce temsil eder; ve noktalı …

3
Bayes Teoremi neden grafiksel olarak çalışıyor?
Matematiksel bir bakış açısından Bayes Teoremi benim için mükemmel bir anlam ifade ediyor (yani türetmek ve kanıtlamak), ama bilmediğim şey Bayes Teoremini açıklamak için gösterilebilecek hoş bir geometrik veya grafiksel argüman olup olmadığıdır. Googling'i buna bir cevap için denedim ve şaşırtıcı bir şekilde bunun üzerinde bir şey bulamadım.

1
RandomForestRegressor için çanta dışı hata tahminini yorumlama
Verilerimde RandomForest regresörü kullanıyorum ve oob skorunun 0.83 olarak elde edildiğini görebiliyordum. Böyle olmanın nasıl bir şey olduğu konusunda emin değilim. Yani hedeflerim 10 ^ 7 aralığında yüksek değerler. Eğer MSE ise, o zaman çok daha yüksek olmalıydı. Burada 0.83'ün ne anlama geldiğini anlamıyorum. Sklearn araç setinin python'un RandomForestRegressor'unu kullanıyorum. …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.