İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Çok değişkenli bir gaussianın kovaryans posterior dağılımını tahmin etme
Birkaç değişkenli bir iki değişkenli gauss dağılımını "öğrenmeliyim", ancak önceki dağıtımda iyi bir hipotez var, bu yüzden bayes yaklaşımını kullanmak istiyorum. tanımladım: P(μ)∼N(μ0,Σ0)P(μ)∼N(μ0,Σ0) \mathbf{P}(\mathbf{\mu}) \sim \mathcal{N}(\mathbf{\mu_0},\mathbf{\Sigma_0}) μ0=[00] Σ0=[160027]μ0=[00] Σ0=[160027] \mathbf{\mu_0} = \begin{bmatrix} 0 \\ 0 \end{bmatrix} \ \ \ \mathbf{\Sigma_0} = \begin{bmatrix} 16 & 0 \\ 0 & 27 \end{bmatrix} …

2
Normal dağılımın parametrelerini tahmin etmek: ortalama yerine medyan?
Normal dağılım parametrelerini tahmin etmek için ortak yaklaşım, ortalama ve örnek standart sapma / varyansını kullanmaktır. Ancak, bazı aykırı değerler varsa, medyan ve medyandan medyan sapması çok daha sağlam olmalıdır, değil mi? Bazı veri kümeleri ben, tahmin normal dağılım çalıştı klasik çok daha iyi bir uyum sağlıyor gibi görünmektedir N …

2
R kullanarak Poisson sürecini nasıl tahmin edebilirim? (Veya: NHPoisson paketi nasıl kullanılır?)
Olaylar veritabanı (yani tarihlerin bir değişkeni) ve ilişkili ortak değişkenler var. Olaylar, durağan olmayan Poisson işlemi tarafından üretilir ve parametre bazı ortak değişkenlerin bilinmeyen (ancak muhtemelen doğrusal) bir işlevidir. Bence NHPoisson paketi sadece bu amaç için var; ancak 15 saatlik başarısız araştırmadan sonra hala nasıl kullanılacağını öğrenemiyorum. Heck, her iki …

4
Logit işlevi, ikili verilerin regresyon modellemesi için her zaman en iyisidir?
Bu sorunu düşünüyorum. İkili verileri modellemek için olağan lojistik fonksiyon: Ancak S-şekilli bir eğri olan logit işlevi, verileri modellemek için her zaman en iyisidir? Belki de verilerinizin normal S-şekilli eğriyi değil, etki alanı(0,1)olan farklı bir eğri türünü takip ettiğine inanmak için nedeniniz vardır.log(p1−p)=β0+β1X1+β2X2+…log⁡(p1−p)=β0+β1X1+β2X2+… \log\left(\frac{p}{1-p}\right)=\beta_0+\beta_1X_1+\beta_2X_2+\ldots (0,1)(0,1)(0,1) Bu konuda herhangi bir araştırma …

2
Kovaryans yapısının belirlenmesi: artıları ve eksileri
Bir GLM'de bir kovaryans yapısının belirtilmesinin faydaları nelerdir (kovaryans matrisindeki diyagonal olmayan tüm girişleri sıfır olarak değerlendirmek yerine)? Verilerin bildiklerini yansıtmanın yanı sıra, uyum iyiliği artırmak? Bekletilen verilerde öngörme doğruluğu artırılsın mı? kovaryansın boyutunu tahmin etmemize izin verir mi? Kovaryans yapısının uygulanmasının maliyeti nedir? Yapar algoritmaları için hesaplama komplikasyonları eklemek? …

1
Gbm paketindeki çıktı terimlerinin anlamı nedir?
Sınıflandırma için gbm paketi kullanıyorum. Beklendiği gibi, sonuçlar iyi. Ama sınıflandırıcının çıktısını anlamaya çalışıyorum. Çıktıda beş terim vardır. `Iter TrainDeviance ValidDeviance StepSize Improve` Herkes her terimin anlamını, özellikle de Geliştir'in anlamını açıklayabilir mi ?

1
Neden varyansı stabilize ediyoruz?
Kaggle Deneme Eval yöntemini okurken varyans dengeleyici dönüşümle karşılaştım . Ortalamalarını almadan önce kappa değerlerini dönüştürmek ve sonra bunları geri dönüştürmek için bir varyans stabilizasyon dönüşümü kullanırlar. Varyans sabitleme dönüşümleri üzerindeki wiki'yi okuduktan sonra bile anlayamıyorum, neden varyansları stabilize ediyoruz? Bununla ne gibi yararlar elde ederiz?

3
Neden bir diğerinin (örneğin MSE) aksine belirli bir tahmin hatası ölçüsü (örneğin MAD) kullanıyorsunuz?
MAD = Ortalama Mutlak Sapma MSE = Ortalama Kare Hata Ben MSE bazı istenmeyen nitelikleri rağmen kullanıldığını çeşitli yerlerden önerileri gördüğüm (örn http://www.stat.nus.edu.sg/~staxyc/T12.pdf , p8 üzerinde devletler hangi "O mad genel olarak inanılmaktadır MSE'den daha iyi bir ölçüttür. Bununla birlikte, matematiksel olarak MSE MAD'den daha uygundur. ") Bundan daha fazlası …
15 forecasting  error  mse  mae 

1
Karışık model sonuçlarını görselleştirme
Karışık modellerde her zaman yaşadığım sorunlardan biri, sonuçlara ulaştığında, bir kağıt veya posterle sonuçlanabilecek veri görselleştirmelerini bulmaktır. Şu anda, aşağıdaki gibi görünen bir formülle Poisson karışık efektler modeli üzerinde çalışıyorum: a <- glmer(counts ~ X + Y + Time + (Y + Time | Site) + offset(log(people)) Glm () ile …

7
Rastgele orman aşırı uyuyor
Ben scikits-learn Rastgele Orman Regresyonu kullanmaya çalışıyorum. Sorun gerçekten yüksek bir test hatası alıyorum: train MSE, 4.64, test MSE: 252.25. Verilerim şöyle görünüyor: (mavi: gerçek veriler, yeşil: tahmin edilen): Eğitim için% 90, test için% 10 kullanıyorum. Bu, birkaç parametre kombinasyonunu denedikten sonra kullandığım kod: rf = rf = RandomForestRegressor(n_estimators=10, max_features=2, …

3
İstatistiksel rastgelelik ile ilgili bazı sorular
Gönderen Wikipedia'nın istatistik randoness : Küresel rastgelelik ve yerel rastgelelik farklıdır. Çoğu felsefi rastgelelik kavramı küreseldir çünkü belirli alt sıralar rastgele görünmese bile "uzun vadede" bir sıralamanın gerçekten rastgele göründüğü fikrine dayanırlar. Örneğin, yeterli uzunlukta sayıların "gerçekten" rasgele bir sayı dizisinde, sıfırdan başka hiçbir şeyin uzun dizilerinin olması muhtemeldir, ancak …

1
Değişkenlerdeki hatalar regresyonu: üç siteden veri toplamak için geçerli mi?
Son zamanlarda bir istemci bana bir bootstrap analizi yapmak için geldi çünkü bir FDA inceleme değişkenleri hataları regresyon geçersiz olduğunu söyledi, çünkü sitelerden veri toplarken analiz iki sitenin bazı örnekleri dahil üç siteden veri havuzu içerir aynısı. ARKA FON Müşteri, göstermek istediği yeni bir test yöntemine sahip, mevcut bir onaylanmış …

5
Lisansüstü istatistik kursu tarafından sunulan düzeyde istatistikler için açık kaynaklı Java kütüphanesi
Uygulamalı İstatistik alanında aşağıdaki ders kitabını kullanan bir yüksek lisans dersi alıyorum (size kapsanan materyalin düzeyi hakkında fikir vermek için): GK Bhattacharyya ve RA Johnson tarafından sunulan İstatistiksel Kavramlar ve Yöntemler . Profesör ödevler için SAS kullanmamızı istiyor. Sorum şu: bu tür sınıflarda genellikle görülen sorunlar için SAS yerine kullanılabilecek …
15 r  sas  java 

11
Poisson olmayan süreç örnekleri?
Poisson dağılımını öğrencilere açıklamama yardımcı olmak için Poisson dağılımıyla modellenmeye uygun olmayan durumlardan bazı iyi örnekler arıyorum. Poisson dağılımı ile modellenebilecek bir örnek olarak, bir mağazaya zaman aralığında gelen müşteri sayısı yaygın olarak kullanılmaktadır. Benzer bir damarda bir karşı örnek arıyorum, yani Poisson değil sürekli zaman içinde olumlu bir sayım …

2
Çapraz doğrulamada ortalama (skorlar) vs Skor (birleştirme)
TLDR: Veri setim oldukça küçük (120) örnektir. 10 kat çapraz doğrulama yaparken aşağıdakileri yapmalıyım: Her test katından çıktıları toplayın, bunları bir vektöre birleştirin ve daha sonra bu tam tahmin vektöründeki hatayı hesaplayın (120 örnek)? Ya da bunun yerine her katta aldığım çıkışlardaki hatayı hesaplamalıyım (kat başına 12 örnekle) ve son …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.