İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
PyMC'de iki normal dağılım için montaj modeli
Daha fazla istatistik öğrenmeye çalışan bir yazılım mühendisi olduğum için, başlamadan önce beni affetmen gerekecek, bu ciddi yeni bölge ... Ben öğrenme been PyMC ve bazı gerçekten (gerçekten) basit örnekleri çalışma. Çalışamadığım (ve ilgili örnekleri bulamadığım) bir problem, iki normal dağılımdan üretilen verilere bir model uydurmaktır. Diyelim ki 1000 değerim …
10 modeling  python  pymc 

2
Lojistik işlevle dönüştürülmüş bir Gauss rasgele değişkeninin beklenen değeri
Hem lojistik fonksiyon hem de standart sapma genellikle gösterilir . Standart sapma için ve kullanacağım .σσ\sigmaσ(x)=1/(1+exp(−x))σ(x)=1/(1+exp⁡(−x))\sigma(x) = 1/(1+\exp(-x))sss Ben ortalama ve standart sapma biliyorum rastgele bir giriş ile bir lojistik nöron var . Umarım ortalamadaki fark bazı Gauss gürültüsü ile iyi bir şekilde tahmin edilebilir. Dolayısıyla, hafif bir gösterim kötüye …

1
Düşük siluet genişlikleri verinin altta yatan yapıya sahip olmadığı anlamına mı geliyor?
Dizi analizinde yeniyim ve Optimal Eşleştirme tabanlı benzerlik matrislerinin küme analizlerinden ortalama siluet genişlikleri (ASW) düşükse (yaklaşık 25) nasıl tepki verdiğinizi merak ediyordum. Dizilerin kümelenmesini sağlayacak altta yatan küçük bir yapı olduğu sonucuna varmak uygun görünebilir mi? Diğer küme kalitesi ölçülerine dayalı olarak düşük ASW'yi yok sayabilir misiniz (aşağıda bazılarını …


2
ACF ve PACF ile mevsimsellik yorumlaması
Deneysel sezginin haftalık bir mevsimsellik beklemem gerektiğini söylediği bir veri setim var (yani, cumartesi ve pazardaki davranış haftanın geri kalanından farklıdır). Bu önermenin doğru olması gerekir mi, otokorelasyon grafiği bana 7'nin kat katlarında patlama yapmamalı mı? Verilerin bir örneği: data = TemporalData[{{{2012, 09, 28}, 19160768}, {{2012, 09, 19}, 19607936}, {{2012, …


1
Zaman olaylarının uzun kuyruklu dağılımı
Bir web sunucusunun günlüklerine sahip olduğunuzu varsayalım. Bu günlüklerde bu tür tupl'ler var: user1, timestamp1 user1, timestamp2 user1, timestamp3 user2, timestamp4 user1, timestamp5 ... Bu zaman damgaları, örneğin kullanıcıların tıklamalarını temsil eder. Şimdi, user1siteyi ay boyunca birden çok kez (oturumlar) ziyaret edecek ve her oturum sırasında her kullanıcının tıklamalarını alacaksınız …


3
Faktör analizinde bir faktör tarafından sadece iki (veya daha az) öğenin (değişkenlerin) yüklü olması kabul edilebilir mi?
SPSS'de faktör analizi yoluyla koyduğum 20 değişkenim var. Araştırma amacıyla 6 faktör geliştirmem gerekiyor. SPSS, 8 değişkenin (20 üzerinden) düşük ağırlıklarla yüklendiğini veya çeşitli faktörler tarafından eşit olarak yüklendiğini gösterdi, bu yüzden onları kaldırdım. Kalan 12 değişken, 6 faktörde 2 çift olarak yüklendi, bu da mükemmel bir yapı - tıpkı …

3
Konsantrasyon parametreleri üzerinde hiperprior dağılımlı multinomial-Dirichlet modeli
Elimdeki sorunu olabildiğince genel olarak anlatmaya çalışacağım. Gözlemleri bir parametre olasılık vektör tetası ile kategorik dağılım olarak modelleniyorum . Sonra parametre vektör teta parametreleri ile bir Dirichlet önceki dağıtımını .α1, α2, … , Αkα1,α2,…,αk\alpha_1,\alpha_2,\ldots,\alpha_k Bu durumda parametreleri üzerine hiperprior dağılımı da uygulamak mümkün ? Kategorik ve dirichlet dağılımları gibi çok …

3
Tutulacak ana bileşen sayısını seçme
Bana önerilen bir yöntem, bir eğri çizgi grafiğine bakmak ve kullanılacak doğru PC sayısını belirlemek için "dirsek" olup olmadığını kontrol etmektir. Ancak grafik net değilse, R'nin sayıyı belirlemek için bir hesaplaması var mı? fit <- princomp(mydata, cor=TRUE)
10 r  pca 

2
Değişkenler mükemmel çağdaş bağımlılık gösterdiğinde çok değişkenli Merkezi Limit Teoremi (CLT) geçerli midir?
Xi∽iidN(0,1)Xi∽iidN(0,1)X_i \overset{iid}{\backsim} \mathcal{N}(0, 1)i=1,...,ni=1,...,ni = 1, ..., nSn=1n∑i=1nXiSn=1n∑i=1nXi\begin{equation} S_n = \frac{1}{n} \sum_{i=1}^n X_i \end{equation}Tn=1n∑i=1n(X2i−1)Tn=1n∑i=1n(Xi2−1)\begin{equation} T_n = \frac{1}{n} \sum_{i=1}^n (X_i^2 - 1) \end{equation} SnSnS_nTnTnT_nn=1n=1n = 1n−−√SnnSn\sqrt{n} S_nn−−√TnnTn\sqrt{n} T_nn→∞n→∞n \rightarrow \infty Motivasyon: Soru için motivasyonum, ve olduğunda mükemmel bir şekilde bağımlı olduğu garip (ama harika) hissetmesinden kaynaklanıyor, ancak çok değişkenli anlamı bağımsızlığa …

3
Zamana bağlı ortak değişkenlerle Cox regresyonu için model önerisi
Hamileliğin bir hastalığın sonucu üzerindeki etkisini modelliyorum (ölü canlı). Hastaların yaklaşık% 40'ı tanıdan sonra gebe kalmıştır - ancak farklı zamanlarda. Şimdiye kadar gebeliğin sağkalım üzerine açık bir koruyucu etkisi ve aynı zamanda düzenli bir Cox modeli gösteren KM grafikleri yaptım - ancak bunlar sadece ikiye bölünmüş bir gebelik değişkeni kullanılarak …
10 survival 

1
AR (1) tahminlerindeki R ve EViews farkları
Ana sorun : EViews ve R ile benzer parametre tahminleri elde edemiyorum. Kendimi bilmediğim nedenlerden ötürü, EViews kullanarak belirli veriler için parametreleri tahmin etmem gerekiyor. Bu, NLS (doğrusal olmayan en küçük kareler) seçeneği seçilerek ve aşağıdaki formül kullanılarak yapılır:indep_var c dep_var ar(1) EViews istemlerde : bunlar AR lineer tahmin ki …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.