İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

5
Zaman serilerini nasıl tespit ederim?
Zaman serilerini nasıl tespit ederim? Sadece ilk farkı alıp bir Dickey Fuller testi yapmanın bir sakıncası var mı? Ayrıca, Stata'da bunu yaparak zaman serilerini telafi edebileceğimi çevrimiçi buldum: reg lncredit time predict u_lncredit, residuals twoway line u_lncredit time dfuller u_lncredit, drift regress lags(0) Detrend zaman serilerine en iyi yaklaşım nedir?


3
K-ortalamaları küme analizinden sonra ANOVA'nın uygunluğu
K-ortalama analizinden sonra ANOVA tablosundan sonraki bildirim, küme çözeltisi mesafeyi en üst düzeye çıkarmak için Öklid mesafesine göre türetildiğinden, önem seviyelerinin eşit araçların testi olarak görülmemesi gerektiğini gösterir. Kümeleme değişkenlerinin ortalamalarının kümeler arasında farklılık gösterip göstermediğini göstermek için hangi testi kullanmalıyım? Bu uyarıyı k-ortalamalarının çıktılarının ANOVA tablosunda gördüklerini gördüm, ancak …
14 anova  k-means 


2
İki değişkenli Poisson dağılımının türetilmesi
Son zamanlarda iki değişkenli Poisson dağılımıyla karşılaştım, ancak nasıl türetilebileceği konusunda biraz kafam karıştı. Dağıtım: P(X=x,Y=y)=e−(θ1+θ2+θ0)θx1x!θy2y!∑i=0min(x,y)(xi)(yi)i!(θ0θ1θ2)iP(X=x,Y=y)=e−(θ1+θ2+θ0)θ1xx!θ2yy!∑i=0min(x,y)(xi)(yi)i!(θ0θ1θ2)iP(X = x, Y = y) = e^{-(\theta_{1}+\theta_{2}+\theta_{0})} \displaystyle\frac{\theta_{1}^{x}}{x!}\frac{\theta_{2}^{y}}{y!} \sum_{i=0}^{min(x,y)}\binom{x}{i}\binom{y}{i}i!\left(\frac{\theta_{0}}{\theta_{1}\theta_{2}}\right)^{i} Toplayabildiğim kadarıyla, \ theta_ {0}θ0θ0\theta_{0} terimi XXX ve Y arasındaki korelasyonun bir ölçüsüdür YYY; dolayısıyla, XXX ve YYY bağımsız olduğunda, θ0=0θ0=0\theta_{0} = 0 ve dağılım …

2
AIC, BIC ve GCV: cezalandırılmış regresyon yöntemlerinde karar vermek için en iyi olan nedir?
Genel anlayışım AIC , modelin uyum iyiliği ile modelin karmaşıklığı arasındaki dengeyi ele alıyor. AIC=2k−2ln(L)AIC=2k−2ln(L)AIC =2k -2ln(L) = modeldeki parametre sayısıkkk = olabilirlikLLL Bayes bilgi kriteri BIC , AIC ile yakından ilişkilidir.AIC, parametre sayısını BIC'den daha az cezalandırır. Bu ikisinin tarihsel olarak her yerde kullanıldığını görebiliyorum. Ancak genelleştirilmiş çapraz doğrulama …

2
İç içe çapraz doğrulamanın kullanımı
Scikit Learn'ün Model Seçimi sayfasındaki iç içe çapraz doğrulamanın kullanıldığından bahsedilir: >>> clf = GridSearchCV(estimator=svc, param_grid=dict(gamma=gammas), ... n_jobs=-1) >>> cross_validation.cross_val_score(clf, X_digits, y_digits) İki çapraz doğrulama döngüsü paralel olarak gerçekleştirilir: biri GridSearchCV tahmincisi tarafından gama ayarlamak için, diğeri cross_val_score tarafından tahmincinin tahmin performansını ölçmek için. Elde edilen puanlar, yeni verilerdeki tahmin …

1
Parametrik bootstrap neden kullanılmalı?
Şu anda parametrik bootstrap ile ilgili bazı şeyleri kafamda tutmaya çalışıyorum. Çoğu şey muhtemelen önemsiz ama yine de bir şeyleri özlemiş olabileceğimi düşünüyorum. Parametrik bir önyükleme yordamı kullanarak veriler için güven aralıkları almak istediğimi varsayalım. Bu örnek var ve normal dağılmış olduğunu varsayalım. Daha sonra varyans ve ortalama tahmin edeceğim …

2
Mikroekonometride nedensellik ve zaman serisi ekonometrisinde daha büyük nedensellik
Mikroekonomide kullanılan nedensellik (özellikle IV veya regresyon süreksizlik tasarımı) ve ayrıca zaman serisi ekonometrisinde kullanılan Granger nedenselliğini anlıyorum . Birini diğeriyle nasıl ilişkilendirebilirim? Örneğin, her iki yaklaşımın panel verileri için kullanıldığını gördüm (örneğin , ). Bu konudaki makalelere yapılan atıflar takdir edilecektir.T = 20N=30N=30N=30T=20T=20T=20

2
Bartlett's Test ile teşhis edilen küresellik neden PCA'nın uygunsuz olduğu anlamına gelir?
Bartlett Testinin örneklerinizin eşit varyansa sahip popülasyonlardan olup olmadığını belirlemekle ilgilendiğini anlıyorum. Örnekler eşit varyansa sahip popülasyonlardan geliyorsa, testin sıfır hipotezini reddedemeyiz ve bu nedenle temel bir bileşen analizi uygun değildir. Bu durumla ilgili sorunun (homoskedastik veri kümesine sahip olması) nerede olduğundan emin değilim. Tüm verilerinizin temeldeki dağıtımının aynı olduğu …




1
Mesafe korelasyonunun sezgisel bir karakterizasyonu var mı?
Nasıl hesaplanabileceği ile karakterize gibi görünen mesafe korelasyonu için wikipedia sayfasına bakıyorum . Hesaplamaları yapabilirken, hangi mesafe korelasyonunun ölçtüğünü ve hesaplamaların neden olduğu gibi görünmesini sağlamaya çalışıyorum . Mesafe korelasyonunun neyi ölçtüğümü anlamama yardımcı olabilecek (sezgisel) daha sezgisel bir karakterizasyonu var mı? Sezgi istemenin biraz belirsiz olduğunu anlıyorum, ama ne …

1
DBSCAN için eps ve minPts seçme rutini
DBSCAN, bazı literatürlere göre en çok atıf yapılan kümeleme algoritmasıdır ve yoğunluğa bağlı olarak rastgele şekil kümeleri bulabilir. İki parametre eps (mahalle yarıçapı olarak) ve minPts (bir noktayı çekirdek nokta olarak kabul etmek için minimum komşu olarak) yüksek oranda onlara bağlı olduğuna inanıyorum. Bu parametreleri seçmek için rutin veya yaygın …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.