İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


3
Birim kökü olmayan bir dizinin sabit olmadığı güzel bir örnek?
İnsanların artırılmış bir Dickey-Fuller testinde null değerini reddettiğini ve daha sonra serilerinin sabit olduğunu iddia ettiğini gördüm (maalesef, bu iddiaların kaynaklarını gösteremiyorum, ancak burada ve burada benzer iddiaların var olduğunu hayal ediyorum. bir veya daha fazla dergi). Bunun bir yanlış anlama olduğunu iddia ediyorum (bir birim kökü null değerinin reddedilmesinin, …

1
İkinci moment yöntemi, Brown hareketi?
Let BtBtB_t standart Brownian hareketi. Let Ej,nEj,nE_{j, n} ifade etkinlik {Bt=0 for some j−12n≤t≤j2n},{Bt=0 for some j−12n≤t≤j2n},\left\{B_t = 0 \text{ for some }{{j-1}\over{2^n}} \le t \le {j\over{2^n}}\right\},ve izin1O anlamına gelir göstergesi işlevi. Orada var mıρ>0öyle ki içinP{Kn≥ρ2n}≥ρherkes içinnKn=∑j=2n+122n1Ej,n,Kn=∑j=2n+122n1Ej,n,K_n = \sum_{j = 2^n + 1}^{2^{2n}} 1_{E_{j,n}},111ρ>0ρ>0\rho > 0P{Kn≥ρ2n}≥ρP{Kn≥ρ2n}≥ρ\mathbb{P}\{K_n \ge \rho2^{n}\} \ge …

2
PCA, LASSO, elastik ağın hız, hesaplama giderleri
Hastie ve ark. "İstatistiksel Öğrenmenin Öğeleri" (2. bs.), Bölüm 3: Alt küme seçimi Büzülme yöntemleri Türetilmiş giriş yönlerini kullanan yöntemler (PCR, PLS) Karşılaştırma sadece biraz fikir vermek için çok kaba olabilir. Cevapların sorunun boyutuna ve bunun bilgisayar mimarisine nasıl uyduğuna bağlı olabileceğini düşünüyorum, bu yüzden somut bir örnek için 500 …

2
Poisson modelinde, zamanı ortak değişken veya ofset olarak kullanma arasındaki fark nedir?
Geçenlerde Poisson regresyonunda dengeleme olarak (örneğin) günlüğünü kullanarak pozlamaların zaman içinde nasıl modelleneceğini keşfettim. Dengenin, katsayı 1 ile eş zamanlı olarak zamana karşılık geldiğini anladım. Zamanı ofset veya normal bir değişken olarak kullanma arasındaki farkı daha iyi anlamak istiyorum (bu nedenle katsayıyı tahmin etmek). Hangi durumda bir yöntemi veya diğerini …

4
Verileri eğitim ve test setine neden bölmek yeterli değildir?
Sınıflandırıcının performansına erişmek için verileri eğitim / test setine bölmem gerektiğini biliyorum. Ama bunu okumak : Bir SVM için manuel olarak ayarlanması gereken C ayarı gibi tahminciler için farklı ayarlar (“hiperparametreler”) değerlendirilirken, tahminci en iyi şekilde performans gösterene kadar parametreler ayarlanabileceğinden, test setinde aşırı uyum riski vardır. Bu şekilde, test …

1
Hile Sayfası ANOVA Alfabe Çorbası ve Regresyon Eşdeğerleri
Rulmanlarımı ANOVA ve REGRESSION eşdeğerlerine alma konusunda bu geçici (devam eden) denemeyi tamamlama konusunda yardım alabilir miyim? Bu iki yöntemin kavramlarını, isimlendirmesini ve sözdizimini uzlaştırmaya çalışıyorum. Bu sitede, örneğin şu veya bu gibi ortaklıklarıyla ilgili birçok yayın var , ancak kullanmaya başladığınızda hızlı bir "buradasınız" haritasına sahip olmak hala iyi. …

1
LOOCV formülünün kanıtı
Kaynaktan İstatistiksel Öğrenme An Introduction James ve diğ., Çapraz doğrulama bırakılan bir çıkış (LOOCV) tahmini ile tanımlanır CV(n)=1n∑i=1nMSEiCV(n)=1n∑i=1nMSEi\text{CV}_{(n)} = \dfrac{1}{n}\sum\limits_{i=1}^{n}\text{MSE}_i buradaMSEi=(yi−y^i)2MSEi=(yi−y^i)2\text{MSE}_i = (y_i-\hat{y}_i)^2. Kanıt olmadan, denklem (5.2), en küçük kareler veya polinom regresyonu için (bunun sadece bir değişken üzerindeki regresyon için geçerli olup olmadığı bilinmemektedir), CV(n)=1n∑i=1n(yi−y^i1−hi)2CV(n)=1n∑i=1n(yi−y^i1−hi)2\text{CV}_{(n)} = \dfrac{1}{n}\sum\limits_{i=1}^{n}\left(\dfrac{y_i - \hat{y}_i}{1-h_i}\right)^2 …

2
Bağımsız bileşen analizini anlama
Temel bileşen analizini anlamlandırma sorusunu gördüm ve keyif aldım ve şimdi aynı bileşen analizi için de aynı sorum var. Yani ICA'yı anlamak için sezgisel yollar hakkında kapsamlı bir soru sormak istiyorum. Bunu anlamak istiyorum . Amacını almak istiyorum. Hissetmek istiyorum. Buna kesinlikle inanıyorum: Büyükannenize açıklayamadıkça bir şeyi gerçekten anlamıyorsunuz. -- …
18 intuition  ica 

5
Neden aşırı değer teorisi kullanılır?
Aşırı Değer Teorisi'ni kullandığımız İnşaat Mühendisliği'nden geliyorum, GEV dağılımı gibi En büyük rüzgar hızı gibi bazı olayların değerini tahmin etmek için , yani rüzgar hızının % 98.5'inin daha düşük olacağı değeri tahmin ediyorum. Sorum şu: Neden böyle aşırı bir değer dağılımı kullanıyorsunuz ? Toplam dağılımı sadece kullanırsak ve % 98,5 …


1
Kement, sırt veya elastik ağ çözelti yollarının monoton olduğu açık bir dizi koşul var mı?
Bu kement grafiğinden (glmnet) çıkarılacak soru , kement tahmin edicisinin monotonik olmayan çözüm yollarını gösterir. Yani, bazı katsayılar küçülmeden önce mutlak değerde büyürler. Bu modelleri birkaç farklı veri setine uyguladım ve bu davranışı "vahşi doğada" hiç görmedim ve bugüne kadar her zaman monotonik olduklarını varsaymıştım . Çözelti yollarının monoton olduğu …

1
Hartigans daldırma testinin yorumlanması
Ampirik olarak aldığım bazı dağılımların bimodalite yoğunluğunu ölçmek için bir yol bulmak istiyorum. Okuduğum kadarıyla, bimodaliteyi ölçmenin yolu hakkında hala bazı tartışmalar var. R üzerinde mevcut olan Hartigans'ın daldırma testini kullanmayı seçtim (orijinal kağıt: http://www.stat.washington.edu/wxs/Stat593-s03/Literature/hartigan85a.pdf ). Hartigans'ın daldırma testi şu şekilde tanımlanır: "Dip testi, bir örnekte ampirik dağılım fonksiyonu ile …
18 r  distributions 


2
Yumuşatma - ne zaman kullanılır ve ne zaman kullanılmaz?
William Briggs'in blogunda , verileri yumuşatma ve bu yumuşatılmış verileri analize taşıma tuzaklarına bakan oldukça eski bir yazı var . Temel argüman şudur: Delilik anında, pürüzsüz zaman serisi verileri yaparsanız ve diğer analizlere girdi olarak kullanırsanız, kendinizi kandırma olasılığını önemli ölçüde artırırsınız! Bunun nedeni, düzleştirmenin sahte sinyalleri, diğer analitik yöntemlere …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.