İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Büyük , küçük problemiyle uğraşırken model kararlılığı
tanıtım: Klasik "büyük p, küçük n problemi" olan bir veri kümem var. Mevcut sayıların sayısı n = 150 iken olası yordayıcıların sayısı p = 400'dür. Sonuç sürekli bir değişkendir. En "önemli" tanımlayıcıları, yani sonucu açıklamak ve bir teori oluşturmaya yardımcı olmak için en iyi aday olanları bulmak istiyorum. Bu konuda …

1
R'de, bir kendir matrisi ile optim'den bir çıktı verildiğinde, kendir matrisini kullanarak parametre güven aralıklarını nasıl hesaplayabilirim?
Bir kendir matrisiyle optim'den bir çıktı verildiğinde, kenet matrisini kullanarak parametre güven aralıklarını nasıl hesaplayabilirim? fit<-optim(..., hessian=T) hessian<-fit$hessian Çoğunlukla maksimum olabilirlik analizi bağlamıyla ilgileniyorum, ancak yöntemin ötesine genişletilip genişletilemeyeceğini bilmek istiyorum.

2
Karışık etki modelleri nasıl karşılaştırılmalı ve ya da doğrulanmalıdır?
(Doğrusal) karışık etki modelleri normal olarak birbirleriyle nasıl karşılaştırılır? Olasılık oranı testlerinin kullanılabileceğini biliyorum, ancak bir model diğerinin 'altkümesi' değilse, bu işe yaramaz mı? Modellerin tahmini df her zaman basit midir? Sabit etki sayısı + varyans bileşenlerinin sayısı tahmin edildi mi? Rastgele etki tahminlerini görmezden mi geliyoruz? Peki ya doğrulama? …

1
Birden fazla mevsimlik bileşenlerle bir zaman serisini nasıl ayrıştırırım?
Çift mevsimsel bileşenler içeren bir zaman serisine sahibim ve diziyi aşağıdaki zaman serisi bileşenlerine (trend, mevsimsel bileşen 1, mevsimsel bileşen 2 ve düzensiz bileşen) ayrıştırmak istiyorum. Bildiğim kadarıyla, R'deki bir dizinin ayrıştırılması için STL prosedürü yalnızca bir mevsimsel bileşene izin veriyor, bu yüzden diziyi iki kez ayrıştırmaya çalıştım. İlk olarak, …

1
İstatistiksel gücün hesaplanması
Anladığım kadarıyla, güç analizi yapmak için önerilen çalışmamın en az üç özelliğini (dördünden) bilmem gerekiyor, yani: test türü - Pearson'un r ve ANCOVA / Regression - GLM'i kullanmayı düşünüyorum anlamlılık düzeyi (alfa) - 0.05 kullanmayı düşünüyorum Beklenen etki büyüklüğü - Orta büyüklükte bir etki kullanmaya niyetliyim (0.5) örnek boyut Herhangi …


4
Lognormal ve güç kanunu dağılımı arasındaki farkı yorumlama (şebeke derece dağılımı)
Öncelikle, istatistikçi değilim. Ancak doktora için istatistiksel ağ analizi yapıyorum. Ağ analizinin bir parçası olarak, ağ derecelerinin Tamamlayıcı Birikimli Dağılım Fonksiyonunu (CCDF) çizdim. Bulduğum şey, geleneksel ağ dağıtımlarından farklı olarak (örneğin WWW), dağıtımın en iyi şekilde lognormal bir dağılıma uymasıydı. Ben bunu bir güç yasasına uymaya çalıştım ve Clauset ve …

2
Model seçimi için en iyi yaklaşım Bayesian veya çapraz doğrulama?
Çeşitli modeller veya eklenecek özelliklerin arasında seçim yapmaya çalışırken, iki yaklaşım düşünebileceğimi tahmin ediyorum. Verileri eğitim ve test setlerine ayırın. Daha da iyisi, önyükleme ya da k-kat çapraz doğrulama kullanın. Her seferinde egzersiz setini eğitin ve test setindeki hatayı hesaplayın. Plot test hatası - parametre sayısı. Genellikle, böyle bir şey …


2
Zayıf öğrencilerin “gücü” hakkında
Topluluk öğreniminde zayıf öğrenicilerle ilgili yakından ilgili birkaç sorum var (örneğin artırma). Bu aptalca gelebilir, ancak güçlü öğrencilerin aksine zayıf kullanmanın yararları nelerdir? (örneğin, neden "güçlü" öğrenme yöntemlerini desteklemiyorsunuz?) Zayıf öğrenciler için bir çeşit "optimal" güç var mı (örneğin, diğer tüm topluluk parametrelerini sabit tutarken)? Güçlerine gelince "tatlı bir nokta" …

3
Çok değişkenli zaman serisi tahmini için destek vektör regresyon
Kimse destek vektör regresyonu kullanarak zaman serisi tahmini yapmaya çalıştı mı? Destek vektör makinelerini anlıyorum ve destek vektör regresyonunu kısmen anlıyorum, fakat zaman serilerini, özellikle de çok değişkenli zaman serilerini modellemek için nasıl kullanılabileceğini anlamıyorum. Birkaç makale okumaya çalıştım, ancak çok üst seviyede. Herkes, özellikle çok değişkenli zaman serileriyle ilgili …

1
Ağır kuyruk ve yağ kuyruğu dağılımları arasındaki farklar
Ağır kuyruk = şişman kuyruk düşündüm, ama okuduğum bazı makaleler bana olmadıklarını hissettirdi. Bunlardan biri diyor ki: ağır kuyruk, bazı j tamsayıları için dağılımın sonsuz anı olduğunu gösterir. Ek olarak, bir Pareto df'nin çekicilik alanı içindeki tüm dfs'ler ağır kuyrukludur. Yoğunluğun merkezi tepe noktası yüksek ve uzun kuyrukları varsa, kurtoz …

2
Çeşitli koşullar altında iki sayısal değişken arasındaki grafik ilişkisine ilişkin ipuçları içeren iyi çevrimiçi kaynak
Bağlam: Bu süre zarfında, iki sayısal değişken arasındaki ilişkiyi etkin bir şekilde çizme konusunda bir dizi sezgisel tarama elde ettim. Verilerle çalışan çoğu insanın da benzer kurallara sahip olacağını hayal ediyorum. Bu tür kurallara örnekler: Değişkenlerden biri pozitif olarak çarpıksa, bu ekseni bir günlük ölçeğinde çizmeyi düşünün. Çok fazla veri …


4
Maksimum değişkenliği kullanarak çok değişkenli normal model takarken kovaryans matrisinin özellikleri nasıl sağlanır?
Diyelim ki aşağıdaki modelim var yi=f(xi,θ)+εiyi=f(xi,θ)+εiy_i=f(x_i,\theta)+\varepsilon_i buradaki , , açıklayıcı değişkenlerin bir vektörüdür, , doğrusal olmayan fonksiyonunun ve nın parametreleridir , burada doğal olarak matrisi.yi∈RKyi∈RKy_i\in \mathbb{R}^Kxixix_iθθ\thetafffεi∼N(0,Σ)εi∼N(0,Σ)\varepsilon_i\sim N(0,\Sigma)ΣΣ\SigmaK× KK×KK\times K Amaç ve tahmin etmek her zamanki gibidir . Belirgin seçim maksimum olabilirlik yöntemidir. Bu model için log olabilirliği (bir örneğimiz olduğunu …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.