İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Rastgele Orman'da neden özelliklerin rastgele bir alt kümesi, ağaç düzeyinde değil düğüm düzeyinde seçiliyor?
Benim sorum: Rasgele orman, neden ağaç düzeyinde değil de her ağaçtaki düğüm düzeyinde bölünmeye yönelik özelliklerin rastgele alt kümelerini ele alıyor ? Arka plan: Bu bir tarih sorusu. Tin Kam Ho , 1998'de her ağacın büyümesi için kullanılacak bir özellik alt kümesini rastgele seçerek "karar ormanları" oluşturma üzerine bu makaleyi …

1
Bir MA sürecinin ters çevrilebilir olup olmadığını neden önemsiyoruz?
Bir MA sürecinin ters çevrilebilir olup olmadığını neden önemsediğimizi anlamakta sorun yaşıyorum. Lütfen yanılıyorsam beni düzeltin, ancak bir AR sürecinin nedensel olup olmadığını neden önemsediğimizi anlayabiliyorum, yani, bir parametre ve beyaz gürültünün toplamı olarak "yeniden yazabiliriz" - yani hareketli bir ortalama süreç. Eğer öyleyse, AR sürecinin nedensel olduğunu kolayca görebiliriz. …

3
İki sınıflandırıcıyı (ortalama) ROC AUC, duyarlılık ve özgüllük açısından karşılaştırmak için istatistiksel anlamlılık (p değeri)
100 vakadan oluşan bir test setim ve iki sınıflandırıcım var. Her iki sınıflandırıcı için tahminler ve ROC AUC, duyarlılık ve özgüllük hesapladım. Soru 1: Tüm puanlara (ROC AUC, duyarlılık, özgüllük) göre birinin diğerinden önemli ölçüde daha iyi olup olmadığını kontrol etmek için p-değerini nasıl hesaplayabilirim? Şimdi, 100 vakanın aynı test …

1
Gauss Karışım Modelleri için farklı kovaryans türleri
Burada Gauss Karışım Modellerini denerken , bu 4 tür kovaryans buldum. 'full' (each component has its own general covariance matrix), 'tied' (all components share the same general covariance matrix), 'diag' (each component has its own diagonal covariance matrix), 'spherical' (each component has its own single variance). Bunları türlerinin her biri …

1
Tren ve Test Hatası Boşluğu ve Aşırı Donatmayla İlişkisi: Çatışan tavsiyeleri uzlaştırmak
Özellikle ikisi arasında bir boşluk olduğunda trenle test hatasını karşılaştırmanın nasıl ele alınacağı konusunda çelişkili tavsiyeler var gibi görünüyor. Bana göre, çatışan iki düşünce okulu var gibi. İkisini nasıl uzlaştıracağımı (veya burada eksik olanı anladığımı) arıyorum. Düşünce # 1: Sadece tren ve test seti performansı arasındaki boşluk aşırı uyuşmayı göstermiyor …

2
2B'deki Uzamsal Bırakma nasıl uygulanır?
Bu, Evrimsel Ağları Kullanarak Verimli Nesne Yerelleştirmesi'ne başvurmaktır ve anladığımdan ayrılma 2B'de uygulanır. Keras'tan Mekansal 2D Bırakmanın nasıl uygulandığına ilişkin kodu okuduktan sonra, temelde rastgele bir ikili şekil maskesi [batch_size, 1, 1, num_channels] uygulanır. Ancak, bu uzamsal 2D Bırakma, şekil [batch_size, yükseklik, genişlik, num_kanallar] giriş evrişim bloğuna tam olarak ne …

1
Derin Sinir Ağlarında Duyarlılık Analizi
Zaten cevaplanan bir sorudan sonra ( Tek Katmanlı ileri beslemeli ağdan ağırlık önemini ayıklama ) Sinir ağlarındaki girdilerin alaka düzeyi hakkında çıkarım arıyorum. İlgilenilen çıkış düğümünden katmanlar arasında geriye doğru gidilerek girdi önemini yeniden yapılandırmanın zor veya zaman alıcı olabileceği derin bir ağ göz önüne alındığında, sinir ağı için duyarlılık …

1
% 95 güvenilir aralık nasıl bulunur?
Aşağıdaki posterior dağılımın% 95 güvenilir aralığını hesaplamaya çalışıyorum. R için işlevi bulamadım ama aşağıdaki yaklaşım doğru mu? x <- seq(0.4,12,0.4) px <- c(0,0, 0, 0, 0, 0, 0.0002, 0.0037, 0.018, 0.06, 0.22 ,0.43, 0.64,0.7579, 0.7870, 0.72, 0.555, 0.37, 0.24, 0.11, 0.07, 0.02, 0.009, 0.005, 0.0001, 0,0.0002, 0, 0, 0) plot(x,px, …

3
Basit doğrusal regresyon, p değerleri ve AIC
Bu konu örneğin önce birkaç kez gelip vardır fark burada , ama yine de benim regresyon çıkışını nasıl yorumlanacağı iyi emin değilim. Ben yere (loc) göre iki gruba bölünmüş bir x değerleri sütunu ve y değerleri sütunu içeren çok basit bir veri kümesi var . Puanlar şöyle görünür Bir meslektaşım, …

3
Yüksek pozitif basıklık hipotez testleri için neden sorunludur?
Duydum (üzgünüm bir metne bağlantı veremem, bana söylenen bir şey), kalıntıların yüksek pozitif basıklığının doğru hipotez testleri ve güven aralıkları (ve dolayısıyla istatistiksel çıkarım ile ilgili problemler) için sorunlu olabileceğini duydum. Bu doğru mu ve eğer öyleyse, neden? Kalıntıların yüksek pozitif basıklığı, artıkların çoğunun artık ortalamanın yakınında olduğunu ve dolayısıyla …


3
Lojistik Regresyonda Değişkenlerin WoE (Kanıt Ağırlığı) ile Değiştirilmesi
Bu, bazı meslektaşlarım tarafından takip edilen bir uygulama veya yöntemle ilgili bir sorudur. Lojistik regresyon modeli yaparken, insanların kategorik değişkenleri (veya ikili değişkenleri) kendi Kanıt Ağırlıkları (WoE) ile değiştirdiklerini gördüm. Bu, regresör ve bağımlı değişken arasında monotonik bir ilişki kurmak için yapılır . Şimdi anladığım kadarıyla, model yapıldıktan sonra, denklemdeki …

4
Gecikmeli çoklu doğrusal regresyon ve zaman serileri arasındaki “mekanik” fark nedir / nelerdir?
Şu anda veri mühendisliği alanında yüksek lisans eğitimi almak isteyen işletme ve ekonomi mezunuyum. Doğrusal regresyon (LR) ve sonra zaman serisi analizi (TS) üzerinde çalışırken aklıma bir soru geldi. Neden çoklu lineer regresyon kullanmak ve ona gecikmeli değişkenler eklemek yerine yepyeni bir yöntem, yani zaman serisi (ARIMA) yaratalım (gecikmeler sırası …

1
Bayes kement vs başak ve levha
Soru: Değişken seçimi için öncekini diğerine göre kullanmanın avantajları / dezavantajları nelerdir? I olasılığını olduğunu varsayalım: ı yerleştirmek için her iki önsel biri: veya: w i ∼ π δ 0 + ( 1 - π ) N ( 0 , 100 )y∼ N( Xw , σ2ben)y∼N(Xw,σ2I)y\sim\mathcal{N}(Xw,\sigma^2I)w i ∼ exp ( …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.