İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


1
Çok Seviyeli Lojistik Regresyon Modellerinin Tahmini
Seviye 1'de (bireysel seviye) bir açıklama değişkeni ve seviye 2'de (grup seviyesi) bir açıklama değişkeni olan aşağıdaki çok seviyeli lojistik modeli: logit (pben j) =π0 j+π1 jxben j… ( 1 )lojit(pbenj)=π0j+π1jxbenj...(1)\text{logit}(p_{ij})=\pi_{0j}+\pi_{1j}x_{ij}\ldots (1) π0 j=γ00+γ01zj+u0 j... ( 2 )π0j=γ00+γ01zj+u0j...(2)\pi_{0j}=\gamma_{00}+\gamma_{01}z_j+u_{0j}\ldots (2) π1 j=γ10+γ11zj+u1 j… ( 3 )π1j=γ10+γ11zj+u1j...(3)\pi_{1j}=\gamma_{10}+\gamma_{11}z_j+u_{1j}\ldots (3) burada, ve grup düzeyinde …

1
Metafor paketi: önyargı ve hassasiyet teşhisi
Birden çok sonucu olan bazı makaleler içeren çok seviyeli bir meta-analiz yapıyorum. Bu nedenle rma.mv()işlevi kullanıyorum . Örnek kod: test.main = rma.mv(yi,vi,random = ~1|ID, data = data) İki sorum var: Bir önceki sorguda kullanırken rma.mv(), ranktest()huni arsa asimetrisinin güvenilir bir test olmadığını okudum . Bununla birlikte, orijinal modele moderatör olarak …

2
SVM'leri kullanırken neden özellikleri ölçeklendirmem gerekiyor?
Scikit-learn'daki StandardScaler nesnesinin belgelerine göre : Örneğin, bir öğrenme algoritmasının objektif işlevinde kullanılan birçok öğe (Destek Vektör Makinelerinin RBF çekirdeği veya doğrusal modellerin L1 ve L2 düzenleyicileri gibi) tüm özelliklerin 0 etrafında ortalandığını ve aynı sırayla varyansa sahip olduğunu varsayar. Bir özellik, diğerlerinden daha büyük büyüklük sıralarına sahip bir varyansa …


2
Rastgele etkiler için alternatif ağırlıklandırma şemaları meta-analiz: eksik standart sapmalar
Standart sapmaları rapor etmeyen bir dizi çalışmayı kapsayan rastgele etkiler meta analizi üzerinde çalışıyorum; tüm çalışmalar örneklem büyüklüğünü bildirmektedir. SD eksik verilere yaklaşık veya dolaylı neden olabileceğine inanmıyorum. Tüm çalışmalarda standart sapmalar mevcut olmadığında, etki büyüklüğü olarak ham (standartlaştırılmamış) ortalama farklılıkları kullanan bir meta analiz nasıl ağırlıklandırılmalıdır? Tabii ki hala …

1
İki model karşılaştırması için anova nasıl kullanılır?
anovaİki modeli karşılaştırırken sonucu nasıl anlamalıyım ? Misal: Res.Df RSS Df Sum of Sq F Pr(>F) 1 9 54.032 2 7 4.632 2 49.4 37.329 0.0001844 *** Manpage şunu belirtir: "Bir veya daha fazla takılmış model nesnesi için varyans (veya sapma) tablolarının hesaplama analizi." Bununla birlikte, profesör model karşılaştırması için …
9 r  regression  anova 

1
Güçlendirilmiş regresyon ağaçlarının (BRT), genelleştirilmiş hızlandırılmış modellerin (GBM) ve gradyan güçlendirme makinesinin (GBM) mutabakatı
Sorular: Arttırılmış regresyon ağaçları (BRT) ve genelleştirilmiş arttırılmış modeller (GBM) arasındaki farklar nelerdir? Bunlar birbirinin yerine kullanılabilir mi? Biri diğerinin belirli bir şekli mi? Ridgeway neden Friedman'ın daha önce "Gradient Boosting Machine" (GBM) olarak önerdiğini tanımlamak için "Genelleştirilmiş Artırılmış Regresyon Modelleri" (GBM) ifadesini kullandı? Bu iki kısaltma aynıdır, aynı şeyi …

2
Artırma için çantadan çıkma hatası tahmini?
Rastgele Orman'da her ağaç, verilerin benzersiz bir takviye örneğine paralel olarak büyütülür. Her takviye örneğinin benzersiz gözlemlerin yaklaşık% 63'ünü içermesi beklendiğinden, bu, ağacın test edilmesi için kullanılabilecek gözlemlerin yaklaşık% 37'sini dışarıda bırakır. Şimdi, Stokastik Degrade benzer bir tahmini var gibi görünüyor :OOBerrorOOBerrorOOB_{error} Bag.fraction 0 değerinden daha büyük olarak ayarlanırsa (0,5 …

2
Model oluşturma süreci etkileşimli olduğunda geri test veya çapraz doğrulama
Performansını geri test etmek istediğim bazı öngörülü modellerim var (yani, veri setimi al, önceki bir noktaya "geri sar" ve modelin prospektif olarak nasıl performans göstereceğini görüyorum). Sorun şu ki, bazı modellerim etkileşimli bir süreçle oluşturuldu. Örneğin, Frank Harrell'in Regresyon Modelleme Stratejilerindeki tavsiyeyi takiben, bir modelde, özellikler ve yanıt arasındaki olası …

2
Bir uyumsuzluk ölçüsü için ağırlıklar nasıl bulunur?
Kümeleme için kullanabileceğim benzerlik ölçümüm için ağırlıklarını öğrenmek (çıkarmak) istiyorum. Bazı örnekler vardır (aynı kümedeki olmalıdır) "içindeki", hem de bazı örnekler olarak nesnelerin çiftlerinin "benzemeyen" nesnelerin çiftlerinin (olmamalıdır aynı kümede olması). Her nesnenin birtakım nitelikleri vardır: İsterseniz, her bir nesneyi , her özelliğin negatif olmayan bir tamsayı olduğu, boyutlu bir …

1
İki emici Markov zinciri göz önüne alındığında, birinin diğerinden önce sona erme olasılığı nedir?
Her biri bir emici duruma ve bilinen bir başlangıç ​​pozisyonuna sahip iki farklı Markov zincirim var. Zincir 1'in zincir 2'den daha az adımda emici bir duruma ulaşma olasılığını belirlemek istiyorum. Sanırım n adımdan sonra belirli bir zincirde emici bir duruma ulaşma olasılığını hesaplayabilirim: bir geçiş matrisi verildiğinde , adımdan sonra …

1
Sürekli değişken için optimum ayrıklaştırma nasıl bulunur ve değerlendirilir
Sürekli değişken ve ikili hedef değişken (0 ve 1) ile bir veri kümesi var. Sürekli değişkenleri (lojistik regresyon için) hedef değişkene göre ayırmak ve her aralıktaki gözlem sıklığının dengelenmesi gerekir. Chi Merge, karar ağaçları gibi makine öğrenme algoritmalarını denedim. Chi merge bana her aralıkta çok dengesiz sayılarla aralıklar verdi (3 …

4
Eşleştirilmiş verilerde Fisher kesin testi
verilmiş 404040 akciğer kanseri olan ve 404040eşleştirilmiş kontroller (akciğer kanseri olmadan) (yaş, cinsiyet vb. Sigaranın akciğer kanseri üzerindeki etkisi arasında kanıt bulmaya çalışmak için Fisher'in kesin testini beklenmedik durum tablosunda kullandım. Ancak bu, kontrollerin ve vakaların eşleştiğini dikkate almadı. Bu yüzden iki grup arasındaki eşleşmeyi dikkate alan Fisher'ın kesin testini …

2
CART ağaçları tahmin ediciler arasındaki etkileşimleri yakalar mı?
Bu makale , CART'ta, her adımda tek bir ortak değişken üzerinde ikili bir bölünme gerçekleştirildiğinden, tüm bölünmelerin dik olduğunu ve bu nedenle ortak değişkenler arasındaki etkileşimlerin dikkate alınmadığını iddia etmektedir. Bununla birlikte, birçok ciddi referans, aksine, bir ağacın hiyerarşik yapısının, öngörücüler arasındaki etkileşimlerin otomatik olarak modellenmesini (örneğin, bu makale ve …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.