İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

8
İstatistiklere iyi bir lisans tanıtım ders kitabı için herhangi bir öneriniz var mı?
Bana bazı önerilerde bulunabileceğinizi umuyorum. Çok çeşitli (azınlık gruplarından oluşan) bir kolejde ders veriyorum ve öğrenciler çoğunlukla Psikoloji bölümleri. Öğrencilerin çoğu liseden taze, ancak bazıları 40 yaşın üzerinde geri dönen yaşlı öğrencilerdir. Öğrencilerin çoğunda motivasyon problemleri ve matematikten kaçınma vardır. Ama hala temel müfredatı kapsayan bir kitap arıyorum: tanımlayıcıdan örneklemeye …

3
Kesişme / sürüklenme ve doğrusal eğilim ile modellenmiş bir zaman serisi için hangi Dickey-Fuller testi?
Kısa versiyon: Durağanlık için test ettiğim bir dizi iklim verim var. Önceki araştırmalara dayanarak, verilerin altında yatan modelin (ya da tabiri caizse, sözde) bir kesişim terimi ve pozitif bir doğrusal zaman eğilimine sahip olmasını bekliyorum. Bu verileri durağanlık açısından test etmek için, kesişim ve zaman eğilimi, yani denklem # 3 …

4
Çapraz doğrulama öncesi normalleştirme
Tekrarlanan bir k-kat çapraz validasyonu gerçekleştirmeden önce verilerin normalleştirilmesi (sıfır ortalama ve birlik standart sapmasına sahip olmak için) aşırı sığdırma gibi herhangi bir olumsuz kontrole sahip mi? Not: Bu #cases> toplam #features bir durum içindir Bazı verilerimi bir günlük dönüşümü kullanarak dönüştürüyorum, sonra yukarıdaki gibi tüm verileri normalleştiriyorum. Daha sonra …

6
Bir dizi veride yerel zirveleri / vadileri nasıl bulurum?
İşte benim denemem: Quantmod paketindeki findPeaksişlevi kullanıyorum : Bir tolerans 5 içinde "yerel" zirveleri tespit etmek istiyorum, yani zaman serisi yerel zirvelerden 5'e düştükten sonraki ilk yerler: aa=100:1 bb=sin(aa/3) cc=aa*bb plot(cc, type="l") p=findPeaks(cc, 5) points(p, cc[p]) p Çıktı [1] 3 22 41 3'ten fazla "yerel zirveleri" bekliyorum gibi yanlış görünüyor …
17 r  time-series 

2
Poster sunumumu nasıl organize etmeliyim?
Şu anda poster sunumu yapıyorum ve grafiğin bazı yönleri hakkında bazı tavsiyelerde bulunmak (veya tavsiyelerde bulunmak) istiyorum. Bahsettiğim posterler için, Hesaplamalı ve Grafik İstatistikler Dergisi Cilt 20 Sayı 2'deki ASA Data Expo makaleleri için ek materyale bakınız (başka bir örnek buradadır ( Hendrix ve ark., 2008 )). Ayrıca, eğer önemli …

1
Gizli Dirichlet tahsisini kullanarak konu tahmini
LDA'yı bir belge topluluğunda kullandım ve bazı konular buldum. Kodumun çıktısı olasılıkları içeren iki matristir; bir doc-konu olasılıkları ve diğer word-konu olasılıkları. Ancak aslında bu sonuçların yeni bir belgenin konusunu tahmin etmek için nasıl kullanılacağını bilmiyorum. Gibbs örneklemesi kullanıyorum. Nasıl olduğunu bilen var mı? Teşekkürler

1
Ağaçların Artırılması ve Torbalanması (XGBoost, LightGBM)
Ağaçları torbalama veya artırma fikirleri hakkında birçok blog yazısı, YouTube videosu vb. Var . Genel anlayışım, her biri için sözde kod: torbalama: Örneklerin% x'i ve özelliklerin% y'i N rasgele örneği alın Modelinizi (örn. Karar ağacı) N Her bir N ile tahmin edin Nihai tahmini almak için tahminleri ortalayın Arttırılması: Modelinizi …


2
Rastgele etkilerle sıralı lojistik regresyon nasıl kullanılır?
Çalışmamda iş yükünü çeşitli ölçümlerle ölçeceğim. Kalp atış hızı değişkenliği (HRV), elektrodinamik aktivite (EDA) ve subjektif skala (IWS) ile. Normalleştirmeden sonra IWS'nin üç değeri vardır: İş yükü normalden düşük İş yükü ortalama İş yükü normalden yüksek. Fizyolojik önlemlerin öznel iş yükünü ne kadar iyi tahmin edebileceğini görmek istiyorum. Bu nedenle …

1
Kosinüs benzerliği, pearson korelasyonu ve z skoru arasında bir ilişki var mı?
Bu 3 önlem arasında herhangi bir ilişki olup olmadığını merak ediyorum. Tanımlara atıfta bulunarak aralarında bağlantı kuramıyorum (muhtemelen bu tanımlara yeniyim ve onları kavramak için biraz zorlanıyorum). Kosinüs benzerliğinin aralığının 0 - 1 arasında olabileceğini ve pearson korelasyonunun -1 ila 1 arasında olabileceğini biliyorum ve z skorunun aralığında emin değilim. …

2
Regresyon için doğal kübik spline tanımı
Hastie ve ark. Tarafından yayınlanan "İstatistiksel Öğrenme Veri Madenciliği, Çıkarım ve Tahmin Öğeleri" kitabındaki spline'ları öğreniyorum. 145. sayfada Doğal kübik kamaların sınır düğümlerinin ötesinde doğrusal olduğunu buldum. Orada knot, içinde spline'lar ve şu kitapta böyle bir spline hakkında bilgi verilmektedir.Karsılık 1 , ξ 2 , . . . ξ KKKKξ1,ξ2,...ξKξ1,ξ2,...ξK\xi_1, …

2
R'de Kolmogorov-Smirnov testini anlama
Kolmogorov-Smirnov test fonksiyonunun çıktısını anlamaya çalışıyorum (iki örnek, iki taraflı). İşte basit bir test. x <- c(1,2,2,3,3,3,3,4,5,6) y <- c(2,3,4,5,5,6,6,6,6,7) z <- c(12,13,14,15,15,16,16,16,16,17) ks.test(x,y) # Two-sample Kolmogorov-Smirnov test # #data: x and y #D = 0.5, p-value = 0.1641 #alternative hypothesis: two-sided # #Warning message: #In ks.test(x, y) : cannot …

2
R'de kademeli regresyon - Nasıl çalışır?
Adım fonksiyonunu kullanarak R adım adım ve geriye doğru regresyon arasındaki temel farkı anlamaya çalışıyorum. Kademeli regresyon için aşağıdaki komutu kullandım step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="both") Yukarıdaki kod için aşağıdaki çıktı var. Geriye doğru değişken seçimi için aşağıdaki komutu kullandım step(lm(mpg~wt+drat+disp+qsec,data=mtcars),direction="backward") Ve geri için aşağıdaki çıktıyı aldım Anladığım kadarıyla, hiçbir parametre belirtilmediğinde, R'de "üst" …
17 r  regression 

1
Bir evrişim ağındaki evrişim filtresi sayısının önemi nedir?
Bir evrişim katmanındaki filtre sayısı ne kadardır? Bu sayı mimarinin performansını veya kalitesini nasıl etkiler? Yani her zaman daha fazla sayıda filtreyi tercih etmeliyiz? onlardan ne iyi? ve İnsanlar farklı katmanlar için farklı sayıda filtreyi nasıl atar? Yani şu soruya bakıyorum: CNN'deki evrişimsel operatörlerin sayısı nasıl belirlenir? Cevap, farklı sayıda …

1
R'de yoğunluk fonksiyonundan olasılık yoğunluk fonksiyonunu bulma / tahmin etme
XBilinmeyen bir dağılımda olduğu gibi bir değişkenim var . Mathematica'nın olarak, kullanarak SmoothKernelDensityişlev biz tahmini yoğunluk çalışmaz.Bu tahmini yoğunluk fonksiyonu ile birlikte kullanılabilir olabilir PDFgibi bir değer hesaplamak olasılık yoğunluk fonksiyonu fonksiyonu Xşeklinde PDF[density,X]"yoğunluk" bir sonucu olduğunu varsayarak SmoothKernelDensity. R'de böyle bir özellik varsa iyi olurdu. Mathematica'da böyle çalışır http://reference.wolfram.com/mathematica/ref/SmoothKernelDistribution.html …
17 r  pdf  cdf 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.