İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Zaman Serisi Verilerini Tren / Test / Doğrulama Kümelerine Bölme
Zaman serisi verilerini tren / test / validasyon setlerine ayırmanın en iyi yolu nedir, validasyon seti hiperparametre ayarı için kullanılacaktır? 3 yıllık günlük satış verilerine sahibiz ve planımız eğitim verileri olarak 2015-2016'yı kullanmak, ardından doğrulama seti olarak kullanılacak 2017 verilerinden 10 hafta ve 2017 verilerinden 10 hafta sonra rastgele örneklemektir. …

2
MCMC örnekleyicileri için neden Jeffreys veya entropi temelli önceliklerin kullanılmasına karşı öneriler var?
On onların wiki sayfasından Stan devletin geliştiriciler: Sevmediğimiz bazı ilkeler: değişmezlik, Jeffreys, entropi Bunun yerine, birçok normal dağıtım önerisi görüyorum. Şimdiye kadar örnekleme itimat etmedi Bayes yöntemleri kullanılır ve nazik anlamış mutlu oldu neden binom olasılıkları için iyi bir seçimdi.θ ~ beta ( α = 12, β= 12)θ~Beta(α=12,β=12)\theta \sim \text{Beta}\left(\alpha=\frac{1}{2},\beta=\frac{1}{2}\right)
12 bayesian  mcmc  prior  pymc  stan 


2
CNN'de filtre boyutu, adım vb. Seçilmeli mi?
Stanford'un CS231N derslerine bakıyordum ve kafamı CNN mimarilerindeki bazı sorunların etrafına sarmaya çalışıyorum. Anlamaya çalıştığım şey, evrişim filtre boyutu ve adım gibi şeyler seçmek için bazı genel kurallar varsa veya bu bir bilimden daha fazla bir sanat mı? Anladığım havuzlama esas olarak bir çeşit çeviri değişmezliğini bir modele sokmak için …




1
XGBoost, tahmin aşamasında eksik verileri işleyebilir
Son zamanlarda XGBoost algoritmasını gözden geçirdim ve bu algoritmanın eğitim aşamasında eksik verileri (çarpışma gerektirmeden) işleyebildiğini fark ettim. XGboost'un yeni gözlemleri tahmin etmek için kullanıldığında (eksik veri gerektirmeden) eksik veriyi işleyip işleyemeyeceğini veya eksik verileri etkilemek için gerekli olup olmadığını merak ediyordum. Şimdiden teşekkürler.

1
Jacobian faktörüne bağlı farklı olasılık yoğunluk dönüşümleri
Bishop'un Örüntü Tanıma ve Makine Öğreniminde , olasılık yoğunluğundan hemen sonra aşağıdakileri okudum :p(x∈(a,b))=∫bap(x)dxp(x∈(a,b))=∫abp(x)dxp(x\in(a,b))=\int_a^bp(x)\textrm{d}x Doğrusal olmayan bir değişken değişikliği altında, olasılık yoğunluğu, Jacobian faktörüne bağlı olarak basit bir işlevden farklı bir şekilde dönüşür. Örneğin, değişkenlerinde bir değişiklik düşünürsek , işlevi . Şimdi , yeni değişken göre yoğunluğuna karşılık gelen bir …

3
Eğitim verilerinden daha yüksek tahmin edilmeyen rastgele orman regresyonu
Rastgele orman regresyon modelleri oluştururken, en azından Rtahmin edilen değerin, eğitim verilerinde görülen hedef değişkenin maksimum değerini asla aşmadığını fark ettim . Örnek olarak, aşağıdaki koda bakın. Verilere mpgdayanarak tahmin etmek için bir regresyon modeli oluşturuyorum mtcars. OLS ve rastgele orman modelleri üretiyorum ve onları mpgçok iyi yakıt ekonomisine sahip …
12 r  random-forest 

4
Bootstrap vs Monte Carlo, hata tahmini
Jeokimyasal hesaplamalarda Monte Carlo yöntemi ile hata yayılımını okuyorum , Anderson (1976) ve tam olarak anlamadığım bir şey var. Ölçülen bazı verileri ve bunları işleyen ve belirli bir değer döndüren bir program . Makalede, bu program ilk önce verilerin araçları kullanılarak en iyi değeri elde etmek için kullanılır (yani: ).{ …

2
R'de yapılan tek örnekli Kolmgorov-Smirnov testinde “Bağlar olmamalı”
Kolmogorov-Smirnov testini R'deki MYDATA'nın normalliğini test etmek için kullanacağım. Bu yaptığımın bir örneği ks.test(MYDATA,"pnorm",mean(MYDATA),sd(MYDATA)) İşte R'nin bana verdiği sonuç: data: MYDATA D = 0.13527, p-value = 0.1721 alternative hypothesis: two-sided Warning message: In ks.test(MYDATA, "pnorm", mean(MYDATA), sd(MYDATA)) : ties should not be present for the Kolmogorov-Smirnov test Bir sorun olduğunu …

3
Kement ve adaptif Kement Karşılaştırması
LASSO ve uyarlanabilir LASSO iki farklı şey, değil mi? (Bana göre cezalar farklı görünüyor, ama sadece bir şeyleri özleyip özlemediğimi kontrol ediyorum.) Genelde elastik ağ hakkında konuştuğunuzda, özel durum LASSO veya uyarlanabilir LASSO mu? Alpha = 1'i seçmeniz koşuluyla glmnet paketi hangisini yapar? Uyarlanabilir LASSO daha ılımlı koşullarda çalışır, değil …

2
Günlük farkı zaman serisi modelleri büyüme hızlarından daha mı iyidir?
Genellikle yazarların "günlük farkı" modelini tahmin ettiğini görüyorum, ör. log(yt)−log(yt−1)=log(yt/yt−1)=α+βxtlog⁡(yt)−log⁡(yt−1)=log⁡(yt/yt−1)=α+βxt\log (y_t)-\log(y_{t-1}) = \log(y_t/y_{t-1}) = \alpha + \beta x_t Bunu ilişkilendirmek uygun katılıyorum bir yüzde değişim ise olduğu .xtxtx_tytyty_tlog(yt)log⁡(yt)\log (y_t)I(1)I(1)I(1) Ancak log farkı yaklaşık bir değerdir ve log dönüşümü olmayan bir modeli de tahmin edebiliriz, ör. yt/yt−1−1=(yt−yt−1)/yt−1=α+βxtyt/yt−1−1=(yt−yt−1)/yt−1=α+βxty_t/y_{t-1} -1 = (y_t - …

1
Koşullu dağılım kullanarak marjinal dağılımdan örnekleme?
Bir tek değişkenli yoğunluktan numuneye istiyorum ama sadece ilişkiyi biliyorum:fXfXf_X fX( x ) = ∫fX| Y( x | y) fY( y) dy.fX(x)=∫fX|Y(x|y)fY(y)dy.f_X(x) = \int f_{X\vert Y}(x\vert y)f_Y(y) dy. MCMC (doğrudan integral gösterimi üzerinde) kullanımından kaçınmak istiyorum ve ve den örnek almak kolay olduğundan, aşağıdaki örnekleyiciyi kullanmayı düşünüyordum :fX| Y( x …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.