İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
Ross Quinlan'ın C5.0'ına MATLAB ve R arayüzleri oluşturma
Ben MATLAB ve R arayüz oluşturma düşünüyorum Ross Quinlan 'ın C5.0 (buna aşina olmayan kişiler için, C5.0 bir karar ağacı algoritması ve yazılım paketidir; bir uzantısı C4.5 ) ve ben çalışıyorum yazmam gereken bileşenler hakkında fikir edinebilirim. C5.0 için bulduğum tek belge burada , See5 (C5.0 için bir Windows arabirimi?) …

3
Bir veri örneğinden Zipf kesik dağılımı için parametreleri nasıl tahmin edebilirim?
Zipf için tahmin parametresiyle ilgili bir sorunum var. Benim durumum şudur: (Zipf dağıtımını takip etmesi gereken çağrıları üreten bir denemeden ölçülen) bir örnek kümesi var. Bu jeneratörün zipf dağıtımı ile gerçekten aramalar yaptığını göstermek zorundayım. Zaten bu soru ve cevapları okudum Zipf'in yasa katsayısını bir dizi üst frekanstan nasıl hesaplayabilirim? …

2
R ve SAS'ta sırt regresyon uygulaması arasındaki fark
Uygulamalı Doğrusal İstatistiksel Modeller , 5. Baskı bölüm 11'deki sırt regresyonunun açıklamasını okuyorum . Sırt regresyonu, burada bulunan vücut yağ verileri üzerinde yapılır . Ders kitabı SAS'daki çıktıyla eşleşir, burada geri dönüştürülmüş katsayılar takılan modelde şu şekilde verilir: Y= - 7,3978 + 0,5553 X1+ 0.3681 X2- 0.1917 X3Y=-7,3978+0,5553X1+0,3681X2-0,1917X3 Y=-7.3978+0.5553X_1+0.3681X_2-0.1917X_3 Bu …

1
Parçalı regresyon çizgisini çizme
linesHer parçayı ayrı ayrı çizmek veya kullanmaktan başka bir parçalı modelin regresyon çizgisini çizmenin bir yolu var mı geom_smooth(aes(group=Ind), method="lm", fill=FALSE)? m.sqft <- mean(sqft) model <- lm(price~sqft+I((sqft-m.sqft)*Ind)) # sqft, price: continuous variables, Ind: if sqft>mean(sqft) then 1 else 0 plot(sqft,price) abline(reg = model) Warning message: In abline(reg = model) : …

2
Yeniden örnekleme için iyi bir metin mi?
Grup uygulamalı yeniden örnekleme tekniklerine iyi bir giriş metni / kaynağı önerebilir mi? Özellikle, normallik gibi varsayımlar açıkça ihlal edildiğinde grupları karşılaştırmak için klasik parametrik testlere (örn. T testleri, ANOVA, ANCOVA) alternatiflerle ilgileniyorum. Daha iyi bir çözüm yolu olarak kendimi eğitmek istediğim örnek bir sorun türü aşağıdakileri içerebilir: I) 2 …

3
Üstel modelin tahmini
Üstel model, aşağıdaki denklemle açıklanan bir modeldir: yi^=β0⋅eβ1x1i+…+βkxkiyi^=β0⋅eβ1x1i+…+βkxki\hat{y_{i}}=\beta_{0}\cdot e^{\beta_{1}x_{1i}+\ldots+\beta_{k}x_{ki}} Bu modeli tahmin etmek için kullanılan en yaygın yaklaşım, her iki tarafın logaritmalarını hesaplayarak kolayca yapılabilen doğrusallaştırmadır. Diğer yaklaşımlar nelerdir? Özellikle bazı gözlemlerde başa ilgileniyorum .yi=0yi=0y_{i}=0 31.01.2011 Güncellemesi Bu modelin sıfır üretemediğinin farkındayım. Modellediğim şeyi ve bu modeli neden seçtiğimi biraz …

2
Hangi çekirdek yöntemi en iyi olasılık çıktılarını verir?
Son zamanlarda varsayılan olayların olasılıklarını tahmin etmek için Platt'ın SVM çıktılarını ölçeklemesini kullandım. Daha doğrudan alternatifler "Çekirdek lojistik Regresyonu" (KLR) ve ilgili "İthalat Vektör Makinesi" gibi görünmektedir. Olasılık çıktıları veren hangi çekirdek yönteminin şu anda en son teknoloji olduğunu söyleyen var mı? KLR'nin R uygulaması var mı? Yardımın için çok …

4
R'de sıfır şişirilmiş bir parametrenin yoğunluğunu nasıl tahmin edebilirim?
Ben böyle görünüyor sıfırlar bir sürü veri kümesi var: set.seed(1) x <- c(rlnorm(100),rep(0,50)) hist(x,probability=TRUE,breaks = 25) Yoğunluğu için bir çizgi çizmek istiyorum, ancak density()fonksiyon x'in negatif değerlerini hesaplayan hareketli bir pencere kullanıyor. lines(density(x), col = 'grey') Bir density(... from, to)argüman var, ancak bunlar sadece hesaplamayı kesiyor gibi görünüyor, pencereyi değiştirmiyor, …
10 r  probability  kde 

5
Ampirik verilerden rastgele çok değişkenli değerler üretin
Kısmen ilişkili getirileri olan birkaç varlığa değer vermek için Monte Carlo işlevi üzerinde çalışıyorum. Şu anda, sadece bir kovaryans matrisi üretiyorum ve rmvnorm()R'deki işleve besliyorum. (İlişkili rasgele değerler üretir.) Ancak, bir varlığın getirilerinin dağılımına bakıldığında, normal olarak dağıtılmaz. Bu gerçekten iki bölümden oluşan bir soru: 1) Tek bir PDF veya …
10 mcmc  monte-carlo  pdf 

2
PLS'de regresyon katsayılarına ilişkin güven aralıkları nasıl hesaplanır?
PLS'nin altında yatan model, belirli bir matris ve vektör ile ilişkili olmasıdır burada gizli bir matrisi ve parazit terimleridir ( ortalanır).n×mn×mn \times mXXXnnnyyyX=TP′+E,X=TP′+E,X = T P' + E, y=Tq′+f,y=Tq′+f,y = T q' + f,TTTn×kn×kn \times kE,fE,fE, fX,yX,yX, y PLS tahminlerini üretmektedir ve 'kısa yolu' vektör regresyon katsayısı, şekilde . Muhtemelen …

3
Veri madenciliği için faktör seviyelerini birleştiren R paketi?
Bir faktördeki tüm düzeylerin oranı bir eşiğin altında olan bir faktörün seviyelerini birleştirecek olan R'de bir paket / fonksiyon boyunca herkesin çalışıp çalışmadığını merak ediyor musunuz? Özellikle, veri hazırlamanın ilk adımlarından biri, toplamın en az% 2'sini oluşturmayan seyrek faktör düzeylerini ('Diğer' adı verilen bir seviyeye) birlikte çöktürmektir. Bu denetimsiz olarak …

1
R'de “glmnet” bir kesişmeye sığar mı?
R kullanarak doğrusal bir model uyduruyorum glmnet. Orijinal (düzenli olmayan) model kullanılarak takıldı lmve sabit bir terimi yoktu (yani formdaydı lm(y~0+x1+x2,data)). glmnetbir tahminler matrisi ve bir cevaplar vektörü alır. glmnetBelgeleri okuyorum ve sürekli terimden bahsedemiyorum. Öyleyse, glmnetdoğrusal uyumu başlangıç ​​noktasından zorlamayı istemenin bir yolu var mı?
10 r  regression  lasso 

3
Sahte zaman serileri regresyonu hakkında bilgi edinme kaynakları
"Sahte regresyon" (zaman serileri bağlamında) ve birim kök testleri gibi ilişkili terimler çok duyduğum ama hiç anlamadığım bir şeydir. Neden / ne zaman, sezgisel olarak meydana gelir? (İki zaman dizinizin eşbütünleşme zamanının geldiğine inanıyorum, yani ikisinin bazı doğrusal kombinasyonları sabittir, ancak eşbütünleşmenin neden sahteliğe yol açması gerektiğini anlamıyorum.) Bundan kaçınmak …

1
GLS ve SUR arasındaki fark
Genelleştirilmiş En Küçük Kareler (GLS) hakkında biraz okudum ve onu temel ekonometrik geçmişime geri bağlamaya çalışıyorum. Gras okulda GLS'ye biraz benzeyen Seemingly Unrelated Regression (SUR) kullanarak hatırlıyorum. Tökezlediğim bir makale, SUR'a GLS'nin "özel durumu" olarak bile atıfta bulundu. Ama yine de beynimi benzerlikler ve farklılıklar etrafında satamıyorum. yani soru: GLS …

4
İstatistiksel modellemeye başlamak için ipuçları ve püf noktaları?
Veri madenciliği alanında çalışıyorum ve istatistik konusunda çok az resmi eğitim aldım. Son zamanlarda çok ilginç bulduğum öğrenme ve madencilik için Bayesci paradigmalara odaklanan çok fazla iş okuyorum. Benim sorum (birkaç kısımda), bir problem göz önüne alındığında, istatistiksel bir model oluşturmanın mümkün olduğu genel bir çerçeve var mı? Temel süreci …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.