İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Regresyonları takarken ortogonal polinomların kullanılmamasının bir nedeni var mı?
Genel olarak, daha yüksek mertebeden değişkenlerle regresyon takarken ortogonal polinomları kullanmamanın daha iyi olup olmadığını merak ediyorum. Özellikle, R kullanımı ile merak ediyorum: Eğer poly()ile raw = FALSEaynı donatılmış değerleri üretir poly()ile raw = TRUE, ve polyile raw = FALSEçözer polinom regresyonu ile ilgili sorunlardan dolayı, daha sonra gereken poly()ile …

1
R'nin lm () neden ders kitabımdan farklı katsayı tahminleri döndürüyor?
Arka fon Ben modelleri uydurma bir kursta ilk örneği anlamaya çalışıyorum (bu yüzden bu gülünç derecede basit görünebilir). Hesaplamaları elle yaptım ve örnekle eşleşiyorlar, ancak bunları R'de tekrarladığımda, model katsayıları kapalı. Ben fark nüfus kitaplığı ( ) kullanarak ders kitabı nedeniyle olabilir R ise örnek varyans ( ) kullanıyor olabilir …
13 r  regression  self-study  lm 

2
Tüm rasyonel değerleri kapalı bir aralıkta alan ayrık düzgün rasgele değişken (?)
Sadece (entelektüel) bir panik atak geçirdim. kapalı aralığında bir üniforma izleyen sürekli rasgele değişken : rahatça tanıdık bir istatistiksel kavram. U(a,b)U(a,b)U(a,b) Genişletilmiş gerçekler (yarım veya bütün) üzerinde desteğe sahip sürekli tekdüze bir rv: bir rv uygun değil, daha önce uygunsuz, kullanışlı ve uygulanabilir bir temel Bayesian kavramı. Sonlu sayıda değer …

3
Kısmi en küçük kareler (PLS) regresyonunun model varsayımları
PLS regresyonu (tekli ) varsayımları hakkında bilgi bulmaya çalışıyorum . Özellikle PLS'nin OLS regresyonu ile ilgili varsayımlarının karşılaştırılması ile ilgileniyorum. yyy PLS konusunda çok sayıda literatür okudum / inceledim; Wold (Svante ve Herman), Abdi ve daha birçok makalenin makaleleri, ancak tatmin edici bir kaynak bulamadılar. Wold ve diğ. (2001) PLS-regresyon: …

1
Cauchy dağılımındaki location parametresinin MLE'si
Merkezlemeden sonra , iki x ve −x ölçümünün olasılık yoğunluk fonksiyonu ile Cauchy dağılımından bağımsız gözlemler olduğu varsayılabilir: 1f(x:θ)=f(x:θ)=f(x :\theta) = ,-∞&lt;x&lt;∞1π(1+(x−θ)2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) ,−∞&lt;x&lt;∞,−∞&lt;x&lt;∞, -∞ < x < ∞ Eğer göster arasında MLE İçeride ISTV melerin RWMAIWi'nin 0'dır ancak eğer x 2 &gt; 1 iki MLE en hakkındaki vardır İçeride …

2
verileri etkileyen veya kapalı verileri bulmak için komşu bilgileri kullanma (R'de)
En yakın komşuların en iyi yordayıcılar olduğu varsayımıyla veri kümem var. Görselleştirilmiş iki yönlü eğimin mükemmel bir örneği Birkaç değerin eksik olduğu bir vakamız olduğunu varsayalım, komşulara ve eğilime göre kolayca tahmin edebiliriz. R'de karşılık gelen veri matrisi (egzersiz için kukla örnek): miss.mat &lt;- matrix (c(5:11, 6:10, NA,12, 7:13, 8:14, …

2
Kolmogorov – Smirnov testinin basit bir eşdeğerlik testi sürümü var mı?
Kolmogorov-Smirnov testi için, iki dağılımın en azından araştırmacı tarafından belirlenen bir seviyede farklılık gösterdiğini belirten negatif sıfır hipotezini test etmek için iki tek taraflı denklik testi (TOST) çerçevelendirildi mi? TOST değilse, başka bir denklik testi formu mu? Nick Stauner akıllıca stokastik eşdeğerlik ve daha kısıtlayıcı varsayımlarla medyan eşdeğerlik için sıfır …

3
Bir 'tavan etkisi' meydana geldiği sonucuna varmak için hangi kriterler yerine getirilmelidir?
SAGE Sosyal Bilimler Araştırma Yöntemleri Ansiklopedisine Göre … [a] tavan etkisi, bir önlemin potansiyel yanıtlar için belirgin bir üst sınıra sahip olması ve katılımcıların yoğun bir konsantrasyonunun bu sınıra yaklaşması veya bu sınıra yakın olması durumunda ortaya çıkar. Ölçek zayıflaması, varyans bu şekilde kısıtlandığında ortaya çıkan metodolojik bir sorundur. …

3
Çok seviyeli / hiyerarşik olarak yapılandırılmış veriler üzerinde rastgele orman
Makine öğrenimi, CART teknikleri ve benzerleri için oldukça yeniyim ve umarım saflığım çok açık değildir. Rastgele Orman çok düzeyli / hiyerarşik veri yapılarını nasıl işler (örneğin, çapraz düzey etkileşimi söz konusu olduğunda)? Yani, çeşitli hiyerarşik düzeylerde analiz birimleri içeren veri kümeleri ( ör. Okullar içinde yuvalanmış öğrenciler, hem öğrenciler hem …

1
PCA yüklemeleri nasıl yorumlanır?
PCA hakkında okurken, aşağıdaki açıklama ile karşılaştım: Her veri noktasının tek bir öğrencinin matematik testi, fizik testi, okuduğunu anlama testi ve kelime testindeki puanlarını temsil ettiği bir veri setimiz olduğunu varsayalım. Verilerdeki değişkenliğin% 90'ını yakalayan ve yüklerini yorumlayan ilk iki temel bileşeni buluyoruz. İlk temel bileşenin genel akademik yeteneği, ikincisinin …
13 pca 

3
Belirsizlikler ile çeşitli ölçümlerin standart sapması
1 Hz (7200 ölçüm) örnekleme oranına sahip 2 saatlik iki GPS verim var. Veriler biçiminde verilir ; burada ölçüm belirsizliğidir.(X,Xσ,Y,Yσ,Z,Zσ)(X,Xσ,Y,Yσ,Z,Zσ)(X, X_\sigma, Y, Y_\sigma, Z, Z_\sigma)NσNσN_\sigma Tüm ölçümlerin ortalamasını aldığımda (örneğin, bu iki saatlik ortalama Z değeri), standart sapması nedir? Elbette Z değerlerinden standart sapmayı hesaplayabilirim, ancak daha sonra bilinen ölçüm …

1
Tekilleştirme işleminde son teknoloji
Kayıt tekilleştirme işleminde en gelişmiş yöntemler nelerdir? Veri tekilleştirme de denir: kayıt bağlantısı, varlık çözümü, kimlik çözümü, birleştirme / temizleme. Örneğin CBLOCK [1] hakkında bilgim var. Yanıtların ayrıca yöntemleri uygulayan mevcut yazılımlara referansları da içermesi hoşuma gider. Örneğin Mahout'un gölgelik kümelemeyi uyguladığını biliyorum . Lucene kullanan Duke da var . …

4
Bilinen tüm dağıtımlar neden imimodal?
Hiçbir multimodal dağılım bilmiyorum. Bilinen tüm dağılımlar neden tek biçimli? Birden fazla moda sahip "ünlü" dağıtım var mı? Tabii ki, dağılımların karışımları genellikle çok modludur, ancak birden fazla moda sahip "karışım olmayan" dağılımların olup olmadığını bilmek istiyorum.


1
Model ölçeklendirilmiş verilerle donatıldığında tahminler yapmak için yeni gözlemler nasıl ölçeklendirilir?
Doğrusal regresyon modelinde kullanılacak veri matrisini ölçeklendirme kavramını anlıyorum. Örneğin, R'de şunları kullanabilirsiniz: scaled.data &lt;- scale(data, scale=TRUE) Tek sorum, çıktı değerlerini tahmin etmek istediğim yeni gözlemler için, bunlar nasıl doğru bir şekilde ölçeklendiriliyor? Olur scaled.new &lt;- (new - mean(data)) / std(data)mu?

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.