İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
LSI bağlamında Tekil Değer Ayrışmasını Anlama
Sorum genellikle Tekil Değer Ayrışması (SVD) ve özellikle Gizli Semantik İndeksleme (LSI) ile ilgili. Diyelim, 7 belge için 5 kelimelik sıklıklar içeren var.Aword×documentAword×document A_{word \times document} A = matrix(data=c(2,0,8,6,0,3,1, 1,6,0,1,7,0,1, 5,0,7,4,0,5,6, 7,0,8,5,0,8,5, 0,10,0,0,7,0,0), ncol=7, byrow=TRUE) rownames(A) <- c('doctor','car','nurse','hospital','wheel') I matris çarpanlara elde SVD kullanılarak: .AAAA=U⋅D⋅VTA=U⋅D⋅VTA = U \cdot D \cdot …

1
LDA'yı ön işleme adımı olarak kullanırken özellikleri standartlaştırma
Boyutsallık azalması (veya PCA yoluyla boyutsallık azalmasından sonra dönüşüm) için çok sınıflı bir Lineer Diskriminant Analizi (veya bazen Birden Çok Diskriminant Analizi de okurum) kullanılıyorsa, genel olarak bir "Z skoru normalizasyonu" (veya standardizasyonu) özellikler tamamen farklı ölçeklerde ölçülseler bile gerekli değil mi? LDA, halihazırda normalleştirilmiş Öklid mesafelerini ima eden Mahalanobis …

1
EM algoritması neden yinelemeli olmalıdır?
Her biri rastgele değişken olan birimine sahip bir popülasyonunuz olduğunu varsayalım . olan herhangi bir birim için değerlerini gözlemlersiniz . Bir tahmin istiyoruz .N-N-NXbenİsson Poisson ( λ )Xben~Poisson(λ)X_i \sim \text{Poisson}(\lambda)n = N-n0n=N--n0n = N-n_0Xben> 0Xben>0X_i > 0λλ\lambda Anların yöntemi ve cevabı almak için koşullu maksimum olasılık yolları var, ancak EM …

1
İki örnekli CDF nedir
Tek taraflı Kolmogorov-Smirnov testi için -değerlerini nasıl elde edeceğimi anlamaya çalışıyorum ve ve için CDF'ler bulmaya çalışıyorum iki örnekli durumda. Aşağıda birkaç örnekte, tek örnekli bir durumda için CDF olarak bahsedilmiştir :pppD+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}D+nDn+D^{+}_{n} p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) = \text{P}\left(D^{+}_{n} \ge x | \text{H}_{0}\right) = x\sum_{j=0}^{\lfloor n\left(1-x\right)\rfloor}{ \binom{n}{j} \left(\frac{j}{n}+x\right)^{j-1}\left(1 - x - \frac{j}{n}\right)^{n-j}} Ayrıca, whuber …

2
Tarih: İstatistiğin astronomideki rolü
Son zamanlarda cesurca bir grup oldukça zeki sekizinci sınıf öğrencisi önünde astronominin istatistiğin temellerine büyük katkı sağladığını ve astronomide kullanılmak üzere birçok istatistiksel kavramın icat edildiğini iddia ettim. Ancak, bunu geri bakarak oldukça hayal kırıklığına uğradım. Hatalar, ortalama ve ortalamadan ortalama sapma ilk olarak astronomide gözlenmiş olabilir. Bununla birlikte, hata …

2
Normallik varsayımına rağmen sıralar Pearson korelasyonu neden geçerlidir?
Şu anda Pearson korelasyonları için varsayımları okuyorum. Takip eden t-testi için önemli bir varsayım, her iki değişkenin de normal dağılımlardan geldiği; eğer yapmazlarsa, Spearman rho gibi alternatif önlemlerin kullanılması savunulur. Spearman korelasyonu Pearson korelasyonu gibi hesaplanır, sadece X ve Y yerine X ve Y safhaları kullanılarak doğru mu? Benim sorum …

1
Katkı Maddesi ve Çarpımsal Bozunma
Benim sorum gerçekten basit ama bunlar beni gerçekten elde edenler :) Belirli bir zaman serisinin bir katkı maddesi veya çarpımsal ayrıştırma yöntemi kullanılarak ayrıştırılıp ayrıştırılamayacağını gerçekten bilmiyorum. Onları birbirinden ayırmanın görsel ipuçları olduğunu biliyorum ama anlamıyorum. Örneğin bu zaman serisini ele alalım: Nasıl tarif edersiniz? Yardımın için şimdiden teşekkür ederim.

2
Poisson regresyonunu kullanarak ikili verilerde düzeltilmiş risk oranlarını tahmin etme
Lojistik regresyon kullanarak birinin ayarlanmış bir oran oranını nasıl tahmin ettiğine benzer şekilde ayarlanmış bir risk oranını tahmin etmekle ilgileniyorum. Bazı literatür (ör. Bu ), Huber-White standart hatalarıyla Poisson regresyonunun kullanılmasının bunu yapmak için model tabanlı bir yol olduğunu göstermektedir Sürekli ortak değişkenler için ayarlamanın bunu nasıl etkilediğine dair literatür …

1
Kategorik değişkenlerle aşırı örnekleme
Veri setimi kabaca 4000 müşteriyle, gruplardan birinin yaklaşık% 15 oranında olduğu iki gruba ayırmak için aşırı örnekleme ve yetersiz örnekleme kombinasyonu yapmak istiyorum. SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) ve ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), ancak bunların her ikisi de mevcut gözlemleri ve örneğin kNN'yi kullanarak yeni sentetik örnekler oluşturur. Ancak, müşterilerle …

1
Ölçek güvenilirliği önlemleri (Cronbach alfa vb.) Ve bileşen / faktör yüklemeleri arasındaki ilişki nedir?
Diyelim ki, psikoloji araştırmalarında olduğu gibi teorik olarak daha az sayıda skaladan oluşan bir grup ankette puanları olan bir veri setim var. Burada ortak bir yaklaşımın, ölçeklerin güvenilirliğini Cronbach alfa veya benzer bir şey kullanarak kontrol etmek, daha sonra ölçeklerdeki maddeleri ölçek puanları oluşturmak ve oradan analize devam etmek olduğunu …

3
R kullanarak sırt regresyonu için K katlama veya tutma çapraz doğrulaması
Verilerimin tahmininin 200 denek ve 1000 değişken ile çapraz doğrulanması üzerinde çalışıyorum. Değişken sayısı (kullanmak istiyorum) örnek sayısından daha büyük olduğu için ridge regresyonuyla ilgileniyorum. Bu yüzden büzülme tahmin edicileri kullanmak istiyorum. Aşağıdaki örnek veriler oluşur: #random population of 200 subjects with 1000 variables M <- matrix(rep(0,200*100),200,1000) for (i in …

1
Olasılıkta bir sabite yakınsama simülasyonu
Asimptotik sonuçlar bilgisayar simülasyonu ile kanıtlanamaz çünkü sonsuzluk kavramını içeren ifadelerdir. Ancak, şeylerin teorinin bize söylediği şekilde yürüdüğünü anlayabilmeliyiz. Teorik sonucu düşünün limn → ∞P( |Xn| >ϵ)=0,ε > 0limn→∞P(|Xn|>ε)=0,ε>0\lim_{n\rightarrow\infty}P(|X_n|>\epsilon) = 0, \qquad \epsilon >0 burada XnXnX_n , aynı ve bağımsız olarak dağılmış nnn rasgele değişkenin bir fonksiyonudur . Bu, XnXnX_n …

2
Ağaçların güçlendirilmesinde ayar parametreleri için en uygun değerler nasıl bulunur?
Artırıcı ağaçlar modelinde 3 ayar parametresi olduğunu, yani ağaç sayısı (yineleme sayısı) büzülme parametresi bölünme sayısı (her bir kurucu ağacın büyüklüğü) Benim sorum: ayarlama parametrelerinin her biri için, optimal değerini nasıl bulabilirim? Hangi yöntem? Şunu unutmayın: büzülme parametresi ve ağaç sayısı parametresi birlikte çalışır, yani büzülme parametresi için daha küçük …

1
GLMM için anova tip III testi
R paketine bir glmermodel lme4takıyorum. Burada gösterilen p değeri olan bir anova tablosu arıyorum, ama ona uyan herhangi bir paket bulamıyorum. R ile yapmak mümkün mü? Uyduğum model şu şekildedir: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times a year'), control=glmerControl(optimizer="bobyqa"))

1
Proteomikte güç mü?
Hibeler genellikle önerilen bir numune büyüklüğünü desteklemek için güç analizi gerektirir. Proteomikte (ve çoğu -omikte), 10 numunede ölçülen 100'den 1000'e kadar özellik / değişken vardır (belki 100'ler, ancak olası değildir). Ayrıca, bu ölçüm birimlerinin bazılarının (örn., Proteinlerin spektral sayıları) normal olarak dağıtılmadığı bilinmektedir ve bu nedenle analiz için parametrik olmayan …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.