İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


4
ses kaydındaki tepe sayısını algıla
Ben ses kayıtları bir grup hece sayısını tespit etmek anlamaya çalışıyorum. Bence iyi bir vekil dalga dosyasında zirveler olabilir. İşte İngilizce konuşan bir dosya ile denedim (gerçek kullanım durumum Kiswahili'de). Bu örnek kaydın transkripti: "Bu benim zamanlayıcı işlevini kullanmaya çalışıyorum. Duraklamalara, seslendirmelere bakıyorum." Bu pasajda toplam 22 hece vardır. wav …

1
Poisson regresyonunda aşırı dağılım ile nasıl başa çıkılır: yarı olabilirlik, negatif binom GLM veya konu düzeyinde rastgele etki?
Bir Poisson tepki değişkeninde aşırı dağılım ile başa çıkmak için üç öneriyle karşılaştım ve tüm sabit etkili başlangıç ​​modeli: Bir yarı model kullanın; Negatif binom GLM kullanın; Nesne düzeyinde rastgele efektli karışık bir model kullanın. Ama hangisini gerçekten seçmeli ve neden? Bunlar arasında gerçek bir kriter var mı?

3
Normal hata varsayımı Y'nin de Normal olduğu anlamına mı geliyor?
Yanılmıyorsam, doğrusal bir modelde, yanıtın dağılımının sistematik bir bileşen ve rastgele bir bileşen olduğu varsayılır. Hata terimi rastgele bileşeni yakalar. Bu nedenle, hata teriminin Normal olarak dağıtıldığını varsayarsak, bu yanıtın da Normal olarak dağıtıldığı anlamına gelmez mi? Bence öyle, ama sonra aşağıdaki gibi ifadeler oldukça kafa karıştırıcı görünüyor: Ve bu …

2
Lojistik regresyon ne zaman uygundur?
Şu anda kendime sınıflandırma yapmayı öğretiyorum ve özellikle üç yönteme bakıyorum: destek vektör makineleri, sinir ağları ve lojistik regresyon. Anlamaya çalıştığım, lojistik regresyonun neden diğer ikisinden daha iyi performans göstereceğidir. Lojistik regresyon anlayışımdan buradaki fikir, lojistik fonksiyonun tüm verilere uymasıdır. Dolayısıyla verilerim ikiliyse, 0 etiketine sahip tüm verilerim 0 değerine …

1
Mahalanobis mesafesi ile Kaldıraç arasındaki ilişkiyi kanıtlıyor musunuz?
Wikipedia'da formüller gördüm . Mahalanobis mesafesini ve Kaldıraç ile ilgili: Mahalanobis mesafe yakın kaldıraç istatistik ile ilgilidir , ama farklı bir ölçek varhhhD2=(N−1)(h−1N).D2=(N--1)(h-1N-).D^2 = (N - 1)(h - \tfrac{1}{N}). Bir de bağlantılı makalede , Vikipedi açıklar şu ifadelerle:hhh Doğrusal regresyon modelinde için kaldıraç puan veri birimi olarak tanımlanır: şapka matris …

2
Poisson Regresyonu için Kimlik Bağlantısına Karşı Log Link'in Artıları ve Eksileri
Ben karşılaştırarak (ve farkını alarak) benim modelinde iki faktör düzeyleri arasında tahmin edilen ortalama sayımlar sonu hedefi olan bir Poisson regresyon yerine getiriyorum: , tutma sırasında diğer model ortak değişkenler (hepsi ikili) sabittir. Herkes ne zaman bir günlük bağlantısı kimlik kimlik karşı kullanılacağı konusunda bazı pratik tavsiyeler verebilir olmadığını merak …

2
Her bir nokta her ikisi de kendi belirsizlik vardır Regresyon
ve değişkenlerinin ölçümünü yaptım . Her ikisinin de ilişkili belirsizlikleri ve olduğu bilinmektedir . ve arasındaki ilişkiyi bulmak istiyorum . Nasıl yapabilirim?x y σ x σ y x ynnnxxxyyyσxσx\sigma_xσyσy\sigma_yxxxyyy DÜZENLEME : her ile ilişkili farklı bir ve ile aynı .σ x , i y ixbenxix_iσx , benσx,i\sigma_{x,i}ybenyiy_i Tekrarlanabilir R örneği: …

2
Farklı AIC tanımları
Wikipedia'da Akaike'nin Bilgi Kriteri'nin (AIC) olarak tanımlanması söz konusudur , burada parametre sayısıdır ve modelin log olasılığıdır.AIC=2k−2logLAIC=2k−2log⁡L AIC = 2k -2 \log L kkklogLlog⁡L\log L Ancak Ekonometriklerimiz saygın bir üniversitede olduğunu belirtmektedir . Burada , bir ARMA modelindeki hatalar için tahmini varyans ve , zaman serisi veri kümesindeki gözlem sayısıdır.AIC=log(σ^2)+2⋅kTAIC=log⁡(σ^2)+2⋅kT …

1
Bağımsız bir değişkenken oranları dönüştürmenin en uygun yolu nedir?
Bu sorunu anladığımı sanıyordum, ama şimdi tam olarak emin değilim ve devam etmeden önce başkalarıyla görüşmek istiyorum. İki değişkenim var Xve Y. YR, bir orandır ve 0 ve 1 ile sınırlı değildir ve genellikle normal olarak dağıtılır. Xbir orandır ve 0 ve 1 ile sınırlıdır (0,0 ila 0,6 arasında çalışır). …

2
Maksimum iid Gumbel Değişkeni Beklentisi
İktisat dergilerinde rastgele faydalı modellerde kullanılan belirli bir sonuç hakkında okumaya devam ediyorum. Sonucun bir sürümü şudur: eğer Gumbel ( , o zaman:ϵi∼iid,ϵi∼iid,\epsilon_i \sim_{iid}, μ,1),∀iμ,1),∀i\mu, 1), \forall i E[maxi(δi+ϵi)]=μ+γ+ln(∑iexp{δi}),E[maxi(δi+ϵi)]=μ+γ+ln⁡(∑iexp⁡{δi}),E[\max_i(\delta_i + \epsilon_i)] = \mu + \gamma + \ln\left(\sum_i \exp\left\{\delta_i \right\} \right), burada γ≈0.52277γ≈0.52277\gamma \approx 0.52277 Euler-Mascheroni sabittir. Bunun R kullanarak mantıklı …

2
Bayes optimizasyonu için GP regresyonunda koşulsuz kovaryans matrisi
Arka plan ve sorun Regresyon ve sonraki Bayes optimizasyonu (BO) için Gauss İşlemleri'ni (GP) kullanıyorum. Regresyon için, MATLAB için gpml paketini birkaç özel yapım modifikasyonla kullanıyorum, ancak sorun genel. İki eğitim girdisi girdi alanında çok yakın olduğunda, kovaryans matrisinin pozitif olmayan bir kesin hale gelebileceği iyi bilinen bir gerçektir (bu …

2
İki sekans dejenere olmayan rastgele bir değişkene yaklaştığında Slutsky teoremi hala geçerli mi?
Slutsky'nin teoremi hakkında bazı ayrıntılar hakkında kafam karıştı : Let , skaler / vektör / matris rastgele elemanlarının iki sekansları olabilir.{Xn}{Xn}\{X_n\}{Yn}{Yn}\{Y_n\} Eğer rastgele elemanı dağıtım yakınsak ve sabit bir olasılık olarak yakınsak , o ters çevrilebilir olması koşuluyla , burada dağıtımda yakınsama anlamına gelir.XnXnX_nXXXYnYnY_ncccXn+Yn XnYn Xn/Yn →d X+c→d cX→d X/c,Xn+Yn …

3
“Doğrusal” ile “doğrusal olmayan” regresyon arasında bir ayrım yapmak neden önemlidir?
Doğrusal ve doğrusal olmayan modeller arasındaki ayrımın önemi nedir? Doğrusal ve genelleştirilmiş doğrusal model sorusu : Lojistik, Poisson vb. Regresyondan nasıl bahsediyorsunuz? ve cevabı genelleştirilmiş doğrusal modellerin doğrusallığı / doğrusal olmama durumu hakkında son derece yararlı bir açıklama idi. Doğrusal olanı doğrusal olmayan modellerden ayırmak kritik öneme sahip görünüyor, ama …

2
Puanların toplamı ile tahmini faktör puanlarının toplamı?
Ölçekler oluştururken puanların düz toplamı üzerinden " faktör puanlarının " ne zaman kullanılacağı hakkında öneriler almak isterim . Yani bir faktörü puanlamak için "rafine edilmiş" üzerinden "rafine edilmemiş" yöntemler. DiStefano ve ark. (2009; pdf ), vurgu eklenmiştir: Faktör skoru hesaplama yöntemlerinin iki ana sınıfı vardır: rafine ve rafine edilmemiş. Rafine …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.