İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Tam olarak ne yapar
∼˙∼˙\dot\sim notasyonu (tilde üzerinden nokta) gibi bağlamda ne anlama geliyor x∼˙N(0,1)x∼˙N(0,1)x \mathrel{\dot\sim} \mathcal N(0,1)? Doğru bir şekilde nasıl ayarlanacağını bulmak daha kolay çıkıyor: tex.SE , boşluk aralığını düzeltmek \mathrel{\dot\sim}yerine \dot\sim- aslında ne anlama geldiğini bulmak yerine yazmak gerektiğini açıklıyor . Şimdiye kadar CV'de sadece 4 kez kullanıldı ; standart mı?

2
Değişmeden bağımsız rasgele örneklerin kesişiminin kardinalitesinin dağılımı nedir?
SSS ile bazı dizi elemanlar ve az pozitif tamsayılar, sabit ya da eşit olan .n∈Nn∈Nn\in\mathbb{N}a1,a2,...,ama1,a2,...,ama_1,a_2,...,a_mnnn Unsurları ile eşit olasılıkla olmak, örnekleri ayrı ve bağımsız olarak çekilir olan boyutu olan, değiştirmeden sırasıyla.SSSmmmL1, L2, . . . , LmL1,L2,...,LmL_1, L_2,...,L_mSSSbir1, bir2, . . . , birmbir1,bir2,...,birma_1,a_2,...,a_m Numunelerin kesişiminin esas değerigenel olarak desteğine …

1
İspat / Reddetme
İspat / ReddetmeE[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1_A | \mathscr{F_t}] = 0 \ \text{or} \ 1 \ \text{a.s.} \ \Rightarrow E[1_A | \mathscr{F_{s}}] = E[1_A | \mathscr{F_t}] \ \text{a.s.} Filtrelenmiş bir olasılık alanı , .(Ω,F,{Fn}n∈N,P)(Ω,F,{Fn}n∈N,P)(\Omega, \mathscr{F}, \{\mathscr{F}_n\}_{n \in \mathbb{N}}, \mathbb{P})A∈FA∈FA \in \mathscr{F} Diyelim ki Bunu …

3
Kategorik değişkenlerin popüler veya yaygın kombinasyonlarını bulmak için kullanabileceğim istatistiksel yöntemler nelerdir?
Çoklu uyuşturucu kullanımı üzerine bir çalışma yapıyorum. Her biri kötüye kullandıkları ilaçları belirten 400 uyuşturucu bağımlısının veri setim var. 10'dan fazla ilaç var ve bu nedenle büyük olası kombinasyonlar var. İkili değişkenler olarak tükettikleri ilaçların çoğunu kodladım (yani bir uyuşturucu bağımlısı eroini başka istismar ederse eroin 1'dir). 2 veya 3 …

3
Auto.arima () 'nın p, d ve q değerleri nasıl okunur?
Modeldeki p,d and qdeğerleri nasıl ARIMA(p,d,q)tahmin edebilirim auto.arima(mytimeseries)? arima_model <- auto.arima (mytimeseries, ic = 'bic') Eğer çıktısına bakarsak arima_model $ arma anlıyoruz, [1] 1 0 0 0 1 2 0 Yukarıdaki sırada yer alan sayıların anlamı nedir?
10 r  arima 

1
2x2 ve Ix2 (tek faktör - ikili tepki) beklenmedik tablolarda ki-kare mi, ki-kare mi?
2x2 ve Ix2 olasılık tablolarında lojistik regresyon kullanımını anlamaya çalışıyorum. Örneğin, bunu örnek olarak kullanmak Ki-kare testi kullanma ile lojistik regresyon kullanma arasındaki fark nedir? Birden fazla nominal faktöre (Ix2 tablosu) sahip bir tablo şöyle: Burada benzer bir soru var - ama cevap esas olarak ki-kare mxn tablolarını işleyebiliyor, ancak …

1
Basit bir algılayıcı nasıl çekirdeklendirilir?
Doğrusal olmayan sınırlarla sınıflandırma problemleri basit bir algılayıcıyla çözülemez . Aşağıdaki R kodu açıklama amaçlıdır ve Python'daki bu örneğe dayanmaktadır ): nonlin <- function(x, deriv = F) { if (deriv) x*(1-x) else 1/(1+exp(-x)) } X <- matrix(c(-3,1, -2,1, -1,1, 0,1, 1,1, 2,1, 3,1), ncol=2, byrow=T) y <- c(0,0,1,1,1,0,0) syn0 <- …

1
PCA ile sadece büyük çift mesafeleri koruyarak ne kastedilmektedir?
Şu anda t-SNE görselleştirme tekniğini okuyorum ve yüksek boyutlu verileri görselleştirmek için temel bileşen analizini (PCA) kullanmanın dezavantajlarından birinin, noktalar arasındaki sadece büyük çift mesafeleri koruduğu belirtildi. Yüksek boyutlu uzayda birbirinden ayrı olan anlam noktaları, düşük boyutlu altuzayda da çok farklı görünecektir, ancak diğer tüm çift mesafeler vidalanacaktır. Birisi bunun …

2
Değişkenleri sayım verisi olarak ölçekle - doğru mu değil mi?
In Bu yazıda (merkezi PubMed aracılığıyla serbestçe kullanılabilir), yazarlar 0-40 attı 10 maddelik tarama enstrüman puanı modellemek için negatif binom regresyon kullanın. Bu prosedürde sayım verileri olduğu varsayılmaktadır, burada açıkça durum böyle değildir. Bu yaklaşımın kabul edilebilir olup olmadığı konusunda görüşlerinizi almak isterim, çünkü bazen aynı enstrümanı veya benzerlerini benim …

2
Ağımın (grafik) “küçük dünya” ağı olup olmadığını istatistiksel olarak nasıl test edebilirim?
Bir küçük dünya ağ en düğümleri birbirine komşu değildir olan matematiksel grafik türüdür, ancak çoğu düğümleri şerbetçiotu veya adımların az sayıda her ulaşılabilir. Özellikle, küçük dünya ağı, rasgele seçilen iki düğüm arasındaki tipik L mesafesinin (gerekli adım sayısı), ağdaki N düğüm sayısının logaritmasına orantılı olarak büyüdüğü bir ağ olarak tanımlanır. …

4
Doğrusal Sınıflandırıcılarla Aşırı Uyum
Bugün profesörümüz sınıfta "lineer sınıflandırıcılar ile aşırı uyumun mümkün olmadığını" belirtti. Yanlış olduğunu düşünüyorum, çünkü lineer sınıflandırıcılar bile eğitim setindeki aykırı değerlere duyarlı olabilir - örneğin sert bir marj alın Destek Vektör Makinesi: Tek bir gürültülü veri noktası, veri kümelerini ayırmak için hangi hiper düzlemin kullanılacağını değiştirebilir. Yoksa yanılıyor muyum? …

2
Lojistik modeller için RMSE (Kök Ortalama Kare Hatası)
Farklı lojistik modelleri karşılaştırmak için RMSE (Kök Ortalama Kare Hatası) kullanmanın geçerliliği ile ilgili bir sorum var. Yanıt ya 0yadır 1ve tahminler 0- 1? Aşağıdaki yöntem ikili yanıtlarla da geçerli midir? # Using glmnet require(glmnet) load(url("https://github.com/cran/glmnet/raw/master /data/BinomialExample.RData")) cvfit = cv.glmnet(x, y, family = "binomial", type.measure = "mse") A <- predict(cvfit, …

1
Bir olasılık fonksiyonunu yeniden parametrelendirirken, sadece değişken formülü değişikliği yerine dönüştürülmüş değişkeni takmak yeterli midir?
Üstel olarak dağıtılan bir olasılık işlevini yeniden parametrelendirmeye çalıştığımı varsayalım. Orijinal olabilirlik fonksiyonum: p ( y∣ θ ) = θ e- θ yp(y|θ)=θe-θy p(y \mid \theta) = \theta e^{-\theta y} ve ϕ = 1 kullanarak yeniden parametrelendirmek istiyorum ,θrastgele bir değişken değil, bir parametre olduğundan, sadece eklenti için yeterlidir?ϕ = …

4
Düzgün dağılmış r.v'ler verildiğinde, bir rv için PDF'nin tüm n r.v'lerin toplamına bölümü nedir?
Ben aşağıdaki tür ilgileniyorum: 1 toplam gerekir 'n' sürekli rasgele değişkenler var Ne sonra böyle herhangi bir değişken için PDF ne olurdu? Yani, n=3n=3n=3 , o zaman X 1'in dağılımı ile ilgileniyorumX1X1+X2+X3X1X1+X2+X3\frac{X_1}{X_1+X_2+X_3} ,X1,X2X1,X2X_1, X_2, veX3X3 X_3 tüm düzgün olarak dağıtılırlar. Bu örnekte elbette ortalama1/31/31/3, çünkü ortalama sadece1/n1/n1/n ve R'deki dağılımı …
10 uniform 


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.