İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Özellik mühendisliği için öğreticiler
Herkesin bildiği gibi, özellik mühendisliği makine öğrenimi için son derece önemlidir, ancak bu alanla ilişkili çok az malzeme buldum. Kaggle'daki çeşitli yarışmalara katıldım ve bazı durumlarda iyi özelliklerin iyi bir sınıflandırıcıdan daha önemli olabileceğine inanıyorum. Özellik mühendisliği hakkında herhangi bir öğretici bilen var mı, ya da bu saf deneyim mi?

1
R'de auto.arima () 'da xreg argümanı nasıl kurulur? [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 6 yıl önce kapalı . Müşteri ziyaret verilerini (günlük) ölçen bir kerelik serilerle küçük bir proje üzerinde çalışıyorum. Değişkenlerim Day, veri toplamanın ilk gününden bu …

1
Lognormal rastgele değişkenler için ulaşılabilir korelasyonlar
Log ( X 1 ) ∼ N ( 0 , 1 ) ve log ( X 2 ) ∼ N ( 0 , σ 2 ) ile lognormal rasgele değişkenleri X1X1X_1 ve düşünün .X2X2X_2log(X1)∼N(0,1)log⁡(X1)∼N(0,1)\log(X_1)\sim \mathcal{N}(0,1)log(X2)∼N(0,σ2)log⁡(X2)∼N(0,σ2)\log(X_2)\sim \mathcal{N}(0,\sigma^2) ρ dk ρ ( X 1 , X 2 )ρmaxρmax\rho_{\max}ρminρmin\rho_{\min}ρ(X1,X2)ρ(X1,X2)\rho (X_1,X_2) ρmax=ρ(exp(Z),exp(σZ))ρmax=ρ(exp⁡(Z),exp⁡(σZ))\rho_{\max}=\rho (\exp(Z),\exp(\sigma Z)) …

2
Regresyon neden varyansla ilgilidir?
Bu notu okuyorum . 2. sayfada şunu belirtir: "Verilerdeki varyansın ne kadarı belirli bir regresyon modeli ile açıklanıyor?" "Regresyon yorumu, katsayıların ortalamasıyla ilgilidir; çıkarım onların sapmalarıyla ilgilidir." Bu tür ifadeleri defalarca okudum, neden "verilerdeki varyansın ne kadarının verilen regresyon modeli tarafından açıklandığını" umursalıyız? "... daha spesifik olarak, neden" varyans "?

2
Ampirik entropi nedir?
Birlikte tipik kümelerin tanımında ("Bilgi Teorisinin Unsurları", ch. 7.6, s. 195), olarakampirik entropibir bölgesininNile tanıyan sekansp(xn)=Π n i = 1 p(xi). Bu terminolojiye daha önce hiç rastlamadım. Kitabın dizinine göre hiçbir yerde açıkça tanımlanmamıştır.−1nlogp(xn)−1nlog⁡p(xn)-\frac{1}{n} \log{p(x^n)}nnnp(xn)=∏ni=1p(xi)p(xn)=∏i=1np(xi)p(x^n) = \prod_{i=1}^{n}{p(x_i)} Benim sorum temelde: Neden ampirik entropi olduğunu burada p ( x )−∑xp^(x)log(p^(x))−∑xp^(x)log⁡(p^(x))-\sum_{x}{\hat p …

2
Simetrik dağılımın tanımı nedir?
Simetrik dağılımın tanımı nedir? Birisi bana rastgele bir değişkeninin XXX, sadece XXX ve −X−X-X aynı dağılıma sahipse simetrik bir dağılımdan geldiğini söyledi . Ancak bu tanımın kısmen doğru olduğunu düşünüyorum. Çünkü karşı bir örnek X∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^{2}) ve sunabilirim μ≠0μ≠0\mu\neq0. Açıkçası, simetrik bir dağılımı var, ama XXX ve −X−X-X farklı dağılımı …

2
Bir günlük dönüşümü, normal olmayan verilerin t testi için geçerli bir teknik midir?
Bir makalenin gözden geçirilmesinde yazarlar, "Normallik için önkoşul varsayımları karşılamak için t testleri yapılmadan önce, eğri dağılım gösteren sürekli sonuç değişkenleri doğal logaritmalar kullanılarak dönüştürülmüştür." Bu normal olmayan verileri analiz etmenin kabul edilebilir bir yolu, özellikle de temeldeki dağıtım mutlaka lognormal değilse? Bu oldukça nadir bir soru olabilir, ama daha …

3
Karma etkiler modeline göre tekrarlanan önlemler ANOVA ne zaman tercih edilir?
Bu soruya yanıt olarak , katılımcıları rastgele farklı kategorilerden resimlerle sunduğum tasarımımın tekrarlanan önlemler ANOVA kullanmam gereken bir örnek olup olmadığı konusunda, bunun yerine karışık bir model kullanmamın cevabını aldım. nedenlerimde iki tür bağımlılığım var: konular ve kategoriler için. Benim sorum şu: Bu tür tekrarlı ölçümler tasarımını yaparken bu şekilde …

1
Ggplot2 ile fasetlerde kullanılmayan seviyeleri düşürme [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. Geçen yıl kapalı . Ggplot2s yönlerinde kullanılmayan seviyeleri düşürmek mümkün mü? Bu benim kodum: tab = as.data.frame(cbind(groups = mtcars$cyl, names = row.names(mtcars), val = mtcars$mpg, …


2
Zaman içinde lojistik regresyonda sınıflandırma olasılığını güncelleme
Bir dönemin sonunda bir öğrencinin başarı olasılığını tahmin eden öngörülü bir model inşa ediyorum. Öğrencinin başarılı veya başarısız olup olmadığı, başarının genellikle kursu tamamlamak ve mümkün olan toplam puanların% 70'ini veya daha fazlasını elde etmek olarak tanımlandığı ile ilgileniyorum. Modeli yerleştirdiğimde, daha fazla bilgi elde edildikçe başarı olasılığı tahmininin zaman …

3
Sınıflandırma için yarı denetimli öğrenme, aktif öğrenme ve derin öğrenme
Tüm kaynaklar güncellendiğinde son düzenleme: Bir proje için, sınıflandırma için makine öğrenimi algoritmaları uyguluyorum. Zorluk: Oldukça sınırlı etiketlenmiş veriler ve çok daha fazla etiketlenmemiş veriler. Hedefler: Yarı denetimli sınıflandırma uygulayın Bir şekilde yarı denetimli etiketleme işlemi uygulayın (aktif öğrenme olarak bilinir) EM, Transductive SVM veya S3VM (Yarı Denetimli SVM) veya …

2
Önceki etkinliklerin zamanlarına bağlı olarak bir sonraki etkinliğin ne zaman gerçekleştiğini nasıl tahmin edebilirim?
Ben bir lise öğrencisiyim ve bir bilgisayar programlama projesi üzerinde çalışıyorum, ancak bir lise istatistik dersinin ötesinde istatistik ve modelleme verileri konusunda çok fazla deneyimim yok, bu yüzden kafam karıştı. Temel olarak, birisinin bir belgeyi yazdırmaya karar verdiği zamanlarda oldukça büyük bir listem var (herhangi bir istatistiksel test veya önlem …

5
Standart sapmanın 2D analogu mu?
Aşağıdaki deneyi düşünün: bir grup kişiye bir şehir listesi verilir ve karşılık gelen yerleri dünyanın (aksi halde etiketlenmemiş) bir haritada işaretlemesi istenir. Her şehir için, kabaca ilgili şehir merkezli noktaların saçılmasını sağlayabilirsiniz. İstanbul gibi bazı şehirler, diğerlerine göre daha az saçılma sergileyeceklerini söylüyor. En Verilen şehir için biz 2D takım …

4
Ortalamaların güven aralıkları nasıl hesaplanır?
Bir deneyi üç kez tekrarladığınızı düşünün. Her deneyde, üçlü ölçümler toplarsınız. Üç kopya, üç deneysel araç arasındaki farklara kıyasla birbirine oldukça yakın olma eğilimindedir. Büyük ortalamanın hesaplanması oldukça kolaydır. Peki, büyük anlam için bir güven aralığını nasıl hesaplayabiliriz? Örnek veri: Deney 1: 34, 41, 39 Deney 2: 45, 51, 52 …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.