İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Bölgesel bir bilim fuarı için kazananları nasıl adil bir şekilde belirleyebilirim?
Bilim fuarımızda kazananları hesaplamanın doğru yolunu bulmak için yardıma ihtiyacım var. İstatistik ve matematik konusundaki bilgisizliğimin, bir çocuğun kazanma şansını engellemesini istemiyorum. (tehlikede olan birçok burs ve ilerleme avantajı). Yardımın için şimdiden teşekkür ederim. İlk olarak, ayarladığımız şeylerin küçük bir arka planı: Fuarımızda tipik olarak 600 civarında öğrenci projesi bulunmaktadır. …

1
Hayatta kalma coxph ve rms cph'den farklı tahmin grafiği
Bu örnekte kullandığım termplotun kendi biraz geliştirilmiş versiyonunu oluşturdum, burada bulabilirsiniz . Daha önce SO üzerine yayınladım, ancak daha çok düşündüğümde, bunun muhtemelen gerçek kodlamadan daha çok Cox Orantılı tehlikeler modelinin yorumlanması ile ilgili olduğuna inanıyorum. Sorun Bir Tehlike Oranı grafiğine baktığımda, güven aralığının doğal olarak 0 olduğu bir referans …
9 r  survival  cox-model 

1
PCA vs. LSA / LSI ne zaman seçilmeli
Soru: PCA'nın LSA / LSI'ya uygulanması arasında karar vermek için kullanılabilecek giriş veri özellikleri ile ilgili genel yönergeler var mı? PCA ve LSA / LSI hakkında kısa özet: İlke Bileşen Analizi (PCA) ve Gizli Semantik Analiz (LSA) veya Gizli Semantik İndeksleme (LSI), hepsinin temel olarak Tekil Değer Ayrıştırma'nın (SVD) bir …

1
SVM ile dengesiz çok sınıflı veri kümesini ele almanın en iyi yolu
Ben dengesiz veri SVMs ile bir tahmin modeli oluşturmak için çalışıyorum. Etiketlerim / çıktımın pozitif, nötr ve negatif olmak üzere üç sınıfı var. Olumlu örneğin verilerimin yaklaşık% 10-20'sini, nötr yaklaşık% 50-60'ını ve negatif yaklaşık% 30-40'ını oluşturduğunu söyleyebilirim. Sınıflar arasında yanlış tahminlerle ilişkili maliyet aynı olmadığı için sınıfları dengelemeye çalışıyorum. Bir …


2
gibi bir regresyon nasıl ?
Ölçülen değişkenin ayrık pozitif tamsayıları (sayıları) olduğu bazı zaman serisi verileri var. Zaman içinde yukarı yönlü bir eğilim olup olmadığını test etmek istiyorum (ya da değil). Bağımsız değişken (x) 0-500 aralığında ve bağımlı değişken (y) 0-8 aralığındadır. Buna y = floor(a*x + b)sıradan en küçük kareler (OLS) kullanarak formun gerilemesini …
9 r  regression  python 

1
İstatistik Yüksek Lisans Öğrencileri için Önerileri
Doktora dereceme bu yıl istatistiklerde başladım ve nasıl büyüyüp istatistik / ML alanında iyi bir akademik araştırmacı olmak için en iyi uygulamalarınızı, tavsiyelerinizi ve (meta-tavsiyelerinizi) arıyorum. Genel düşünceler ve bağlantılar memnuniyetle karşılanır, ancak topun yuvarlanmasına başlamak için, burada Michael Steele'nin " İstatistikte Yüksek Lisans Öğrencilerine Tavsiye " başlıklı harika makalesinden …
9 careers  phd  academia 

4
1D verilerinin 1 veya 3 değer etrafında kümelenip kümelenmediğini nicel olarak nasıl anlarım?
Bir insanın kalp atışları arasındaki zaman hakkında bazı verilerim var. Ektopik (ekstra) atımların bir göstergesi, bu aralıkların bir yerine üç değer etrafında kümelenmiş olmasıdır. Bunun kantitatif bir ölçümünü nasıl alabilirim? Birden çok veri kümesini karşılaştırmak istiyorum ve bu iki 100 bölmeli histogramlar hepsini temsil ediyor. Varyansları karşılaştırabilirim, ancak algoritmamın diğer …

4
N-1 değişkenlerini kullanarak kukla değişken nasıl uygulanır?
4 seviyeli bir değişkenim varsa, teoride 3 kukla değişken kullanmam gerekir. Uygulamada, bu aslında nasıl yapılır? 0-3 mü kullanıyorum, 1-3 mü kullanıyorum ve 4'ü boş mu bırakıyorum? Herhangi bir öneri? NOT: R'de çalışacağım. GÜNCELLEME: Yalnızca AD'ye karşılık gelen 1-4 kullanan bir sütun kullanırsam ne olur? Bu işe yarar mı yoksa …


1
Regresyon katsayısının karşılıklı dağılımı
Diyelim ki doğrusal bir modelimiz var yben=β0+β1xben+εbenyi=β0+β1xi+ϵiy_i = \beta_0 + \beta_1 x_i + \epsilon_itüm standart regresyon (Gauss-Markov) varsayımlarını karşılar. İlgileniyoruzθ = 1 /β1θ=1/β1\theta = 1/\beta_1. Soru 1: Dağıtım için hangi varsayımlar gereklidir?θ^θ^\hat{\theta} iyi tanımlanmalı? β1≠ 0β1≠0\beta_1 \neq 0 önemli olurdu --- diğerleri? Soru 2: Hataların normal dağılıma uyduğu varsayımını ekleyin. …


3
Bir “hipotez ailesi” için açık ve pratik bir tanım ne olabilir (ailevi hata oranı ile ilgili olarak)?
Bir deney / proje / analiz içinde bir hipotez ailesini neyin oluşturduğunu değerlendirmeye çalışırken, aileleri sınırlamak için kılavuz olarak verilen "maksatlı benzer" ve "içerik bakımından benzer" buldum, ancak bunlar yoruma oldukça açık ( kısaca söylemek gerekirse). Bir analiz sırasında, grup araçlarının birkaç testini ve oranların homojenliğinin ayrı bir grup testini …

2
Değişkenler otomatik olarak ilişkilendirilirse regresyona güvenebilir miyim?
Her iki değişken (bağımlı ve bağımsız) otokorelasyon etkileri gösterir. Veri zaman serileri ve durağan Regresyonu yürüttüğümde artıklar birbiriyle ilişkili görünmüyor. Durbin-Watson istatistiğim üst kritik değerden daha büyük, bu nedenle hata terimlerinin pozitif bir şekilde ilişkili olmadığına dair bir kanıt var. Ayrıca hatalar için ACF çizdiğimde orada bir korelasyon yok ve …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.