İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Sinir ağı - ikili / ayrık / sürekli giriş
Tüm giriş düğümleri (geri yayılımlı olsun veya olmasın) için ileri beslemeli bir ağ için girdi olarak, ayrık veya sürekli normalize edilmiş değerlere (örn. (1; 3) göre ikili değerleri (0/1) tercih etmenin iyi bir nedeni var mı? Tabii ki, sadece her iki formata dönüştürülebilecek girdilerden bahsediyorum; örneğin, birden fazla değer alabilen …

4
Özellik ölçeklendirme ve ortalama normalleştirme
Andrew Ng'in makine öğrenimi kursunu alıyorum ve birkaç denemeden sonra bu sorunun cevabını doğru bir şekilde alamadım. Seviyeden geçtiğim halde lütfen bunu çözmeye yardımcı ol. öğrencinin bir ders aldığını ve dersin bir ara sınav ve bir final sınavı olduğunu varsayalım . İki sınavda puanlarının veri kümesini topladınız. Bu, aşağıdaki gibidir:m …

4
Neden “Artık standart hata” diyoruz?
Bir standart hata tahmini standart sapma σ ( θ ) kestiricinin bir parametre için .σ^( θ^)σ^(θ^)\hat \sigma(\hat\theta)θ^θ^\hat\thetaθθ\theta Kalıntıların tahmini standart sapmasına neden summary.lm"artık standart sapma" değil , "artık standart hata" (örn. R fonksiyonunun çıktısında) denir ? Burada hangi parametre tahminini standart bir hatayla donatıyoruz? Her bir kalıntıyı "kendi" hata terimi …

2
Kare farkı neden bu kadar yaygın kullanılıyor?
Sıklıkla yeni istatistiksel yöntemleri ve kavramları araştırdığımda, kare farkı (veya ortalama kare hatası veya diğer epitetlerin bolluğu) ile karşılaşıyorum. Tıpkı bir örnek olarak, Pearsonson'un r'sinin, noktaların yalanladığı regresyon çizgisinden ortalama kare farkına dayanarak karar verilir. ANOVA'lar için, karelerin toplamına bakıyorsunuz vb. Şimdi, anladığım kadarıyla, her şeyi kareleyerek, aykırı değerlere sahip …

4
Bir ROC eğrisi nasıl yorumlanır?
SAS'daki verilerime lojistik regresyon uyguladım ve işte ROC eğrisi ve sınıflandırma tablosu. Sınıflandırma tablosundaki rakamlarla rahatım, ancak roc eğrisinin ve altındaki alanın tam olarak ne olduğundan emin değilim. Herhangi bir açıklama büyük mutluluk duyacağız.

1
R'de çoklu eksojen değişkenlerle Arima zaman serisi tahmini (auto.arima)
Birden fazla eksojen değişkenli çoklu zaman serisi ARIMA modeline dayalı bir tahmin yapmak istiyorum. Ne istatistiklere ne de UR'ye bağlı kalmak konusunda o kadar yetenekli olmadığım için mümkün olduğunca basit (3 aylık trend tahmini yeterlidir). Ben 1 bağımlı zaman serisi ve 3-5 tahmin zaman serisi, tüm aylık veri, boşluk, aynı …
14 r  time-series  arima 


4
Veriler çarpıkken ortalama kullanılmalı mıdır?
Genellikle, uygulanan uygulamalı istatistik metinleri, ortalamanın örnek verilerdeki ve / veya eğri popülasyon dağılımları için kullanılır ve bu, veriler simetrik olmadığında medyanın tercih edileceği iddiası için bir gerekçe olarak kullanılır. Örneğin: Belirli bir veri kümesi için merkezi eğilimin en iyi ölçümü genellikle değerlerin dağıtılma şekline bağlıdır .... Veriler simetrik olmadığında, …


3
Lojistik regresyonda kesişim terimi
Aşağıdaki lojistik regresyon modeline sahip olduğumuzu varsayalım: logit ( p ) = β0+ β1x1+ β2x2logit(p)=β0+β1x1+β2x2\text{logit}(p) = \beta_0+\beta_{1}x_{1} + \beta_{2}x_{2} Mı olayın oran ve ? Başka bir deyişle, ve en düşük düzeylerde olduğunda (bu 0 olmasa bile) olayın olasılığı nedir? Örneğin, ve yalnızca ve değerlerini alırsa, bunları 0 olarak ayarlayamayız.x 1 …


5
Düzgünleştirilmiş verilerden R'deki bükülme noktalarını bulma
Düzgün kullandığım bazı verilerim var loess. Düzeltilmiş çizginin bükülme noktalarını bulmak istiyorum. Mümkün mü? Eminim birisi bunu çözmek için süslü bir yöntem yapmış ... Yani ... sonuçta, R! Kullandığım yumuşatma işlevini değiştirme konusunda iyiyim. Sadece kullandım loessçünkü geçmişte kullandığım şey buydu. Ancak herhangi bir yumuşatma işlevi iyidir. Bükülme noktalarının kullandığım …
14 r  smoothing  loess 

3
PCA'dan ne elde ettiğimi nasıl yorumlayabilirim?
Üniversite ödevinin bir parçası olarak, oldukça büyük, çok değişkenli (> 10) bir ham veri setinde veri ön işleme yapmak zorundayım. Kelimenin hiçbir anlamında bir istatistikçi değilim, bu yüzden neler olduğu konusunda biraz kafam karıştı. Muhtemelen gülünç basit bir soru için özür dilerim - başım çeşitli cevaplara bakıp istatistik-konuşmada beklemeye çalıştıktan …
14 pca 

4
ROC ve multiROC analizi: optimal kesme noktası nasıl hesaplanır?
Ben bir ROC eğrisi (hassasiyet ve özgüllük en üst düzeye çıkarıldığı değeri) için en uygun kesme noktası hesaplamak anlamaya çalışıyorum. aSAHPaketten veri kümesini kullanıyorum pROC. outcomeDeğişken iki bağımsız değişkenler tarafından açıklanabilir: s100bve ndka. EpiPaketin sözdizimini kullanarak iki model oluşturdum: library(pROC) library(Epi) ROC(form=outcome~s100b, data=aSAH) ROC(form=outcome~ndka, data=aSAH) Çıktı aşağıdaki iki grafikte gösterilmektedir: …

3
Kmeans çalıştırmadan önce korelasyonlu / doğrusal olan değişkenleri düşürmem gerekir mi?
Müşteri kümelerini tanımlamak için kmeans kullanıyorum. Kümeleri tanımlamak için yaklaşık 100 değişkenim var. Bu değişkenlerin her biri, bir müşterinin bir kategoriye yaptığı harcama yüzdesini temsil eder. Yani, 100 kategorim varsa, bu değişkenlerin toplamı her müşteri için% 100 olacak şekilde 100 değişkenim var. Şimdi, bu değişkenler birbiriyle güçlü bir şekilde ilişkilidir. …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.