İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Primal, Dual ve Kernel Ridge Regresyonu Arasındaki Fark
Primal , Dual ve Kernel Ridge Regresyonu arasındaki fark nedir ? İnsanlar her üçünü de kullanıyor ve herkesin farklı kaynaklarda kullandığı farklı gösterimden dolayı benim için zor. Birisi bana bu üç kelime arasındaki farkın ne olduğunu basit bir şekilde söyleyebilir mi? Ayrıca, her birinin avantajları ve dezavantajları neler olabilir ve …


3
“Normalleştirme” ne demektir ve bir numunenin veya dağılımın normalleştirildiğini nasıl doğrulayabilirim?
Tekdüze dağılımın ( U n i f o r m ( a , b ) olup olmadığını doğrulamak istediğini soran bir sorum varUniform(a,b)Uniform(a,b){\rm Uniform}(a,b) ) normal . Birincisi, herhangi bir dağılımın normalleştirilmesi ne demektir? Ve ikincisi, bir dağılımın normal olup olmadığını nasıl kontrol edeceğiz? X hesaplayarak anlıyorum - meanX−meansdX−meansd \frac{X-\text{mean}}{\text{sd}} …

1
Doğrudan post-hoc veya planlı karşılaştırma testlerine atlamak yerine neden ANOVA kullanıyorsunuz?
Gruplar arası bir ANOVA durumuna baktığımızda, önce böyle bir ANOVA testi yaparak, ikincisi post-hoc (Bonferroni, Šidák, vb.) Veya planlı karşılaştırma testleri yaparak ne elde edersiniz? ANOVA adımını neden tamamen atlamıyorsunuz? Böyle bir durumda, gruplar arasında ANOVA'nın bir yararı, Tukey'in HSD'sini post-hoc test olarak kullanabilmektir. İkincisi, ilgili standart hatasını hesaplamak için …

2
Zaman serilerinde tersinir sürecin sezgisi nedir?
Zaman serileri üzerine bir kitap okuyorum ve aşağıdaki bölümde başımı çizmeye başladım: Birisi benim için sezgiyi açıklayabilir mi? Bu metinden alamadım. İşlemin neden tersine çevrilebilir olması gerekiyor? Buradaki büyük resim nedir? Herhangi bir yardım için teşekkürler. Ben bu konuda yeniyim, bu yüzden bunu açıklarken öğrenci düzeyinde terimleri kullanmak için nazik …
19 time-series  arma 

2
Sonuç değişkenleri için çoklu gösterim
Tarımsal denemeler hakkında bir veri setim var. Yanıt değişkenim bir yanıt oranıdır: log (tedavi / kontrol). Ben fark arabuluculuk ile ilgileniyorum, bu yüzden RE meta-regresyonlar (ağırlıksız, çünkü etkisi boyutu tahminlerin varyans ile ilgisiz olduğu açık görünüyor) çalıştırıyorum. Her çalışma tahıl verimi, biyokütle verimi veya her ikisini rapor eder. Sadece biyokütle …


1
2D histogramlar için uyum iyiliği
Yıldız parametrelerini temsil eden iki veri setim var: gözlenen ve modellenen. Bu setlerle iki renkli diyagram (TCD) olarak adlandırılan şeyi yaratıyorum. Burada bir örnek görülebilir: Bir gözlenen veri ve varlık B modelinden çıkarılan verileri sadece bir tane var (siyah çizgiler aldırma, noktalar verileri temsil) bir şeması, ancak birçok farklı olarak …

2
Geri yayılım algoritması
Çok katmanlı algılayıcıda (MLP) kullanılan geri yayılım algoritması üzerinde hafif bir karışıklık var . Hata, maliyet fonksiyonu tarafından ayarlanır. Geri çoğaltmada, gizli katmanların ağırlığını ayarlamaya çalışıyoruz. Anlayabildiğim çıkış hatası, yani e = d - y[Abonelikler olmadan]. Sorular: Gizli katman hatası nasıl alınır? Kişi nasıl hesaplar? Geri çoğaltırsam, uyarlanabilir bir filtrenin …

3
0-1 Kayıp İşlevi açıklaması
Kayıp fonksiyonunun amacının ne olduğunu kavramaya çalışıyorum ve bunu tam olarak anlayamıyorum. Yani, anladığım kadarıyla kayıp fonksiyonu, yanlış bir kararın "maliyetini" ölçebileceğimiz bir tür metrik sunmaktır. Diyelim ki 30 nesne veri setim var, bunları 20/10 gibi eğitim / test setlerine böldüm. 0-1 kayıp işlevini kullanacağım, bu yüzden sınıf etiketleri setimin …

2
Gama dağılım parametrelerini örnek ortalama ve std kullanarak tahmin etme
Veri örneğime en uygun bir gama dağılımının parametrelerini tahmin etmeye çalışıyorum . Veri örneklerinden sadece ortalama , std (ve dolayısıyla varyans ) kullanmak istiyorum , gerçek değerler değil - bunlar her zaman uygulamamda mevcut olmayacak. Bu belgeye göre , şekli ve ölçeği tahmin etmek için aşağıdaki formüller uygulanabilir: Verilerim için …



2
Aşırı Örneklenmiş Dengesizlik Verilerinde Sınıflandırmanın Test Edilmesi
Ciddi dengesiz veriler üzerinde çalışıyorum. Literatürde, yeniden örnekleme (aşırı veya düşük örnekleme) kullanarak verileri yeniden dengelemek için çeşitli yöntemler kullanılmaktadır. İki iyi yaklaşım: SMOTE: Sentetik Azınlık Aşırı Örnekleme Teknikleri ( SMOTE ) ADASYN: Dengesiz Öğrenme için Uyarlanabilir Sentetik Örnekleme Yaklaşımı ( ADASYN ) ADASYN'i uyarladım çünkü uyarlanabilir yapısı ve çok …

3
R de eksik veri için tam bilgi maksimum olasılığı
Bağlam : Bazı eksik verilerle hiyerarşik regresyon. Soru : R'deki eksik verileri ele almak için tam bilgi maksimum olabilirlik (FIML) tahminini nasıl kullanabilirim? Tavsiye edeceğiniz bir paket var mı ve tipik adımlar nelerdir? Çevrimiçi kaynaklar ve örnekler de çok yardımcı olacaktır. Not : Yakın zamanda R'yi kullanmaya başlayan bir sosyal …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.