İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Rastgele Ormanlar için hangi eğitim hatası rapor edilir?
Şu anda randomForestR'de paketi kullanarak bir sınıflandırma sorunu için rastgele ormanlar uyuyorum ve bu modeller için eğitim hatasını nasıl bildireceğinden emin değilim . Komutla aldığım tahminleri kullanarak hesapladığımda eğitim hatam% 0'a yakın: predict(model, data=X_train) X_traineğitim verileri nerede . İlgili bir soruya yanıt olarak, rastgele ormanlar için eğitim hatası metriği olarak …

2
Güven aralığının yorumlanması
Not: Bu yinelenen bir durum varsa özür dilerim, aramamda benzer bir q bulamadım Diyelim ki gerçek bir parametreniz var p. Bir güven aralığı (C (X)), örneğin% 95 oranında p içeren bir RV'dir. Şimdi X'i gözlemlediğimizi ve C (X) hesapladığımızı varsayalım. Yaygın cevap, bunu "% 95 p içermesi şansına sahip" olarak …

3
Negatif olmayan matris çarpanlarına ayırmada optimum sayıda gizli faktör nasıl seçilir?
Bir matris verilen Vm × nVm×n\mathbf V^{m \times n} , negatif olmayan matris çarpanlara (NMF), iki negatif olmayan matrisleri bulur Wm × kWm×k\mathbf W^{m \times k} ve 'Hk × nHk×n\mathbf H^{k \times n} (yani, tüm elemanları ile ≥ 0≥0\ge 0 ) halinde dekompoze olmuş matrisi temsil etmek: V ≈ G …

2
Hangi gösterim ve neden:
Bunlar yalnızca üslupsal sözleşmeler (italik veya italik olmayan) mı yoksa bu notasyonların anlamları arasında önemli farklılıklar var mı? Bu soruda dikkate alınması gereken " olasılığı " anlamına gelen başka gösterimler var mı?

3
Kollearlıktan ne zaman bahsedebiliriz
Doğrusal modellerde, açıklayıcı değişkenler arasında bir ilişki olup olmadığını kontrol etmeliyiz. Eğer çok fazla korelasyon gösterirlerse, o zaman eşbiçimlilik vardır (yani, değişkenler kısmen birbirlerini açıklar). Şu anda sadece açıklayıcı değişkenlerin her biri arasındaki ikili korelasyona bakıyorum. Soru 1: Çok fazla korelasyon olarak ne sınıflandırır? Örneğin, 0.5 arası bir Pearson korelasyonu …

3
Neden iç içe var-covar modelleri arasında seçim yapmak için REML (ML yerine) kullanmak zorunda?
Doğrusal Karışık Modellerin rastgele etkileri üzerine model seçimi ile ilgili çeşitli açıklamalar REML kullanmayı öğretmektedir. Bir düzeyde REML ve ML arasındaki farkı biliyorum, ancak ML önyargılı olduğu için REML'nin neden kullanılması gerektiğini anlamıyorum. Örneğin, ML kullanarak normal bir dağıtım modelinin varyans parametresinde bir LRT yapmak yanlış mıdır (aşağıdaki koda bakın)? …

1
Saflık nasıl hesaplanır?
Küme analizinde saflığı nasıl hesaplarız? Denklem nedir? Benim için yapacak bir kod aramıyorum. Let küme k olacak ve sınıf j olun.c jωkωk\omega_kcjcjc_j Saflık pratik doğruluk mu? örnek büyüklüğü üzerinden küme başına gerçek sınıflandırılmış sınıf miktarını toplamak gibi görünüyor. denklem kaynağı Soru, çıktı ile girdi arasındaki ilişki nedir? Gerçekten Pozitif (TP), …
16 clustering 


1
Cauchy Dağılımı ve Merkezi Limit Teoremi
CLT'nin tutunabilmesi için ortalama ve sonlu varyans σ 2'ye sahip olmak istediğimiz dağılıma ihtiyacımız var . Cauchy dağılımı söz konusu olduğunda, ortalamanın ve varyansının tanımlanmamış olduğu, Merkezi Limit Teoreminin asemptotik olarak bile iyi bir yaklaşım sağlayamadığını söylemek doğru olur mu?μμ\muσ2σ2\sigma^2

1
Doğrusal regresyon için minimum nokta sayısı
Doğrusal bir gerilemeyle zaman içinde bir eğilim aramak için "makul" asgari sayıda gözlem ne olurdu? ikinci dereceden bir model takmaya ne dersiniz? Bileşik sağlıkta eşitsizlik indeksleri (SII, RII) ile çalışıyorum ve anketin sadece 4 dalgası var, bu yüzden 4 puan (1997,2001,2004,2008). İstatistikçi değilim ama sezgisel bir izlenim var 4 puan …
16 regression 

4
ROC eğrilerinin avantajları
ROC eğrilerinin avantajları nelerdir? Örneğin, bir ikili sınıflandırma sorunu olan bazı görüntüleri sınıflandırıyorum. Yaklaşık 500 özellik çıkardım ve bir dizi özellik seçmek için bir özellik seçim algoritması uyguladım ve sonra sınıflandırma için SVM uyguladım. Bu durumda bir ROC eğrisini nasıl alabilirim? Özellik seçim algoritmamın eşik değerlerini değiştirmeli ve bir ROC …

1
Ki-kare özellik seçimi tam olarak nasıl çalışır?
Her özellik sınıfı çifti için ki-kare istatistiği değerinin hesaplandığını ve bir eşikle karşılaştırıldığını biliyorum . Yine de biraz kafam karıştı. Varsa özellikleri ve k sınıfları, bir yapı ihtimal tablosu nasıl yapar? Hangi özelliklerin ve hangilerinin kaldırılacağına nasıl karar verilir?mmmkkk Herhangi bir açıklama çok takdir edilecektir. Şimdiden teşekkürler



2
İki ilişkili rasgele değişkeni örneklemek için bazı teknikler nelerdir?
İki ilişkili rasgele değişkeni örneklemek için bazı teknikler nelerdir: olasılık dağılımları parametrelendirildiyse (örn. log-normal) parametrik olmayan dağılımları varsa. Veriler, sıfır olmayan korelasyon katsayılarını hesaplayabildiğimiz iki zaman serisidir. Tarihsel korelasyon ve zaman serileri CDF'sinin sabit olduğunu varsayarak bu verileri gelecekte simüle etmek istiyoruz. Durum (2) için, 1-B analogu CDF'yi ve ondan …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.