İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Torbalama neden bootstrap örnekleri kullanıyor?
Torbalama, N farklı bootstrap örneği üzerinde N öğrenen oluşturma, ardından tahminlerinin ortalamasını alma sürecidir. Sorum şu: Neden başka bir örnekleme türü kullanılmıyor? Neden bootstrap örnekleri kullanılır?
10 bagging 

2
Farklılıklara Müdahale
Burada tartışıldığı gibi zaman serisi verileri (diğer bir deyişle Kesintili Zaman serileri) ile bir müdahale analizi yaparken, bir gereklilikim, müdahale nedeniyle toplam kazancı (veya kaybı) tahmin etmektir - yani kazanılan veya kaybedilen birimlerin sayısı (Y değişkeni) ). R içinde bir filtre fonksiyonu kullanarak müdahale fonksiyonunu nasıl tahmin edeceğimi tam olarak …

2
RandomForest modeli için düzeltme işareti değişkeni
varImpPaketle birlikte bir randomForest modeli için işlevin nasıl çalıştığını anlamada sorun yaşıyorum caret. Aşağıdaki örnekte var3 özelliği varImp, caret işlevini kullanarak sıfır önem kazanmaktadır , ancak altta yatan randomForest son model, var3 özelliği için sıfır olmayan bir öneme sahiptir. Neden böyle? require(randomForest) require(caret) rf <- train(x, y, method = "rf", …
10 r  caret  random-forest 


1
Uzak tutma doğrulaması, "yeni veri almanın" k katı CV'den daha iyi bir tahmini mi?
Birkaç hafta önce bir soruya verdiğim yanıtı yeniden düşünüyorum Uzak tutma çapraz doğrulaması, gösterim için tekrar tekrar kullanılabilen tek bir test seti üretir. Hepimiz bunun birçok yönden olumsuz bir özellik olduğu konusunda hemfikir görünüyoruz, çünkü bir set seti rasgele olarak temsili olmayabilir. Dahası, egzersiz verisine uyum sağlayabileceğiniz şekilde test verilerine …

2
Veri türleri (nominal / sıralı / aralık / oran) gerçekten değişken türleri olarak mı düşünülmeli?
Örneğin, standart ders kitaplarından aldığım tanımlar Değişken - popülasyonun veya örneğin karakteristiği. ex. Testteki hisse senedi veya kalitenin fiyatı Veri - gerçek gözlemlenen değerler İki sütunluk bir rapor için [Ad | Gelir] sütun adları değişkenler ve gerçek gözlemlenen değerler olacaktır {dave | 100K}, {jim | 200K} veri olurdu Yani [Ad] …

3
R'de (veya genel olarak) regresyon katsayılarını belirli bir işaret olmaya zorlamak mümkün müdür?
Bazı gerçek dünya verileri ile çalışıyorum ve regresyon modelleri bazı mantıksız sonuçlar veriyor. Normalde istatistiklere güvenirim ama gerçekte bunlardan bazıları doğru olamaz. Gördüğüm temel sorun, bir değişkendeki artışın, gerçekte, negatif olarak ilişkilendirilmeleri gerektiğinde, yanıtta bir artışa neden olmasıdır. Regresyon katsayılarının her biri için belirli bir işareti zorlamanın bir yolu var …

2
Çarpılabilecek kararlı dağılımlar?
Kararlı dağılımlar kıvrımlar altında değişmez. İstikrarlı dağılımların hangi alt aileleri de çarpma altında kapatılır? Anlamda, eğer f ∈ F ve g ∈ F , daha sonra ürün olasılık yoğunluk fonksiyonu, f ⋅ g (en fazla bir normalizasyon sabiti), aynı zamanda ait F ?FFFf∈ Ff∈Ff\in Fg∈ Fg∈Fg\in F f⋅ gf⋅gf \cdot …

4
ARIMA modellemesi için parametrelerin (p, d, q) belirlenmesi
İstatistikler için oldukça yeniyim ve veri setim için ARIMA parametrelerini belirleme sürecini bilmek istiyorum. Aynı şeyi R ve teorik olarak (mümkünse) kullanarak anlamama yardımcı olabilir misiniz? Veriler, Jan-12 ile Mar-14 arasında değişir ve aylık satışları gösterir. İşte veri seti: 99 58 52 83 94 73 97 83 86 63 77 …
10 r  arima  box-jenkins 


1
Moment Üreten Fonksiyonlar ve Fourier Dönüşümleri?
Moment üreten fonksiyon , olasılık yoğunluk fonksiyonunun Fourier dönüşümü mü? Diğer bir deyişle, moment üreten bir fonksiyon sadece rastgele bir değişkenin olasılık yoğunluk dağılımının spektral çözünürlüğüdür, yani bir fonksiyonu parametre yerine genliği, fazı ve frekansı ile karakterize etmenin eşdeğer bir yolu mu? Eğer öyleyse, bu canavara fiziksel bir yorum yapabilir …
10 moments  mgf  cumulants 



2
Bileşen sayısını seçmek için PCA uyumunun kalitesini değerlendirmek için iyi metrikler nelerdir?
Temel bileşen analizinin (PCA) kalitesini değerlendirmek için iyi bir ölçüm nedir? Bu algoritmayı veri kümesinde gerçekleştirdim. Amacım özellik sayısını azaltmaktı (bilgi çok gereksizdi). Tutulan varyans yüzdesinin ne kadar bilgi tuttuğumuzun iyi bir göstergesi olduğunu biliyorum, gereksiz bilgileri kaldırdığımı ve bu tür bilgileri 'kaybetmediğimden emin olmak için kullanabileceğim başka bilgi metrikleri …

2
NBA çekim tutarlılığını hesaplama
Bir NBA oyuncusunun 3 puanlık atış tutarlılığını değerlendirmenin / belirlemenin doğru yolu ne olabilir? Mesela, 3 sayı mesafesinden% 37 vuran ve tüm yıl 200 deneme yapan bir oyuncum var. Rastgele sayıda çekimin% 3'lük yuvarlanma ortalamasını almayı düşünüyordum (20 diyelim). Daha sonra bu ortalamaları kullanarak% 37 ortalamadan standart sapmayı belirleyin. Yuvarlanan …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.