İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Büyük bir veri kümesi için önem düzeyi nasıl seçilir?
N 200.000 civarında bir veri kümesiyle çalışıyorum. Regresyonlarda, çok küçük etki boyutlarıyla ilişkili çok küçük önem değerleri << 0.001 görüyorum, örneğin r = 0.028. Bilmek istediğim, örneklem büyüklüğü ile ilgili uygun bir anlamlılık eşiğine karar vermenin ilkeli bir yolu var mı? Etki büyüklüğünün bu kadar büyük bir örnekle yorumlanmasında başka …

2
Cox orantılı tehlikeler modeli ile çapraz doğrulama nasıl yapılır?
Bir veri kümesinde (model oluşturma veri kümesi) belirli bir hastalığın ortaya çıkması için bir tahmin modeli oluşturduğumu ve şimdi modelin yeni bir veri kümesinde (doğrulama veri seti) ne kadar iyi çalıştığını kontrol etmek istediğimizi varsayalım. Lojistik regresyon ile oluşturulan bir model için, model oluşturma veri kümesinden elde edilen model katsayılarına …

2
R'deki ağaçların bölünmesi: parti vs. rpart
Ağaçları bölmeye baktığımdan beri bir süre geçti. Son kez böyle bir şey yaptım, R (Hothorn tarafından yaratılmış) partiyi seviyorum. Örnekleme yoluyla koşullu çıkarım fikri bana mantıklı geliyor. Ancak rpart'ın da itirazları vardı. Mevcut uygulamada (ayrıntı veremiyorum, ancak büyük bir aresteste örneği arasında kimin hapse gireceğini belirlemeye çalışıyor) Rasgele ormanlar, torbalama, …
15 r  cart  rpart  partitioning 

3
Bir bilgisayar laboratuarında R'yi öğretmek için iyi bir yaklaşım nedir?
Giriş kitaplarında veya R'yi öğrenme konusunda burada ve burada birkaç iyi soru ve cevap seti vardır . Ama biraz farklı bir sorunum var - insanları bir bilgisayar laboratuarında saatte bir seans (veya birkaç seans) çalıştırmanın en iyi yolu, R'deki temel yaklaşımı tanıyan vb. Şu anki planım Verzani'nin SimpleR gibi bir …
15 r  teaching 

1
Sürekli değişkenler tahmin edilirken karar ağacı bölünmeleri nasıl uygulanmalıdır?
Aslında Rastgele Ormanların bir uygulamasını yazıyorum ama sorunun karar ağaçlarına (RF'lerden bağımsız) özgü olduğuna inanıyorum. Yani bağlam, bir karar ağacında bir düğüm oluşturuyorum ve hem tahmin hem de hedef değişkenler süreklidir. Düğüm, verileri iki kümeye bölmek için bölünmüş bir eşik değerine sahiptir ve her kümedeki ortalama hedef değere dayalı olarak …

3
Verilerin rastgele örneklenmesinden kaynaklanan benzersiz oluşum sayılarını nasıl tahmin edebilirim?
Diyelim ki bazen tekrar eden geniş bir değerleri kümem var. Büyük kümedeki toplam benzersiz değerlerin sayısını tahmin etmek istiyorum .SSS Ben sıradan bir örneğini ele alırsak değerleri ve içerdiği olduğunu belirlemek T u bu büyük sette benzersiz değerlerin sayısını tahmin etmek için kullanabileceğiniz, benzersiz değerleri?TTTTuTuT_u

1
Boyutlar arttıkça normal dağılımın yoğunluğu
Sormak istediğim soru şudur: Normal dağılımın ortalama 1 SD'si içindeki örneklerin oranı, değişken sayısı arttıkça nasıl değişir? (Neredeyse) herkes, 1 boyutlu normal dağılımda, numunelerin% 68'inin ortalamanın 1 standart sapması içinde bulunabileceğini bilir. 2, 3, 4, ... boyutlarında ne olacak? Azaldığını biliyorum ... ama ne kadar (tam olarak)? 1, 2, 3 …

3
GMM ne zaman kullanılmalıdır?
Şeylerden biri Ekonometriyi benzersiz kılan biri, Genelleştirilmiş Momentler Yöntemi tekniğinin kullanılmasıdır. Hangi tür problemler GMM'yi diğer tahmin tekniklerinden daha uygun hale getirir? GMM kullanmak, verimlilik veya azaltılmış sapma veya daha spesifik parametre tahmini açısından size ne kazandırır? Tersine, MLE, vb. Üzerinden GMM kullanarak ne kaybedersiniz?

4
Bir değişkenin standart sapması 0 ise korelasyon nedir?
Anladığım kadarıyla, denklemi kullanarak kovaryansı normalleştirerek korelasyon elde edebiliriz ρi,j=cov(Xi,Xj)σiσjρi,j=cov(Xi,Xj)σiσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} burada σi=E[(Xi−μi)2]−−−−−−−−−−−√σi=E[(Xi−μi)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]} ait standart sapmaXiXiX_i. Endişem, standart sapma sıfıra eşitse? Sıfır olamayacağını garanti eden herhangi bir koşul var mı? Teşekkürler.

6
“Politika” değişikliği nedeniyle zaman serisi verilerinde önemli bir değişiklik nasıl tespit edilir?
Umarım bunu göndermek için doğru yer, şüpheci yayınlamayı düşündüm, ama sadece çalışmanın istatistiksel olarak yanlış olduğunu söyleyeceklerini düşünüyorum. Sorunun ters tarafını merak ediyorum, bu nasıl doğru yapılır. Quantified Self web sitesinde , yazar zaman içinde kendi üzerinde ölçülen ve aniden kahve içmeyi bırakmadan önce ve sonra karşılaştırılan bazı çıktı metriği …

2
Artan özellik sayısı doğruluk düşüşüne neden olur, ancak ön / geri çağırma artar
Makine Öğreniminde yeniyim. Şu anda 3 sınıftaki küçük metinleri NLTK ve python kullanarak pozitif, negatif veya nötr olarak sınıflandırmak için Naive Bayes (NB) sınıflandırıcısı kullanıyorum. Bazı testler yaptıktan sonra, 300.000 örnekten oluşan bir veri kümesiyle (16.924 pozitif 7.477 negatif ve 275.599 nötr), özellik sayısını artırdığımda doğruluk azalır, ancak pozitif ve …

9
Negatif olmayan verilerin standart sapması ortalamayı aşabilir mi?
Üçgene 3D ağlarım var. Üçgen alanların istatistikleri: Min. 0.000 Maksimum 2341.141 Ortalama 56.317 Standart Dev 98.720 Yani, standart sapma hakkında özellikle yararlı bir şey mi ifade ediyor veya rakamlar yukarıdaki gibi çalıştığında, hesaplamada hatalar olduğunu gösteriyor mu? Alanlar normalde dağılmaktan kesinlikle uzaktır. Ve birisinin aşağıdaki yanıtlarından birinde bahsettiği gibi, sayıların …

5
Farklı sınıflandırıcıların artılarını ve eksilerini karşılaştırmayı içeren iyi bir kaynak nedir?
Kutudan çıktığı en iyi 2 sınıf sınıflandırıcı nedir? Evet, sanırım bu milyon dolarlık bir soru ve evet, ücretsiz öğle yemeği teoreminin farkında değilim ve önceki soruları da okudum: Uygulamanız için en iyi 2 sınıfı sınıflandırıcı nedir? ve En Kötü sınıflandırıcı Yine de konuyla ilgili daha fazla okumak istiyorum. Farklı sınıflandırıcıların …

1
Merdiven basamakları fonksiyonu ggplot ile nasıl çizilir?
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. Ben böyle bir grafik var: Onu oluşturmak için R kodu: DF <- data.frame(date = as.Date(runif(100, 0, 800),origin="2005-01-01"), outcome = rbinom(100, 1, 0.1)) DF <- DF[order(DF$DateVariable),] #Sort by …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.