İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

5
5'li Likert ölçeğine 6. yanıt seçeneği (“Bilmiyorum”) eklendi. Veri kayboldu mu?
Bir anketten veri kurtarma konusunda biraz yardıma ihtiyacım var. Meslektaşlarımdan biri bir anket uyguladı, ancak yanlışlıkla 5 puanlık Likert ölçeğini kullanmak yerine (kesinlikle katılıyorum), ölçeğe 6. bir cevap ekledi. Ve konuyu daha da kötüleştirmek için 6. yanıt seçeneği… “Bilmiyorum”. Sorun şu ya da bu noktada “Bilmiyorum” u seçen katılımcıların büyük …


2
'69'daki verilerden genel olarak en son teknoloji
Sinir ağları için çok kritik olan 1969'dan kalma ünlü Minsky ve Papert kitabı "Perceptrons" un içeriğini anlamaya çalışıyorum. Bildiğim kadarıyla, henüz algılayıcı dışında başka genel denetimli öğrenme algoritmaları yoktu: karar ağaçları sadece 70'lerin sonunda, rastgele ormanlar ve SVM'ler 90'larda gerçekten kullanışlı olmaya başladı. Jackknife yöntemi zaten biliniyordu, ancak k-çapraz validasyonu …

2
“Tüm bu veri noktaları aynı dağıtımdan geliyor.” Nasıl test edilir?
Bu konunun daha önce burada tartışıldığını gördüm ama özel bir şey bulamadım. Sonra tekrar, ne arayacağından da emin değilim. Bir boyutlu sıralı veri setim var. Kümedeki tüm noktaların aynı dağılımdan çekildiğini varsayıyorum. Bu hipotezi nasıl test edebilirim? "Bu veri setindeki gözlemler iki farklı dağılımdan alınmıştır" genel bir alternatifine karşı test …

1
Düzeltme - Tekrarlanan K katlama çapraz doğrulaması ve İç içe K katlama çapraz doğrulaması, n kez tekrarlandı
Şapka paketi birden makine öğrenme modellerini oluşturmak için parlak bir Ar kütüphane ve model oluşturma ve değerlendirme için çeşitli fonksiyonlara sahiptir. Parametre ayarlama ve model eğitimi için düzeltme paketi, yöntemlerden biri olarak 'tekrarlanancv' sunar. İyi bir uygulama olarak, parametre ayarlama aşağıdaki şekilde çalışan iç içe K-kat çapraz doğrulaması kullanılarak yapılabilir: …

1
Öngörülü modelleri değerlendirmek için tekrarlanan çapraz geçerlilik kullanılmalı mıdır?
Ben rastladım bu 2012 makalesinde soru çapraz doğrulama varyansını azaltmak için popüler bir teknik haline gelmiştir tekrarlanan çapraz doğrulama, yararını çağırarak Gitte Vanwinckelen ve Hendrik Blockeel tarafından. Yazarlar, tekrarlanan çapraz-validasyonun model tahminlerinin varyansını azaltmasına rağmen, aynı örnek veri kümesinin yeniden örneklendiği için, yeniden örneklenen çapraz-validasyon tahminlerinin ortalamasının gerçek öngörme doğruluğunun …

2
Neden “standart” sapma deniyor?
Basit ve muhtemelen önemsiz bir sorum var: standart sapmaya neden sadece " standart " deniyor ? Veri kümeleri ve sonuçlarının dağılımlarına göre karşılaştırılmasını standartlaştırdığı için mi? Stack Exchange'de yapılan bir arama bu soruyu ortaya çıkarmaz ve Google terimi teriminin etimolojisinde çok fazla değer vermez.

2
Sırt regresyonu neden bazı katsayıları kement gibi sıfıra çekmeyecek?
LASSO regresyonunu açıklarken, genellikle bir elmas ve dairenin diyagramı kullanılır. LASSO'daki kısıtlamanın şekli bir elmas olduğu için, elde edilen en küçük kareler çözeltisinin, bazı değişkenlerin büzülmesine yol açacak şekilde elmasın köşesine dokunabileceği söylenir. Bununla birlikte, sırt regresyonunda, bir daire olduğu için, genellikle eksene dokunmaz. Neden eksene temas edemediğini veya bazı …

1
Çoklu doğrusal regresyonda, tahmin edilen noktaların bir grafiği neden düz bir çizgide yer almıyor?
Y ve X1, X2 arasındaki ilişkileri tanımlamak için çoklu doğrusal regresyon kullanıyorum. Teoriden, çoklu regresyonun Y ile X'in her biri (Y ve X1, Y ve X2) arasında doğrusal ilişkiler olduğunu varsaydım. X'in herhangi bir dönüşümünü kullanmıyorum. Böylece modeli R = 0.45 ve tüm anlamlı X ile aldım (P <0.05). Sonra …

5
En son araştırmaları nasıl takip edersiniz?
ArXiv ile ilgili bu soruyu okuduktan ve daha önce bilmediğim GitXiv'e bir bağlantı bulduktan sonra , insanların kendi alanlarındaki en son araştırmaları güncellemek için hangi web sitelerini / kaynaklarını kullandığını merak ettim.
16 academia 

3
İki aşamalı modeller: Heckman modelleri (örnek seçimi ile ilgilenmek için) ve Enstrümantal değişkenler (endojenite ile ilgilenmek için) arasındaki fark
Başımı örnek seçimi ve endojenite arasındaki fark etrafında toplamaya çalışıyorum ve Heckman modellerinin (örnek seçimi ile başa çıkmak için) enstrümantal değişken regresyonlardan (endojenlik ile başa çıkmak için) nasıl farklı olduğunu düşünüyorum. Örnek seçiminin, endojen değişkenin tedavi edilme olasılığı olduğu belirli bir endojenite formu olduğunu söylemek doğru mudur? Ayrıca, hem Heckman …

1
Pearson VS Deviance Lojistik regresyonda artıklar
Standart Pearson Kalıntılarının geleneksel olasılıklarla elde edildiğini biliyorum: ri=yi−πiπi(1−πi)−−−−−−−−√ri=yi−πiπi(1−πi) r_i = \frac{y_i-\pi_i}{\sqrt{\pi_i(1-\pi_i)}} ve Sapma Kalıntıları daha istatistiksel bir yolla elde edilir (her noktanın olasılığa katkısı): di=si−2[yilogπi^+(1−yi)log(1−πi)]−−−−−−−−−−−−−−−−−−−−−−−−−−√di=si−2[yilog⁡πi^+(1−yi)log⁡(1−πi)] d_i = s_i \sqrt{-2[y_i \log \hat{\pi_i} + (1 - y_i)\log(1-\pi_i)]} burada ise 1 = 1 = ise = -1 = 0.sisis_iyiyiy_isisis_iyiyiy_i Bana, sezgisel olarak, …



2
Temel bileşen analizi yapmadan önce verileri neden log dönüşümü?
Burada bir öğreticiyi takip ediyorum: PCA'yı daha iyi anlamak için http://www.r-bloggers.com/computing-and-visualizing-pca-in-r/ . Eğitici Iris veri kümesini kullanır ve PCA'dan önce bir günlük dönüşümü uygular: [1] ve seti tarafından önerildiği gibi Bildirimi aşağıdaki kodda biz sürekli değişkenler için bir günlük dönüşümü geçerli olduğunu centerve scalehiç eşit TRUEçağrısında prcompönce PCA uygulanmasından değişkenleri …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.