İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Olasılığı en üst düzeye çıkaran bir lojistik regresyon, lineer modellere göre AUC'yi mutlaka en üst düzeye çıkarıyor mu?
İkili sonuçlar y∈{0,1}ny∈{0,1}ny\in\{0,1\}^n ve bazı tahmin matrisi X∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p} olan bir veri seti verildiğinde , standart lojistik regresyon modeli binom olasılığını en üst düzeye çıkaran βMLEβMLE\beta_{MLE} katsayılarını tahmin eder. XXX dolu olduğunda βMLEβMLE\beta_{MLE} benzersizdir; mükemmel bir ayrılma olmadığında, sonludur. Bu, maksimum olabilirlik modeli aynı zamanda ROC AUC (aka maksimize mu …

3
İstatistiklerle ilgili olarak kötü istatistiksel uygulamaları yayan çok alıntılanmış makaleler var mı?
İstatistiksel yöntemleri kötüye kullanmanın pek çok yolu vardır. Daha sonra tekrar tekrar atıfta bulunulan saygın akademik dergilerde, ilk olarak açık tavsiye olarak yayınlanan (örneğin, "bu yöntemi ... için kullanmalısınız") kötü istatistik uygulama örneklerini biliyor musunuz? Örnek olarak, genellikle lojistik veya Cox PH regresyon modelleri ( LINK ) için çağrılan her …

1
“RMSE'nin 2,5 katına” dayalı aykırı değerler
In Kahneman ve Deaton (2010) , yazarlar şunları yazın:††^\dagger Bu gerileme, varyansın% 37'sini açıklar ve 0.67852 kök ortalama kare hatası (RMSE) içerir. Aykırı değerleri ve mantıksız gelir raporlarını ortadan kaldırmak için, log geliri ile tahmini arasındaki farkın mutlak değerinin RMSE'nin 2,5 katını aştığı gözlemleri bıraktık. Bu yaygın bir uygulama mı? …


5
Lojistik regresyon hakkında felsefi soru: optimal eşik değeri neden eğitilmiyor?
Genellikle lojistik regresyonda, bir modele uyuyoruz ve eğitim seti hakkında bazı tahminler alıyoruz. Daha sonra bu eğitim tahminlerini ( burada olduğu gibi ) çapraz doğrular ve ROC eğrisi gibi bir şeye dayanarak optimum eşik değerine karar veririz . Neden gerçek modele INT eşiğinin çapraz doğrulamasını dahil etmiyoruz ve her şeyi …

2
Karar eşiği lojistik regresyonda hiperparametre midir?
(İkili) lojistik regresyondan tahmin edilen sınıflar, model tarafından oluşturulan sınıf üyelik olasılıkları üzerinde bir eşik kullanılarak belirlenir. Anladığım kadarıyla, varsayılan olarak 0,5 kullanılır. Ancak eşiği değiştirmek, öngörülen sınıflamaları değiştirecektir. Bu eşiğin bir hiperparametre olduğu anlamına mı geliyor? Öyleyse, (örneğin) scikit-learn'un GridSearchCVyöntemini (normalleştirme parametresi için yaptığınız gibi) kullanarak bir eşik ızgarasını …

4
Çok değişkenli regresyondan önce tek değişkenli regresyonun anlamı nedir?
Şu anda küçük bir veri setine sahip olduğumuz ve bir tedavinin sonuç üzerindeki nedensellik etkisi ile ilgilenen bir sorun üzerinde çalışıyorum. Danışmanım, her bir prediktör üzerinde sonuç olarak yanıt olarak, daha sonra yanıt olarak tedavi atamasıyla tek değişkenli bir regresyon yapmamı söyledi. Yani, bir seferde bir değişkenle regresyona uymam ve …

1
Tek bir örneğin olasılığı 0 olduğunda MLE neden mantıklı geliyor?
Bu, bazı eski istatistikleri incelerken sahip olduğum garip bir düşünce ve bir nedenden dolayı cevabı düşünemiyorum. Sürekli bir PDF bize herhangi bir aralıktaki değerleri gözlemleme yoğunluğunu söyler. Yani, eğer , örneğin, daha sonra olasılık bir gerçekleşme arasında düşer ve basitçe burada olduğu standardın yoğunluğu.X∼N(μ,σ2)X∼N(μ,σ2)X \sim N(\mu,\sigma^2)aaabbb∫baϕ(x)dx∫abϕ(x)dx\int_a^{b}\phi(x)dxϕϕ\phi Ait dediğimizde bir parametrenin …

8
Mantıksız anket cevapları nasıl tedavi edilir
Bir grup sanatçıya anket gönderdim. Sorulardan biri, sanatsal faaliyet, devlet desteği, bireysel emeklilik, sanatla ilgili olmayan faaliyetlerden elde edilen gelir yüzdesini göstermekti. Bireylerin yaklaşık% 65'i, yüzde toplamı 100 olacak şekilde cevap vermiştir. Diğerleri: örneğin, gelirlerinin% 70'inin sanatsal faaliyetlerinden ve% 60'ının gelir hükümetinden kaynaklandığını cevaplayanlar vardır. , ve bunun gibi. Sorum …
13 survey  bias 

2
Atlanan değişken yoksa regresyon nedensel mi?
Bir regresyon yyy ile ilgili xxx hem de etkileyen değişkenler var çıkarılırsa nedensel olması gerekli değildir xxx ve yyy . Ancak atlanan değişkenler ve ölçüm hatası için değilse, bir regresyon nedensel mi? Yani, olası her değişken regresyona dahil edilirse?

4
Maksimum posterior tahmini varsa MCMC tabanlı yöntemler uygun mudur?
Birçok pratik uygulamada, posterior analitik olmasına rağmen (örneğin, öncekiler eşlenik olduğu için) bir parametreyi tahmin etmek için MCMC tabanlı yöntemlerin kullanıldığını fark ettim. Benim için MCMC tabanlı tahmin edicilerden ziyade MAP tahmin edicilerinin kullanılması daha anlamlı. Herkes MCMC'nin analitik posterior varlığında neden hala uygun bir yöntem olduğunu belirtebilir mi?

2
Kement ile karşılaştırıldığında neden en iyi altküme seçimi tercih edilmiyor?
İstatistiksel öğrenme kitabının Unsurları'nda en iyi altküme seçimini okuyorum. 3 tahmin edicim , 2 3 = 8 altkümesi oluştururum:x1,x2,x3x1,x2,x3x_1,x_2,x_323=823=82^3=8 Tahmini olmayan alt küme öngörücü ile alt küme x1x1x_1 öngörücülü alt küme x2x2x_2 öngörücülü alt küme x3x3x_3 öngörücülü alt küme x1,x2x1,x2x_1,x_2 öngörücülü alt küme x1,x3x1,x3x_1,x_3 öngörücülü alt küme x2,x3x2,x3x_2,x_3 öngörücülü alt …


1
Kontrol değişkenleri üzerindeki grupları karşılaştırdığımızda denklik testleri mi kullanmalıyız?
Tedavileri ve sonuçları düşünen birçok makalede, rahatsızlık değişkenleri (genellikle demografi, bazen tıbbi durumlar) olarak adlandırılabilecek tabloların (genellikle "tablo 1"), "gruplar genel olarak benzer, XXXXX'te anlamlı fark yoktu, bkz. Tablo ". Dolayısıyla açık hedef, farklı tedavilere atanan grupların benzer olduğunu göstermektir. Ancak bana öyle geliyor ki "boş kabul etmek" olabilir ve …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.