İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Giriş sayısı ile birlikte yüzdelerin nasıl görselleştirileceği.
Aşağıdaki tabloyu görselleştirmenin ve tedaviyi deneyen hasta sayısına göre tedavi etkinliğini vurgulamanın en iyi yolunu bulmaya çalışıyorum. Asıl sayfanın bağlantısı: http://curetogether.com/cluster-headaches/treatments/ Tedavileri karşılaştırmayı ve kaç hastanın her birini derecelendirdiğini görmeyi kolaylaştırırken etkinliği vurgulamanın en iyi yolu nedir? Düşüncem, etkinliği yüzde olarak göstermekti, ancak bunları nasıl kolayca karşılaştırılabilir hale getireceğinden ve …

1
Gerçek mekansal durağanlık: sadece küçük gecikmeler için geçerli değil mi?
İçsel durağanlık tanımından: E[ Z( x ) - Z( x - h ) ] = 0E[Z(x)−Z(x−h)]=0E[Z(x)-Z(x-h)] = 0 Bu varsayım örneğin sıradan kriging'de kullanılır, tüm alan üzerinde sabit bir ortalama varsaymak yerine, ortalamanın lokal olarak sabit olduğunu varsayarız. Bir mahallede ortalama sabitse, birbirine yakın iki ölçüm arasındaki farkın mantıksal olarak …
10 spatial 

1
Veri işleme hataları istatistiksel analize zaten 'fiyatlandırılmıştır' mi?
Tamam, adil uyarı - bu sayı içermeyen felsefi bir sorudur. Hataların zaman içinde veri kümelerine nasıl girdiğini ve bunun analistler tarafından nasıl ele alınması gerektiğini ya da gerçekten önemli olup olmadığını çok düşündüm. Arka plan için, analizi 7-8 yıl içinde muhtemelen 25 kişi tarafından toplanan birçok veri kümesini içeren uzun …
10 dataset  error 

2
Bağımlı değişkente ölçüm hatası neden sonuçlara yön vermiyor?
Bağımsız değişkente ölçüm hatası olduğunda, sonuçların 0'a karşı önyargılı olacağını anladım. Bağımlı değişken hata ile ölçüldüğünde, bunun sadece standart hataları etkilediğini söylüyor, ancak bu benim için çok anlamlı değil çünkü XXX orijinal değişkeni YYYüzerinde değil, başka bir YYY artı bir hata üzerindeki etkisini tahmin etmek . Peki bu tahminleri nasıl …


3
gl - R - hangi değer tüm modelin uyum iyiliğini temsil eder?
R'de glm'ler çalıştırıyorum (genelleştirilmiş doğrusal modeller). Değerleri bildiğimi sanıyordum - bir glm için bir özet çağırmanın size bir bütün olarak modelin geçersiz kılınan bir değer vermediğini görene kadar - en azından doğrusal modellerin yaptığı yerde değil. Bunun katsayı tablosunun üst kısmında Kesişim için bir değer olarak verilip verilmediğini merak ediyorum. …

4
Ana ilgi alanı olmayan tüm değişkenleri neden log-dönüştürmüyoruz?
Kitaplar ve tartışmalar sık ​​sık bir yordayıcıyla (birkaçının olduğu) sorunlarla karşılaştığında, log-dönüşümünün bir olasılık olduğunu belirtir. Şimdi, bunun öngörücülerdeki dağılımlara ve normalliğe bağlı olduğunu anlıyorum, bir gerileme varsayımı değildir; ancak günlük dönüştürme, verileri daha düzenli hale getirir, aykırı değerlerden daha az etkilenir vb. Ana interesr olmayan tüm sürekli değişkenlerimi, yani …

2
Büyüme grafikleri oluşturmak için en iyi yöntem
Negatif olmayan, sürekli ve sürekli bir sağlık değişkeni için 5 ila 15 yaş arası çocuklar için (büyüme çizelgelerine benzer) grafikler oluşturmak zorundayım (sadece 5,6,7 vb; 2.6 yıl gibi kesirli değerler yoktur) 50-150 aralığı (bu aralığın dışında yalnızca birkaç değerle). 90., 95. ve 99. yüzdelik eğrileri oluşturmam ve bu yüzdelikler için …

3
Times serisi analizi mi, makine öğrenmesi mi?
Sadece genel bir soru. Zaman serisi verileriniz varsa, zaman serisi tekniklerini (aka, ARCH, GARCH, vb.) Makine / istatistiksel öğrenme teknikleri (KNN, regresyon) üzerinde ne zaman kullanmak daha iyidir? Çapraz onaylanmış benzer bir soru varsa, lütfen bana doğru yönlendirin - baktım ve bulamadık.

1
Rasgele Orman Olasılık Tahminine karşı çoğunluk oyu
Scikit öğrenmesi , neden olduğu hakkında bir açıklama yapmadan model toplama tekniği için çoğunluk oyu yerine olasılıksal öngörü kullanıyor gibi görünmektedir (1.9.2.1. Rastgele Ormanlar). Nedeninin açık bir açıklaması var mı? Ayrıca Rastgele Orman torbalaması için kullanılabilecek çeşitli model toplama teknikleri için iyi bir makale veya inceleme makalesi var mı? Teşekkürler!

3
Büyük N, ayrık veriler ve birçok değişkeniniz olduğunda, dağılım grafiği matrisinden nasıl bilgi alınır?
Meme kanseri veri kümesiyle oynuyorum ve hangilerinin (kırmızı) sınıfını malignant(mavi) tahmin etmede en fazla etkiye sahip olduğu hakkında bir fikir edinmek için tüm niteliklerin bir dağılım grafiğini oluşturdum benign. Satırın x eksenini ve sütunun y eksenini temsil ettiğini anlıyorum, ancak veriler veya bu dağılım grafiğindeki nitelikler hakkında hangi gözlemleri yapabileceğimi …

1
İkili endojen değişken ile 2SLS'nin tutarlılığı
2SLS tahmincisinin ikili endojen değişkenle bile hala tutarlı olduğunu okudum ( http://www.stata.com/statalist/archive/2004-07/msg00699.html ). İlk aşamada, doğrusal model yerine probit tedavi modeli çalıştırılacaktır. 2. aşama bir probit veya logit modeli olsa bile 2SLS'nin hala tutarlı olduğunu gösteren herhangi bir resmi kanıt var mı? Ayrıca sonuç da ikili olursa ne olur? İkili …

2
Scikit SVM'nin çok sınıflı sınıflandırmadaki çıktısı her zaman aynı etiketi verir
Şu anda Scikit aşağıdaki kodu ile öğrenmek kullanıyorum: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') ve sonra 7 farklı etikete sahip bir veri seti için uygunluk ve tahmin yapın. Tuhaf bir çıktı aldım. Doğrulama setinde öngörülen etiketi hangi çapraz doğrulama tekniğini kullanırsam kullanalım, daima etiket 7 olacaktır. Tam varsayılan …

1
bayesglm (kol) ve MCMCpack
Hem bayesglm()(kol R paketinde) hem de MCMCpack paketindeki çeşitli işlevler, genelleştirilmiş doğrusal modellerin Bayesian tahminini yapmayı amaçlamaktadır, ancak aslında aynı şeyi hesapladıklarından emin değilim. MCMCpack fonksiyonları, model parametreleri için eklem posteriorundan (bağımlı) bir örnek almak için Markov zinciri Monte Carlo kullanır. bayesglm(), diğer taraftan, üretir. Ne olduğundan emin değilim. bayesglm()Tam …

2
Zaman serilerinin öngörülebilirliği nasıl belirlenir?
Tahmincileri karşılaştığı önemli konulardan biri verilen seri halinde olabilir tahmin ya da değil? Belirli bir zaman serisini belirlemek için göreli bir ölçü olarak Yaklaşık Entropi'yi (ApEn) kullanan Peter Catt tarafından " Öngörülebilirliğin Öncelik Göstergesi Olarak Entropi " başlıklı bir makaleye rastladım . Makale diyor ki, "Daha küçük ApEn değerleri, bir …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.