İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
Gözlemlenen Fisher bilgileri neden tam olarak kullanılıyor?
Standart en yüksek olabilirlik ortamda (IID örnek yoğunluğu olan bir dağılımdan f y ( y | İçeride ISTV melerin RWMAIWi'nin 0 ve doğru bir şekilde belirtilen model halinde Fisher bilgisi ile verilir))Y1,…,YnY1,…,YnY_{1}, \ldots, Y_{n}fy(y|θ0fy(y|θ0f_{y}(y|\theta_{0} I(θ)=−Eθ0[∂2θ2lnfy(θ)]I(θ)=−Eθ0[∂2θ2ln⁡fy(θ)]I(\theta) = -\mathbb{E}_{\theta_{0}}\left[\frac{\partial^{2}}{\theta^{2}}\ln f_{y}(\theta) \right] burada verileri üreten gerçek yoğunluğa ilişkin beklenti alınır. Gözlemlenen Fisher bilgilerinin …

1
Sıfır hipotezi altında binom testleri simüle edilirken p değerlerinin eşit olmayan dağılımı
Sıfır hipotezi altında p-değeri dağılımının eşit olması gerektiğini duydum. Bununla birlikte, MATLAB'daki binom test simülasyonları, ortalama 0.5'ten (bu durumda 0.518) daha büyük olan homojen dağılımlardan çok farklı geri dönüşler sağlar: coin = [0 1]; success_vec = nan(20000,1); for i = 1:20000 success = 0; for j = 1:200 success = …

1
Jenks Python Doğal Molalar: Optimum mola sayısı nasıl bulunur?
Bulduğum bu Python uygulaması arasında Jenks Doğal Sonları algoritma ve bunu benim Windows 7 makine üzerinde çalıştırmak yapabiliriz. Oldukça hızlı ve coğrafi verilerimin boyutunu göz önünde bulundurarak araları birkaç kez bulur. Verilerim için bu kümeleme algoritmasını kullanmadan önce sklearn.clustering.KMeans (burada) algoritma kullanıyordum. KMeans ile yaşadığım problem, optimum K değeri parametresini …


1
Tekrarlanan k-kat çapraz doğrulamanın varyansının bildirilmesi
Tekrarlanan k-kat çapraz doğrulamayı kullanıyorum ve çapraz doğrulamanın farklı çalışmalarının kıvrımları boyunca büyük ortalama olarak hesaplanan ortalamayı (değerlendirme metriğinin, örneğin hassasiyet, özgüllük) rapor ediyorum. Ancak, varyansı nasıl rapor etmem gerektiğinden emin değilim. Burada tekrarlanan çapraz doğrulamayı tartışan birçok soru buldum, ancak farkında olmadığım hiçbiri tekrarlanan çapraz doğrulama testlerinde varyans sorununu …

2
Matthews korelasyon katsayısı (MM) nasıl yorumlanır?
Soru için cevap phi, Matthews ve Pearson korelasyon katsayıları arasındaki İlişki? üç katsayı yönteminin hepsinin eşdeğer olduğunu gösterir. İstatistiklerden değilim, bu yüzden kolay bir soru olmalı. Matthews makalesi (www.sciencedirect.com/science/article/pii/0005279575901099) aşağıdakileri açıklar: "A correlation of: C = 1 indicates perfect agreement, C = 0 is expected for a prediction no better …

1
Bir değişkenin bir PCA bileşeniyle (bir biplot / yükleme grafiğinde) uygun ilişkilendirme ölçüsü nedir?
FactoMineRVeri ölçümlerimi gizli değişkenlere indirmek için kullanıyorum . Beni yorumlamak için yukarıdaki değişken haritası açıktır, ancak değişken Haritaya bakmak değişkenler ve bileşen 1 arasında derneklere geldiğinde karıştı, ddpve covçok yakın haritasındaki bileşenlerle ve ddpAbsbiraz daha fazla uzakta. Ancak, korelasyonların gösterdiği şey bu değildir: $Dim.1 $Dim.1$quanti correlation p.value jittAbs 0.9388158 1.166116e-11 …

2
Sırt regresyonunda standardizasyon hakkında soru
Hey millet sırt regresyonu kullanan bir veya iki makale buldum (basketbol verileri için). Bir sırt regresyonu yürüttüysem her zaman değişkenlerimi standartlaştırmam söylendi, ancak basitçe bunu yapmam söylendi çünkü sırt ölçekli varyanttı (sırt regresyonu gerçekten kursumuzun bir parçası değildi, bu yüzden öğretim üyemiz onu gözden kaçırdı). Okuduğum bu makaleler değişkenlerini standardize …


1
Posterior dağılımın bu resminde yanlış olan ne?
Bana şu görüntüye sahibim ki, posterior olasılık dağılımının önceki ve olasılık dağılımlarının nasıl bir birleşimi olduğunu gösteren bir örnek. Bana görüntüyle ilgili yanlış bir şey olduğu söylendi, yani arka dağılımın, olasılık fonksiyonu şeklinde verilen forma sahip olamayacağı söylendi. Ama görüntüde neyin yanlış olduğunu düşünmeye çalışıyorum. Posterior olasılık gibi görünmektedir, ancak …

2
Regresyon için polinom kontrastları
Regresyon uyumunda polinom kontrastlarının kullanımını anlayamıyorum. Özellikle, bu sayfadaR açıklanan bir aralık değişkenini (eşit aralıklı düzeylere sahip sıralı değişken) ifade etmek için kullanılan bir kodlamaya atıfta bulunuyorum . Bu sayfa örneğinde, doğru anladıysam, R bir aralık değişkeni için bir modele uyuyor ve doğrusal, karesel veya kübik eğilimini ağırlaştıran bazı katsayılar …

5
“Zaman serisi analizi” ile “boyuna veri analizi” terimleri arasındaki farklar nelerdir?
Uzunlamasına verilerden bahsederken, aynı özne / çalışma biriminden zaman içinde tekrar tekrar toplanan verilere başvurabiliriz, bu nedenle aynı özne içindeki gözlemler için, yani özne içi benzerlik için korelasyonlar vardır. Zaman serisi verileri hakkında konuşurken, bir süre boyunca toplanan verilere de atıfta bulunuyoruz ve yukarıda belirtilen uzunlamasına ayara çok benziyor. Birinin …

2
R'de Ordinal Lojistik Regresyon analizini hem sayısal hem de kategorik değerlerle nasıl çalıştırabilirim?
Temel Veriler : Değerlendirmelerle işaretlenmiş ~ 1.000 kişi var: '1,' [iyi] '2,' [orta] veya '3' [kötü] - bunlar gelecekte insanlar için tahmin etmeye çalıştığım değerler . Buna ek olarak, bazı demografik bilgilerim var: cinsiyet (kategorik: E / K), yaş (sayısal: 17-80) ve ırk (kategorik: siyah / beyaz / latino). Başlıca …

3
Neden otomatik kodlayıcılara ihtiyacımız var?
Son zamanlarda oto-kodlayıcılar üzerinde çalışıyorum. Doğru anladıysam, otomatik kodlayıcı, giriş katmanının çıkış katmanıyla aynı olduğu bir sinir ağıdır. Böylece sinir ağı, girdiyi altın standart olarak kullanarak çıktıyı tahmin etmeye çalışır. Bu modelin faydası nedir? Bazı çıkış öğelerini yeniden oluşturmaya çalışmanın ve bunları giriş öğelerine mümkün olduğunca eşit hale getirmenin faydaları …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.