İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Uzamsal verilere uyumu dağıtma
Bazı istatistiklere özel yardım bulmak için sorumu mathoverflow'dan yayınlayın . Negatif olmayan değerlerle iki boyuta güzel bir şekilde yansıyan veri üreten fiziksel bir süreç üzerinde çalışıyorum. Her işlemin - y noktalarının (yansıtılan) bir izi vardır - aşağıdaki resme bakın.xxxyyy Örnek pistler mavidir, zahmetli bir pist elle yeşil olarak çizilmiştir ve …


2
Bir örnek t-testinde, varyans tahmin edicisinde örnek ortalaması
Boş hipotezin olduğu tek örnekli bir t testi olduğunu varsayalım . İstatistik daha sonra örnek standart sapma kullanılarak . Tahmininde , tek bir numune ortalamaları gözlemlerini karşılaştırır :μ=μ0μ=μ0\mu=\mu_0t=x¯¯¯−μ0s/n√t=x¯−μ0s/nt=\frac{\overline{x}-\mu_0}{s/\sqrt{n}}ssssssx¯¯¯x¯\overline{x} s=1n−1∑ni=1(xi−x¯¯¯)2−−−−−−−−−−−−−−−√s=1n−1∑i=1n(xi−x¯)2s=\sqrt{\frac{1}{n-1}\sum_{i=1}^n (x_i-\overline{x})^2}. However, if we assume a given μ0μ0\mu_0 to be true, one could also estimate the standard deviation s∗s∗s^* using μ0μ0\mu_0 …

1
Bu iki regresyon modeli arasındaki temel fark nedir?
Diyelim ki anlamlı korelasyona sahip iki değişkenli bir yanıtım var. Bu sonuçları modellemenin iki yolunu karşılaştırmaya çalışıyorum. Tek yönlü iki sonuç arasındaki fark modellemek için: bir başka yolu ise ya da bunları model: ( y i j = β 0 + zaman + X ' β )(yi2−yi1=β0+X′β)(yi2−yi1=β0+X′β)(y_{i2}-y_{i1}=\beta_0+X'\beta)glsgee(yij=β0+time+X′β)(yij=β0+time+X′β)(y_{ij}=\beta_0+\text{time}+X'\beta) İşte bir foo …

1
Sağkalım analizi için CPH, hızlandırılmış başarısızlık süresi modeli veya sinir ağlarının karşılaştırılması
Hayatta kalma analizinde yeniyim ve yakın zamanda bunu belirli bir amaç doğrultusunda yapmanın farklı yolları olduğunu öğrendim. Bu yöntemlerin gerçek uygulaması ve uygunluğu ile ilgileniyorum. Zaman, statü ve diğer tıbbi veriler göz önüne alındığında bir hastanın hayatta kalması için yöntemler olarak geleneksel Cox Orantılı Tehlikeler , Hızlandırılmış başarısızlık süresi modelleri …

2
Bir açımlayıcı faktör analizi çözümünün döndürülmemesinin bir nedeni var mı?
Herhangi bir sebep var mıdır değil bir faktör analizi çözümü döndürmek? Ortogonal çözümleri eğik çözümlerle karşılaştıran tartışmalar bulmak kolaydır ve sanırım tüm bunları tamamen anlıyorum. Ayrıca, ders kitaplarında bulabildiklerimden, yazarlar genellikle faktör analizi tahmin yöntemlerini açıklamaktan rotasyonun nasıl çalıştığını ve bazı farklı seçeneklerin ne olduğunu açıklamaya doğru giderler. Görmediğim şey, …

1
Bilinen ortalama mutlak sapma için maksimum entropi hangi dağılımdadır?
Hacker News'ta ortalama mutlak sapma gibi diğer metriklerin aksine standart sapmanın kullanımı hakkındaki tartışmayı okuyordum . Peki, eğer maksimum entropi ilkesini takip edecek olsaydık, sadece dağılımın ortalamasını ve ortalama mutlak sapmayı bilseydik ne tür bir dağıtım kullanırdık? Yoksa medyanı ve medyandan ortalama mutlak sapmayı kullanmak daha mantıklı mı? Merak ettiğim …

2
LmerTest :: anova'daki özgürlük dereceleri doğru mu? RM-ANOVA'dan çok farklılar
R'deki bir reaksiyon süresi deneyinin sonuçlarını analiz ediyorum. Tekrarlanan ölçümler ANOVA (2 seviyeli 1 denek içi faktör ve 2 seviyeli 1 denek arası faktör) çalıştırdım. Benzer bir doğrusal karma model çalıştırdım ve lmer sonuçlarını ANOVA tablosu kullanarak özetlemek istedim lmerTest::anova. Beni yanlış anlamayın: Aynı sonuçları beklemiyordum, ancak lmerTest::anovasonuçlardaki özgürlük derecelerinden …

3
Amerikan Topluluğu Araştırması çeşitlilik verilerinin yeniden ağırlıklandırılması, hata paylarını nasıl etkiler?
Arka plan: Kuruluşum şu anda işgücü çeşitliliği istatistiklerini (örn.% Engelli kişiler,% kadın, gazi yüzdesi) Amerikan Topluluğu Araştırması'na (ABD Nüfus Sayım Bürosu tarafından yürütülen bir anket projesi) dayanan bu grupların toplam işgücü mevcudiyeti ile karşılaştırmaktadır. Bu yanlış bir ölçüttür, çünkü bir bütün olarak işgücünden farklı demografik özelliklere sahip çok özel bir …

2
Boylamsal bir çalışmada, takipte kaybedilen bireyler için Y zamanında ölçülen Y sonucunu ima etmeli miyim?
Bir örneklemde 2 kez tekrarlanan önlemlerim var. 1. sırada 18k, 2. sırada 13k (5000 kişi kaybetti) vardır. Zaman 1'de ölçülen bir X tahmincisi kümesinde (2. zamanda ölçülen (ve sonuç 1'de ölçülemez)) bir gerileme elde etmek istiyorum. Tüm değişkenlerin bazı eksik verileri vardır. Çoğu nispeten rastgele görünüyor veya eksiklik gözlemlenen verilerle …

2
En küçük kovaryans matrisini bulmak için uygun önlem
Okuduğum ders kitabında iki kovaryans matrisi karşılaştırmak için pozitif kesinlik (yarı pozitif kesinlik) kullanmaktadırlar. Fikir, eğer pd ise , küçüktür . Ama bu ilişkinin sezgisini almak için uğraşıyorum?A−BA−BA-BBBBAAA Burada benzer bir iplik var: /math/239166/what-is-the-intuition-for-using-definiteness-to-compare-matrices Matrisleri karşılaştırmak için kesinlik kullanma sezgisi nedir? Cevaplar güzel olsa da sezgiye gerçekten değinmiyorlar. İşte kafa …

4
Karma model fikri ve Bayes yöntemi
Karışık modelde, rastgele etkilerin (parametrelerin) normal dağılımları takip eden rastgele değişkenler olduğunu varsayıyoruz. Tüm parametrelerin rastgele olduğu varsayıldığı Bayesian yöntemine çok benziyor. Rastgele efekt modeli Bayesian yönteminin özel durumu mudur?

2
Özet istatistikleri ortalama, sd, min ve max ile mi çiziyorsunuz?
Ben bir ekonomi geçmişindeyim ve genellikle disiplinde değişkenlerin özet istatistikleri bir tabloda rapor edilir. Ancak, onları planlamak istiyorum. Bir kutu grafiğini ortalama, standart sapma, minimum ve maksimum değerlerini görüntüleyecek şekilde değiştirebilirim, ancak kutu grafikleri geleneksel olarak medyanları ve Q1 ve Q3'ü görüntülemek için kullanıldığından bunu yapmak istemiyorum. Tüm değişkenlerimin farklı …

2
Güçlü regresyon çıkarımı ve Sandviç tahmin edicileri
Sağlam regresyon çıkarımını gerçekleştirmek için bana sandviç tahmin edicilerinin kullanımına bir örnek verebilir misiniz? Örneği görebiliyorum ?sandwich, ancak fonksiyon tarafından döndürülen varyans-kovaryans matrisini kullanarak bir regresyon modelinden kaynaklanan bir tahmin ve p değerine nasıl lm(a ~ b, data)( r- kodlu) gidebileceğimizi tam olarak anlamıyorum . sandwich
10 r  regression  lm  sandwich 

2
İnsanların tekrarlanan kayıplardan sonra bahisleri bırakıp bırakmadıklarını test edin
Her turdan sonra yıpranma ile 5 turdan fazla kazanan ve kaybeden bahisler hakkında verilerim var. Verileri görüntülemek için aşağıdaki gibi bir karar ağacı kullanıyorum. Ağacın tepesine doğru düğümler kazanan bahislere sahip olanlardır ve ağacın dibine doğru olan düğümler kaybetme bahislerine sahiptir. Her düğümdeki (b) ortalama bahis boyutlarındaki değişikliklerin (a) yıpranmasına …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.