İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Neden t-testi ve ANOVA iki grup karşılaştırması için farklı p değerleri veriyor?
ANOVA hakkındaki Wikipedia makalesinde şöyle diyor: En basit şekliyle ANOVA, birkaç grubun ortalamalarının eşit olup olmadığı konusunda istatistiksel bir test sağlar ve bu nedenle t testini ikiden fazla gruba genelleştirir. Bunu benim anlayışım, iki grup karşılaştırması söz konusu olduğunda ANOVA'nın t testi ile aynı olduğudur. Bununla birlikte, aşağıdaki basit örneğimde …


2
Lojistik regresyon konusunda varsayım var mı?
Lojistik regresyonun tepki değişkeni üzerinde iid varsayımı var mı? Örneğin, 100010001000 veri noktamız olduğunu varsayalım . Görünüşe göre yanıtı , ile Bernoulli dağılımından geliyor . Bu nedenle, farklı parametre ile Bernoulli dağılımımız olmalıdır .p i = logit ( β 0 + β 1 x i ) 1000 pYiYiY_ipi=logit(β0+β1xi)pi=logit(β0+β1xi)p_i=\text{logit}(\beta_0+\beta_1 x_i)100010001000ppp Yani …

1
Örneklem büyüklüğünü rastgele bir değişken yapmak ne demektir?
Frank Harrell bir blog başlattı ( İstatistiksel Düşünme) . İlk yayınında , istatistiksel felsefesinin bazı temel özelliklerini listeler. Diğer öğelerin yanı sıra şunları içerir: Mümkünse örnek boyutunu rastgele bir değişken yapın "Örnek boyutunu rastgele değişken yapmak" ne anlama gelir? Bunu yapmanın avantajları nelerdir? Neden tercih edilebilir?

5
Bayesci istatistikler meta analizi geçersiz kılıyor mu?
Sadece bir meta-analizi geçersiz kılarsa, Bayesian istatistiklerinin ilk çalışmadan sonuncuya kadar uygulanıp uygulanmayacağını merak ediyorum. Örneğin, farklı zaman noktalarında yapılmış 20 çalışmayı varsayalım. İlk çalışmanın tahmini veya dağılımı, daha önce bilgilendirici olmayan bir şekilde yapılmıştır . İkinci çalışma, posterior dağılımı önceki gibi kullanır. Yeni posterior dağılım şimdi üçüncü çalışma için …

5
İstatistikçiler neden rastgele matrisler tanımladılar?
On yıl önce matematik okudum, bu yüzden matematik ve istatistik geçmişim var, ama bu soru beni öldürüyor. Bu soru benim için hala biraz felsefi. İstatistikçiler neden rastgele matrislerle çalışmak için her türlü tekniği geliştirdiler? Demek istediğim, rastgele bir vektör sorunu çözmedi mi? Değilse, rastgele bir matrisin farklı sütunlarının anlamı nedir? …

1
Genel olarak Aşırı Örnekleme ve özellikle SMOTE algoritması hakkındaki görüşler [kapalı]
Kapalı . Bu soru görüş temelli . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Bu yayını düzenleyerek gerçekler ve alıntılarla yanıtlanabilmesi için soruyu güncelleyin . 2 yıl önce kapalı . Genel olarak sınıflandırmada ve özellikle SMOTE algoritmasında aşırı örnekleme hakkında ne düşünüyorsunuz? Neden sadece sınıf verilerindeki dengesizliği …

3
sinir ağlarını doğrusal olmayan bir sınıflandırma modeli yapan nedir?
Doğrusal olmayan sınıflandırma modellerinin matematiksel anlamını anlamaya çalışıyorum: Sinir ağlarının doğrusal olmayan bir sınıflandırma modeli olduğu hakkında bir makale okudum. Ama bunun farkındayım: İlk katman: h1=x1∗wx1h1+x2∗wx1h2h1=x1∗wx1h1+x2∗wx1h2h_1=x_1∗w_{x1h1}+x_2∗w_{x1h2} h2=x1∗wx2h1+x2∗wx2h2h2=x1∗wx2h1+x2∗wx2h2h_2=x_1∗w_{x2h1}+x_2∗w_{x2h2} Sonraki katman y=b∗wby+h1∗wh1y+h2∗wh2yy=b∗wby+h1∗wh1y+h2∗wh2yy=b∗w_{by}+h_1∗w_{h1y}+h_2∗w_{h2y} Basitleştirilebilir =b'+(x1∗wx1h1+x2∗wx1h2)∗wh1y+(x1∗wx2h1+x2∗wx2h2)∗wh2y=b′+(x1∗wx1h1+x2∗wx1h2)∗wh1y+(x1∗wx2h1+x2∗wx2h2)∗wh2y=b′+(x_1∗w_{x1h1}+x_2∗w_{x1h2})∗w_{h1y}+(x_1∗w_{x2h1}+x_2∗w_{x2h2})∗w_{h2y} =b'+x1(wh1y∗wx1h1+wx2h1∗wh2y)+x2(wh1y∗wx1h1+wx2h2∗wh2y)=b′+x1(wh1y∗wx1h1+wx2h1∗wh2y)+x2(wh1y∗wx1h1+wx2h2∗wh2y)=b′+x_1(w_{h1y}∗w_{x1h1}+w_{x2h1}∗w_{h2y})+x_2(w_{h1y}∗w_{x1h1}+w_{x2h2}∗w_{h2y}) İki katmanlı sinir ağı Sadece basit bir doğrusal regresyon =b′+x1∗W′1+x2∗W′2=b′+x1∗W1′+x2∗W2′=b^′+x_1∗W_1^′+x_2∗W_2^′ Bu, herhangi bir sayıda tabakaya gösterilebilir, çünkü …

4
Varyans standart sapmadan daha temel bir kavram mıdır?
On Bu Psikometri web Bunu okumuştum [A] derin bir varyans standart sapmadan daha temel bir kavramdır. Site, varyansın neden standart sapmadan daha temel olduğu anlamına gelmiyor, ancak bu sitede benzer şeyler okuduğumu hatırlattı. Örneğin, bu yorumda @ kjetil-b-halvorsen "standart sapmanın yorumlama, raporlama için iyi olduğunu. Teori geliştirmek için varyansın daha …

4
Sıradan En Küçük Kareler neden Poisson regresyonundan daha iyi performans gösteriyor?
Bir şehrin her bölgesindeki cinayet sayısını açıklamak için bir gerileme oluşturmaya çalışıyorum. Verilerimin bir Poisson dağılımını izlediğini bilmeme rağmen, şöyle bir OLS yerleştirmeye çalıştım: log(y+1)=α+βX+ϵlog(y+1)=α+βX+ϵlog(y+1) = \alpha + \beta X + \epsilon Sonra, Poisson regresyonunu da denedim. Sahte: Sorun En Küçük Kareler regresyon daha iyi sonuçlar olması R2R2R^2 yüksektir (0.57 …

4
İstatistikte ben üstlenmesi gerektiğini için ortalama veya doğal logaritma ?
İstatistikleri inceliyorum ve genellikle içeren formüller ile karşılaşıyorum logve bunu standart anlamı log, yani temel 10 olarak yorumlamalıysam veya istatistiklerde sembolün log genellikle doğal log olduğu varsayılırsa her zaman kafam karışır ln. Özellikle örnek olarak Good-Turing Frekans Tahminini inceliyorum , ama sorum daha genel bir soru.

1
Gerçekten * milyon * katsayıları / bağımsız değişkenleri ile çok değişkenli regresyon analizi yapıyor muyuz?
Makine öğrenimi öğrenmek için biraz zaman harcıyorum (özyineleme için özür dilerim :) ve çok değişkenli doğrusal regresyon durumunda, regresyon katsayılarını hesaplamak için doğrudan denklem çözme üzerinde Gradient Descent'i seçme kuralının ilgisini çekemedim. Temel kural: özellik sayısı (okuma katsayıları / bağımsız değişkenler) veya bir milyonun üzerindeyse, Gradient Descent ile devam edin, …


4
Ki-Kare mesafesini kullanarak iki histogramı karşılaştırma
İki yüz görüntüsünü karşılaştırmak istiyorum. LBP-histogramlarını hesapladım. Şimdi bu iki histogramı karşılaştırmam ve bu histogramların ne kadar eşit olduğunu söyleyecek bir şey elde etmem gerekiyor (% 0 - 100). Bu görevi çözmenin birçok yolu vardır, ancak LBP yönteminin yazarları (Yerel İkili Desenlerle Yüz Tanımı: Yüz Tanıma Uygulaması. 2004) Ki-Kare mesafe …

5
Etki büyüklüğü nedir… ve neden yararlıdır?
Giriş düzeyinde lisansüstü düzeyde bir istatistik geçmişim var (lisans düzeyinde matematik istatistiklerini ve olasılığını bildiğimi varsayalım (örneğin, Wackerly ve ark., Ross'un Olasılığı) ve bazı ölçü teorisi bilgisine sahibim). Kısa süre önce eğitim istatistiklerinde deneysel tasarım ve istatistiksel raporlama yapan bir işe başladım ve temelde okullar için hesap verebilirlik metriklerini değerlendirdiğim …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.