İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Bu, l'de lme4 ile karışık etki modellerini analiz etmek için kabul edilebilir bir yol mu?
Analiz etmek için ayarlanmış bir dengesiz tekrarlanan ölçüm verilerim var ve çoğu istatistiksel paketin ANOVA (yani tip III karelerin toplamı) ile bu şekilde işlemesinin yanlış olduğunu okudum. Bu nedenle, bu verileri analiz etmek için karışık efektler modeli kullanmak istiyorum. Karışık modeller hakkında çok şey okudum R, ancak hala çok yeni …

2
McNemar'ın testi ve koşullu lojistik regresyon arasındaki ilişki
Eşleştirilmiş gözlemlerde ikili yanıt verilerinin modellenmesi ile ilgileniyorum. Bir gruba post-post müdahalenin etkinliği hakkında çıkarımda bulunmayı, çeşitli ortak değişkenler için potansiyel olarak ayarlama yapmayı ve müdahalenin bir parçası olarak özellikle farklı eğitim alan bir grup tarafından etki modifikasyonu olup olmadığını belirlemeyi amaçlıyoruz. Aşağıdaki formdaki veriler: id phase resp 1 pre …

5
İlişkili normal olmayan veri üretme yöntemi
İlişkili, normal olmayan veriler üretmek için bir yöntem bulmakla ilgileniyorum. İdeal olarak, bir kovaryans (veya korelasyon) matrisini parametre olarak alan ve ona yaklaşan veriler üreten bir çeşit dağıtım. Ama işte yakalama: bulmaya çalıştığım yöntem, çok değişkenli çarpıklığını ve / veya basıklığını kontrol etme esnekliğine sahip olmalıdır. Fleishman'ın yöntemini ve normal …

2
Kademeli regresyon, nüfusun r-karesi hakkında önyargılı bir tahmin sağlıyor mu?
Psikoloji ve diğer alanlarda genellikle aşağıdakileri içeren bir tür kademeli regresyon kullanılır: Kalan yordayıcılara bakın (ilk başta modelde hiçbiri yoktur) ve en büyük r-kare değişikliğine neden olan yordayıcıyı tanımlayın; R-kare değişikliğinin p-değeri alfadan (tipik olarak .05) düşükse, o zaman kestiriciyi ekleyin ve 1. adıma geri dönün, aksi takdirde durun. Örneğin, …

5
KNN imputation R paketleri
Bir KNN dürtü paketi arıyorum. Ben imputation paketi bakıyordum ( http://cran.r-project.org/web/packages/imputation/imputation.pdf ) ama nedense KNN impute işlevi (açıklamadaki örneği takip ederken bile) sadece görünüyor sıfır değerleri impute etmek için (aşağıdaki gibi). Etrafa bakıyordum ama henüz bir şey bulamıyorum ve bu yüzden iyi KNN imputasyon paketleri için başka önerileri olup olmadığını …

2
Normal dağılımın belirli bir değeri için neden olasılık sıfırdır?
Normal dağılımda olasılığının sıfıra eşit olduğunu fark ettim , Poisson dağılımı için c negatif olmayan bir tamsayı olduğunda sıfır olmayacaktır .P(x=c)P(x=c)P(x=c)ccc Benim sorum: Normal dağılımdaki herhangi bir sabitin olasılığı sıfıra eşit midir, çünkü herhangi bir eğrinin altındaki alanı temsil eder mi? Yoksa ezberlemek sadece bir kuraldır?

6
10 kat çapraz doğrulama yapmak için bir veri kümesini bölme
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. Şimdi bir Rveri çerçevem ​​(eğitim) var, kimse bana bu veri kümesini 10 kat çapraz doğrulama yapmak için rasgele bölmeyi söyleyebilir mi?

1
Confounder - tanım
Çok değişkenli analiz kitabında M. Katz'a göre (Bölüm 1.2, sayfa 6), “ Bir karıştırıcı risk faktörü ile ilişkilidir ve sonuçla nedensel olarak ilişkilidir ” . Karıştırıcı neden nedensel olarak sonuçla ilgili olmalıdır ? Karışıklığın sonuçla ilişkilendirilmesi yeterli olur mu?


3
Medyanın standart hatası
Normal olmayan bir dağılıma sahip küçük bir örnek durumunda (python kullanıyorum) medyanın standart hatasını ölçmek istiyorsam aşağıdaki formül doğru mu? sigma=np.std(data) n=len(data) sigma_median=1.253*sigma/np.sqrt(n)

3
Neden diğer algoritmalar yerine k-araçlarını kullanıyoruz?
K-ortalamaları hakkında araştırma yaptım ve bunlar var: k-means bilinen kümelenme sorunlarını çözmek için denetimsiz öğrenme yöntemini kullanan en basit algoritmalardan biridir. Büyük veri kümeleriyle gerçekten iyi çalışır. Bununla birlikte, K-Ortalamalarının dezavantajları vardır: Aykırı değerlere ve gürültüye karşı güçlü hassasiyet Dairesel olmayan küme şekliyle iyi çalışmaz - küme sayısı ve başlangıç …

4
R'de brant testi [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Soruyu , Çapraz Doğrulanmış için konuyla ilgili olacak şekilde güncelleyin . 7 ay önce kapalı . Sıralı lojistik regresyondaki paralel regresyon varsayımını test ederken birkaç yaklaşım olduğunu düşünüyorum. Ben grafiksel bir yaklaşım hem kullandım …


1
R kare nüfusunun tarafsız bir tahmini nedir?
Ben çoklu doğrusal regresyon tarafsız bir tahmin elde ilgileniyorum .R,2R2R^2 Yansıtma üzerine, tarafsız bir tahminin eşleşmeye çalıştığı iki farklı değer düşünebilirim .R,2R2R^2 Örnek : örnektenR,2R2R^2β elde edilen regresyon denkleminin (yani ) numunenin dışında sonsuz miktarda veriye, ancak aynı verilerden uygulanması durumunda elde edilecek r-karesi üretim süreci.β^β^\hat{\beta} Nüfus :R,2R2R^2 β Sonsuz …

3
Tahmin
Aşağıdaki gibi teorik bir ekonomik modelim var, y= a + b1x1+ b2x2+ b3x3+ uy=a+b1x1+b2x2+b3x3+u y = a + b_1x_1 + b_2x_2 + b_3x_3 + u Teori olduğunu söylüyor Yani , ve faktörleri tahmin etmek .x 2 x 3 yx1x1x_1x2x2x_2x3x3x_3yyy Şimdi gerçek verilerim var ve , , tahmin . Sorun, gerçek …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.