İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Küme Analizi ve ardından Ayırım Analizi
Literatürde zaman zaman gördüğüm gibi (esas olarak zihinsel bozuklukların klinik alt tiplendirmesinde) k-ortalamaları gibi bir kümeleme algoritmasının sonuçlarında Diskriminant Analizini (DA) kullanmanın mantığı nedir? Genellikle, sınıflar arası (sınıf içinde sırasıyla) ataletin maksimizasyonunu (sırasıyla minimizasyon) destekledikleri için, küme yapımı sırasında kullanılan değişkenler üzerindeki grup farklılıklarının test edilmesi önerilmez. Bu nedenle, bireyleri …

2
Dağılımların eşitliği için ki-kare testi: kaç sıfıra tolere eder?
Her biri 21 farklı fenotipten sadece birine sahip olabilen iki mutant grubunu karşılaştırıyorum. Bu sonuçların dağılımının iki grup arasında benzer olup olmadığını görmek istiyorum. "Dağılımların eşitliği için ki-kare testi" ni hesaplayan ve bana bazı makul sonuçlar veren çevrimiçi bir test buldum . Ancak, bu tabloda birkaç sıfırım var, bu durumda …

1
R'yi C ++ diline çevir (sonunda Rcpp ile) [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Konuyla ilgili olacak şekilde soruyu güncelleyin , Çapraz Doğrulanmış için olacak . 2 yıl önce kapalı . Rcpp kullanmayı öğrenmek istiyorum . Paketin CRAN web sitesindeki dokümanlardan geçtim, ancak pratik bir örnek üzerinde çalıştığımı …
10 r  c++ 

3
Lojistik regresyonda (SPSS) ikili olmayan kategorik değişkenlerle nasıl başa çıkılır?
Bir çok bağımsız değişkenle ikili lojistik regresyon yapmak zorundayım. Bunların çoğu ikili, ancak kategorik değişkenlerin birkaçı ikiden fazla seviyeye sahip. Bu değişkenlerle baş etmenin en iyi yolu nedir? Örneğin, üç olası değere sahip bir değişken için, iki yapay değişkenin oluşturulması gerektiğini düşünüyorum. Sonra, adım adım regresyon prosedüründe, kukla değişkenlerin her …


4
QQ grafiğini niceleme
Qq-plot, benzer iki dağılımın ne kadar olduğunu görselleştirmek için kullanılabilir (örneğin, bir dağılımın normal bir dağılımla benzerliğini görselleştirmek, ancak aynı zamanda iki olasılıklı veri dağılımını karşılaştırmak için). Benzerliklerini (tercihen normalize edilmiş (0 <= x <= 1) formunda) temsil eden daha objektif, sayısal bir ölçü üreten herhangi bir istatistik var mı? …

2
İki dağılımın boyuna karşılaştırması
Altı aylık aralıklarla 2500 kişiye dört kez uygulanan kan testinin test sonuçlarım var. Sonuçlar öncelikle, biri belli tüberküloz antijenlerinin varlığında, biri yokluğunda olmak üzere iki immün yanıt ölçümünden oluşur. Şu anda, her test, antijen yanıtı ve sıfır yanıtı arasındaki farka bağlı olarak pozitif veya negatif olarak değerlendirilir (bağışıklık sisteminiz TB …


4
Bir grafikte vadiler nasıl aranır?
Temelde tamsayıların uzun bir listesi (birkaç milyon değer) olan bazı genomik kapsama verilerini inceliyorum, her biri genomdaki bu pozisyonun ne kadar iyi (veya "derin") olduğunu söylüyor. Bu verilerde "vadileri", yani çevrelerinden önemli ölçüde "daha düşük" bölgeleri aramak istiyorum. Aradığım vadilerin büyüklüğünün 50 baz ile birkaç bin arasında değişebileceğini unutmayın. Bu …


2
Çekirdek yoğunluk tahmininde çekirdek bant genişliği
Ağırlıklı noktalar ayarlanmış (yani her bir numunenin gerekli olmayan bir ağırlığı vardır), N boyutlarında bazı Çekirdek yoğunluk tahmini yapıyorum. Ayrıca, bu örnekler sadece bir metrik uzaydadır (yani, aralarındaki mesafeyi tanımlayabiliriz) ama başka bir şey değildir. Örneğin, numune noktalarının ortalamasını, standart sapmayı veya bir değişkeni diğerine göre ölçekleyemeyiz. Çekirdek sadece bu …

1
Ne tür kalıntı sonrası uyum analizi kullanıyorsunuz?
OLS çoklu lineer regresyon yaparken, kalıntıları uygun değerlere göre çizmek yerine, (dahili) Öğrencileştirilmiş kalıntıları uygun değerlere (ortak değişkenler için ditto) çizerim. Bu kalıntılar şu şekilde tanımlanır: e∗i=eis2(1−hii)−−−−−−−−−√ei∗=eis2(1−hii)\begin{equation} e^*_i = \frac{e_i}{\sqrt{s^2 (1-h_{ii})}} \end{equation} burada ve şapka matrisinin köşegen öğeleridir. Bu öğrencileştirilmiş kalıntıları R'ye almak için komutu kullanabilirsiniz .eieie_ihiihiih_{ii}rstandard Bu bağlamda insanlar …

4
Multinomiyalin asimptotik dağılımı
Multinom dağılımının d sonuçları üzerindeki sınırlayıcı dağılımını arıyorum. IE, aşağıdakilerin dağıtımı limn → ∞n- 12Xnlimn→∞n−12Xn\lim_{n\to \infty} n^{-\frac{1}{2}} \mathbf{X_n} Burada yoğunluğu olan bir vektör değeri rasgele değişkendir için şekilde , ve Diğer tüm için 0 , burada f n ( x ) x ∑ i x i =n x i ∈ …

2
CSV sütunlarını kategorik veri olarak doğrudan okumak mümkün müdür?
CSV ile gelen bir tıbbi anketten (100+ kodlu sütunlarla) verileri R ile analiz etmem gerekiyor. İlk analiz için çıngırak kullanacağım ama perde arkasında hala R var. I Eğer read.csv () dosyası, sayısal kodların kolonların sayısal veri olarak kabul edilir. Onlardan faktör () ile kategorik sütunlar oluşturabileceğimin farkındayım, ancak 100+ sütun …

5
Karekök, kütük vs. gibi yaygın olanların ötesinde başka hangi normalleştirici dönüşümler yaygın olarak kullanılır?
Test puanlarının analizinde (örneğin Eğitim veya Psikoloji), ortak analiz teknikleri genellikle verilerin normal olarak dağıtıldığını varsayar. Bununla birlikte, belki de çoğu zaman, puanlar bazen çılgınca normalden sapma eğilimindedir. Bazı temel normalleştirici dönüşümlere aşinayım: kare kökler, logaritmalar, pozitif eğriltmeyi azaltmak için karşılıklı dönüşümler, negatif eğriliği azaltmak için yukarıdakilerin yansıtılmış versiyonları, leptokurtik …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.