İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
R fonksiyonları 'princomp' ve 'prcomp' neden farklı özdeğerler veriyor?
Bunu yeniden üretmek için dekatlon veri kümesini {FactoMineR} kullanabilirsiniz. Soru, hesaplanan özdeğerlerin kovaryans matrisininkinden farklı olmasının nedenidir. İşte kullanarak özdeğerler princomp: > library(FactoMineR);data(decathlon) > pr <- princomp(decathlon[1:10], cor=F) > pr$sd^2 Comp.1 Comp.2 Comp.3 Comp.4 Comp.5 Comp.6 1.348073e+02 2.293556e+01 9.747263e+00 1.117215e+00 3.477705e-01 1.326819e-01 Comp.7 Comp.8 Comp.9 Comp.10 6.208630e-02 4.938498e-02 2.504308e-02 4.908785e-03 …
22 r  pca 




2
Bir olasılık ve istatistik geliştirmek için öneriler
Bağlam: Olasılık teorisi ve statikinde karşılaştığım merkez parçalarını yapılandırmak için matematiksel temellere odaklanan bir referans belgesi oluşturdum ( burada bulunabilir ). Bu dokümanı paylaşarak, istatistik öğrencilerine bu konularda lisansüstü derslerde öğretilen temel materyallerin kapsamlı bir özetini vermeyi umuyorum. Çoğunlukla bir öğretim kaynağı olarak düşünülmekle birlikte, halk da bunu, örneğin ortak …
22 teaching 


5
Normal olmayan dağıtılmış bir DV için ANOVA sonuçlarına güvenebilir miyim?
Bir deneyi tekrarlanan ölçümlerle ANOVA ile analiz ettim. ANOVA, 2 denek-denek faktörü içeren 3'lü (N = 189) 3x2x2x2x3'tür. Hata oranı bağımlı değişkendir. Hata oranlarının dağılımı 3.64 bükülme ve 15.75 kurtosis vardır. Çarpıklık ve kurtosis, hata oranının% 90'ının sonucudur. Normalde dağıtılmayan verileriniz varsa, mümkünse dönüştürmenin sizin yararınıza olduğunu düşündüm, ancak çoğu …

2
Markov Süreci sadece önceki durumuna bağlı olarak
Sadece birinin anlamamı onaylamasını istiyorum veya bir şeyleri özlüyorum. Markov sürecinin tanımı, bir sonraki adımın sadece mevcut duruma bağlı olduğunu ve geçmişteki durumların olmadığını söylüyor. Öyleyse, a, b, c, d durumlarına sahip olduğumuzu ve a-> b-> c-> d'den gideceğimizi varsayalım. Bu, d'ye geçişin yalnızca c olduğumuz gerçeğine bağlı olabileceği anlamına …

6
Grafik teorisi - analiz ve görselleştirme
Konunun CrossValidated faizine girdiğinden emin değilim. Bana söyleyeceksin. Bir grafiği incelemeliyim ( grafik teorisinden ). Bağlanan belli sayıda nokta var. Her birinin bağlı olduğu tüm noktalar ve noktalar içeren bir masam var. (Ayrıca sonuçları olan başka bir tablom var) Sorum şu: Kolayca çalışmak için iyi bir yazılım (veya bir R …

3
Çoklu sansürlü veriler için kovaryans matrisinin kısaltılmamış tahmini
Çevresel numunelerin kimyasal analizleri genellikle raporlama limitlerinde veya çeşitli tespit / ölçüm limitlerinde aşağıda sansürlenir. Sonuncusu, genellikle diğer değişkenlerin değerleriyle orantılı olarak değişebilir. Örneğin, yüksek konsantrasyonda bir bileşik içeren bir numunenin analiz için seyreltilmesi gerekebilir, bu durumda aynı numunede aynı anda analiz edilen tüm diğer bileşikler için sansür limitlerinin orantılı …

1
Benjamini-Hochberg, p-değerleri veya q-değerleri ile çoklu hipotez testi düzeltmesi?
Artan sıraya göre sıralanan bağımsız testlerden elde edilen p değerlerinin bir listesi göz önüne alındığında, birden fazla test düzeltmesi için Benjamini-Hochberg prosedürü kullanılabilir . Her p değeri için, Benjamini-Hochberg prosedürü, her p değeri için Yanlış Keşif Oranını (FDR) hesaplamanıza izin verir. Yani, sıralanan p-değerleri listesindeki her "pozisyonda", bunların ne kadarının …

6
Beş noktadan oluşan grup farkları
İtibaren ardından bu soruya : Bir 5'li Likert öğe üzerinde iki grup (örneğin, erkek ve kadın) arasındaki merkezi eğilim farklılıkları için teste istediğiniz düşünün (örn, yaşam doyum: Memnun etmek Memnun). Bir t-testinin çoğu amaç için yeterince doğru olacağını düşünüyorum, ancak grup araçları arasındaki farkların önyükleme testinin genellikle güven aralıklarının daha …

9
Ping yanıtı sürelerinde bu verileri nasıl bir dağılım gösterdiğini nasıl bulabilirim?
Ağ ping sürelerini gerçek bir dünya sürecinden örnekledim. "Gidiş-dönüş süresi" milisaniye cinsinden ölçülür. Sonuçlar bir histogramda çizilmiştir: Ping süreleri minimum bir değere sahiptir, ancak uzun bir üst kuyruk. Bunun ne kadar istatistiksel dağılım olduğunu ve parametrelerinin nasıl tahmin edileceğini bilmek istiyorum. Dağılım normal bir dağılım olmasa da, ne elde etmeye …



Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.