İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Neredeyse ilişkisiz olan yüksek korelasyonlu değişkenlerin toplamı ve farkı için referans
Yazdığım bir makalede , ve yüksek derecede korelasyonlu ve eşit varyansa sahip oldukları zaman (uygulamamda olduğu gibi) ortaya çıkan problemleri etkili bir şekilde gidermek için ve yerine rastgele ve değişkenlerini . Hakemler referans vermemi istiyor. Kolayca kanıtlayabilirim, ancak bir uygulama günlüğü olarak basit bir matematiksel türetmeye başvurmayı tercih ederler.X - …

2
Wilcoxon imzalı rütbe testinin uygunluğu
Çapraz Onaylı arşivlerde biraz dolaştım ve soruma cevap bulamadım. Sorum şu: Vikipedi Wilcoxon imzalı rütbe testi (sorularım için biraz değiştirildi) için tutulması gereken üç varsayım sunuyor: İ = 1, ..., n için Zi = Xi-Yi olsun. Zi farklılıklarının bağımsız olduğu varsayılmaktadır. (a.) Her bir Zi aynı sürekli popülasyondan gelir ve …

2
Zar atışlarını etkileyebileceğini söyleyen bir psişik için bir test tasarlama
Diyelim ki aklını kullanarak zar atışını kontrol edebileceğini söyleyen bir arkadaşım var (ona "George" diyelim) (yani, zarların düşündüğü belirli bir sayıya düşme olasılığını artırın). Bunu gerçekten yapıp yapamayacağını belirlemek için bilimsel olarak titiz bir test nasıl tasarlayabilirim ? (Elbette yapabileceğini gerçekten sanmıyorum, ama test başlamadan önce şaşırtıcı Randi tarzı bir …

2
Boyuna veriler arasında gruplar (yörüngeler) nasıl bulunur?
bağlam Soruyu biraz genişletmeden önce sahneyi ayarlamak istiyorum. Boylamsal verilerim var, yaklaşık 3 ayda bir deneklerde yapılan ölçümler, birincil sonuç 5 (14) aralığında sayısal (sürekli 1dp'de olduğu gibi), toplu (tüm veri noktalarının) 7 ile 10 arasında. spagetti arsa (x ekseni üzerinde yaş ve her kişi için bir çizgi ile)> 1500 …

5
Örneğimde “sol göz” ve “sağ göz” yi iki farklı konu olarak kullanabilir miyim?
Verilerim aşağıdaki gibidir. İki hasta grubum var. Her gruptaki hastalar farklı tipte bir göz ameliyatı geçirdi. Her gruptaki hastalarda 5 değişken ölçüldü. Bu değişkenleri bir permütasyon testi veya MANOVA kullanarak karşılaştırmak istiyorum. Ameliyatın yapıldığı göz analizde gerçekten önemli değil. Bununla birlikte, örneğin A grubundaki Hasta 2, her iki göze de …
11 sampling 

1
Verilerin sürekli bir dağıtımdan en uygun şekilde ayrıştırılmasını belirleme
üzerinde desteklenen yoğunluğuna sahip sürekli bir dağıtımdan veri olduğunu varsayalım , ancak oldukça büyük olduğundan çekirdek yoğunluğu (örneğin) tahmin, oldukça doğrudur. Belirli bir uygulama için, gözlenen kütle fonksiyonu olan yeni bir veri kümesi elde etmek için gözlenen verileri sınırlı sayıda kategoriye dönüştürmem gerekiyor .Y1,...,YnY1,...,YnY_{1}, ..., Y_{n}p(y)p(y)p(y)[0,1][0,1][0,1]nnnp^(y)p^(y)\hat{p}(y)Z1,...,ZnZ1,...,ZnZ_{1}, ..., Z_{n}g(z)g(z)g(z) olduğunda basit …


1
Python'da bir scree arsa nasıl çizilir? [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. Geçen yıl kapalı . Bir matris üzerinde tekil vektör ayrışımı kullanıyorum ve U, S ve Vt matrislerini elde ediyorum. Bu noktada, elde edilecek boyutların sayısı …

2
Ki-kare değişkenlerin sonsuz koleksiyonunun düzen istatistikleri (örneğin, minimum)?
Bu benim ilk defa burada, bu yüzden sorumu herhangi bir şekilde açıklığa kavuşturabilir miyim lütfen (biçimlendirme, etiketler vb. Dahil). (Ve umarım daha sonra düzenleyebilirim!) Referanslar bulmaya çalıştım ve indüksiyon kullanarak kendimi çözmeye çalıştım, ancak her ikisinde de başarısız oldum. Ben farklı serbestlik dereceleri ile bağımsız rasgele değişkenler sayılabilecek kadar sonsuz …

4
K-araçlarında optimal k'nin olmadığı durumlar var mı?
Bu en azından birkaç saattir aklımda. Ben k-ortalamalar algoritmasından ( kosinüs benzerlik metriği ile ) çıktı için optimal bir k bulmaya çalışıyordum, bu yüzden çarpıklığı kümelerin sayısının bir fonksiyonu olarak çizdim. Veri setim, 600 boyutlu bir alanda 800 belgeden oluşan bir koleksiyon. Anladığım kadarıyla, bu eğri üzerindeki diz noktasını veya …

1
Artıkları karışık efektler modelinden önyüklemek neden anti-muhafazakar güven aralıkları veriyor?
Tipik olarak, birden fazla bireyin her biri 2 veya daha fazla koşulda birden çok kez ölçüldüğü verilerle ilgilenirim. Son zamanlarda, koşullar arasındaki farklılıklar için kanıtları değerlendirmek için karışık efekt modelleme ile, individualrastgele bir etki olarak modelleme ile oynuyorum . Böyle bir modellemeden tahminlerle ilgili belirsizliği görselleştirmek için, bootstrap'i her bir …

5
Nominal / dairesel değişkenler için SOM kümelemesi
Nominal girdileri kümelemeye aşina olup olmadığını merak etmek. SOM'a bir çözüm olarak bakıyordum ama görünüşe göre sadece sayısal özelliklerle çalışıyor. Kategorik özellikler için herhangi bir uzantı var mı? Özellikle 'Haftanın Günleri'ni olası bir özellik olarak merak ediyordum. Tabii ki bunu sayısal bir özelliğe dönüştürmek mümkündür (yani Mon - Sun, 1-7 …

2
Bir sınıflandırma ağacını (rpart'ta) bir dizi kural halinde düzenlemek mi?
Her sınıf için üretilen karar kurallarını düzenlemek için rpart (R'de) kullanılarak karmaşık bir sınıflandırma ağacının inşa edilmesinin bir yolu var mı? Yani büyük bir ağaç almak yerine, sınıfların her biri için bir dizi kuralımız var mı? (Öyleyse nasıl?) Aşağıda örnekleri göstermek için basit bir kod örneği verilmiştir: fit <- rpart(Kyphosis …
11 r  classification  cart  rpart 

3
Ggplot2 kullanarak QQ grafiğiyle iki veri kümesini nasıl karşılaştırabilirim?
Hem istatistik hem de R acemi olarak, 1: 1 en boy oranına sahip qqplotlar oluşturmaya çalışırken gerçekten zor bir zaman geçirdim. ggplot2, çizim üzerinde varsayılan R çizim paketlerinden çok daha fazla kontrol sunuyor gibi görünüyor, ancak ggplot2'de iki veri kümesini karşılaştırmak için nasıl qqplot yapılacağını göremiyorum. Benim sorum, ggplot2 eşdeğeri …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.