İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
Destek vektör makineleri için öğrenme parametrelerini seçme bağlamında çapraz doğrulama nasıl uygun şekilde uygulanır?
Harika libsvm paketi, sınıflandırıcının doğruluğunu en üst düzeye çıkaran öğrenme parametrelerini (maliyet ve gama) otomatik olarak arayan bir python arayüzü ve "easy.py" dosyası sağlar. Belirli bir öğrenme parametresi seti içinde, doğruluk çapraz doğrulama ile işlevselleştirilir, ancak bunun çapraz doğrulama amacını baltaladığını hissediyorum. Yani, öğrenme parametrelerinin kendileri, verilerin aşırı uyumuna neden …

4
Meta-analizde toplanan tek oranlar için güven aralıkları nasıl hesaplanır?
Genom çapında ilişki çalışmalarından iki veri setim var. Mevcut tek bilgi, her genotipli SNP için tek oranlar ve bunların güven aralıklarıdır (% 95). Bu iki olasılık oranını karşılaştıran bir orman grafiği oluşturmak istiyorum, ancak özet efektleri görselleştirmek için birleşik güven aralıklarını hesaplamanın yolunu bulamıyorum. PLINK programını sabit efektler kullanarak meta-analiz …

1
İki glm modelini R'de birleştirmenin kolay bir yolu var mı?
R'de yapılmış iki lojistik regresyon modelim var glm(). Her ikisi de aynı değişkenleri kullanır, ancak bir matrisin farklı alt kümeleri kullanılarak yapılmıştır. Katsayıların ortalamalarını veren ortalama bir model elde etmenin ve bunu predict () fonksiyonuyla kullanmanın kolay bir yolu var mı? [bu tür bir sorunun bir programlama sitesine gönderilmesi gerekiyorsa …


3
Wilcoxon testi yapmadan önce titreşmek yanlış mı?
Ben bir komut dosyası kullanarak verileri test yazdı wilcox.test, ama sonuçları aldığımda, tüm p-değerleri nerede 1 eşittir. Bazı web sitelerinde veri test etmeden önce jitter kullanabileceğiniz okudum (dedikleri gibi bağları önlemek için), Bunu yaptım ve şimdi kabul edilebilir bir sonucum var. Bunu yapmak yanlış mı? test<- function(column,datacol){ library(ggplot2) t=read.table("data.txt", stringsAsFactors=FALSE) …
9 r  nonparametric  ties 

1
Bu tür önyükleme için bir ad var mı?
Her biri iki koşulda birden çok kez ölçülen birden fazla insan katılımcıyla bir deney yapmayı düşünün. Karışık efektler modeli ( lme4 sözdizimi kullanılarak) şu şekilde formüle edilebilir: fit = lmer( formula = measure ~ (1|participant) + condition ) Şimdi, bu modelin tahminleri için önyüklenmiş güven aralıkları oluşturmak istediğimi varsayalım. Bence …

1
Sıklığı büyük ölçüde farklılık gösteren nokta süreçleri için kuadratlar nasıl oluşturulur?
Daha sonra bazı boyutsal küçültme tekniklerini uygulamak için birkaç nokta işleminde (veya bir işaretli nokta işleminde) kuadrat sayımı analizi yapmak istiyorum. İşaretler aynı şekilde dağılmaz, yani bazı işaretler oldukça sık görülür ve bazıları oldukça nadirdir. Bu nedenle, 2B alanımı normal bir ızgarada bölemiyorum, çünkü daha sık işaretler, daha az sık …

3
Spearman veya Pearson'un doğrusallık ve homoscedastisitenin ihlal edilebileceği Likert ölçekleriyle ilişkisi
Likert ölçeklerinin kullanıldığı bir dizi ölçümde korelasyon yapmak istiyorum. Dağılım grafiklerine bakıldığında, doğrusallık ve homoscedastisite varsayımlarının ihlal edilmiş olduğu anlaşılmaktadır. Sıra seviye düzeyine yaklaşan sıra seviyeli derecelendirme hakkında bazı tartışmalar olduğu göz önüne alındığında, onu güvenli oynamalı ve Pearson'un r yerine Spearman Rho'yu kullanmalı mıyım? Spearman'ın Rho'yla gidersem alıntı yapabileceğim …

1
Ayrık fonksiyonlar: Güven aralığı kapsamı?
Kesikli aralık kapsamı nasıl hesaplanır? Ne yapacağımı bildiğim: Sürekli bir modelim olsaydı, tahmin edilen değerlerimin her biri için% 95'lik bir güven aralığı tanımlayabilirim ve sonra gerçek değerlerin güven aralığında ne sıklıkta olduğunu görebilirim. Zamanın sadece% 88'inin% 95 güven aralığımın gerçek değerleri kapsadığını görebilirim. Nasıl yapılacağını bilmiyorum: Bunu poisson veya gamma-poisson …

4
İstatistikçiler için sayısal optimizasyon referansları
İstatistikçilere yönelik sayısal optimizasyon tekniklerine sağlam bir referans (veya referanslar) arıyorum, yani bazı standart çıkarımsal sorunlara (örneğin ortak modellerde MAP / MLE) bu yöntemleri uygulayacağım. Degrade iniş (düz ve stokastik), EM ve spinoffları / genellemeleri, benzetilmiş tavlama vb. Uygulama hakkında bazı pratik notlar olacağını umuyorum (bu yüzden sıklıkla gazetelerde eksik). …

4
Standart hata ne için kullanılır?
Bulduğum bir öğretici kullanıyorum ve verilerimi göstermek için standart hatalarla birlikte ortalama değerler çiziyorum. Ama sonuçları tartışırken sorun yaşıyorum. Grafiğim aşağıda gösterildiği gibidir: standart hatalardan bazıları (hata çubuğu olarak gösterilir) çok değişir ve bazıları sıfıra çok yakındır.

3
Özellik seçimi için medyan cila kullanımı
Son zamanlarda okuduğum bir makalede veri analizi bölümünde şu bitle karşılaştım: Veri tablosu daha sonra dokulara ve hücre çizgilerine ayrıldı ve iki alt tablo, tek bir tablo haline getirilmeden önce ayrı olarak medyanla parlatıldı (satırlar ve sütunlar, medyan 0 olacak şekilde tekrar tekrar ayarlandı). Sonunda, test edilen örneklerin en az …

2
Farklı etkinlik türleri arasındaki ilişkiler (2B konumlarıyla tanımlanır) nasıl bulunur?
Aynı zaman diliminde gerçekleşen bir veri kümesi var. Her etkinliğin bir türü (ondan az olan birkaç farklı tür vardır) ve 2B nokta olarak gösterilen bir konumu vardır. Olay türleri arasında ya da türü ve konumu arasında herhangi bir korelasyon olup olmadığını kontrol etmek istiyorum. Örneğin, belki A tipi olaylar genellikle …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.