İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Egzersiz verilerinde eşit olmayan grup boyutlarına sahip SVM
Bir grubun diğerinden daha fazla temsil edildiği eğitim verilerinden bir SVM oluşturmaya çalışıyorum. Ancak, gruplar nihai test verilerinde eşit olarak temsil edilecektir. Bu nedenle, iki paketin eğitim verilerindeki etkisini dengelemek için R paketi arabiriminin class.weightsparametresini kullanmak istiyorum .e1071libsvm Bu ağırlıkların tam olarak nasıl belirlenmesi gerektiğinden emin olmadığım için küçük bir …

2
R'de Monte Carlo simülasyonunu kullanarak integralleri yaklaşma
MC simülasyonunu kullanarak aşağıdaki integrali nasıl yaklaştırabilirim? ∫1−1∫1−1|x−y|dxdy∫−11∫−11|x−y|dxdy \int_{-1}^{1} \int_{-1}^{1} |x-y| \,\mathrm{d}x \,\mathrm{d}y Teşekkürler! Düzenleme (Bazı bağlamlar): Simülasyonun integralleri yaklaşık olarak nasıl kullanacağımı öğrenmeye çalışıyorum ve bazı zorluklarla karşılaştığımda bazı alıştırmalar yapıyorum. Edit 2 + 3 : Bir şekilde kafam karıştı ve integrali ayrı parçalara bölmem gerektiğini düşündüm. Yani, aslında …

2
Sayım verilerinin varyansının parametrik modellenmesi
Bazı verileri modellemek istiyorum, ancak ne tür bir model kullanabileceğimden emin değilim. Sayım verilerim var ve verilerin ortalaması ve varyansı için parametrik tahminler verecek bir model istiyorum. Yani, çeşitli tahmin faktörlerim var ve bunlardan herhangi birinin varyansı etkileyip etkilemediğini belirlemek istiyorum (sadece grup ortalamasını değil). Poisson regresyonunun işe yaramayacağını biliyorum, …

4
İstatistikçilere danışanlara danışmak için referanslar
Bu soru , Wikipedia gibi zayıf gelişmiş kaynaklar karşısında istatistiklerde ve olasılıkta kendi başına uzmanlaşmanın zorluğunu göstermektedir. Bana danışmanlık istatistiklerinin geldiğini ve burada birkaçının rutin olarak belirli kavramları ve yöntemleri bir müşteriye açıklama zorluğu ile karşı karşıya kalabileceği ortaya çıktı. Bu pedagojik madalyonun kapak tarafı. Bir kişi bu kavram üzerinde …

3
Read.csv ile üç sütundan yalnızca ikisini okuma
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. Üç sütundan oluşan bir ascii veri kümem var, ancak yalnızca son ikisi gerçek verilerdir. Şimdi kullanarak bir nokta grafiği oluşturmak istiyorum read.csv(file = "result1", sep= " "). …
12 r 

2
Doğrusal regresyonda t-testi ve ANOVA arasındaki fark
Acaba lineer regresyonda t-testi ile ANOVA arasındaki farklar nelerdir? Eğim ve kesişimden herhangi birinin ortalama sıfır olup olmadığını test etmek için bir t testi, ANOVA ise tüm eğimlerin ortalama sıfır olup olmadığını test etmek için mi? Aralarındaki tek fark bu mu? Basit doğrusal regresyonda, yani sadece bir tahmin değişkeni olduğunda, …

4
İstatistiksel araçların uygunsuz kullanımından kaynaklanan maliyetli sonuçlara örnekler
İstatistiksel araç kullanıcılarının çoğunun yardımcı kullanıcılar olduğundan şüpheleniyorum (istatistik konusunda çok az resmi eğitim almış veya hiç eğitim almamış kişiler). Araştırmacıların ve diğer profesyonellerin, sadece hakemli dergilerde, gri literatürde, web'de veya bir konferansta “daha ​​önce yapıldığını” gördükleri için istatistik yöntemlerini uygulamalarına çok cazip geliyor. Bununla birlikte, gerekli varsayımları ve istatistiksel …

5
Küme analizi için değişken seçimi yapmak için PCA kullanabilir miyim?
Bir küme analizi yapabilmek için değişken sayısını azaltmalıyım. Değişkenlerim güçlü bir şekilde ilişkilidir, bu yüzden bir Faktör Analizi PCA (temel bileşen analizi) yapmayı düşündüm . Ancak, elde edilen puanları kullanırsam, kümelerim tam olarak doğru değildir (literatürdeki önceki sınıflandırmalara kıyasla). Soru: Her bileşen / faktör için en büyük yüke sahip değişkenleri …

4
Binom dağılımı için tahminci
Binom dağılımından gelen veriler için bir tahminci nasıl tanımlarız? Bernoulli için p parametresini tahmin eden bir tahminci düşünebilirim, ancak binom için dağılımı n karakterize ettiğimizde hangi parametrelerin tahmin edileceğini göremiyorum? Güncelleme: Bir tahminci ile, gözlemlenen verilerin bir fonksiyonunu kastediyorum. Verileri oluşturan dağılımın parametrelerini tahmin etmek için bir tahminci kullanılır.

4
İkili zaman serilerini tahmin etme
Araba hareket etmiyorken 1, araba hareket ettiğinde 0 olan bir ikili zaman serim var. 36 saat ileri ve her saat için bir zaman ufku tahmin etmek istiyorum. İlk yaklaşımım şu girişleri kullanarak bir Naive Bayes kullanmaktı: t-24 (günlük mevsimsel), t-48 (haftalık mevsimsel), günün saati. Ancak, sonuçlar çok iyi değil. Bu …


2
R'deki bir grafiğe birden çok barplot çizme [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 4 yıl önce kapalı . R'de tek bir grafik üzerinde dört barplot çizmek istiyorum. Aşağıdaki kodu kullandım. Burada, bir efsaneyi grafiğin üstünde nasıl tutabilir, özellikle …

1
Bağımlı gözlemlerde önyükleme yoluyla güven aralıklarının hesaplanması
Bootstrap, standart formunda, gözlemlerin geçerli olması koşuluyla tahmini istatistiklerin güven aralıklarını hesaplamak için kullanılabilir. I. Visser ve diğ. " Gizli Markov Model Parametreleri için Güven Aralıkları " nda, HMM parametreleri için CI'leri hesaplamak için bir parametrik önyükleme kullandı. Bununla birlikte, bir gözlem sekansına bir HMM taktığımızda, gözlemlerin zaten bağımlı olduğunu …

2
Otomobil kullanarak tekrarlanan ölçümler ANOVA için belirli kontrastlar nasıl belirlenir?
Bu veri kümesinde bazı belirli zıtlıklar ardından R tekrarlanan önlemler Anova çalıştırmak için çalışıyorum. Bence doğru yaklaşım Anova()araç paketinden kullanmak olacaktır . Verilerimi verileri ?Anovakullanarak alınan örnekle OBrienKaiseraçıklayalım (Not: Örnekte cinsiyet faktörünü göz ardı ettim): Denekler faktörü, tedavi (3 seviye: kontrol, A, B) ve tekrarlanan 2 arasında bir tasarıma sahibiz …

1
Ağırlıklı bir örnek üzerinde kantilleri tanımlama
Kuantilleri hesaplamak istediğim ağırlıklı bir örneğim var. 1 İdeal olarak, ağırlıkların eşit olduğu durumlarda (= 1 veya başka türlü olsun), sonuçlar scipy.stats.scoreatpercentile()ve R'lerinkiyle tutarlı olacaktır quantile(...,type=7). Basit bir yaklaşım, verilen ağırlıkları kullanarak numuneyi "çoğaltmak" olacaktır. Bu, ağırlık> 1 olan bölgelerde etkili bir şekilde yerel olarak "düz" bir ecdf verir; bu, …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.