İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
1D verilerini kümeleme
Ben bir veri kümesi var, ben sadece bir değişkene dayalı veri üzerinde kümeler oluşturmak istiyorum (eksik değer yok). Bu tek değişkene dayalı 3 küme oluşturmak istiyorum. Hangi kümeleme algoritması kullanılacak, k-araçları, EM, DBSCAN vb. Benim asıl sorum şu durumlarda EM-k yerine EM-k'yi veya k-ortalamaları yerine EM'yi ne şekilde kullanmalıyım?
16 clustering 

11
R ile başlamanın ve öğrenmenin yolu?
"Kendi başıma gitmek" için birkaç kez denedim - ama sınırlı bir başarı ile. Sıradan bir SPSS kullanıcısıyım ve bazı SAS deneyimim var. Benzer arka planı olan ve şimdi R kullanan birinden bir veya iki işaretçiyi takdir ediyorum.
16 r  references 

1
İki ampirik dağılımı karşılaştırmak için Kolmogorov-Smirnov'u kullanabilir miyim?
Bir ampirik dağılımı önceden belirlenmiş bir referans dağılımı ile karşılaştırmak yerine, aynı temel dağılımdan gelip gelmediklerini belirlemek için iki ampirik dağılımı karşılaştırmak için Kolmogorov-Smirnov uygunluk testini kullanmak uygun mudur? Bunu başka bir şekilde sormaya çalışayım. Bir yerde bazı dağıtımlardan N numune topluyorum. M örneklerini başka bir yerde topluyorum. Veriler süreklidir …

2
Boyutsal azaltmayı ne zaman kümeleme ile birleştiriyoruz?
Belge düzeyinde kümeleme yapmaya çalışıyorum. Doküman terim frekans matrisini oluşturdum ve bu yüksek boyutlu vektörleri k-araçları kullanarak kümelemeye çalışıyorum. Doğrudan kümeleme yerine, U, S, Vt matrislerini elde etmek için LSA'nın (Latent Semantic Analysis) tekil vektör ayrışmasını uygulamak, dağlama grafiğini kullanarak uygun bir eşik seçti ve indirgenmiş matrislere kümeleme uygulandı (özellikle …

1
Özel bir dağıtımdan rastgele örnekler oluşturma
R kullanarak özel bir pdf rastgele örnekleri oluşturmaya çalışıyorum. Benim pdf: fX( x ) = 32( 1 - x2) , 0 ≤ x ≤ 1fX(x)=32(1-x2),0≤x≤1f_{X}(x) = \frac{3}{2} (1-x^2), 0 \le x \le 1 Tek tip örnekler ürettim ve sonra özel dağıtımıma dönüştürmeye çalıştım. Bunu dağıtımımın ( ) bularak ve tek …
16 r  sampling  uniform 

2
'Havuz verilerinin' tam olarak anlamı nedir?
Ben 'veri havuzu' basitçe daha önce kategorilere ayrılmış veri birleştirmek anlamına düşündüm ... temelde, kategorileri görmezden ve veri kümesi dev bir veri havuzu 'yapmak. Sanırım bu, istatistiklerin uygulanmasından ziyade terminoloji hakkında bir soru. Örneğin: 2 siteyi karşılaştırmak istiyorum ve her site içinde iki yıllık tipim var (iyi ve kötü). 2 …


2
R kullanarak “paralel kümeler” grafiği oluşturmak mümkün müdür?
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. Tormod sorusu ( burada yayınlanan ) sayesinde Paralel Kümeler grafiğine rastladım . İşte nasıl göründüğüne bir örnek: (Titanik veri kümesinin bir görselleştirmesidir. Örneğin, hayatta kalamayan kadınların çoğunun …

2
Bir anketin güvenilirliğini değerlendirme: boyutsallık, sorunlu öğeler ve alfa, lambda6 veya başka bir indeks kullanıp kullanmayacağınız?
Bir deneye katılan katılımcılar tarafından verilen puanları analiz ediyorum. Katılımcıların bir ürüne karşı tutumunu tahmin etmeyi amaçlayan 6 maddeden oluşan anketimin güvenilirliğini tahmin etmek istiyorum. Tüm maddelere tek bir ölçek gibi davranarak (alfa yaklaşık 0.6 idi) ve her seferinde bir öğeyi sildiğimde (maks alfa yaklaşık 0.72 idi) Cronbach alfa hesapladım. …

2
Panel / boyuna verilerle verilerinizi bir gerilemede standartlaştırmak iyi bir uygulama mı?
Genel olarak, katsayıları düzgün bir şekilde karşılaştırmak için bağımsız değişkenlerimi regresyonlarda standardize ederim (bu şekilde aynı birimlere sahip olurlar: standart sapmalar). Ancak, panel / boyuna verilerle, özellikle hiyerarşik bir model tahmin edersem verilerimi nasıl standartlaştırmam gerektiğinden emin değilim. Neden potansiyel bir sorun olabileceğini görmek için, dönemleri boyunca ölçülen bireye sahip …




2
Cohen'in d için güven aralıklarını nasıl hesaplıyorsunuz?
Cohen'in d'sini (t istatistiğinden) regresyon katsayıları, olasılık oranları ve farklılıklar için, bir meta analizde sonuçları bir araya getirip nasıl çalıştığını umarak hesapladım. Ancak, Stata'da, Cohen'in d için güven aralıkları olmadan bu sonuçları bir araya getiremeyeceğiniz görülmüyor, bu yüzden sorum şu: Bu sorunu nasıl çözeceğim? Bunu hesaplamanın bir yolu var mı, …
16 cohens-d 


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.