İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

8
Kümeleme kalite ölçüsü
Ben giriş parametresi (küme sayısı ) ile bir kümeleme algoritması (k-anlamına gelir) var . Kümeleme yaptıktan sonra bu kümelemenin niceliksel bir ölçüsünü almak istiyorum. Kümeleme algoritmasının önemli bir özelliği vardır. İçin k = 2 Beslemem halinde N sonucu bu algoritmaya aralarında anlamlı bir fark gözetilmeksizin veri noktaları I ihtiva eden …
17 clustering 


2
Platt'un ölçeklendirmesini neden kullanmalıyım?
Bir güven düzeyini denetimli öğrenme olasılığına göre kalibre etmek için (örneğin, bir SVM'den veya aşırı örneklenmiş veriler kullanarak bir karar ağacından güveni haritalamak için) bir yöntem Platt'ın Ölçeklendirmesini kullanmaktır (örn. Kalibre Edilmiş Olasılıkları Artırmaktan Almak ). Temel olarak haritalamak için lojistik regresyon kullanılır [−∞;∞][−∞;∞][-\infty;\infty] ila [0;1][0;1][0;1] . Bağımlı değişken gerçek …

2
R'de parametrik olmayan Bayes analizi
Ben Rhiyerarşik dirichlet işlemi (HDP) (son ve popüler parametrik olmayan Bayesian yöntemlerinden biri) kullanarak veri kümeleme hakkında iyi bir öğretici arıyorum . Orada DPpackageiçinde (IMHO, mevcut tüm olanlardan en kapsamlı) Rparametrik olmayan Bayes analizi için. Ancak R Newspaket referans kılavuzunda veya paketinde verilen örnekleri HDP'yi kodlayacak kadar iyi anlayamıyorum . …

6
R: gruba göre korelasyonu hesapla
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. R de, bir sınıf etiketi C (bir faktör) ve iki ölçüm, M1 ve M2 içeren bir veri çerçevem ​​var . Her sınıfta M1 ve M2 arasındaki korelasyonu …
17 r  correlation 

9
İstatistikler ve biyoistatistik arasındaki fark nedir?
Bana, yıllar boyunca istatistik ve biyoistatistik arasındaki farklar hakkında bazı fikirler eklerken, hiçbir zaman resmi bir açıklama duymadım. Bu iki disiplin (şu anda) arasındaki ayrım nedir? Ve bu ayrım neden ilk olarak başladı? EDIT: Orijinal sorumda yeterince belirgin değilim. Biyoistatistiğin, biyomedikal alanındaki istatistiklerin uygulanması ve geliştirilmesi olduğunu anlıyorum. Fakat ayrımların …

1
Tekrarlanan ölçümler için dengesiz karışık etki ANOVA
Ameliyat sırasında 2 farklı tedaviyle tedavi edilen hastalardan verilerim var. Kalp atış hızı üzerindeki etkisini analiz etmem gerekiyor. Kalp atış hızı ölçümü her 15 dakikada bir yapılır. Ameliyat uzunluğunun her hasta için farklı olabileceği göz önüne alındığında, her hasta 7 ila 10 arasında kalp atış hızı ölçümüne sahip olabilir. Bu …

3
İstatistik ve olasılıkların tümevarım ve tümdengelim gibi olduğunu söyleyebilir misiniz?
Bu konuyu okudum ve bana söylenebilir gibi görünüyor: istatistik = indüksiyon? olasılık = kesinti? Ancak, karşılaştırmayla ilgili eksik olduğum bazı ayrıntılar olup olmadığını merak ediyorum. Örneğin, istatistikler tümevarım ile eşit mi, yoksa sadece belirli bir durum mu? Olasılığın bir alt kesinti vakası olduğu görülmektedir (çünkü matematiksel düşüncenin bir alt vakasıdır). …

2
Değişken çekirdek genişlikleri genellikle çekirdek regresyonu için iyi ise, neden çekirdek yoğunluğu tahmini için genellikle iyi değildir?
Bu soru başka bir yerde tartışılarak sorulmaktadır . Değişken çekirdekler genellikle yerel regresyonda kullanılır. Örneğin, loess yaygın olarak kullanılır ve bir regresyon pürüzsüzlüğü kadar iyi çalışır ve veri genişliğine uyum sağlayan değişken genişlikte bir çekirdeğe dayanır. Öte yandan, değişken çekirdeklerin genellikle çekirdek yoğunluğu tahmininde zayıf tahmin edicilere yol açtığı düşünülmektedir …

4
İki güven aralığını / puan tahminini birleştirme
Birinin aynı popülasyondan iki bağımsız örneği olduğunu ve iki örnek üzerinde nokta tahmini ve güven aralıkları elde etmek için farklı yöntemler kullanıldığını varsayalım. Önemsiz durumlarda, mantıklı bir kişi sadece iki örneği bir araya getirecek ve analizi yapmak için bir yöntem kullanacaktır, ancak bir an için eksik veri gibi numunelerden birinin …


3
Likert maddelerinden oluşan anketlerin faktör analizi
Maddeleri psikometrik bir bakış açısıyla analiz ederdim. Ama şimdi motivasyon ve diğer konularla ilgili diğer soruları analiz etmeye çalışıyorum. Bu soruların hepsi Likert skalalarında. İlk düşüncem faktör analizini kullanmaktı, çünkü sorular bazı temel boyutları yansıttığı varsayılıyor. Ancak faktör analizi uygun mu? Her bir sorunun boyutluluğuna ilişkin doğrulanması gerekli midir? Likert …

4
Ortalama için sağlam t testi
Rastgele değişkenin hafif ve orta çarpıklığına ve basıklıklarına maruz kalan rastgele bir X değişkeni için yerel E [ X ] > 0 değerine karşı boş değerini test etmeye çalışıyorum . Wilcox'un 'Sağlam Tahmin ve Hipotez Testine Giriş' önerilerini takiben, kesilmiş ortalamaya, medyanın yanı sıra konumun M tahmincisine (Wilcox '"tek adımlı" …

12
İstatistiksel veri analizine giriş için en iyi kitaplar?
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. Bu kitabı aldım: Her Şey Nasıl Ölçülür: İşletmedeki Maddi Olmayan Maddelerin Değerini Bulma ve İlk Veri Analizi: Büyük Sayılar, İstatistikler ve İyi Kararlar için Öğrenci Kılavuzu Başka …

5
Büyük verilerle Poisson regresyonu: ölçüm birimini değiştirmek yanlış mı?
Bir poisson dağılımındaki faktöriye bağlı olarak, gözlemler büyük olduğunda poisson modellerini (örneğin, maksimum olasılık kullanarak) tahmin etmek pratik olmaz. Yani, örneğin, belirli bir yıldaki intihar sayısını açıklamak için bir model tahmin etmeye çalışıyorsam (sadece yıllık veriler mevcuttur) ve her yıl binlerce intihar var, yüzlerce intihar ifade etmek yanlış mı , …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.