İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Kümeleme için karışım modeli nasıl takılır
İki değişkenim var - X ve Y ve kümeyi maksimum (ve optimal) = 5 yapmalıyım. Değişkenlerin ideal grafiği aşağıdaki gibidir: Bunun 5 kümesini yapmak istiyorum. Bunun gibi bir şey: Bu yüzden bu 5 küme ile karışım modeli olduğunu düşünüyorum. Her kümenin merkez noktası ve çevresinde bir güven dairesi vardır. Kümeler …

1
Yüksek eğimli verilerde t testi kullanmalı mıyım? Bilimsel kanıt lütfen?
Kullanıcıların katılımı (örneğin: mesaj sayısı) hakkında çok eğimli (üstel dağılım gibi) bir veri kümesinden, farklı boyutlarda (ancak 200'den az olmayan) örneklere sahibim ve ortalamalarını karşılaştırmak istiyorum. Bunun için iki örnek eşleştirilmemiş t-testi (ve numuneler farklı varyanslara sahip olduğunda Welch faktörü ile t-testleri) kullanıyorum. Duyduğum gibi, gerçekten büyük numuneler için, numunenin …

1
ayarında regresyon : Düzenleme yöntemi nasıl seçilir (Kement, PLS, PCR, sırt)?
Ben gitmek için olup olmadığını görmek çalışıyorum sırt regresyon , kement , temel bileşenler regresyon (PCR) veya Kısmi En Küçük Kareler değişkenler / özellikler (çok sayıda olduğu yerde bir durumda (PLS) ppp ) ve numunelerin daha az sayıda ( ) ve hedefim tahmin.n<pn<pn n , çoğu zaman p>10np>10np>10n ; Değişkenler …

2
Permütasyon testinde 0'a eşit P değerleri
İki veri setim var ve bunların önemli ölçüde farklı olup olmadıklarını bilmek istiyorum (bu " İki grup önemli ölçüde farklı mı? Kullanmak için test " ten geliyor ). Bir permütasyon testi kullanmaya karar verdim. permutation.test <- function(coding, lncrna) { coding <- coding[,1] # dataset1 lncrna <- lncrna[,1] # dataset2 ### …

4
Uçak kazaları kümesi ne kadar tuhaf?
Orijinal soru (25.07.2014): Haber medyasından yapılan bu alıntı mantıklı mı, yoksa son uçak kazalarının durumunu izlemek için daha iyi bir istatistiksel yol var mı? Bununla birlikte, Barnett ayrıca Poisson dağılımı teorisine de dikkat çekiyor, bu da çökmeler arasındaki kısa aralıkların aslında uzun olanlardan daha muhtemel olduğunu ima ediyor. Barnett, "Her …




3
Dengesiz bir ortamda maliyete duyarlı öğrenme için öneriler
Birkaç milyon satır ve ~ 100 sütun içeren bir veri kümem var. Ortak bir sınıfa ait veri kümesindeki örneklerin yaklaşık% 1'ini tespit etmek istiyorum. Minimum hassasiyet kısıtlamam var, ancak çok asimetrik maliyet nedeniyle belirli bir geri çağırma konusunda çok hevesli değilim (10 olumlu maçla kalmadığım sürece!) Bu ortamda önerebileceğiniz bazı …


2
Ridge regresyon - Bayes yorumu
Önceden yeterince seçilmişse sırt regresyonunun posterior dağılımın ortalaması olarak türetilebileceğini duydum. Öncekine göre regresyon katsayıları üzerinde belirlenen kısıtlamaların (örneğin, 0 civarında standart normal dağılımlar) sezgisi aynı mı / katsayıların kare büyüklüğünde ayarlanan cezayı değiştiriyor mu? Bu denkliğin elde edilebilmesi için öncekinin Gauss olması gerekir mi?

1
Gini azalması ve çocuk düğümlerinin Gini safsızlığı
Rastgele orman için Gini özelliği önem ölçüsü üzerinde çalışıyorum. Bu nedenle, düğüm safsızlığında Gini azalmasını hesaplamam gerekiyor. İşte böyle yapıyorum, bu tanımla çatışmaya yol açıyor, bir yerde yanlış olmam gerektiğini gösteriyor ... :) Bir ikili ağaç için ve sol ve sağ çocukların olasılıkları göz önüne alındığında, düğümünün Gini safsızlığını hesaplayabilirim …

3
Dengesiz veriler için SVM
Veri kümemde Destek Vektör Makineleri'ni (SVM'ler) kullanmayı denemek istiyorum. Sorunu denemeden önce, SVM'lerin son derece dengesiz veriler üzerinde iyi performans göstermedikleri konusunda uyarıldım. Benim durumumda,% 95-98 0 ve% 2-5 1'e kadar sahip olabilirim. Seyrek / dengesiz verilerde SVM'lerin kullanımı hakkında konuşulan kaynakları bulmaya çalıştım, ancak bulabildiğim tek şey 'seyrekSVM'ler' (az …

1
Varyansı açıklamak ne demektir?
Özellikle, neden bu çoklu kavram (Çoklu regresyonda gözlemlenen ve tahmin edilen puanlar arasındaki korelasyon olarak anlayabiliyorum) ve daha sonra sadece kare veya R olan ayrı bir R-kare konseptine sahip olduğumuzu merak ediyorum. R-kare'nin açıklanan yüzde varyasyon olduğu ve R'nin olmadığı bildirildi, ancak korelasyon ve açıklanmış varyasyon arasında yapılan ayrımı anlamıyorum.

6
Polarize kullanıcı görüşleri nasıl algılanır (yüksek ve düşük yıldız derecelendirmeleri)
Kullanıcıların bir ürün veya öğe için tercihlerini ifade edebilecekleri bir yıldız derecelendirme sistemim varsa, oylar oldukça "bölünmüşse" istatistiksel olarak nasıl tespit edebilirim? Yani, belirli bir ürün için ortalama 5 üzerinden 3 olsa bile, bunun sadece verileri kullanarak bir fikir birliği 3'e karşı 1-5 bölünmüş olup olmadığını nasıl tespit edebilirim (grafik …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.