İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Pozitif ve negatif değerlere sahip veriler kullanılırken varyasyon katsayısı neden geçerli değil?
Soruma kesin bir cevap bulamıyorum. Verilerim, 0.27 ila 0.57 arasında değişen ölçülü ortalamalara sahip birkaç grafikten oluşuyor. Benim durumumda, tüm veri değerleri pozitiftir, ancak ölçümün kendisi -1 ila +1 arasında değişen bir yansıtma değeri oranına dayanmaktadır. Grafikler , bitki örtüsü "verimlilik" in uzaktan türetilmiş bir göstergesi olan NDVI değerlerini temsil …

2
Sabit bir mesafedeki nokta sayısını en üst düzeye çıkaran bilinen sayıda daire merkezi bulma
Belirtilen mesafe ( ) içindeki toplam nokta sayısını en üst düzeye çıkaran belirli sayıda daire merkezinin ( ) merkezlerini bulmak istediğim 2-D veri setim var .RNNNRRR örneğin 10.000 veri var ve yarıçapında olabildiğince çok nokta yakalayan dairelerinin merkezlerini bulmak istiyorum . 10'luk 5 merkez ve yarıçap, verilerden türetilmeden önceden verilmiştir.N …
10 r  clustering  distance 

1
Üniform ve üniform olmayan kutular ile histogram
Bu soru , üniform ve üniform olmayan bir histogram arasındaki temel farkı açıklar. Ve bu soru , histogramın veri örneklerinin çizildiği dağılımı temsil etme derecesini optimize eden (bir anlamda) tek tip bir histogramın kutu sayısını seçmek için temel kuralı tartışıyor. Üniforma ile üniform olmayan histogramlar hakkında aynı tür bir "iyimserlik" …

1
R cinsinden ayrık zamanlı tehlike modelleri (cloglog)
survivalPaket Rgöründüğünü sürekli zaman hayatta kalma modellerine odaklanmak. Tamamlayıcı log-log modeli olan oransal bir tehlike modelinin ayrık zamanlı bir versiyonunu tahmin etmekle ilgileniyorum. Basit sansür ile oldukça basit bir hayatta kalma modelim var. Bu modeli tahmin etmenin bir yolunun, "ölü" olmadığı her dönem için her gözlem için ayrı bir satır …
10 r  survival 



3
K-demektir kümelerine sınıf etiketi atama
Kümeleme hakkında çok temel bir sorum var. Centroid'leri ile k kümeleri bulduktan sonra, kümelediğim veri noktalarının sınıflarını nasıl yorumlayacağım (her kümeye anlamlı sınıf etiketleri atama). Bulunan kümelerin validasyonundan bahsetmiyorum. Küçük bir etiketli veri noktası seti verilebilir, bu etiketli noktaların hangi kümeye ait olduğunu hesaplayın ve her bir kümenin aldığı noktaların …
10 k-means 


3
Zaman çizgisi analizi
Bir kişinin doğum sırası ile daha sonra obezite riski arasındaki ilişkiyi birkaç yıllık doğum kohortlarındaki verileri kullanarak araştırıyorum (ör. Http://www.ncbi.nlm.nih.gov/pmc/articles/PMC2908417/ ). Önemli bir zorluk, doğum düzeninin anne yaşı, küçük ve / veya büyük kardeş sayısı ve doğum aralığı gibi diğer mekanizmalarla sonucu etkileyebilecek diğer özelliklerle bağlantılı olmasıdır. Ayrıca, bu şeylerin …
10 timelines 

3
Regülasyonda birden fazla model oluşturmaya karşı ithamın avantajı nedir?
Birisinin, eksik veri için neden gösterilmesinin, eksik veri içeren vakalar için farklı modeller oluşturmaktan daha iyi olup olmadığına dair bir fikir verebilir mi acaba? Özellikle [genelleştirilmiş] doğrusal modeller söz konusu olduğunda (belki doğrusal olmayan durumlarda bazı şeylerin farklı olduğunu görebilirim) Temel doğrusal modele sahip olduğumuzu varsayalım: Y= β1X1+ β2X2+ β3X3+ …

3
Lojistik regresyon için Bayesli uyum iyiliği nasıl görselleştirilir
Bayes lojistik regresyon problemi için posterior bir prediktif dağılım oluşturdum. Tahmin dağılımından örnek alıyorum ve sahip olduğum her gözlem için binlerce (0,1) örnek alıyorum. Uyumun iyiliğini görselleştirmek ilginç olmaktan daha azdır, örneğin: Bu grafik, 10.000 örneği + gözlenen referans noktasını gösterir (soldaki yol kırmızı bir çizgi oluşturabilir: evet bu gözlemdir). …

1
Makine öğrenimi için istatistik, başlayacak makaleler?
Bilgisayar programlama ve temel sayı teorisinde bir geçmişim var, ancak gerçek bir istatistik eğitimi yok ve son zamanlarda bir dizi tekniğin muhteşem dünyasının aslında istatistiksel bir dünya olduğunu "keşfettim". Matris çarpanlarına ayırma, matris tamamlama, yüksek boyutlu tensörler, düğünler, yoğunluk tahmini, Bayes çıkarsama, Markov bölümleri, özvektör hesaplaması, PageRank'ın tümü son derece …



2
Asimetrik dağılımlarda çekirdek yoğunluğu tahmini
İzin Vermek {x1, … ,xN-}{x1,...,xN-}\{x_1,\ldots,x_N\} bilinmeyen (ama kesinlikle asimetrik) bir olasılık dağılımından alınan gözlemler olabilir. KDE yaklaşımını kullanarak olasılık dağılımını bulmak istiyorum: f^( x ) =1N-hΣi = 1N-K(x -xbenh)f^(x)=1N-hΣben=1N-K(x-xbenh) \hat{f}(x) = \frac{1}{Nh}\sum_{i=1}^{N} K\bigl(\frac{x-x_i}{h}\bigr) Ancak, bir Gauss çekirdeği kullanmaya çalıştım, ancak simetrik olduğu için kötü performans gösterdi. Böylece, Gamma ve Beta …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.