İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Lojistik regresyon parametresini hesaplamak için genelleştirilmiş moment yöntemini (GMM) kullanma
Lojistik regresyona çok benzeyen bir regresyon katsayılarını hesaplamak istiyorum (Aslında başka bir katsayılı lojistik regresyon: ne zaman verilebilir). Katsayıları hesaplamak için GMM kullanmayı düşündüm, ancak kullanmam gereken moment koşullarının ne olduğundan emin değilim.A1+e−(b0+b1x1+b2x2+…),A1+e−(b0+b1x1+b2x2+…), \frac{A}{1 + e^{- (b_0 + b_1 x_1 + b_2 x_2 + \ldots)}},AAA Biri bana bununla ilgili yardım …


2
Yalnızca bilmek Doğrusal regresyon , değil doğrudan
Varsayalım .Xβ=YXβ=YX\beta =Y Bilmiyoruz , tam olarak her etkenin, sadece onun korelasyon .YYYXtYXtYX^\mathrm{t}Y Sıradan en küçük kareler (OLS) çözümü ve bir sorun yoktur.β=(XtX)−1XtYβ=(XtX)−1XtY\beta=(X^\mathrm{t} X)^{-1} X^\mathrm{t}Y Ancak tekil (çok doğrusal doğrusallık) yakınında olduğunu ve optimal sırt parametresini tahmin etmeniz gerektiğini varsayalım . Tüm yöntemlerin kesin değerlerine ihtiyacı olduğu görülmektedir .XtXXtXX^\mathrm{t}XYYY Yalnızca …

3
Makine öğrenimindeki en son gelişmeleri takip etmek için iyi, serbestçe kullanılabilir dergiler nelerdir?
Herhangi bir yararlı bilgi portalı yerine 'dergileri' değiştirmekten çekinmeyin. Pratik uygulamalar açısından makine öğrenimindeki yeni gelişmeleri takip etmek istiyorum. Kendi çalışmamı yayınlamaya çalışan bir akademisyen değilim (en azından bu alanda değil), ancak pratik düzeyde yararlı olabilecek potansiyel yeni algoritmaların veya püf noktalarının farkında olmak istiyorum. Tek uyarı, dergi / konferans …

6
Rasgele orman: Test setinde yeni faktör seviyeleri nasıl ele alınır?
R'de rastgele bir orman modeli kullanarak tahminler yapmaya çalışıyorum. Ancak bazı faktörlerin test setinde eğitim setinden farklı değerlere sahip olduğundan hata alıyorum. Örneğin, bir faktörün test setinde egzersiz setinde görünmeyen Cat_2değerler 34, 68, 76vb. Vardır. Ne yazık ki, Test seti üzerinde kontrolüm yok ... Onu olduğu gibi kullanmalıyım. Benim tek …

3
Kök ortalama kare hatası ve ortalama yanlılık sapmasının kavramsal anlaşılması
Kök Ortalama Kare Hatası (RMSE) ve Ortalama Sapma Sapması (MBD) hakkında kavramsal bir anlayış kazanmak istiyorum. Bu ölçümleri kendi veri karşılaştırmalarım için hesapladıktan sonra, RMSE'nin yüksek (örneğin 100 kg), MBD'nin düşük (örneğin,% 1'den az) olduğunu bulmak için sık sık şaşırdım. Daha spesifik olarak, bu önlemlerin matematiğini listeleyen ve tartışan bir …


2
Yığın testleri nedir?
Bir soruya yanıt olarak çoklu doğrusal varlığında model seçimi , Frank Harrell önerdi : Tüm değişkenleri modele koyun ancak rakip değişkenlerin etkilerine göre ayarlanmış bir değişkenin etkisini test etmeyin ... Rakip değişkenlerin yığın testleri güçlüdür, çünkü eş değişkenler genel olarak çoklu serbestlik derecesi ilişkilendirme testinde güçlerini birleştirir. değişkenleri tek tek …

3
İki boyutlu Kolmogorov-Smirnov
İki boyutlu bir dağılımın bir referansa uyup uymadığını belirlemek için bazı iki boyutlu Kolmogorov-Smironov testleri yapmak istiyorum. Nispeten basit bir şekilde kullanabileceğim herhangi bir paket veya uygulama var mı? Yoksa tercih edilen farklı bir algoritma var mı? Sadece temel bir istatistiki bilgim var.


2
Önemli örneklemeyle üretilen Monte Carlo tahminlerine ilişkin sonuçlar
Geçtiğimiz yıl için oldukça yakından örneklemenin önemi üzerinde çalışıyorum ve yardım almayı umduğum birkaç açık uçlu sorum var. Önemli örnekleme şemaları ile ilgili pratik deneyimim, zaman zaman fantastik düşük sapma ve düşük sapma tahminleri üretebilmeleridir. Bununla birlikte, daha sık olarak, düşük örnek varyansı ancak çok yüksek sapmaya sahip yüksek hata …

3
Bir istatistik tezgahı olarak Ruby
Bu aynı zamanda çok ilgilidir bir sorudur tezgahı bir istatistik olarak Python ve bir istatistik tezgâha olarak excel . Ruby ile Python hakkında çok büyük bir tartışma olduğunu biliyorum ama bu sorunun konusu bu değil. Ben Ruby hızlı Python daha olmak ve çok doğal bir sözdizimi istatistiklerini anlamama faydalı olacağını …
13 r  python  software  ruby 



2
Oranları analiz et
1'e kadar birden fazla oranlar içeren bir veri kümesi var. Ben degrade boyunca bu oranlarda değişiklik ilgileniyorum (örnek veri için aşağıya bakın). gradient <- 1:99 A1 <- gradient * 0.005 A2 <- gradient * 0.004 A3 <- 1 - (A1 + A2) df <- data.frame(gradient = gradient, A1 = A1, …
13 r  multinomial 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.