İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Destekleme: öğrenme oranına neden bir düzenleme parametresi denir?
Öğrenme oranı parametresi ( ) Gradyan küçülür -typically her yeni baz model seri olarak bağlanır sığ tree katkısını Arttırılması de. Daha küçük adımlarda olduğu gibi anlaşılabilir olan test seti doğruluğunu önemli ölçüde arttırdığı gösterilmiştir, kayıp fonksiyonunun minimumuna daha hassas bir şekilde ulaşılabilir. ν∈ [ 0 , 1 ]ν∈[0,1]\nu \in [0,1] …

8
Varyans neden birbirini izleyen her değer arasındaki fark olarak tanımlanmamış?
Bu birçok kişi için basit bir soru olabilir, ama işte burada: Varyans neden değerlerin ortalamasıyla fark yerine birbirini izleyen her değer arasındaki fark olarak tanımlanmamıştır? Bu benim için daha mantıklı bir seçim olurdu, sanırım bazı dezavantajları gözetiyorum. Teşekkürler DÜZENLE: Mümkün olduğunca net bir şekilde yeniden ifade edeyim. Demek istediğim bu: …
19 variance 


1
Doğrusal regresyonda dairesel öngörücülerin kullanımı
Rüzgar verilerini (0, 359) ve günün saatini (0, 23) kullanarak bir model yerleştirmeye çalışıyorum, ancak kendilerinin doğrusal parametreler olmadıkları için doğrusal bir regresyona zayıf bir şekilde sığacaklarından endişeliyim. Onları Python kullanarak dönüştürmek istiyorum. En azından rüzgar durumunda, bir sürü değil, derecelerin günahını ve cos'unu alarak bir vektörün hesaplanmasından bahsetmiştim. Yararlı …

1
Konu (çift) uzayda PCA'nın geometrik olarak anlaşılması
Temel bileşen analizinin (PCA) konu (ikili) alanda nasıl çalıştığını sezgisel bir şekilde anlamaya çalışıyorum . İki değişken, 2D veri kümesi düşünün ve ve veri noktası (veri matrisi isimli ve ortalanmış olduğu varsayılmaktadır). PCA'nın olağan sunumu, noktasını dikkate almamız , kovaryans matrisini yazmamız ve özvektörlerini ve özdeğerlerini bulmamızdır; ilk PC maksimum …

3
Julia: Nasıl yapıldığını değerlendirmek
Bu gönderi hızla değişen bir olayla ilgilidir. Çeşitli İstatistiksel Çalışmalar için R / Python'a alternatif olarak Julia hakkında çok iyi bir tartışma yaşayan 2012 sorusu ile karşılaştım. İşte 2012'den Julia'nın vaadiyle ilgili orijinal Soru yatıyor Ne yazık ki Julia o zamanlar çok yeniydi ve istatistiksel çalışma için gerekli araç takımları …
19 r  python  computing  julia 

3
Nadir olay lojistik regresyon önyargısı: hafife alınan p'leri minimal bir örnekle nasıl simüle edebilirim?
CrossValidated'ın King ve Zeng (2001) tarafından yapılan nadir olay önyargı düzeltmesinin ne zaman ve nasıl uygulanacağı konusunda birkaç sorusu vardır . Ben farklı bir şey arıyorum: önyargı var minimal simülasyon tabanlı bir gösteri. Özellikle, Kral ve Zeng devleti “... nadir olay verilerinde olasılıklardaki yanlılıklar binlerce örneklem büyüklüğü ile büyük ölçüde …

3
Sinir ağlarında önyargı düğümünün önemi
Önyargı düğümünün modern sinir ağlarının etkinliği için ne kadar önemli olduğunu merak ediyorum. Sadece birkaç girdi değişkeni olan sığ bir ağda önemli olabileceğini kolayca anlayabiliyorum. Bununla birlikte, derin öğrenme gibi modern sinir ağları, belirli bir nöronun tetiklenip tetiklenmediğine karar vermek için genellikle çok sayıda girdi değişkenine sahiptir. Bunları örneğin LeNet5 …


3
Pearson parametrik ve Spearman neden parametrik değildir
Görünüşe göre Pearson'un korelasyon katsayısı parametrik ve Spearman'ın rho parametrik olmadığı. Bunu anlamakta güçlük çekiyorum. Anladığım kadarıyla Pearson olarak hesaplanır ve Spearman aynı şekilde hesaplanır, ancak tüm değerleri değiştiririz.rxy=cov(X,Y)σxσyrxy=cov(X,Y)σxσy r_{xy} = \frac{cov(X,Y)}{\sigma_x\sigma_y} Wikipedia diyor Parametrik model ile parametrik olmayan model arasındaki fark, birincisinin sabit sayıda parametreye sahip olması, ikincisinin ise …

1
Bu kement çiziminden ne sonuçlandırılır (glmnet)
Aşağıda, r'de DV ve diğerleri ile öngörücü değişkenler olarak mtcarsayarlanmış verileri kullanan varsayılan alfa (1, dolayısıyla kement) bulunan glmnet'in çizimi verilmiştir mpg. glmnet(as.matrix(mtcars[-1]), mtcars[,1]) Ne özellikle, farklı değişkenlere ilişkin bu taslaktan sonuca varabiliriz am, cylve wt(kırmızı, siyah ve açık mavi çizgiler)? Bir rapordaki çıktıyı yayınlanması için nasıl ifade ederiz? Aşağıdakileri …


5
Veri akışı için t-SNE'nin herhangi bir sürümü var mı?
Benim anlayış , t-SNE ve Barnes-Hut yaklaşım tüm veri noktaları tüm kuvvet etkileşimleri aynı anda hesaplanabilir ve her nokta 2d ayarlanabilir (veya boyutsal alt) ilk böylece gerekli olmasıdır. Veri akışı ile etkin bir şekilde başa çıkabilen t-sne'nin herhangi bir sürümü var mı? Dolayısıyla, gözlemlerim birer birer geliyorsa, yeni gözlemi yerleştirmek …

2
Elastik / sırt / kement analizi, sonra ne olacak?
Öngörü büzülmesi / seçimi için elastik ağ prosedürüyle gerçekten ilgileniyorum. Çok güçlü görünüyor. Ancak bilimsel açıdan, katsayıları aldıktan sonra ne yapacağımı iyi bilmiyorum. Hangi soruyu cevaplıyorum? Bunlar sonucu en çok etkileyen değişkenlerdir ve bunlar validasyon sırasında en iyi varyans / yanlılık oranını veren katsayılardır? Bu elbette klasik p değer / …

3
Yanlış keşif oranı ve çoklu testlerle karışıklık (Colquhoun 2014'te)
David Colquhoun'un bu büyük makalesini okudum: Yanlış keşif oranı ve p değerlerinin yanlış yorumlanması üzerine bir araştırma (2014). Özünde, ile tip I hatası kontrol etsek de yanlış keşif oranının (FDR) neden kadar yüksek olabileceğini açıklıyor .30%30%30\%α=0.05α=0.05\alpha=0.05 Bununla birlikte, çoklu test durumunda FDR kontrolünü uygularsam ne olacağı konusunda hala kafam karıştı. …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.