İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Bir GLM taktığımızda neden Fisher skorlaması kullanmayla ilgili büyük bir tartışma yaratıyoruz?
Neden GLMS'ye bazı özel optimizasyon problemleriymiş gibi muamele ettiğimizi merak ediyorum. Öyle mi? Bana öyle geliyor ki, bunlar sadece maksimum olasılıktır ve olasılığı yazıyoruz ve sonra ... maksimize ediyoruz! Peki neden uygulamalı matematik literatüründe geliştirilmiş sayısız optimizasyon planı yerine Fisher puanlaması kullanıyoruz?

1
Rasgele bir mutfak lavabosu nasıl çalışır?
Geçen yıl NIPS 2017'de Ali Rahimi ve Ben Recht "Büyük Ölçekli Çekirdek Makineleri için Rastgele Özellikler" adlı makaleleri için zaman testi ödülü kazandılar . Makalelerini yayınlamanın bir parçası olarak, modellerinin 5 satır matlab'de uygulanabileceğini gösterdiler. % Approximates Gaussian Process regression % with Gaussian kernel of variance gamma^2 % lambda: regularization …

2
Özellikler ilişkilendirildiğinde neden Kement veya Elastik Ağ Ridge'den daha iyi performans gösterir?
Bir dizi 150 özelliğim var ve bunların birçoğu birbiriyle yüksek derecede korelasyonlu. Amacım aralığı 1-8 olan ayrık bir değişkenin değerini tahmin etmektir . Örneklem boyutum 550 ve 10 kat çapraz doğrulama kullanıyorum. AFAIK, düzenlileştirme yöntemleri (Kement, Elastik Ağ ve Sırt) arasında Ridge, özellikler arasındaki korelasyon için daha titizdir. Bu yüzden …


4
ACF ve PACF Formülü
Zaman serisi verilerinden ACF ve PACF çizmek için bir kod oluşturmak istiyorum. Tıpkı minitab'dan oluşturulan bu komplo gibi (aşağıda). Formülü aramaya çalıştım, ama hala iyi anlamıyorum. Bana formülü ve nasıl kullanılacağını söyler misiniz? Yukarıdaki ACF ve PACF grafiğindeki yatay kırmızı çizgi nedir? Formül nedir? Teşekkür ederim,

2
K katlı CV'yi kaç kez tekrarlamalıyız?
Ben rastladım bu konuya arada büyük cevap ve referanslar - bootstrapping ve çapraz doğrulama arasındaki farklar bakıyor. Şimdi merak ediyorum, eğer bir sınıflandırıcının doğruluğunu hesaplamak için tekrar tekrar 10 kat CV söyleyecek olsaydım , kaç kez n tekrarlamalıyım? Does n kıvrımlar sayısına bağlıdır? Örnek boyutu üzerinde? Bunun için bir kural …

2
Ggplot2'deki regresyon çizgileri nasıl tahmin edilir veya uzatılır?
İki zaman serisi içeren bir veri çerçevesi var: tarihleri ​​ve Emacs ve Firefox sürümleri sürüm numaraları. Bir ggplot2 komutu kullanarak, noktaları çizgi haline getirmek için loess (biraz eğlenceli görünüyor, umursamıyorum) kullanan bir grafik yapmak kolaydır. Hatları geleceğe nasıl uzatabilirim? Emacs ve Firefox sürüm numaralarının nerede ve ne zaman geçeceğini belirlemek …

1
KL sapması neden negatif değildir?
KL sapması neden negatif değildir? Bilgi teorisi açısından, bu kadar sezgisel bir anlayışa sahibim: Diyelim ki etiketlenmiş aynı elemanlardan oluşan iki ve topluluğu var . ve , sırasıyla ve topluluğu üzerinde farklı olasılık dağılımlarıdır .AAABBBxxxp(x)p(x)p(x)q(x)q(x)q(x)AAABBB Bilgi teorisi perspektifinden bakıldığında, , topluluğu için bir elemanını kaydetmek için gereken en az miktarda …

2
Kukla değişkenlerle özellik önemi
Kukla değişkenlere ayrılmış kategorik bir değişkenin önemini nasıl elde edebileceğimi anlamaya çalışıyorum. Ben sizin için kategorik değişkenleri R veya h2o yaptığı gibi işlemez scikit-learn kullanıyorum. Kategorik bir değişkeni sahte değişkenlere ayırırsam, bu değişkente sınıf başına ayrı özellik içe aktarımları elde ederim. Benim sorum şu, bu kukla değişken ithalatlarını sadece toplayarak …

5
“Örnek içi” ve “örnek dışı” tahminleri arasındaki fark nedir?
"Örnek içi" ve "örnek dışı" tahmini arasındaki farkın tam olarak ne olduğunu anlamıyorum? Örnek içi bir tahmin , tahmin süresi dışındaki değerleri tahmin etmek için mevcut verilerin bir alt kümesini kullanır . Bunun yerine örnek tahmininin tümü mevcut tüm verileri kullanıyor Bunlar doğru mu? Aşağıdaki tanım çok doğru mu? Bir …

2
Gradyan Arttırma ile Sınıflandırma: [0,1]
Soru Gradient Boosting ile ikili sınıflandırma yaparken tahminin aralığında nasıl tutulduğunu anlamak için uğraşıyorum .[ 0 , 1 ][0,1][0,1] İkili bir sınıflandırma problemi üzerinde çalıştığımızı varsayalım ve objektif fonksiyonumuz günlük kaybı, , burada içindeki hedef değişken ve mevcut modelimizdir.y ∈ { 0 , 1 } H- ∑ ybengünlük( Hm( xben) …

3
Python'daki collinear değişkenleri sistematik olarak nasıl kaldırırım? [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Soruyu , Çapraz Doğrulanmış için konuyla ilgili olacak şekilde güncelleyin . 2 yıl önce kapalı . Şimdiye kadar, korelasyon tablolarına bakarak ve belirli bir eşiğin üzerindeki değişkenleri kaldırarak veri hazırlama sürecinin bir parçası olarak …



3
Rastgele üretilen verilerin amaçlanan dağıtımına karşı test edilmesi
Rastgele veri üreten bir program yazdım. Program düzgün çalışıyorsa, bu veriler bilinen, belirli bir olasılık dağılımını izlemelidir. Programı çalıştırmak, sonuç üzerinde bazı hesaplamalar yapmak ve bir p değeri bulmak istiyorum. Başkası söylemeden önce: Hipotez testinin programın ne zaman düzgün çalıştığını tespit edemediğini anlıyorum. Sadece belirli bir şekilde yanlış çalıştığını tespit …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.