İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Stokastik degrade iniş, standart degrade inişe kıyasla zamandan nasıl tasarruf edebilir?
Standart Degrade İniş, tüm eğitim veri kümesi için degradeyi hesaplar. for i in range(nb_epochs): params_grad = evaluate_gradient(loss_function, data, params) params = params - learning_rate * params_grad Önceden tanımlanmış bir dönem sayısı için, ilk olarak parametre vektör parametrelerimizle tüm veri kümesi için kayıp fonksiyonunun gradient vektörü ağırlıkları_gradını hesaplıyoruz. Stokastik Degrade İniş, …

2
ROC eğrisinin altındaki alana karşı doğruluk
Bir teşhis sistemi için bir ROC eğrisi oluşturdum. Daha sonra eğrinin altındaki alanın parametrik olmayan bir şekilde AUC = 0.89 olduğu tahmin edildi. En uygun eşik ayarında doğruluğu hesaplamaya çalıştığımda (noktaya en yakın nokta (0, 1)), teşhis sisteminin doğruluğunu 0.8 olarak aldım, bu da AUC'den daha az! Hassasiyeti optimum eşikten …

1
Kısmi en küçük kareler, azalan sıralama regresyonu ve temel bileşen regresyonu arasındaki bağlantı nedir?
Düşük kademeli regresyon ve temel bileşen regresyonu sadece kısmi en küçük karelerin özel durumları mıdır? Bu öğretici (Sayfa 6, "Hedeflerin Karşılaştırılması"), X veya Y yansıtmadan kısmi en küçük kareler yaptığımızda (yani, "kısmi değil"), buna karşılık olarak azalan sıralama regresyonu veya temel bileşen regresyonu haline geldiğini belirtir. Bu SAS dokümantasyon bölümünde …




1
Negatif olmayan sıfır şişirilmiş sürekli veriler nasıl modellenir?
Şu anda family = gaussiansıfırdan daha düşük değerler alamaz, sıfır şişirilmiş ve sürekli bir biyolojik çeşitlilik göstergesine doğrusal bir model ( ) uygulamak çalışıyorum . Değerler 0 ile 0,25 arasında değişir. Sonuç olarak, modelin kalıntılarında kurtulmayı başaramadığım oldukça açık bir desen var: Bunu çözmek için herhangi bir fikri olan var …

3
Lojistik regresyona karşı diskriminant analizi
Bazı ayrımcı analiz uzmanları buldum ve onlar hakkında sorularım var. Yani: Sınıflar iyi ayrıldığında, lojistik regresyon için parametre tahminleri şaşırtıcı bir şekilde kararsızdır. Katsayılar sonsuza gidebilir. LDA bu sorundan muzdarip değildir. Özelliklerin sayısı azsa ve yordayıcılarının dağılımı XXXsınıfların her birinde yaklaşık olarak normalse, doğrusal ayırıcı model yine lojistik regresyon modelinden …


2
Varyansın doğrusallığı
Aşağıdaki iki formülün doğru olduğunu düşünüyorum: Var(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) a sabit bir sayı iken eğer , bağımsızVar(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) XXXYYY Ancak, aşağıdakilerle ilgili sorunun ne olduğundan emin değilim: Var(2X)=Var(X+X)=Var(X)+Var(X)Var(2X)=Var(X+X)=Var(X)+Var(X)\mathrm{Var}(2X) = \mathrm{Var}(X+X) = \mathrm{Var}(X) + \mathrm{Var}(X) , eşit değil , yani .4 V a r ( X )22Var(X)22Var(X)2^2 \mathrm{Var}(X)4Var(X)4Var(X)4\mathrm{Var}(X) bir …

1
Ağırlıklı Rastgele Orman için R paketi? classwt seçeneği?
Son derece dengesiz bir veri kümesinin sonucunu tahmin etmek için Random Forest kullanmaya çalışıyorum (azınlık sınıf oranı sadece% 1 veya daha az). Geleneksel Rastgele Orman algoritması, azınlık sınıflarına özel önem vermek yerine genel hata oranını en aza indirdiğinden, dengesiz verilere doğrudan uygulanamaz. Bu yüzden azınlık sınıfının yanlış sınıflandırılmasına yüksek bir …
16 r  random-forest 

1
İstatistiksel öğrenme teorisinde, bir test setine aşırı uyum sağlama sorunu yok mu?
MNIST veri kümesini sınıflandırmayla ilgili sorunu ele alalım. Göre Yann LeCun en MNIST bir Web 'Ciresan ve diğ.' Evrimsel Sinir Ağı kullanılarak MNIST test setinde% 0.23 hata oranı elde edildi. olarak ayarlanmış MNIST eğitimini DtrainDtrainD_{train}, olarak ayarlanmış MNIST testini DtestDtestD_{test}, h 1DtrainDtrainD_{train} olarak kullanarak elde ettikleri son hipotezi ve h_ …

3
Dağıtım tam olarak nedir?
Olasılık ve İstatistik hakkında çok az şey biliyorum ve öğrenmek istiyorum. "Dağıtım" kelimesinin her yerde farklı bağlamlarda kullanıldığını görüyorum. Örneğin, ayrı bir rastgele değişkenin "olasılık dağılımı" vardır. Bunun ne olduğunu biliyorum. Sürekli bir rastgele değişken için, daha sonra bir olasılık yoğunluk fonksiyonu vardır x∈Rx∈Rx\in\mathbb{R} integralin, −∞−∞-\infty için xxx olasılık yoğunluk …


3
Neden yeterli bir istatistik, parametrenin herhangi bir tahminini hesaplamak için gerekli tüm bilgileri içerir?
İstatistik okumaya yeni başladım ve sezgisel bir yeterlilik anlayışı elde edemiyorum. Daha kesin olmak gerekirse, aşağıdaki iki paragrafın eşdeğer olduğunu nasıl göstereceğimizi anlayamıyorum: Kabaca, bilinmeyen bir parametre conditioned üzerinde koşullandırılmış bağımsız özdeş dağıtılmış veri seti X verildiğinde, yeterli bir istatistik, değeri parametrenin herhangi bir tahminini hesaplamak için gereken tüm bilgileri …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.