İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
KKT Kullanarak Norm Düzenli Regresyon ve Norm Kısıtlı Regresyon Arasındaki Eşdeğerliği Gösterme
Referanslarına göre Kitap 1 , Kitap 2 ve kağıt . Düzenli regresyon (Ridge, LASSO ve Elastik Ağ) ile bunların kısıtlayıcı formülleri arasında bir denklik olduğu belirtilmiştir. Ayrıca Çapraz Doğrulanmış 1 ve Çapraz Doğrulanmış 2'ye de baktım , ancak denklik veya mantığı gösteren net bir cevap göremiyorum. Sorum şu Karush – …

2
Bir 0-1 kayıp işlevi neden kullanılamaz?
Ian Goodfellow'un Derin Öğrenme kitabında, Bazen, gerçekten önem verdiğimiz kayıp fonksiyonu (örneğin, sınıflandırma hatası) verimli bir şekilde optimize edilebilen bir işlev değildir. Örneğin, beklenen 0-1 kaybını tam olarak en aza indirmek, doğrusal bir sınıflandırıcı için bile tipik olarak inatçıdır (giriş boyutunda üstel). Bu gibi durumlarda, tipik olarak vekil görevi gören …


4
Kementin özellik seçimi için kararsız olmasına ne neden olur?
Sıkıştırılmış algılama olarak, bir teoremi garantisi yoktur argmin∥c∥1subject to y=Xcargmin‖c‖1subject to y=Xc\text{argmin} \Vert c \Vert_1\\ \text{subject to } y = Xc benzersiz seyrek çözelti sahip ccc (daha fazla ayrıntı için ek). Kement için benzer bir teorem var mı? Böyle bir teorem varsa, sadece kementin stabilitesini garanti etmekle kalmaz, aynı zamanda …


1
Negatif sırt regresyonunu anlama
Negatif sırt regresyonu ile ilgili literatür arıyorum . Kısacası, tahminci formülünde negatif kullanılarak doğrusal sırt regresyonunun genelleştirilmesidir :Olumlu durum güzel bir teoriye sahiptir: bir kayıp fonksiyonu olarak, bir kısıtlama olarak, daha önce bir Bayes olarak ... ama sadece yukarıdaki formüle sahip negatif versiyonda kaybolmuş hissediyorum. Yaptığım şey için yararlı olur, …


1
RMSProp ve Adam ve SGD
RMSProp, Adam ve SGD ile ağları kullanarak EMNIST doğrulama seti üzerinde deneyler yapıyorum. SGD (öğrenme oranı 0.1) ve bırakma (0.1 bırakma probu) ile L2 düzenlenmesi (1e-05 cezası) ile% 87 doğruluk elde ediyorum. RMSProp ve Adam ile aynı yapılandırmayı ve 0.001 başlangıç ​​öğrenme oranını test ederken,% 85 doğruluk ve daha az …

4
Birkaç grubun ortalamalarını karşılaştırmak için ANOVA ile iç içe modelleri karşılaştırmak için ANOVA arasındaki ilişki nedir?
Şimdiye kadar ANOVA'nın iki şekilde kullanıldığını gördüm: İlk olarak , giriş istatistik metnimde, ANOVA, araçlardan birinin istatistiksel olarak anlamlı bir fark olup olmadığını belirlemek için, üç veya daha fazla grubun ortalamalarını karşılaştırmak için, ikili karşılaştırmaya göre bir iyileştirme olarak tanıtıldı. İkincisi , istatistiksel öğrenme metnimde, Model 2'nin öngörücülerinin bir alt …


2
Bir kişi (teorik olarak) bir sinir ağını ağırlıktan daha az eğitim örneği ile eğitebilir mi?
Her şeyden önce: Biliyorum, sinir ağını eğitmek için genel bir örneklem sayısı gerekmiyor. Bu, görevin karmaşıklığı, verilerdeki gürültü vb.Gibi çok fazla faktöre bağlıdır. Ve ne kadar çok eğitim örneğim olursa, ağım o kadar iyi olur. Ama merak ediyordum: Eğer görevimin yeterince basit olduğunu varsayarsam, teorik olarak ağırlıklardan daha az eğitim …

5
Aynı dağıtım ailesinden iki Rastgele Değişkenin aynı beklentiye ve varyansa, ancak farklı daha yüksek momentlere sahip olması mümkün müdür?
Konum ölçeğinde ailenin anlamını düşünüyordum. Benim anlayış her için olmasıdır XXX parametrelerle bir konum ölçek ailesinin üyesi yer ve ölçek, daha sonra dağıtım herhangi parametrelerin bağlı değildir ve her için aynı o ailesine ait.biraabbbZ= ( X- a ) / bZ=(X−a)/bZ =(X-a)/bXXX Öyleyse sorum şu, aynı dağıtım ailesinden iki rasgele standartlaştırılan …

3
Hangi algoritmalar bir sıcak kodlama gerektirir?
Sıralı olmayan değişkenler için ne zaman bir sıcak kodlama kullanılacağından ve ne zaman kullanılacağından emin değilim Algoritma benzerliği hesaplamak için bir mesafe metriği kullandığında kullanırım. Ne tür algoritmaların sıralı olmayan kategorik özelliklerin tek-sıcak kodlu olmasını gerektireceği ve hangilerinin istemeyeceği konusunda genel bir kural verebilir mi?

1
Varyasyonel Çıkarım, KL sapması gerçek gerektirir
Varyasyonel çıkarım (çok mütevazı) anlayışım için , aşağıdakileri optimize eden bir dağıtım bularak bilinmeyen bir dağıtım yaklaşmaya çalışır :pppqqq KL(p||q)=∑xp(x)logp(x)q(x)KL(p||q)=∑xp(x)logp(x)q(x)KL (p||q) = \sum\limits_{x} p(x)log \frac {p(x)}{q(x)} Ne zaman varyasyonsal çıkarımları anlamak için zaman harcadığım zaman bu formüle çarpmaya devam ediyorum ve yardım edemiyorum ama noktayı kaçırmış gibi hissediyorum. yı hesaplamak …

1
T-SNE'nin sınıfları iyi ayırdığını gördükten sonra hangi sınıflandırma algoritması kullanılmalıdır?
Bir sınıflandırma problemimiz olduğunu varsayalım ve ilk önce verilerden bir fikir edinmek istiyoruz ve t-SNE yapıyoruz. T-SNE'nin sonucu sınıfları çok iyi ayırır. Bu, sınıfları da çok iyi ayıracak sınıflandırma modeli oluşturmanın mümkün olduğu anlamına gelir (t-SNE iyi ayrılmazsa, çok fazla ima etmez). T-SNE'nin yerel yapıya odaklandığını ve sınıfları iyi ayırabildiğini …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.