İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Köprü cezası - Elastik Net düzenlenmesi
LASSO ( L1L1L_1 ) ve Ridge ( L2L2L_2 ) gibi bazı ceza fonksiyonları ve yaklaşımları iyi incelenmiştir ve bunların regresyonda nasıl karşılaştırıldığı. ∑∥βj∥γΣ‖βj‖γ\sum \|\beta_{j}\|^{\gamma}γ=1γ=1\gamma = 1γ=2γ=2\gamma = 2 Wenjiang [ 1 ], olduğunda Bridge cezasını karşılaştırdı , ancak olarak verilen LASSO ve Ridge cezalarının bir birleşimi olan Elastik Net Düzenlemesi …

3
Neden sinir ağları ile degrade iniş kullanılmalı?
Geri yayılım algoritmasını kullanarak bir sinir ağını eğitirken, ağırlık güncellemelerini belirlemek için degrade iniş yöntemi kullanılır. Benim soru: Daha çok yavaş belirli ağırlığına göre en az noktasını bulmak için dik iniş metodunu kullanarak yerine, neden türevi set değil , ve hatayı en aza indiren ağırlık değerini bulun.wd(Error)dw=0d(Error)dw=0\frac{d(\text{Error})}{dw}=0www Ayrıca, geri yayılımdaki …


2
Laplace neden daha seyrek çözümler üretiyor?
Düzenlemeyle ilgili literatürü inceliyordum ve çoğunlukla L2 düzenlemesini Gaussian'la bağlayan, L1'i de sıfır merkezli olan L1'i bağlayan paragrafları görüyordum. Bu önceliklerin nasıl göründüğünü biliyorum, ama örneğin doğrusal modeldeki ağırlıklar ile nasıl ilişkili olduğunu anlamıyorum. L1'de, doğru anlarsam, seyrek çözümler bekleriz, yani bazı ağırlıklar tam olarak sıfıra itilir. Ve L2'de küçük …

2
“İngilizcede“ Normal Dağılım ”daki“ N ”yi büyük harf mi kullanmalıyım?
Bu soru biraz sol alan, ancak buradaki toplumun konuyla ilgili güçlü görüşleri olduğunu düşündüm! Doktora tezimi yazıyorum. Tutarlı olarak, bir Gauss dağılımına resmen bağlı olan miktarlardan bahsederken, "Normal" in "N" değerlerini kendilerine atıfta bulunmak için kullandım. Örneğin, "[... Bu şartlar altında], ortaya çıkan dağılım Normal değil, daha çok [...] ile …


2
Prediktif çıkarım için hangi Bayesian dışı yöntemler var?
Bayesci çıkarımda, gelecekteki veriler için bir tahmin edici dağılım bilinmeyen parametrelerin bütünleştirilmesiyle elde edilir; Bu parametrelerin posterior dağılımına entegrasyon posterior tahminsel dağılım verir - daha önce gözlemlenmiş olanlara bağlı gelecekteki veriler için bir dağılım. Parametre tahminlerindeki belirsizliği hesaba katan, öngörülen çıkarsama için hangi Bayesian olmayan yöntemler var (yani, sadece maksimum …


1
Uygun puanlama kuralları arasında seçim yapma
Uygun puanlama kurallarıyla ilgili çoğu kaynak, log kaybı, Brier puanı veya küresel puanlama gibi farklı puanlama kurallarından bahseder. Ancak, genellikle aralarındaki farklar hakkında çok fazla rehberlik yapmazlar. (Sergi A: Vikipedi .) Logaritmik skoru maksimize eden modelin seçilmesi, logaritmik skorlamanın kullanılması için iyi bir argüman gibi görünen maksimum olabilirlik modelinin seçilmesine …

2
Küçültülmüş
Kafamda, Pearson korelasyon katsayısının popülasyon değerinin iki tür tahmincisi hakkında bir kafa karışıklığı oldu. A. Fisher, (1915) iki değişkenli normal popülasyon ampirik için gösterdi a, negatif eğimli tahmincisi p'ye eğilim, sadece küçük bir numune boyutu (pratikte önemli miktarda olmasına rağmen, n < 30 ). Numune r hafife p o daha …

1
Neden sadece orada
PCA'da, sayısı sayısı numune sayısından büyük (hatta eşit) olduğunda , neden en fazla sıfır olmayan özvektörlere sahip olacaksınız ? Başka bir deyişle, kovaryans matrisinin boyutları arasındaki sırası .N N - 1 d ≥ N N - 1dddNNNN−1N−1N-1d≥Nd≥Nd\ge NN−1N−1N-1 Örnek: Örnekleriniz boyutunda vectorized resimlerdir , ancak yalnızca .N = 10d=640×480=307200d=640×480=307200d = …

2
“Azaltılmış regresyon” nedir?
İstatistiksel Öğrenmenin Öğelerini okuyordum ve 3.7. Bölümün "Çoklu sonuç küçültmesi ve seçimi" nin ne anlama geldiğini anlayamadım. RRR (azaltılmış dereceli regresyon) hakkında konuşuyor ve ben sadece öncülün katsayıların bilinmediği (ve tahmin edileceği) fakat tam dereceye sahip olmadığı bilinen bir genel değişkenli doğrusal model hakkında olduğunu anlayabiliyorum. Anladığım tek şey bu. …

4
Acil durum tabloları için en iyi görselleştirme hangisidir?
İstatistiksel açıdan, ki-kare testi ile analiz edilen bir beklenmedik durum tablosunu göstermek için en iyi arsa hangisidir? Soluk bir barplot, yığılmış barplot, heatmap, kontur arsa, titrek dağılım, çoklu çizgi arsa veya başka bir şey mi? Kişi mutlak değerler veya yüzdeler göstermeli mi? Düzenleme: Veya @forecaster'ın yorumlarda önerdiği gibi, sayı tablosunun …

2
En Küçük Kareler Regresyonu Adım Adım Doğrusal Cebir Hesaplaması
R'deki lineer karışık modeller hakkında bir soruya ön hazırlık olarak ve yeni başlayan / orta düzey istatistik meraklıları için referans olarak paylaşırken, bağımsız bir “Soru ve Cevap Stili” olarak göndermeye karar verdim. Basit doğrusal regresyonun katsayıları ve öngörülen değerleri. Örnek, R dahili veri mtcarsseti ile ilgilidir ve bağımsız değişken olarak …

6
İleri regresyon modelleme örnekleri
GLM veya OLS kullanarak karmaşık, çoklu doğrusal olmayan ilişkileri modellemek için gereken adımları gösteren gelişmiş bir doğrusal regresyon durum çalışması arıyorum. Temel okul örneklerinin ötesine geçen kaynakları bulmak şaşırtıcı bir şekilde zordur: Okuduğum kitapların çoğu, bir tahmincinin bir BoxCox'u veya en iyi durumda doğal bir eğri ile birleştiğinde yanıtın bir …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.