İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
Normları - ilgili özel olan nedir ?
Bir normu benzersizdir (en azından kısmen), çünkü dışbükey olmayan ve dışbükey arasındaki . Bir normu 'en seyrek' dışbükey normdur (değil mi?).L1L1L_1p=1p=1p=1L1L1L_1 I anlamak Öklid norm geometrisinde kökleri ve boyutlar aynı birimlere sahip olduğunda net bir yoruma sahiptir. Ama neden diğer gerçek sayılar üzerinde tercihli olarak kullanıldığını anlamıyorum : ? ? …

3
Beta dağılımı nerede?
Eminim herkes burada, zaten Beta dağılımı ait PDF bilir X∼B(a,b)X∼B(a,b)X \sim B(a,b) tarafından verilir f(x)=1B(a,b)xa−1(1−x)b−1f(x)=1B(a,b)xa−1(1−x)b−1f(x) = \frac{1}{B(a,b)}x^{a-1}(1-x)^{b-1} Bu formülün kökenlerini açıklamak için her yerde avlanıyordum, ama bulamıyorum. Beta dağıtımında bulduğum her makale bu formülü veriyor, birkaç şeklini gösteriyor, sonra doğrudan anlarını tartışmaya devam ediyor ve oradan devam ediyor. Türetemediğim ve …

4
Doğrusal olmayan modeller kullanılırken çoklu-eş-doğrusallıktan endişe edilmeli mi?
Diyelim ki çoğunlukla kategorik özelliklere sahip bir ikili sınıflandırma problemimiz var. Öğrenmek için bazı doğrusal olmayan modeller (örneğin, XGBoost veya Rastgele Ormanlar) kullanıyoruz. Kişi hala çok eşbiçimli olma konusunda endişelenmeli mi? Neden? Yukarıdakilerin cevabı doğruysa, bu tip doğrusal olmayan modelleri kullandığını düşünerek nasıl mücadele etmeliyiz?

2
Sinir Ağları: Bir sıcak değişken ezici sürekli?
Yaklaşık 20 sütun (20 özellik) olan ham veri var. Bunlardan on tanesi sürekli veridir ve 10 tanesi kategoriktir. Kategorik verilerin bazıları 50 farklı değere sahip olabilir (ABD Devletleri). Verileri önceden işledikten sonra 10 sürekli sütun 10 hazırlanmış sütun haline gelir ve 10 kategorik değer 200 tek etkin kodlanmış değişken gibi …

1
Derin pekiştirici öğrenme neden kararsız?
DeepMind'in 2015 derin takviye öğrenimi makalesinde, "Önceki RL'yi sinir ağları ile birleştirmeye yönelik önceki girişimlerin dengesiz öğrenme nedeniyle büyük ölçüde başarısız olduğunu" belirtmektedir. Bu makalede, gözlemler arasındaki korelasyonlara dayanarak bunun bazı nedenleri listelenmektedir. Lütfen birisi bunun ne anlama geldiğini açıklayabilir mi? Sinir ağının eğitimde mevcut olan, ancak testte bulunmayan bazı …


2
Değişken seçiminde çelişkili yaklaşımlar: AIC, p değerleri veya her ikisi mi?
Anladığım kadarıyla, p-değerlerine (en azından regresyon bağlamında) dayalı değişken seçim çok kusurlu. AIC'ye (veya benzeri) dayalı değişken seçimin de benzer nedenlerle bazıları tarafından kusurlu olduğu düşünülmektedir, ancak bu biraz belirsiz görünmektedir (örneğin soruma ve bu konudaki bazı bağlantılara bakın: "Kademeli model seçimi" tam olarak nedir? ). Ancak, modelinizdeki en iyi …


2
R, r kare ve artık standart sapma bize doğrusal bir ilişki hakkında ne anlatıyor?
Regresyon analizinin yorumlanması üzerinde çok az arka plana sahibim ama r, r kare ve artık standart sapmanın anlamı hakkında gerçekten kafam karıştı. Tanımları biliyorum: Karakterizasyonları r dağılım grafiğindeki iki değişken arasındaki doğrusal ilişkinin gücünü ve yönünü ölçer R-kare, verilerin yerleştirilmiş regresyon hattına ne kadar yakın olduğunun istatistiksel bir ölçüsüdür. Kalıntı …

4
İki değişkenin toplamı, bireysel değişkenlerden daha fazla varyansı nasıl açıklayabilir?
İki yordayıcı negatif korelasyonlu olduğunda toplamın üçüncü değişkenle korelasyonu için bazı şaşırtıcı sonuçlar elde ediyorum. Bu şaşırtıcı sonuçlara neden olan nedir? Örnek 1: İki değişkenin toplamı ile üçüncü değişkenin korelasyonu Aşağıda gösterilen Guildford'un 1965 metninin 427. sayfasındaki formül 16.23'ü düşünün. Şaşırtıcı bulgu: Her iki değişken de .2'yi üçüncü değişkenle ve …

2
Özetle KKT grafiksel olarak
Amaç KKT anlayışının doğru olup olmadığını onaylayın. KKT hakkında daha fazla açıklama ve teyit isteyin. Arka fon SVM makalelerinde her zaman maviden çıkan KKT koşullarını, özellikle tamamlayıcı olanı anlamaya çalışmak. Soyut formül listesine ihtiyacım yok ama somut, sezgisel ve grafiksel bir açıklamaya ihtiyacım var. Soru Maliyet fonksiyonunu f (X) en …

1
Dairesel verilerin zaman serisi modellenmesi
Bazı rüzgar / dalga verileri için ARIMA modelleri yapıyorum. Her değişken için ayrı bir model oluşturuyorum. Modellemem gereken değişkenlerden ikisi dalga ve rüzgar yönleridir. Değerler derece cinsindendir (0-360 °). Bu tip verileri değer aralığının dairesel olduğu yerde modellemek mümkün müdür? Değilse, bu tür veriler için hangi model sınıfı en iyisidir?

3
Sınıflandırma için T-SNE kullanarak hiperparametrelerin seçimi
Çalıştığım belirli bir problemde (bir yarışma) follwoing ayarına sahibim: 21 özellik ([0,1] üzerinde sayısal) ve bir ikili çıktı. Yaklaşık 100 K satırım var. Ayar çok gürültülü görünüyor. Ben ve diğer katılımcılar bir süreliğine özellik üretmeyi uyguluyoruz ve t-dağılmış stokastik komşu yerleştirme bu ortamda oldukça güçlü çıktı. "T-SNE Etkili Nasıl Kullanılır" …

1
Veri matrisi diyagonal olduğunda kement problemine kapalı form çözümü
Sorunumuz\newcommand{\diag}{\operatorname{diag}} var: minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),\min_{w\in\mathbb{R}^{d}}\left( \frac{1}{n}\sum_{i=1}^{n} \left( \langle w,x_{i}\rangle-y_{i} \right)^{2} +2\lambda||w||_1\right), şu varsayımla: ∑i=1nxixTi=diag(σ21,...,σ2d).∑i=1nxixiT=diag⁡(σ12,...,σd2).\sum_{i=1}^nx_ix_i^T=\diag(\sigma_1^2,...,\sigma_d^2). Bu durumda kapalı bir çözüm var mı? Ben var: (XTX)−1=diag(σ−21,...,σ−2d),(XTX)−1=diag⁡(σ1−2,...,σd−2),(X^TX)^{-1}=\diag\left(\sigma_1^{-2},...,\sigma_d^{-2}\right), ve bu yüzden cevap olduğunu düşünüyorum : wj=yjmax{0,1−λn|yj|},wj=yjmax{0,1−λn|yj|},w\,^j=y\,^j\max\left\{0,1-\lambda \frac{n}{|y^j|}\right\}, için yj=∑i=1nyixijσ2iyj=∑i=1nyixijσi2y\,^j=\displaystyle\sum_{i=1}^n\frac{y_ix_i\,^j}{\sigma_i^2} , ancak emin değilim.

2
İstatistiksel bakış açısından: Fourier temelli Fourier dönüşümü ve regresyon
Ayrık Fourier dönüşümünün bir eğrinin Fourier temelini kullanarak bir regresyon ile aynı temsilini verip vermediğini anlamaya çalışıyorum. Örneğin, library(fda) Y=daily$tempav[,1] ## my data length(Y) ## =365 ## create Fourier basis and estimate the coefficients mybasis=create.fourier.basis(c(0,365),365) basisMat=eval.basis(1:365,mybasis) regcoef=coef(lm(Y~basisMat-1)) ## using Fourier transform fftcoef=fft(Y) ## compare head(fftcoef) head(regcoef) FFT karmaşık bir sayı …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.