İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Neden Örnek Kuantil Yerine Cornish-Fisher Genişletmesini Kullanalım?
Cornish-Fisher Genişleme anları dayalı bir dağılımın quantiles tahmin etmek için bir yol sağlar. (Bu anlamda, anlara dayalı kümülatif dağılımın bir tahminini veren Edgeworth Genişlemesi'nin bir tamamlayıcısı olarak görüyorum .) Hangi durumlarda ampirik çalışma için Cornish-Fisher genişlemesini tercih edeceğini bilmek istiyorum. numune kantil veya tam tersi. Birkaç tahmin: Hesaplamalı olarak, örnek …

2
Karmaşık mevsimsellik için mevsimsellik endekslerinin hesaplanması
Üstel yumuşatma kullanarak perakende ürünlerini (haftaya göre) tahmin etmek istiyorum. Şu anda sesonalite indekslerinin nasıl hesaplanacağı, saklanacağı ve uygulanacağı konusunda sıkıştım. Sorun şu ki, bulduğum tüm örnekler bir çeşit basit mevsimsellik ile ilgileniyor. Benim durumumda şu sorunlar var: 1. Mevsim her yıl aynı hafta meydana gelmez: hareketli. Mardi-gras, ödünç, paskalya …

2
Yumuşak eşikleme ile Kement cezalandırması
Şimdiye kadar yüksek boyutlu veri kümeleriyle cezalandırılmış çok değişkenli analizde anladığımı özetlemeye çalışıyorum ve hala yumuşak eşikleme ile Kement (veya ) doğru bir tanımını elde mücadele ediyorum .L1L1L_1 Daha kesin olarak, genomik veriler ( tek nükleotid polimorfizmleri dahil olmak üzere 2 bloklu veri yapısını analiz etmek için seyrek PLS regresyonunu …

5
İki analitik yöntemin eşdeğer olduğunu göstermenin yolları nelerdir?
Bir matristeki belirli bir molekülün konsantrasyonunu ölçebilen iki farklı analitik yöntemim var (örneğin sudaki tuz miktarını ölçebilir) İki yöntem farklıdır ve her birinin kendi hatası vardır. İki yöntemi göstermek için hangi yollar eşdeğerdir (veya eşdeğer değildir). Ben bir dağılım grafik üzerinde her iki yöntemle ölçülen bir dizi örnek sonuçları çizmek …

3
Ne olduğunu
Diyelim ki YYY sürekli rasgele bir değişken ve XXX de ayrık bir değişken . Pr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y)Pr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y) \Pr(X=x|Y=y) = \frac{\Pr(X=x)\Pr(Y=y|X=x)}{\Pr(Y=y)} Bilindiği gibi, Pr(Y=y)=0Pr(Y=y)=0\Pr(Y=y) = 0 için YYY bir sürekli rastgele değişkendir. Ve buna dayanarak, Pr(X=x|Y=y)Pr(X=x|Y=y)\Pr(X=x|Y=y) olasılığının tanımsız olduğu sonucuna varıyorum . Ancak Wikipedia burada aslında şu şekilde tanımlandığını iddia ediyor: Pr(X=x|Y=y)=Pr(X=x)fY|X=x(y)fY(y)Pr(X=x|Y=y)=Pr(X=x)fY|X=x(y)fY(y) \Pr(X=x|Y=y) …

2
Can
Eğer , can‖ β * ‖ 2 artış zamanλartar?β∗=argminβ∥y−Xβ∥22+λ∥β∥1β∗=argminβ‖y−Xβ‖22+λ‖β‖1\beta^*=\mathrm{arg\,min}_{\beta} \|y-X\beta\|^2_2+\lambda\|\beta\|_1∥β∗∥2‖β∗‖2\|\beta^*\|_2λλ\lambda Bunun mümkün olduğunu düşünüyorum. Her ne kadar zaman artmaz λ artar (benim geçirmez ), ‖ β * ‖ 2 artırabilir. Aşağıdaki şekilde bir olasılık gösterilmektedir. Zaman λ yükselirse, β * seyahatlerdir (doğrusal) P için Q , daha sonra ‖ β …
11 lasso 

1
Sınırlı kübik spline'lar ve cezalandırılmış spline'lar ne kadar farklıdır?
Çeşitli regresyon problemlerinde spline kullanımı hakkında çok şey okuyorum. Bazı kitaplar (örneğin Hodges Richly Parrametreli Doğrusal Modeller ) cezalandırılmış spline'lar önerir. Diğerleri (örneğin, Harrell Regresyon Modelleme Stratejileri ) kısıtlı kübik spline'ları tercih eder. Bunlar pratikte ne kadar farklı? Sık sık birini veya diğerini kullanmaktan çok farklı sonuçlar elde eder misiniz? …

1
“Önceden seyrek” terimi neyi ifade eder (FBProphet Paper)?
"Ölçekte Öngörü" (FBProphet öngörme aracı, bkz. Https://peerj.com/preprints/3190.pdf ) "Daha önce seyrek" terimiyle karşılaştım. Yazarlar , lojistik büyüme modelinde bir model parametresi olan bazı skaler oran hız sapması vektörünü modellemede böyle bir "seyrek öncekini" kullandıklarını açıklarlar .δδ\mathbf{\delta}kkk Bunlar belirttiği gibi bu , bir parametre ise "seyrek", sıfıra yakın elemanlarını taşıyan vektöre …


2
İkinci dereceden farkın ardındaki sezgi nedir?
Bazen bir zaman serisinin durağan hale getirilmesi için farklı olması gerekebilir. Ancak ikinci dereceden farkın, birinci dereceden fark yeterli olmadığında durağan hale gelmesine nasıl yardımcı olabileceğini anlamıyorum. İkinci mertebe farklar ve ihtiyaç duyulan durumlar için sezgisel bir açıklama yapabilir misiniz?

2
Katlamalı bir katmandaki birden fazla filtre, eğitim sırasında aynı parametreyi öğrenmez mi?
Öğrendiklerime dayanarak, farklı özellik dedektörlerini öğrenmek için bir CNN'nin Konv Katmanında birden çok filtre kullanıyoruz. Ancak bu filtreler benzer şekilde uygulandığından (yani girdinin bölgelerine kaydırılmış ve çoğaltılmış), eğitim sırasında aynı parametreleri öğrenmezler miydi? Bu yüzden birden fazla filtre kullanımı gereksiz olur mu?

1
R'deki her tahmin için regresyondaki güven puanlarını (rastgele ormanlarla / XGBoost ile) nasıl hesaplayabilirim?
Rastgele Ormanlar veya Aşırı Gradient Boosting (XGBoost) gibi algoritmaları kullanırken, tahmin edilen her değer için bir güven puanı almanın bir yolu var mı (buna güven değeri veya olasılığı da diyebiliriz)? Diyelim ki bu güven puanı 0 ile 1 arasında değişiyor ve belirli bir tahminden ne kadar emin olduğumu gösteriyor . …


3
Tek sıcak kodlama ile sahte kodlama arasındaki sorunlar
K seviyeli kategorik değişkenlerin kukla kodlamada k-1 değişkenleri ile kodlanması gerektiğinin farkındayım (benzer şekilde çok değerli kategorik değişkenler için). Çoğunlukla doğrusal regresyon, cezalandırılmış doğrusal regresyon (Kement, Ridge, Elastik Ağ), ağaç tabanlı (rastgele ormanlar) için farklı regresyon yöntemleri için kukla kodlama üzerinde bir sıcak kodlama (yani bunun yerine k değişkenlerini kullanarak) …

2
Bootstrapping'in artıları ve eksileri
Önyükleme kavramını yeni öğrendim ve naif bir soru aklıma geldi: Verilerimizden her zaman çok sayıda bootstrap örneği oluşturabilirsek, neden daha fazla "gerçek" veri elde etmek için uğraşasınız? Bir açıklamam olduğunu düşünüyorum, lütfen doğru olup olmadığımı söyle: Önyükleme işleminin varyansı azalttığını düşünüyorum, ancak orijinal veri kümem BIASED ise, düşük varyans ve …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.