İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
LogisticRegressionCV'de yakınsama nasıl düzeltilir?
Ben scikit-learn veri kümesi (> 7000 normalleştirilmiş gözlemler ile yaklaşık 14 parametre) ile çapraz validasyon ile lojistik regresyon gerçekleştirmek için kullanıyorum. Ayrıca 1 veya 0 değerine sahip bir hedef sınıflandırıcı var. Sahip olduğum sorun, kullanılan çözücüden bağımsız olarak, yakınsama uyarıları almaya devam etmem ... model1 = linear_model.LogisticRegressionCV(cv=10,verbose=1,n_jobs=-1,scoring='roc_auc',solver='newton-cg',penalty='l2') /home/b/anaconda/lib/python2.7/site-packages/scipy/optimize/linesearch.py:285: LineSearchWarning: The …

4
R'de bir nls modeli için doğru başlangıç ​​değerlerini elde etme
Aşağıdaki gibi bir veri kümesine basit bir güç yasası modeli sığdırmaya çalışıyorum: mydf: rev weeks 17906.4 1 5303.72 2 2700.58 3 1696.77 4 947.53 5 362.03 6 Amaç, güç hattını geçmek ve revgelecek haftalara yönelik vlaueları tahmin etmek için kullanmaktır . Bir grup araştırma beni nlsşu şekilde uyguladığım işleve götürdü …

2
Sırt regresyonu neden LASSO'dan daha iyi yorumlanabilirlik sağlayamıyor?
Sırt regresyonu ve LASSO'nun artıları ve eksileri hakkında zaten bir fikrim var. LASSO için, L1 ceza süresi, bir özellik seçim yöntemi olarak görülebilen seyrek bir katsayı vektörü verecektir. Bununla birlikte, LASSO için bazı sınırlamalar vardır. Özelliklerin yüksek korelasyonu varsa, LASSO bunlardan sadece birini seçecektir. Ek olarak, > n olan problemler …

4
Sıra normalleşmesinin amacı nedir
Sütun normalleşmesinin ardındaki mantığı anlıyorum, çünkü özelliklerin aynı ölçekte ölçülmemiş olsalar bile eşit olarak ağırlıklandırılmasına neden oluyor - ancak, en yakın komşu literatüründe, hem sütunlar hem de satırlar normalleştiriliyor. Satır normalleştirmesi nedir / neden satırları normalleştirmelisiniz? Özellikle, satır normalleştirmesinin sonucu satır vektörleri arasındaki benzerliği / mesafeyi nasıl etkiler?


4
Lojistik regresyon analizinde sürekli bağımsız değişkenler için logit için doğrusallık varsayımını nasıl kontrol etmeliyim?
Lojistik regresyon analizinde sürekli öngörücü değişkenler için logit için doğrusallık varsayımı ile karıştırıyorum. Tek değişkenli lojistik regresyon analizi kullanarak potansiyel prediktörleri tararken doğrusal ilişkiyi kontrol etmemiz gerekir mi? Benim durumumda, katılımcılar arasında beslenme durumu (ikilik sonuç) ile ilişkili faktörleri tanımlamak için çoklu lojistik regresyon analizini kullanıyorum. Yaş, Charlson komorbidite skoru, …

1
Gauss Proses Regresyonunda Hiperparametre Ayarı
log(y|X,θ)=−12yTK−1yy−12log(det(K))−n2log(2π)log⁡(y|X,θ)=−12yTKy−1y−12log⁡(det(K))−n2log⁡(2π)\log(\mathbf{y}|X,\mathbf{\theta})=-\frac{1}{2} \mathbf{y}^TK_y^{-1}\mathbf{y}-\frac{1}{2}\log(\det(K))-\frac{n}{2}\log(2\pi)KKKKij=k(xi,xj)=b−1exp(−12(xi−xj)TM(xi−xj))+a−1δijKij=k(xi,xj)=b−1exp⁡(−12(xi−xj)TM(xi−xj))+a−1δijK_{ij}=k(x_i,x_j)=b^{-1}\exp(-\frac{1}{2}(x_i-x_j)^TM(x_i-x_j))+a^{-1}\delta_{ij}M=lIM=lIM=lIa,ba,ba,blll log marjinal olabilirlik wrt parametrelerinin kısmi türevi aşağıdakilog(y|X,θ)dθ=12trace(K−1dKdθ)+12(ydKdθK−1dKdθy)log⁡(y|X,θ)dθ=12trace(K−1dKdθ)+12(ydKdθK−1dKdθy)\frac{\log(\mathbf{y}|X,\mathbf{\theta})}{d\theta}=\frac{1}{2}\mathrm{trace}(K^{-1}\frac{dK}{d\theta})+\frac{1}{2}(\mathbf{y}\frac{dK}{d\theta}K^{-1}\frac{dK}{d\theta}\mathbf{y}) girişleri parametrelere bağlı olduğundan, türevler ve tersi de geçerlidir . Bu, gradyan tabanlı bir optimize edici kullanıldığında, gradyanın belirli bir noktada (parametre değeri) değerlendirilmesi, kovaryans matrisinin yeniden hesaplanmasını gerektireceği anlamına gelir. Benim uygulamada, bu mümkün değildir çünkü kovaryans matrisini sıfırdan …

2
Önyargılı bootstrap: CI'yi gözlemlenen istatistik etrafında ortalamak uygun mu?
Bu, Bootstrap'e benzer : tahmin, güven aralığının dışında Bir popülasyondaki genotiplerin sayısını temsil eden bazı verilerim var. Shannon dizinini kullanarak genetik çeşitliliği tahmin etmek ve ayrıca bootstrapping kullanarak bir güven aralığı oluşturmak istiyorum. Bununla birlikte, önyükleme yoluyla tahminin son derece önyargılı olduğunu ve gözlemlediğim istatistik dışında kalan bir güven aralığıyla …

1
Siyam sinir ağında geri yayılma nasıl çalışır?
İmzaların tanınması için 1994 yılında Yann LeCun ve meslektaşları tarafından sunulan siyam sinir ağının mimarisini inceliyorum ( “Siyam zaman gecikmesi sinir ağı kullanılarak imza doğrulaması” .pdf , NIPS 1994) Bu mimarinin genel fikrini anladım, ancak bu durumda geri yayılımın nasıl çalıştığını gerçekten anlayamıyorum. Sinir ağının hedef değerlerinin ne olduğunu anlayamıyorum, …

2
Büzülme nedir?
Büzülme sözcüğü belirli çevrelerde çok fazla atılır. Ama büzülme nedir, net bir tanım yok gibi görünüyor. Bir zaman serim varsa (ya da herhangi bir sürecin herhangi bir gözlem koleksiyonuna sahipsem), serideki ampirik büzülmeyi ölçmenin farklı yolları nelerdir? Bahsetebileceğim farklı teorik büzülme türleri nelerdir? Büzülme öngörüye nasıl yardımcı olabilir? İnsanlar iyi …

3
Bernoulli çalışmasında “başarı” olasılığını tahmin etmek için gerekli örnek büyüklüğü
Bir oyunun tamamlandığında ya ödül veren ya da hiçbir şey vermeyen bir etkinlik sunduğunu varsayalım. Ödülün verilip verilmediğini belirlemek için kesin mekanizma bilinmemektedir, ancak rastgele bir sayı üretecinin kullanıldığını varsayıyorum ve sonuç sabit kodlanmış bir değerden daha büyükse ödülü alırsınız. Temelde, programcılara ödülün ne sıklıkta verildiğini (tahmini% 15-30) belirlemek için …


3
Birim bilyadan N numunenin ortasına kadar en yakın medyan nokta için formülün açıklaması
In İstatistiksel Öğrenme Elements , bir sorun yüksek boyutlu uzaylarda k-nn ile vurgulamak konulara tanıtıldı. Vardır NNN homojen bir dağıtılan veri noktaları ppp boyutlu birim top. Başlangıç ​​noktasından en yakın veri noktasına olan ortalama mesafe ifadesi tarafından verilir: d(p,N)=(1−(12)1N)1pd(p,N)=(1−(12)1N)1pd(p,N) = \left(1-\left(\frac{1}{2}\right)^\frac{1}{N}\right)^\frac{1}{p} Zaman en yakın nokta olarak sınırına yaklaşırken, nasıl topun …

1
Arasındaki bağlantıları (d-asal) ve AUC (ROC eğrisinin altındaki alan); Temel varsayımlar
Makine öğreniminde , bir sistemin iki kategori arasında ne kadar iyi ayrım yapabileceğini özetlemek için ROC eğrisinin altındaki alanı (genellikle AUC veya AUROC olarak kısaltılır ) kullanabiliriz. Sinyal algılama teorisinde genellikle (hassasiyet indeksi) benzer bir amaç için kullanılır. İkisi yakından bağlantılıdır ve bazı varsayımların karşılanması durumunda birbirlerine eşdeğer olduklarına inanıyorum …

6
Ani değişim nasıl karakterize edilir?
Bu soru çok temel olabilir. Bir verinin zamansal eğilimi için, "ani" değişikliğin gerçekleştiği noktayı bulmak istiyorum. Örneğin, aşağıda gösterilen ilk şekilde, bazı istatistik yöntemlerini kullanarak değişiklik noktasını bulmak istiyorum. Ve böyle bir yöntemi, değişiklik noktasının açık olmadığı diğer bazı verilere uygulamak istiyorum (2. şekil gibi).

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.