İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Matrise yeni bir satır ekledikten sonra SVD ayrışmasını güncelleme
SVD ayrışması A = U S V with olan m × n boyutunda yoğun bir matrisine sahip olduğumu varsayalım .AA \textbf{A}m×nm×nm \times nA=USV⊤.A=USV⊤.\mathbf{A}=\mathbf{USV}^\top.In Rben SVD hesaplayabilirsiniz şöyle: svd(A). A'ya yeni satır eklenirse , SVD'yi sıfırdan yeniden hesaplamaksızın eski SVD ayrışmasını eskisine göre (yani U , S ve V kullanarak ) …

2
İmkansız bir tahmin sorunu mu?
Soru Negatif bir binom (NB) dağılımının varyansı her zaman ortalamasından daha büyüktür. Bir numunenin ortalaması varyansından daha büyük olduğunda, NB parametrelerini maksimum olasılıkla veya moment tahmini ile uydurmaya çalışmak başarısız olur (sonlu parametrelerle çözüm yoktur). Bununla birlikte, bir NB dağılımından alınan bir numunenin ortalama varyanstan daha büyük olması mümkündür. İşte …

2
Kümeleme - Kleinberg'in İmkansızlık Teoreminin arkasındaki sezgi
Kleinberg (2002) tarafından kümelenmenin zorluklarını araştıran bu ilginç analiz hakkında bir blog yazısı yazmayı düşünüyorum . Kleinberg, bir kümeleme işlevi için görünüşte sezgisel görünen üç desideratayı özetlemekte ve daha sonra böyle bir işlevin olmadığını kanıtlamaktadır. Üç ölçütten ikisini doyuran birçok kümeleme algoritması vardır; ancak, hiçbir işlev aynı anda üçünü de …

5
Uygulamalı bir istatistik dersinde basıklık öğretmeli miyiz? Öyleyse nasıl?
Merkezi eğilim, yayılma ve çarpıklık en azından sezgisel olarak nispeten iyi tanımlanabilir; Bunların standart matematiksel ölçümleri de sezgisel görüşlerimize nispeten iyi karşılık gelir. Ancak basıklık farklı görünüyor. Çok kafa karıştırıcı ve dağıtım şekli ile ilgili herhangi bir sezgi ile iyi uyuşmuyor. Uygulanan bir ortamda basıklığın tipik bir açıklaması, Microsoft Excel …

2
Bir örneğin CDF'si neden eşit olarak dağıtılır
Okumayı burada bir örnek verilmiş olduğu X1,X2,...,XnX1,X2,...,Xn X_1,X_2,...,X_n ED ile sürekli bir dağılımdan FXFX F_X , örnek tekabül eden Ui=FX(Xi)Ui=FX(Xi) U_i = F_X(X_i) , standart bir düzgün dağılımını izler. Bunu Python'daki nitel simülasyonları kullanarak doğruladım ve ilişkiyi kolayca doğrulayabildim. import matplotlib.pyplot as plt import scipy.stats xs = scipy.stats.norm.rvs(5, 2, 10000) …
17 pdf  uniform  cdf  intuition 


3
Ne zaman bir topluluk sınıflandırıcısı kullanmamalıyım?
Genel olarak, amaç doğru dışı numune tahmin etmek sınıfı üyelik olan bir sınıflandırma problemi, içinde ne zaman gerektiğini değil bir topluluk sınıflandırıcı kullanılır? Bu soru neden Topluluk öğrenmeyi her zaman kullanmıyorsunuz? . Bu soru neden hep toplulukları kullanmadığımızı soruyor. Toplulukların, topluluk dışı bir eşdeğere göre daha kötü (sadece "daha iyi …

2
Regresyon analizi ve eğri uydurma arasındaki fark
Herkes bana regresyon analizi ve eğri uydurma (doğrusal ve doğrusal olmayan) arasındaki gerçek farkları mümkünse bir örnekle açıklayabilir mi? Hem iki değişken (bağımsız veya bağımlı) arasında bir ilişki bulmaya çalışıyor, hem de önerilen modellerle ilişkili parametreyi (veya katsayıyı) belirlemeye çalışıyor. Örneğin, aşağıdaki gibi bir veri kümem varsa: Y = [1.000 …



1
LOESS için tahmin aralıkları nasıl hesaplanır?
Bana bunu veren bir LOESS modeli R kullanarak bazı veriler var: Verilerin bir öngörücüsü ve bir yanıtı vardır ve heterossedastiktir. Ayrıca güven aralıkları ekledim. Sorun şu ki, aralıklar çizgi için güven aralıklarıdır, oysa tahmin aralıklarıyla ilgileniyorum. Örneğin, alt panel üst panelden daha değişkendir, ancak bu aralıklarla yakalanmaz. Bu soru biraz …

1
Torbalamanın teorik garantileri nelerdir?
Şunu duydum (yaklaşık olarak): torbalama, bir kestirimci / kestirimci / öğrenme algoritmasının varyansını azaltmak için bir tekniktir. Ancak, bu ifadenin resmi matematiksel kanıtını hiç görmedim. Bunun neden matematiksel olarak doğru olduğunu bilen var mı? Bu kadar yaygın kabul gören / bilinen bir gerçek gibi görünüyor, buna doğrudan bir referans bekliyorum. …

2
Dağılımı nedir
Her biri [ 0 , 1 ] ' de dört bağımsız düzgün dağılmış değişkenim var . ( A - d ) 2 + 4 b c'nin dağılımını hesaplamak istiyorum . I dağılımı hesaplanabilir u 2 = 4 b C olması f 2 ( u 2 ) = - 1a,b,c,da,b,c,da,b,c,d[0,1][0,1][0,1](a−d)2+4bc(a−d)2+4bc(a-d)^2+4bcu2=4bcu2=4bcu_2=4bcf2(u2)=−14lnu24f2(u2)=−14ln⁡u24f_2(u_2)=-\frac{1}{4}\ln\frac{u_2}{4} (dolayısıylau2∈(0,4]u2∈(0,4]u_2\in(0,4]) …

2
Yankı Devlet Ağlarının sezgisel açıklaması nedir?
Tekrarlayan Sinir Ağlarında (RNN) yeniyim ve hala kavramları öğreniyorum. Soyut bir düzeyde, bir Yankı Durum Ağı'nın (ESN) giriş kaldırıldıktan sonra bile bir dizi girdi, yani bir sinyal üretebildiğini anlıyorum . Ancak, Scholarpedia makalesini tamamen kavramak ve anlamak çok zor buldum . Birisi öğrenmenin matematiksel olarak nasıl çalıştığını mümkün olan en …

2
Hangi (simetrik) dağılımlar için örnek, örnek medyandan daha verimli bir tahmin edicidir?
Örnek medyanının, örneklerin ortalamasının daha sağlam bir ölçüsü olduğu inancı altında çalıştım, çünkü aykırı değerleri göz ardı eder. Bu nedenle ( başka bir soruya cevap olarak ) normal bir dağılımdan alınan numuneler için, numune ortalamasının varyansının, numune medyanının varyansından daha az olduğunu (en azından büyükler için)nnn ). Bunun neden doğru …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.