İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Çeşitli R kuadratik programlama çözücüleri arasındaki farklar nelerdir?
İkinci dereceden optimizasyon problemlerini çözmeme yardımcı olacak bir paket arıyorum ve en az yarım düzine farklı paket olduğunu görüyorum. Bu sayfaya göre : QP (İkinci dereceden programlama, 90C20): cplexAPI , kernlab , limSolve , LowRankQP , quadprog , Rcplex , Rmosek Bunlardan bazıları (Rmosek ve cplexAPI) diğer tescilli paketlere bağlıdır, …
9 r  optimization 

6
Anomali tespiti için özellikler nasıl hazırlanır / oluşturulur (ağ güvenliği verileri)
Amacım izinsiz giriş tespiti amacıyla kümeleme / anormallik algılama kullanarak ağ günlüklerini (ör. Apache, syslog, Active Directory güvenlik denetimi vb.) Analiz etmektir. Günlüklerden IP adresi, kullanıcı adı, ana bilgisayar adı, hedef bağlantı noktası, kaynak bağlantı noktası ve benzeri gibi çok fazla metin alanım var (toplam 15-20 alanda). Günlüklerde bazı saldırılar …

1
Monte Carlo == rastgele bir süreç uyguluyor mu?
Hiçbir zaman resmi bir istatistik kursum olmadı, ancak araştırmalarımdan dolayı sürekli olarak çeşitli istatistiksel kavramları uygulayan makalelere rastlıyorum. Genellikle belirli bir duruma uygulanan Monte Carlo sürecinin bir açıklamasını göreceğim ve 10 defadan 9'unu toplayabildiğim şey, basit bir nüfus nesli ve daha sonraki çalışmasıyla ilgili. Benim sorum: İstatistik dünyasında, Monte Carlo …

3
Bazı gözlemler için ofset değişkeninin 0 olduğu sayı verilerini modelleme
Bir meslektaşından bir öğrenciye yardım etmeye çalışıyorum. Öğrenci, deneysel bir düzenekte kuş davranışını (çağrı sayısı) gözlemledi ve saydı. Her deney sırasında gözlemlenen belirli bir kuşa atfedilebilen çağrıların sayısı belirlenemedi, ancak kaydedilen çağrıların sayısına katkıda bulunan kuşların sayısını saymak mümkün oldu. Bu nedenle ilk önerim, kuş sayısını bir Poisson GLM modelinde …

1
Belirli miktarlardan dağılımların toplam miktarını hesapla
Varsayalım NNN bağımsız rasgele değişkenler X1,...,XNX1,...,XNX_1, ..., X_N belirli bir seviyedeki miktarlar αα\alpha verilerden tahminlerle bilinir: α=P(X1&lt;q1)α=P(X1&lt;q1)\alpha = P(X_1 < q_1), ..., α=P(XN&lt;qN)α=P(XN&lt;qN)\alpha = P(X_N < q_N). Şimdi rastgele değişkeni tanımlayalımZZZ toplam olarak Z=∑Ni=1XiZ=∑i=1NXiZ = \sum_{i=1}^N X_i. Toplamın kantilinin değerini seviyeden hesaplamanın bir yolu var mıαα\alpha, yani, qzqzq_z içinde α=P(Z&lt;qZ)α=P(Z&lt;qZ)\alpha …
9 quantiles 

1
(Tahmin) kelimesini (lojistik) regresyon için kullanmak ne kadar adil?
Anladığım kadarıyla regresyon bile nedensellik vermiyor. Sadece y değişkeni ve x değişkeni ve muhtemelen bir yön arasında ilişki verebilir. Doğrumuyum? Çoğu ders kitaplarında ve çevrimiçi çeşitli ders sayfalarında bile "x tahminleri y" ile benzer ifadeler buldum. Ve sık sık regresörleri yordayıcı, y ise yanıt olarak adlandırırsınız. Doğrusal regresyon için kullanmak …



3
Mathematica'nın binom olasılığından sapan rasgele sayı üreteci?
Diyelim ki 10 kez bozuk para çevirdiniz ve buna 1 "etkinlik" deyin. Eğer bu "olayların" 1.000.000'ini yönetirseniz, kafaları 0.4 ile 0.6 arasında olan olayların oranı nedir? Binom olasılığı bunun yaklaşık 0,65 olmasını önerir, ancak Mathematica kodum bana yaklaşık 0,24'ü anlatıyor İşte benim sözdizim: In[2]:= X:= RandomInteger[]; In[3]:= experiment[n_]:= Apply[Plus, Table[X, …

1
Üstel dağılımın ML tahmini (sansürlenmiş verilerle)
Hayatta Kalma Analizinde, bir rv hayatta kalma süresinin katlanarak dağıtıldığını . Ben şimdi düşünüldüğünde iid RV ait "çıktıları" . Bu sonuçların sadece bir kısmı aslında "tamamen gerçekleşir", yani geriye kalan gözlemler hala "canlıdır".XiXiX_ix1,…,xnx1,…,xnx_1,\dots,x_nXiXiX_i Dağılımın rate parametresi için bir ML tahmini yapmak istersem, gerçekleştirilmeyen gözlemleri tutarlı / uygun bir şekilde nasıl …

3
Korelasyonu elde etmek için 2D verileri nasıl yeniden düzenleyebilirim?
İki sürekli değişkenli basit veri setim var; yani: d = data.frame(x=runif(100,0,100),y = runif(100,0,100)) plot(d$x,d$y) abline(lm(y~x,d), col="red") cor(d$x,d$y) # = 0.2135273 Değişkenler arasındaki korelasyon ~ 0.6 olacak şekilde verileri yeniden düzenlemem gerekiyor. Her iki değişkenin ortalamalarını ve diğer tanımlayıcı istatistiklerini (sd, min, max, vb.) Sabit tutmam gerekiyor. Verilen verilerle hemen hemen …
9 r  correlation 

1
Olabilirlik işlevi nasıl hesaplanır
3 elektronik bileşenin ömrü X1=3,X2=1.5,X1=3,X2=1.5,X_{1} = 3, X_{2} = 1.5, ve X3=2.1X3=2.1X_{3} = 2.1. Rasgele değişkenler, parametre ile üstel dağılımdan 3 boyutlu rastgele bir örnek olarak modellenmiştir.θθ\theta. Olabilirlik işlevi,θ&gt;0θ&gt;0\theta > 0 f3(x|θ)=θ3exp(−6.6θ)f3(x|θ)=θ3exp(−6.6θ)f_{3}(x|\theta) = \theta^{3} exp(-6.6\theta), nerede x=(2,1.5,2.1)x=(2,1.5,2.1)x = (2, 1.5, 2.1). Ve sonra sorun, MLE'nin değerini bularak θθ\theta en üst …

1
Normal dağılımların üst düzey ürünlerine ilişkin beklentiler
İki normal dağıtılmış değişkenim var X1X1X_1 ve X2X2X_2 ortalama sıfır ve kovaryans matrisi ile ΣΣ\Sigma. Değerini hesaplamaya çalışmakla ilgileniyorumE[X21X22]E[X12X22]E[X_1^2 X_2^2] girişleri açısından ΣΣ\Sigma. Almak için toplam olasılık yasasını kullandım E[X21X22] = E[X21E[X22|X1] ]E[X12X22]=E[X12E[X22|X1]]E[X_1^2 X_2^2] = E[X_1^2 E[X_2^2 | X_1]] ama iç beklentinin neye indirdiğinden emin değilim. Burada başka bir yöntem …

1
Binom yanıtları için heterossedastik genelleştirilmiş doğrusal modelin yerleştirilmesi
Aşağıdaki deneysel tasarımdan verilerim var: gözlemlerim, her biri bireylerden oluşan iki grup için , tedavilerden, her bir faktör kombinasyonunda replikatların bulunduğu K, karşılık gelen sayıda denemeden ( N) başarıların sayısı ( ) sayımıdır. . Burada T *, R * * Bu yüzden, tamamen bir 2 var K 'nin ve mukabil …

1
2.2a.16 “Sağlam İstatistikler: Etki Fonksiyonlarına Dayalı Yaklaşım” uygulamasının çözümü
Sağlam İstatistikler'nin 180. sayfasında : Etki Fonksiyonlarına Dayalı Yaklaşım aşağıdaki soruyu bulur: 16: Konum değişmez tahmin ediciler için her zaman olduğunu gösterin . Her ikisi de tek veya çift olduğu durumda , sonlu örnek parçalama noktası ilgili üst sınırı bulun .ε∗≤12ε∗≤12\varepsilon^*\leq\frac{1}{2}ε∗nεn∗\varepsilon^*_nnnnnnn İkinci kısım (noktadan sonra) aslında önemsizdir (birincisi verilir) ama …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.