İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Anomali tespiti: hangi algoritmayı kullanmalı?
Bağlam: Yazım hatası olabilecek mantıksız verileri filtrelemek için klinik verileri analiz eden bir sistem geliştiriyorum. Şimdiye kadar ne yaptım: Akla yatkınlığı ölçmek için şimdiye kadar denediğim veriyi normalleştirmek ve sonra D setindeki bilinen veri noktalarına olan uzaklığına bağlı olarak p noktası için bir güvenilirlik değeri hesaplamaktı (= eğitim seti): plausibility(p)=∑q∈DGauss(distance(p,q))plausibility(p)=∑q∈DGauss(distance(p,q))\text{plausibility}(p)=\sum_{q\in …


1
Söyleyen bir teoremi var mı
, tanımlanan ortalama, μ ve standart sapma, σ ile herhangi bir dağılım olsun . Merkezi limit teoremi √XXXμμ\muσσ\sigma dağılımda standart normal dağılıma yakınsar. Eğerσ'yistandartSstandart sapması iledeğiştirirsek, √n−−√X¯−μσnX¯−μσ \sqrt{n}\frac{\bar{X} - \mu}{\sigma} σσ\sigmaSSS dağılımda t-dağılımına yakınsak mı? Büyükn-t-dağılımı için normal yaklaştığından teorem, varsa, sınırın standart normal dağılım olduğunu belirtebilir. Bu nedenle, bana …


2
Küme düzeyinde mi yoksa bireysel düzeyde mi önyükleme yapmalıyım?
Hastanelerde iç içe geçmiş, hastaneler için rastgele bir etki içeren hastalar ile bir hayatta kalma modelim var. Rastgele etki gama dağıtılır ve bu terimin 'alaka düzeyini' kolayca anlaşılan bir ölçekte rapor etmeye çalışıyorum. Medyan Tehlike Oranını (Medyan Oran Oranı gibi) kullanan aşağıdaki referansları buldum ve bunu hesapladım. Bengtsson T, Dribe …


1
Monte Carlo analizi için gerekli simülasyon sayısı
Sorum Monte Carlo analiz yöntemi için gerekli sayıda simülasyon ile ilgili. Gördüğüm kadarıyla, izin verilen herhangi bir yüzde hatası için gerekli simülasyon sayısını (ör. 5) EEEn = { 100 ⋅ zc⋅ standart ( x )E⋅ ortalama ( x )}2,n={100⋅zc⋅std(x)E⋅anlamına gelmek(x)}2, n = \left\{\frac{100 \cdot z_c \cdot \text{std}(x)}{E \cdot \text{mean}(x)} \right\}^2 …

2
Spearman-Brown kehanet formülü farklı zorluklarla ilgili sorulardan nasıl etkilenir?
Spearman-Brown kehanet formülünün sonuçları, farklı veya zor sınıflayıcı olan farklı zorluk veya puanlayıcıların test soruları ile nasıl etkilenir. Saygı duyulan bir metin SB'nin etkilendiğini, ancak ayrıntı vermediğini söylüyor. (Aşağıdaki alıntıya bakın.) Guion, R.M (2011). Personel Kararları için Ölçme, Ölçme ve Tahmin, 2. baskı. Sayfa 477 "Güvenilirlik, Spearman-Brown denklemi kullanılarak havuz …

1
GAP istatistiğini nasıl yorumlamalıyım?
R'deki k kümelerini tahmin etmek için GAP istatistiğini kullandım. Ancak iyi yorumlayıp yorumlamadığımdan emin değilim. Yukarıdaki tablodan 3 küme kullanmam gerektiğini varsayıyorum. İkinci grafikten 6 küme seçmeliyim. GAP istatistiği doğru yorumlanıyor mu? Herhangi bir açıklama için minnettar olurum.
10 clustering 

1
Normal olarak dağıtılmayan hatalar neden önem beyanlarımızın geçerliliğini tehlikeye atar?
OLS modellerini dikkate alma konusunda bir normallik varsayımı vardır ve bu da hataların normal olarak dağıtılmasıdır. Çapraz Doğrulanmış'a göz atıyorum ve Y ve X gibi hataların normal olması için normal olması gerekmez. Benim sorum, normalde dağıtılmayan hatalarımız olduğunda neden önem beyanlarımızın geçerliliği tehlikeye atılıyor? Güven aralıkları neden çok geniş veya …

1
Genelleştirilmiş katkı modelleri için varyans enflasyon faktörü
Doğrusal bir regresyon için olağan VIF hesaplamasında, her bağımsız / açıklayıcı değişken , sıradan bir en küçük kareler regresyonunda bağımlı değişken olarak kabul edilir. yaniXjXjX_j Xj=β0+∑i=1,i≠jnβiXiXj=β0+∑i=1,i≠jnβiXi X_j = \beta_0 + \sum_{i=1, i \neq j}^n \beta_i X_i değerlerinin her biri için depolanır gerileme de görülmemiştir ve VIF'ye belirlenirR2R2R^2nnn VIFj=11−R2jVIFj=11−Rj2 VIF_j = …

3
Bayesian A / B testini ne zaman bitirmeli?
Hacker'lar için Olasılıksal Programlama ve Bayes A / B testleri gibi Bayes yolunda A / B testi yapmaya çalışıyorum . Her iki makale de karar vericinin hangi varyantlardan hangisinin daha iyi olduğuna karar verdiğini varsaymaktadır örneğin , bu nedenle daha iyidir. Bu olasılık, ondan herhangi bir sonuç çıkarmak için yeterli …

1
Bir GARCH (1,1) - R'de ortak değişkenler içeren model takın
Zaman serisi modelleme ile ilgili basit ARIMA modelleri ve benzeri deneyimlerim var. Şimdi volatilite kümelenmesi sergileyen bazı verilerim var ve verilere bir GARCH (1,1) modeli yerleştirmeye başlamak istiyorum. Bir veri serim var ve onu etkilediğini düşündüğüm birkaç değişken var. Yani temel regresyon terimleriyle, şuna benzer: yt= α + β1xt 1+ …
10 r  regression  garch 

2
Yanma sonrası MCMC yinelemeleri yoğunluk tahmini için kullanılabilir mi?
Yakıldıktan sonra, MCMC yinelemelerini doğrudan bir histogram veya çekirdek yoğunluğu tahmini gibi yoğunluk tahmini için kullanabilir miyiz? Benim endişem MCMC yinelemelerinin, en fazla aynı şekilde dağıtılmış olmalarına rağmen, bağımsız olmalarıdır. MCMC tekrarlarına daha fazla inceltme uygularsak ne olur? Benim endişem MCMC yinelemelerinin en fazla ilişkisiz olması ve henüz bağımsız olmamasıdır. …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.