İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


3
Sıfır olmayan asimptotik varyans ile asimptotik tutarlılık - neyi temsil eder?
Sorun daha önce ortaya çıktı, ancak açıklığa kavuşturacak (ve sınıflandıracak) bir cevap ortaya çıkarmaya çalışacak belirli bir soru sormak istiyorum: "Zavallı Adamın Asimptotikleri" nde insan, (a) olasılıkta bir sabite yaklaşan rastgele değişkenler dizisi aksine (b) olasılıkla rastgele bir değişkene (ve dolayısıyla ona dağılımda) yaklaşan rastgele değişkenler dizisi. Ama "Bilge Adamın …

2
Birden fazla kategorik değişken olduğunda betaların yorumlanması
O kavramını regresyon katsayısı iki kategoriye ortalama farkıdır uç yorumlamak kategorik değişkeni 0 eşittir (veya referans grubu olduğu) zaman için ortalamasıdır. > 2 kategoride bile, her bir bu kategorinin ortalaması ile referans arasındaki farkı açıkladığını varsayabilirim . ββ^0β^0\hat\beta_0β^β^\hat\beta Ancak, çok değişkenli modele daha fazla değişken getirilirse ne olur? Şimdi, iki …

4
ve , in bağımsızlığının ardındaki sezgi nedir ?
Birisinin , standart normal dağılıma sahip olan ve , rasgele değişkenlerinin neden bağımsız olduğunu açıklayan bir argüman önerebileceğini umuyordum . Bu gerçeğin kanıtı MGF tekniğinden kolayca geliyor, ancak bunu son derece sezgisel buluyorum.Y 2 = X 1 + X 2 X iY1=X2−X1Y1=X2−X1Y_1=X_2-X_1Y2=X1+X2Y2=X1+X2Y_2=X_1+X_2XiXiX_i Bu yüzden eğer varsa sezgiyi takdir ediyorum. Şimdiden …

3
Optimizasyon teknikleri örnekleme teknikleriyle eşleşiyor mu?
Herhangi bir genel örnekleme algoritmasından, bir optimizasyon algoritması türetilebilir. Gerçekten de, fonksiyonunu en üst düzeye çıkarmak için , den örnek çizmek yeterlidir . İçin yeterince küçük, bu numuneler fonksiyonu global maksimum (veya uygulamada yerel maksimum) yakın düşecek .f:x→f(x)f:x→f(x)f: \textbf{x} \rightarrow f(\textbf{x})g∼ef/Tg∼ef/Tg \sim e^{f/T}TTTfff "Örnekleme" ile kastedilen, bir sabite kadar bilinen …

1
İkili sınıflandırma için kayıp fonksiyonları arasında seçim yapma
İnsanların sıklıkla ROC-AUC veya AveP (ortalama hassasiyet) bildirdiği bir sorun alanında çalışıyorum . Ancak, yakın zamanda Log Loss'i optimize eden kağıtlar buldum , ancak diğerleri Menteşe Kaybını bildirdi . Bu metriklerin nasıl hesaplandığını anlasam da , aralarındaki ödünleşimleri anlamakta zorlanıyorum ve bu tam olarak ne için iyi. ROC-AUC ve Precision-Recall'a …

3
Negatif-binom GLM ve sayım verileri için log dönüşümü: artan Tip I hata oranı
Bazılarınız bu güzel makaleyi okumuş olabilir: O'Hara RB, Kotze DJ (2010) Sayım verilerini günlüğe kaydetmeyin. Ekoloji ve Evrimde Yöntemler 1: 118-122. tıklayın . Araştırma alanımda (ekotoksikoloji) kötü çoğaltılmış deneylerle uğraşıyoruz ve GLM'ler yaygın olarak kullanılmıyor. Bu yüzden O'Hara & Kotze (2010) ile benzer bir simülasyon yaptım, ancak ekotoksikolojik verileri taklit …

3
Sonuçları “son derece anlamlı” olarak belirtmek yanlış mıdır?
İstatistikçiler , değeri olan geleneksel seviyesinin oldukça altında olduğunda neden sonuçlara " yüksek derecede anlamlı" demekten vazgeçiyorlar ?α 0.05pppαα\alpha0.050.050.05 % 99,9'luk Tip I hatası ( ) olma şansına sahip olan bir sonuca, yalnızca bu şansı% 99 ( ) veren bir sonuçtan daha fazla güvenmek gerçekten yanlış mıdır ?p = 0.01p=0.001p=0.001p=0.001p=0.01p=0.01p=0.01

3
Bayes istatistikleri istatistiksel süreç kontrolü için neden daha popüler değil?
Bayesci ve sık sık tartışma konusundaki anlayışım, sıklık istatistikleri: nesneldir (veya iddia edilir) veya en azından tarafsız farklı varsayımları kullanan farklı araştırmacılar yine de nicel olarak karşılaştırılabilir sonuçlar elde edebilirler bayes istatistikleri iken "daha iyi" tahminlerde bulunduğunu iddia ediyor (yani daha düşük beklenen kayıp), çünkü ön bilgileri kullanabilir (diğer nedenlerin …

1
Temel bileşen analizini kullanarak verileri beyazlatma nasıl yapılır?
Verilerimi XX\mathbf X varyanslar bir olacak ve kovaryanslar sıfır olacak şekilde dönüştürmek istiyorum (yani verileri beyazlatmak istiyorum). Ayrıca, araçlar sıfır olmalıdır. Oraya Z standardizasyonu ve PCA-dönüşümü yaparak ulaşacağımı biliyorum, ama hangi sırayla yapmalıyım? Kombine beyazlatma dönüşümünün biçiminde olması gerektiğini eklemeliyim x↦Wx+bx↦Wx+b\mathbf{x} \mapsto W\mathbf{x} + \mathbf{b}. PCA'ya benzer şekilde hem bu …

4
Bir Gizli Markov Modelinin Eğitimi, birden fazla eğitim örneği
Bu eğiticiye göre ayrı bir HMM uyguladım http://cs229.stanford.edu/section/cs229-hmm.pdf Bu eğitim ve diğerleri her zaman bir gözlem sekansı verilen bir HMM'nin eğitiminden bahseder. Birden fazla egzersiz dizim olduğunda ne olur? Onları sıralı olarak çalıştırmalı mıyım, modeli birbiri ardına eğitmeli miyim? Başka bir seçenek, dizileri bire birleştirmek ve üzerinde çalışmaktır, ancak daha …

9
Referans Talebi: Genelleştirilmiş Doğrusal Modeller
Genelleştirilmiş Doğrusal Modeller hakkında orta seviye bir kitap arıyorum. İdeal olarak, modellerin arkasındaki teoriye ek olarak, R veya başka bir programlama dilinde uygulamaları ve örnekleri içermesini isterim - SAS'ın da popüler bir seçim olduğunu duyuyorum. Kendi başıma çalışmayı planlıyorum ve bu yüzden kendi egzersizlerine cevaplar vermesi yardımcı olacaktır. Matematik ve …

1
Spesifik sapma ile normal dağılım karesi
Normal olarak dağıtılmış rastgele bir değişkeninin karesinin ile dağılımı nedir? Biliyorum standart normal dağılım karesi alırken geçerli bir argüman , ama ya birim dışı varyans durumunda?X2X2X^2X∼N(0,σ2/4)X∼N(0,σ2/4)X\sim N(0,\sigma^2/4)χ2(1)=Z2χ2(1)=Z2\chi^2(1)=Z^2

2
Gauss karışımını optimize etmek neden doğrudan hesaplama açısından zor?
Gauss'luların bir karışımının günlük olasılığını düşünün: l(Sn;θ)=∑t=1nlogf(x(t)|θ)=∑t=1nlog{∑i=1kpif(x(t)|μ(i),σ2i)}l(Sn;θ)=∑t=1nlog⁡f(x(t)|θ)=∑t=1nlog⁡{∑i=1kpif(x(t)|μ(i),σi2)}l(S_n; \theta) = \sum^n_{t=1}\log f(x^{(t)}|\theta) = \sum^n_{t=1}\log\left\{\sum^k_{i=1}p_i f(x^{(t)}|\mu^{(i)}, \sigma^2_i)\right\} Bu denklemi doğrudan maksimize etmenin niçin hesaplama açısından zor olduğunu merak ediyordum? Neden zor olduğu açık ya da belki de neden zor olduğu hakkında daha titiz bir açıklama üzerinde net bir sezgi arıyordum. Bu problem …

3
Lojistik regresyon katsayılarının standart hatalarını hesaplama
Lojistik regresyonu eğitmek ve test etmek için Python'un scikit-learn'u kullanıyorum. scikit-learn, regresyonun bağımsız değişkenlerin katsayılarını döndürür, ancak katsayıların standart hatalarını sağlamaz. Her katsayı için Wald istatistiği hesaplamak ve bu katsayıları birbirleriyle karşılaştırmak için bu standart hatalara ihtiyacım var. Bir lojistik regresyon katsayıları için standart hataların nasıl hesaplanacağına dair bir açıklama …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.