İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Negatif olmayan veriler için sıfırlar halinde toplanan bir model (Tweedie GLM, sıfır şişirilmiş GLM, vb.) Kesin sıfırları tahmin edebilir mi?
Bir Tweedie dağılımı, parametresi (ortalama-varyans ilişkisindeki üs) 1 ile 2 arasında olduğunda, çarpık bir nokta kütlesine sahip eğri verileri modelleyebilir .ppp Benzer şekilde sıfır şişirilmiş (aksi halde sürekli veya ayrık olsun) bir model çok sayıda sıfır içerebilir. Neden bu tür modellerle tahmin yaptığımda veya takılan değerleri hesapladığımda, tahmin edilen tüm …

2
Markov zinciri ile Markov zinciri monte carlo arasındaki bağlantı nedir
SAS kullanarak Markov zincirlerini anlamaya çalışıyorum. Bir Markov sürecinin, gelecekteki durumun sadece geçmiş duruma değil, yalnızca geçmiş duruma bağlı olduğu ve bir durumdan diğerine geçiş olasılığını yakalayan bir geçiş matrisi olduğunu anlıyorum. Ama sonra bu terimle karşılaştım: Markov Zinciri Monte Carlo. Bilmek istediğim, Markov Zinciri Monte Carlo'nun yukarıda tarif ettiğim …

3
Kesilmiş SVD'yi hesaplamak için hangi hızlı algoritmalar var?
Burada muhtemelen konu dışı, ancak zaten birkaç ( bir , iki ) ilgili soru var. Literatürde (veya Kesik SVD Algoritmaları için bir google araması) dolaşmak, kesilmiş SVD'leri çeşitli şekillerde kullanan birçok kağıt ortaya çıkarır ve bunu hesaplamak için hızlı algoritmalar olduğunu iddia eder (sinir bozucu, genellikle alıntı yapmadan), ancak hiç …

5
Çekirdek SVM: Daha yüksek boyutlu bir özellik alanına eşlemenin sezgisel bir şekilde anlaşılmasını ve bunun doğrusal ayırmayı nasıl mümkün kıldığını anlamak istiyorum
Çekirdek SVM'lerin arkasındaki sezgiyi anlamaya çalışıyorum. Şimdi, doğrusal SVM'nin nasıl çalıştığını anlıyorum, böylece verileri olabildiğince bölen bir karar satırı hazırlanıyor. Verileri daha yüksek boyutlu bir alana taşıma arkasındaki ilkeyi ve bunun bu yeni alanda doğrusal bir karar çizgisi bulmayı nasıl kolaylaştırabileceğini de anlıyorum. Anlamadığım şey, veri noktalarını bu yeni alana …

1
iki sayı arasındaki farkın önemi
1. zamandaki trafik kazalarının sayımı arasındaki farkın 2. zamandaki sayımdan önemli ölçüde farklı olup olmadığını belirlemenin bir yolu var mı? Farklı zamanlarda gözlem grupları arasındaki farkı belirlemek için farklı yöntemler buldum (örneğin, poisson araçlarını karşılaştırma), ancak sadece iki sayıyı karşılaştırmak için değil. Yoksa denemek bile geçersiz mi? Herhangi bir tavsiye …

2
Veri Dönüştürme: Tüm değişkenler mi yoksa sadece normal olmayanlar mı?
Andy Field'ın SPSS Kullanarak İstatistikleri Keşfederken tüm değişkenlerin dönüştürülmesi gerektiğini belirtir. Ancak yayında: "Coğrafi ağırlıklı regresyon I: arazi tasarımı ve su kalitesi arasındaki mekansal olarak değişen ilişkilerin incelenmesi": Model tasarımı ve değerlendirmesi "özellikle sadece normal olmayan değişkenlerin dönüştürüldüğünü belirtirler. Bu analiz spesifik mi? Örneğin, ortalamaların karşılaştırılmasında, günlüklerin ham verilerle karşılaştırılması …



1
Araştırmada yüksek doğrulama doğruluğu ancak düşük test doğruluğu varsa ne olur?
Makine öğrenimi araştırmalarında doğrulama hakkında özel bir sorum var. Bildiğimiz gibi, makine öğrenme rejimi araştırmacılardan modellerini eğitim verileri üzerinde eğitmelerini, doğrulama seti ile aday modeller arasından seçim yapmalarını ve test setinde doğruluğunu bildirmelerini ister. Çok titiz bir çalışmada, test seti sadece bir kez kullanılabilir. Bununla birlikte, asla araştırma senaryosu olamaz, …

3
Spline ve Gauss Süreç Regresyonu
Gauss Süreci Regresyonunun (GPR) esnek doğrusal olmayan modellerin takılması için spline kullanımına alternatif olduğunu biliyorum. Özellikle Bayesci regresyon çerçevesinde hangi durumların diğerinden daha uygun olacağını bilmek istiyorum. Zaten baktım oluklarını, düzleştirilmiş oluklarını ve Gauss süreci taklitçileri kullanmanın avantajları / dezavantajları nelerdir? ancak bu yazıda GPR'de hiçbir şey görünmüyor.


1
Exp'den (katsayılardan) Oran Oranına ve Lojistik Regresyonda faktörlerle birlikte yorumlanması
SAT puanlarına ve aile / etnik kökene karşı üniversiteye kabul edilme konusunda doğrusal bir gerileme yaptım. Veriler kurgusaldır. Bu, daha önce cevaplanmış olan önceki bir sorunun takibidir. Soru, SAT puanlarını basitlik için bir kenara bırakırken olasılık oranlarının toplanması ve yorumlanmasına odaklanmaktadır. Değişkenler Accepted(0 veya 1) ve Background("kırmızı" veya "mavi") şeklindedir. …
15 r  regression  logistic 

1
CNN'ler yok olan gradyan problemini nasıl önler
Konvansiyonel sinir ağları hakkında çok şey okudum ve yok olan gradyan probleminden nasıl kaçındıklarını merak ediyordum. Derin inanç ağlarının tek seviyeli otomatik kodlayıcıları veya diğer önceden eğitilmiş sığ ağları biriktirdiğini biliyorum ve bu nedenle bu sorunu önleyebilirim ama CNN'lerde nasıl önlendiğini bilmiyorum. Wikipedia'ya göre : "yukarıda belirtilen" kaybolan gradyan sorununa …

1
Daha sonra analiz yapmak için PCA tarafından yakalanan gerekli bir varyans var mı?
11 değişkenli bir veri setim var ve verileri azaltmak için PCA (dikey) yapıldı. Konuya ilişkin bilgi birikimimden emin olmak için bileşenlerin sayısına karar vermek, iki ana bileşenin (PC) verileri açıklamak için yeterli olduğunu ve geri kalan bileşenlerin sadece daha az bilgilendirici olduğunu belirttim. Paralel analiz ile dağ eteğindeki parsel: gözlemlenen …
15 variance  pca 

4
Bir evrişimli sinir ağı için ne kadar veriye ihtiyacınız var?
Yaklaşık 1.000.000 parametreye sahip olan evrişimli bir sinir ağım (CNN) varsa, kaç tane eğitim verisine ihtiyaç duyulur (stokastik degrade iniş yaptığımı varsayalım)? Temel kural var mı? Ek notlar: Stokastik gradyan inişi gerçekleştirdiğimde (örneğin, 1 yineleme için 64 yama), ~ 10000 yinelemeden sonra, sınıflandırıcının doğruluğu kaba bir sabit değere ulaşabilir). Bu, …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.