İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Gauss karışım modelleri (GMM'ler) ile çalışmak için Python paketleri
Python'da Gauss Karışım Modelleri (GMM) ile çalışmak için çeşitli seçenekler var gibi görünüyor. İlk bakışta en az: PyMix - http://www.pymix.org/pymix/index.php Karışım modelleme araçları - PyEM http://www.ar.media.kyoto-u.ac.jp/members/david/softwares/em/ Scipy araç kutusu bir parçasıdır ve gmms odaklanmak gibi görünüyor Şimdi bir deyişle: Güncellemesi sklearn.mixture . PyPR - http://pypr.sourceforge.net/ örüntü tanıma ve GMM'ler dahil …

2
Çapraz doğrulama ve sıralı lojistik regresyon
Ordinal lojistik regresyon için çapraz doğrulamayı anlamaya çalışıyorum. Oyunun amacı bir analizde kullanılan modeli doğrulamaktır ... İlk önce bir oyuncak veri seti oluşturdum: set.seed(1) N <- 10000 # predictors x1 <- runif(N) x2 <- runif(N) x3 <- runif(N) # coeffs in the model a <- c(-2,-1) x <- -x1+2*x2+x3 # …

2
Lojistik regresyon katsayılarının analizi
İşte lojistik regresyon katsayılarının bir listesi (birincisi bir engeldir) -1059.61966694592 -1.23890500515482 -8.57185269220438 -7.50413155570413 0 1.03152408392552 1.19874787949191 -4.88083274930613 -5.77172565873336 -1.00610998453393 Kesişimin bu kadar düşük olduğunu garip buluyorum ve aslında 0'a eşit bir katsayım var. Bunu nasıl yorumlayacağımdan tam olarak emin değilim. 0, belirli değişkenin model üzerinde hiçbir etkisi olmadığını gösteriyor mu? …

2
Hiyerarşik Bayesian Modeli (?)
Lütfen istatistik lingo benim kasap özür dilerim :) Burada reklam ve tıklama oranları ile ilgili birkaç soru bulduk. Fakat hiçbiri hiyerarşik durumumu anlamamda bana çok yardımcı olmadı. İlgili bir soru var Bu hiyerarşik Bayesci modelin eşdeğer gösterimleri var mı? , ama aslında benzer bir problemleri olup olmadığından emin değilim. Başka …

2
Bir değerin popülasyon ortalamasından önemli ölçüde daha uzakta olması için istatistiksel test: bu bir Z testi mi yoksa T testi mi?
Bir değer, değerler listesiyle karşılaştırıldığında ne kadar önemlidir? Çoğu durumda istatistiksel testler, bir örneklem grubunun bir popülasyonla karşılaştırılmasını içerir. Benim durumumda örnek bir değerle yapılır ve biz bunu popülasyonla karşılaştırırız. İstatistiksel hipotez testinde belki de en temel sorunla karşılaşan bir amatörüm. Bu sadece bir test değil, yüzlerce test. Bir parametre …

1
R'de kısmi en küçük kareler regresyonu: standartlaştırılmış verilerdeki PLS neden korelasyonu en üst düzeye çıkarmaya eşdeğer değil?
Ben kısmi en küçük kareler (PLS) çok yeni ve R işlevin çıktısını anlamaya çalışma plsr()içinde plspaketin. Verileri simüle edip PLS'yi çalıştıralım: library(pls) n <- 50 x1 <- rnorm(n); xx1 <- scale(x1) x2 <- rnorm(n); xx2 <- scale(x2) y <- x1 + x2 + rnorm(n,0,0.1); yy <- scale(y) p <- plsr(yy …

1
Analitik bir forma sahip olmak için yeterince basit olabileceği zaman bir posterior dağılım bulmaya yönelik adımlar?
Bu aynı zamanda Hesaplamalı Bilim'de de sorulmuştur . Ben 11 veri örnekleri ile, bir otomatik için bazı katsayılar Bayesian bir tahmin hesaplamaya çalışıyorum: nerede ortalama 0 ve varyans ile Vektör üzerindeki önceki dağılım ortalama ile Gauss ve ortalama ile çapraz kovaryans matrisi eşit çapraz girişler . ϵ i σ 2 …

1
Seyrek bir eğitim seti SVM'yi olumsuz etkiler mi?
İletileri bir SVM kullanarak farklı kategorilere ayırmaya çalışıyorum. Eğitim setinden istenen kelimelerin / simgelerin bir listesini derledim. Bir mesajı temsil eden her vektör için, 1kelime varsa karşılık gelen satırı ayarladım : "corpus": [mary, küçük, kuzu, yıldız, parıltı] ilk mesaj: "mary'nin küçük bir kuzusu vardı" -> [1 1 1 0 0] …

1
Duda ve arkadaşlarının Desen Sınıflandırmasında ücretsiz öğle yemeği teoremini anlama
Duda, Hart ve Stork'un Desen Sınıflandırmasında Herhangi Bir Sınıflandırıcının Doğasında Üstünlük Eksikliği Bölüm 9.2'de kullanılan gösterimler hakkında bazı sorularım var . Öncelikle kitaptan alakalı bazı metinler vereyim: Kolaylık olması açısından, eğitim seti desenlerinden ve öğrenilecek bilinmeyen hedef fonksiyonu tarafından oluşturulan için olan iki kategori sorununu düşünün , , burada .DDDxixix^iyi=±1yi=±1y_i …

2
Birden fazla hedefi veya sınıfı öngörüyor musunuz?
Birden fazla olayı tahmin etmeye çalıştığım bir tahmin modeli oluşturduğumu varsayalım (örneğin, hem bir paranın rulosu hem de bir madalyonun atımı). Bildiğim çoğu algoritma tek bir hedefle çalışır, bu yüzden bu tür şeylere standart bir yaklaşım olup olmadığını merak ediyorum. İki olası seçenek görüyorum. Belki de en naif yaklaşım, onlara …

2
DDoS filtrelemesi için makine öğrenimi uygulama
In Stanford Yapay Öğrenme kursu Andrew Ng IT ML uygulayarak söz. Bir süre sonra sitemizde orta büyüklükte (yaklaşık 20 bin bot) DDoS aldığımda basit Sinir Ağı sınıflandırıcısını kullanarak buna karşı savaşmaya karar verdim. Bu python betiğini yaklaşık 30 dakika içinde yazdım: https://github.com/SaveTheRbtz/junk/tree/master/neural_networks_vs_ddos PyBrain kullanır ve ikisi Sinir Ağı'nı eğitmek için …

2
Anlamsal anlamı koruyan alan-agnostik özellik mühendisliği?
Özellik mühendisliği genellikle makine öğrenimi için önemli bir bileşendir ( 2010'da KDD Kupası'nı kazanmak için yoğun olarak kullanılmıştır ). Ancak, çoğu mühendislik tekniğinin de altta yatan özelliklerin sezgisel anlamlarını yok etmek veya belirli bir alan adına ve hatta belirli türdeki özelliklere çok özeldir. Birincisinin klasik bir örneği temel bileşen analizi …

2
Uyarlamalı ardışık analiz için p-değerinin ayarlanması (ki kare testi için)?
Aşağıdaki problemle ilgili istatistiksel literatürün ne olduğunu bilmek istiyorum ve hatta nasıl çözüleceğine dair bir fikir bile istiyorum. Aşağıdaki sorunu düşünün: Bazı hastalıklar için 4 olası tedavimiz var. Hangi tedavinin daha iyi olduğunu kontrol etmek için özel bir deneme yapıyoruz. Denemede, hiç denek olmamakla başlıyoruz, daha sonra denemeye birer birer …



Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.