İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Zaman serisi regresyon tahmin modelinde aktarım fonksiyonları nasıl tanımlanır?
Diğer tahmin ediciler / girdi değişkenleri ve otokorelasyon hataları açısından bir sonuç değişkeni için dolar tutarında bir zaman serisi regresyon tahmin modeli oluşturmaya çalışıyorum. Bu tür bir modele dinamik regresyon modeli de denir. Her bir öngörücü için aktarım işlevlerini nasıl tanımlayacağımı öğrenmem gerekiyor ve bunu yapmanın yolları hakkında sizden haber …

2
Aynı x ölçeğine, ancak R'de farklı bir y ölçeğine sahip iki grafiği dikey olarak nasıl yığınlayabilirim?
Selamlar, Şu anda R'de aşağıdakileri yapıyorum: require(zoo) data <- read.csv(file="summary.csv",sep=",",head=TRUE) cum = zoo(data$dcomp, as.Date(data$date)) data = zoo(data$compressed, as.Date(data$date)) data <- aggregate(data, identity, tail, 1) cum <- aggregate(cum, identity, sum, 1) days = seq(start(data), end(data), "day") data2 = na.locf(merge(data, zoo(,days))) plot(data2,xlab='',ylab='compressed bytes',col=rgb(0.18,0.34,0.55)) lines(cum,type="h",col=rgb(0,0.5,0)) Özet.csv alıntısı: date,revision,file,lines,nclass,nattr,nrel,bytes,compressed,diff,dcomp 2007-07-25,16,model.xml,96,11,22,5,4035,991,0,0 2007-07-27,17,model.xml,115,16,26,6,4740,1056,53,777 2007-08-09,18,model.xml,106,16,26,7,4966,1136,47,761 2007-08-10,19,model.xml,106,16,26,7,4968,1150,4,202 2007-09-06,81,model.xml,111,16,26,7,5110,1167,13,258 …

5
Bir değişken doğrusal regresyon modelinde önemli midir?
Örnek ve değişken gözlemlerle doğrusal bir regresyon modelim var ve bilmek istiyorum: Belirli bir değişkenin modele dahil kalacak kadar önemli olup olmadığı. Modele başka bir değişkenin (gözlemlerle) dahil edilmesi gerekip gerekmediği. Hangi istatistikler bana yardımcı olabilir? Onları en verimli şekilde nasıl alabilirim?

2
Birden çok “histogramı” görselleştirme (çubuk grafikler)
Verileri görselleştirmek için doğru yolu seçmekte zorlanıyorum. Let elimizdeki demek kitabevi satan kitaplar ve her kitap en az birine sahiptir kategori . Bir kitapçı için, tüm kitap kategorilerini sayarsak, o kitapçı için belirli bir kategoriye giren kitap sayısını gösteren bir histogram elde ederiz. Kitapçı davranışını görselleştirmek istiyorum, bir kategoriyi diğer …

4
Toplam olay sayısı için bir güven aralığı nasıl bulunur
Bazı olasılıkları olan bir olayı algılayacak dedektör var p . Dedektör bir olayın meydana geldiğini söylüyorsa, durum her zaman böyledir, bu nedenle yanlış pozitifler yoktur. Bir süre çalıştırdıktan sonra, k olaylarının algılanmasını sağlarım. Ortaya çıkan toplam olay sayısının, tespit edildiğini veya başka bir şekilde,% 95 diyelim, hesaplamak istiyorum. Diyelim ki …

2
Eksik verileri olan bir hayatta kalma modelinin uygun olup olmadığını nasıl belirlerim?
Biraz basitleştirmek gerekirse, yaklaşık on yıl süren bir sistemdeki insanların giriş ve çıkış zamanlarını kaydeden yaklaşık bir milyon kaydım var. Her kaydın bir giriş zamanı vardır, ancak her kaydın bir çıkış zamanı yoktur. Sistemdeki ortalama süre ~ 1 yıldır. Eksik çıkış süreleri iki nedenden kaynaklanır: Kişi, verinin alındığı sırada sistemden …



2
Çapraz doğrulama uygulaması sonuçlarını etkiler mi?
Bildiğiniz gibi, iki popüler çapraz doğrulama türü vardır: K-katlama ve rastgele alt örnekleme ( Wikipedia'da açıklandığı gibi ). Bununla birlikte, bazı araştırmacıların K-katlamalı CV olarak tanımlanan bir şeyin gerçekten rastgele bir alt örnekleme olduğu kağıtları hazırladığını ve yayınladığını biliyorum, bu yüzden pratikte okuduğunuz makalede gerçekten ne olduğunu asla bilemezsiniz. Genellikle …

4
Model uydurma / eğitim ve validasyon için kullanılan örnek verilerin oranının hesaplanması
Verileri tahmin etmek için kullanmayı planladığım bir örnek boyut "N" sağladı. Verileri alt bölümlere ayırmanın bazı yolları nelerdir? Bunun siyah-beyaz bir cevabı olmadığını biliyorum, ama bazı "başparmak kuralları" veya genellikle kullanılan oranları bilmek ilginç olurdu. Üniversitemizden biliyorum, profesörlerimizden biri eskiden% 60 model söyler ve% 40 geçer.

7
Normal dağılım ve monotonik dönüşümler
Doğada meydana gelen birçok miktarın normal olarak dağıldığını duydum. Bu tipik olarak, çok sayıda iid rasgele değişkenleri ortalamalandırdığınızda normal bir dağılım elde ettiğinizi söyleyen merkezi limit teoremi kullanılarak doğrulanır. Dolayısıyla, örneğin, çok sayıda genin ilave etkisi ile belirlenen bir özellik yaklaşık olarak normal olarak dağıtılabilir, çünkü gen değerleri kabaca rastgele …




1
Naive Bayes ile Tekrarlayan Sinir Ağı (LSTM) arasındaki fark
Ben metin üzerinde duygu analizi yapmak istiyorum, bazı makaleler geçti, bazıları "Naive Bayes" kullanıyor ve diğer "Tekrarlayan Sinir Ağı (LSTM)" , öte yandan duygu analizi için bir python kütüphanesi gördüm nltk. "Naive Bayes" kullanır Herkes ikisini kullanma arasındaki farkın ne olduğunu açıklayabilir? Ben de bu yazıdan geçtim ama ikisi hakkında …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.