İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Poisson regresyonundan veri örnekleri oluşturma
R'de bir Poisson regresyon denkleminden nasıl veri üreteceğinizi merak ediyordum. Soruna nasıl yaklaşacağım konusunda kafam karıştı. Ben varsayarsak yüzden iki yordayıcılarını var ve X 2 dağıtılır N ( 0 , 1 ) . Ve kesme noktası 0'dır ve her iki katsayı 1'e eşittir. Sonra tahminim basitçe:X1X1X_1X2X2X_2N(0,1)N(0,1)N(0,1) log(Y)=0+1⋅X1+1⋅X2log⁡(Y)=0+1⋅X1+1⋅X2\log(Y) = 0+ 1\cdot …

1
PCA biplotundaki oklar ne anlama geliyor?
Aşağıdaki PCA biplotunu düşünün: library(mvtnorm) set.seed(1) x <- rmvnorm(2000, rep(0, 6), diag(c(5, rep(1,5)))) x <- scale(x, center=T, scale=F) pc <- princomp(x) biplot(pc) Bir sürü kırmızı ok çizilir, ne anlama geliyorlar? "Var1" ile etiketlenmiş ilk okun veri kümesinin en değişken yönünü göstermesi gerektiğini biliyordum (eğer bunları 2000 veri noktası olarak düşünürsek, …
14 r  pca  linear-algebra  biplot 

4
Rasgelelik nedir?
Olasılık ve istatistikte, "rastgele" ve "rastgele" kavramı sıklıkla kullanılmaktadır. Çoğunlukla rastgele değişken kavramı, şansa bağlı olarak meydana gelen olayları modellemek için kullanılır. Benim sorum "rastgele" terimiyle ilgili. Rastgele nedir? Rasgelelik gerçekten var mı? Rastgele olaylarla çalışma konusunda çok fazla deneyime sahip insanların rastgele olma hakkında ne düşündüklerini ve inandıklarını merak …

4
Doğrulukta iyileşmenin önemli olup olmadığını kontrol etme
Her şeyi iki kategoriye ayıran bir algoritmam olduğunu varsayalım. Diyelim ki 1000 test nesnesi üzerinde algoritmanın doğruluğunu ölçebilirim - düşünelim ki şeylerin% 80'i doğru sınıflandırılmıştır. Diyelim ki algoritmayı bir şekilde değiştiriyorum, böylece şeylerin% 81'i doğru bir şekilde sınıflandırılıyor. İstatistikler algoritmadaki gelişimimin istatistiksel olarak anlamlı olup olmadığı hakkında bir şey söyleyebilir …

2
Sinir Ağı'ndan gerçek değerli sürekli çıktı nasıl alınır?
Sinir ağlarının şimdiye kadar gördüğüm örneklerinin çoğunda, ağ sınıflandırma için kullanılır ve düğümler sigmoid işleviyle dönüştürülür. Ancak, sürekli bir gerçek değer üretmek için bir sinir ağı kullanmak istiyorum (gerçekçi olarak çıktı genellikle -5 ila +5 aralığında olacaktır). Sorularım: 1. Should I still scale the input features using feature scaling? What …

2
Gradyan iniş vs lm () fonksiyonu R?
Andrew Ng'in Stanford'daki ücretsiz çevrimiçi makine öğrenimi kursundaki videolardan geçiyorum . Degrade İnişi, bunu yapmak için Octave'de lineer regresyon ve yazma fonksiyonlarını çözmek için bir algoritma olarak tartışır. Muhtemelen R'de bu işlevleri yeniden yazabilirim, ama sorum şu ki, lm () işlevi zaten doğrusal regresyonun çıktısını vermiyor mu? Neden kendi degrade …

2
Düz İngilizce R kullanarak Cox orantılı tehlikeler regresyon modelinin yorumlanması ve onaylanması
Birisi bana Cox modelimi düz İngilizce olarak açıklayabilir mi? Bu işlevi kullanarak tüm verilerime aşağıdaki Cox regresyon modelini yerleştirdim cph. Verilerim adlı bir nesneye kaydedilir Data. Değişkenler w, xve ysüreklidir; ziki seviyeli bir faktördür. Zaman ay olarak ölçülür. Bazı hastalarım değişkenleri için veri eksik z( Not : Dr.Harrell'in aşağıda, modelime …

3
Neden genellikle Gauss dağılımı olduğu varsayılır?
Bir saf Bayes sınıflandırıcısı için parametre tahmini hakkındaki Wikipedia makalesinden alıntı : "tipik bir varsayım, her sınıfla ilişkili sürekli değerlerin bir Gauss dağılımına göre dağıtıldığıdır." Gauss dağılımının analitik nedenlerle uygun olduğunu anlıyorum. Ancak, bu varsayımı yapmak için başka bir gerçek dünya nedeni var mı? Nüfus iki alt popülasyondan oluşuyorsa (akıllı …

3
Büyük sayılar yasasına karşı merkezi limit teoremi
Merkezi limit teoremi, sonsuza giderken iid değişkenlerinin ortalamasının normal olarak dağıldığını belirtir .NNN Bu iki soruyu gündeme getiriyor: Bundan büyük sayılar yasasını çıkarabilir miyiz? Büyük sayılar kanunu rastgele değişkenin değerlerinin bir numunenin ortalaması gerçek ortalama eşittir diyorsa olarak sonsuza gider o zaman değer haline gelmesi (merkezi sınır söylediği gibi) demek …

4
R [kod ve çıktı dahil] 'de rastgele efektlerle kırık bir çubuk / parçalı doğrusal modelde kırılma noktasını tahmin etme
Birisi bana diğer rastgele etkileri de tahmin etmem gerektiğinde R'nin parçalı doğrusal bir modelde (sabit veya rastgele bir parametre olarak) kırılma noktasını nasıl tahmin edeceğini söyleyebilir mi? Aşağıda bir kırılma noktası için rastgele bir eğim varyansı ve rastgele bir y kesme noktası varyansı ile bir hokey sopası / kırık çubuk …

8
Birden fazla bilinmeyen düğüm ile parçalı doğrusal regresyon nasıl yapılır?
Çoklu düğümleri otomatik olarak algılayabilen parçalı doğrusal regresyon yapmak için herhangi bir paket var mı? Teşekkürler. Yapısal paketini kullandığımda. Değişim noktalarını tespit edemedim. Değişim noktalarını nasıl tespit ettiği hakkında hiçbir fikrim yok. Parsellerden, onları seçmeme yardımcı olabileceğim birkaç nokta olduğunu görebiliyordum. Burada bir örnek verilebilir mi?

1
Tekrarlanan ölçüm tasarımı için bir ANOVA nasıl hesaplanır: R'de aov () vs lm ()
Başlık her şeyi söylüyor ve kafam karıştı. Aşağıdaki R tekrarlanan önlemler aov () çalışır ve eşdeğer bir lm () çağrısı olduğunu düşündüğüm çalışır, ancak farklı hata kalıntıları (kareler toplamları aynı olmasına rağmen) döndürür. Açıkça aov () 'dan kalıntılar ve takılmış değerler modelde kullanılan değerlerdir, çünkü karelerin toplamları modelin her birine …


3
Saçma büyük Z skorları ile ilişkili olasılık nasıl hesaplanır?
Ağ motifi tespiti için yazılım paketleri çok yüksek Z-skorları döndürebilir (gördüğüm en yüksek değer 600.000+, ancak 100'den fazla Z-skorları oldukça yaygındır). Bu Z-skorlarının sahte olduğunu göstermeyi planlıyorum. Büyük Z skorları son derece düşük ilişkili olasılıklara karşılık gelir. İlişkili olasılıkların değerleri, 6'ya kadar Z puanları için örneğin normal dağıtım wikipedia sayfasında …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.