İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Genel bir iyileştirici kullanarak glmnet doğrusal regresyonu için sonuçları çoğaltma
Başlık belirtildiği gibi, ben kütüphaneden LBFGS optimizer kullanarak glmnet doğrusal sonuçları çoğaltmaya çalışıyorum lbfgs. Bu optimize edici, objektif fonksiyonumuz (L1 düzenleyici terimi olmadan) dışbükey olduğu sürece, farklılaşma konusunda endişelenmenize gerek kalmadan bir L1 düzenleyici terim eklememizi sağlar. Esnek ağ doğrusal regresyon sorun glmnet kağıdı ile verilir burada X \ in …

4
Bir meslekten olmayan kişi için tarafsız bir kestiricinin ne olduğunu nasıl açıklayabiliriz?
Diyelim ki için tarafsız bir tahmin . Sonra elbette, . θE[ θ |θ]=θθ^θ^\hat{\theta}θθ\thetaE[θ^∣θ]=θE[θ^∣θ]=θ\mathbb{E}[\hat{\theta} \mid \theta] = \theta Kişi bunu bir meslekten nasıl açıklar? Geçmişte, söylediğim şey , örnek boyutu büyüdükçe \ hat {\ theta} değerinin bir demet değerini ortalama θ^θ^\hat{\theta}olarak alırsanız, \ theta'nın daha iyi bir yaklaşımını elde edersiniz θθ\theta. …



2
Referans istek: Çalışan veri bilimcileri için klasik istatistikler
Regresyon, diğer makine öğrenimi tipi algoritmaları ve programlama (hem veri analizi hem de genel yazılım geliştirme için) konusunda sağlam deneyime sahip çalışan bir veri bilimciyim. Çalışma hayatımın çoğu tahmin doğruluğu için modeller (çeşitli iş kısıtlamaları altında çalışmak) ve kendi (ve diğerlerinin) çalışmalarımı desteklemek için veri boru hatları oluşturmaya odaklanmıştı. İstatistikte …

3
Sınıflandırmada ne zaman LDA yerine PCA kullanırsınız?
İlke Bileşen Analizi ve Çoklu Diskriminant Analizi (Doğrusal Diskriminant Analizi) arasındaki fark üzerine bu makaleyi okuyorum ve neden MDA / LDA yerine PCA kullanacağınızı anlamaya çalışıyorum. Açıklama aşağıdaki gibi özetlenmiştir: kabaca PCA'da verinin en fazla yayıldığı maksimum varyanslı eksenleri bulmaya çalışıyoruz (bir sınıf içinde, PCA tüm veri setini bir sınıf …

2
R'deki iki polinom regresyonu arasındaki farkın istatistiksel önemini karşılaştırın
Her şeyden önce bu forumda biraz araştırma yaptım ve çok benzer sorular sorulduğunu biliyorum , ancak genellikle doğru cevaplanmadılar veya bazen cevap anlayabileceğim kadar ayrıntılı değil. Yani bu kez sorum şu: İki veri setim var, her birinde, böyle bir polinom regresyonu yapıyorum: Ratio<-(mydata2[,c(2)]) Time_in_days<-(mydata2[,c(1)]) fit3IRC <- lm( Ratio~(poly(Time_in_days,2)) ) Polinom …

1
Kutu arsa çentikleri ve Tukey-Kramer aralığı
'R' içindeki kutu grafiğindeki "notch" yardım belgesi ( veya orijinal metin ) aşağıdakileri verir: İki parselin çentikleri üst üste gelmezse, bu iki medyanın farklı olduğuna dair 'güçlü kanıttır' (Chambers et al, 1983, s. 62). Kullanılan hesaplamalar için boxplot.stats sayfasına bakın. ve ' boxplot.stats ' aşağıdakileri verir: Çentikler (istenirse) +/- 1.58 …

1
PCA özvektörleri olmayan vektörlerin “özdeğerleri” (açıklanan varyans yüzdeleri) nasıl elde edilir?
PCA tarafından sağlanan koordinat alanında değil, biraz farklı (döndürülmüş) vektörlere karşı bir veri kümesinin varyans yüzdesini nasıl elde edebileceğimi anlamak istiyorum. set.seed(1234) xx <- rnorm(1000) yy <- xx * 0.5 + rnorm(1000, sd = 0.6) vecs <- cbind(xx, yy) plot(vecs, xlim = c(-4, 4), ylim = c(-4, 4)) vv <- …

2
Aynı sınıfta aynı ada sahip beş çocuğun olasılığı
Bebek isimlendirme forumlarında, müstakbel ebeveynler Jennifer Korkularının bazı versiyonlarını her zaman tekrarlarlar: "Çocuğumun sınıfında 5 adından biri olmasını istemiyorum." Şey, artık hiçbir isim bu tür popülerliğe daha fazla yaklaşmıyor ve Jennifer çılgınlığının yüksekliğinde bile, bir sınıfta beş tane alamadınız. Bu ebeveynler için, böyle bir isim tekrarının tesadüfünün ne kadar olası …

1
Öngörülen değerleri ARIMA zaman serisinde R olarak çizme
Bu soruda muhtemelen birden fazla ciddi yanlış anlama vardır, ancak hesaplamaları doğru yapmak değil, zaman serisi öğrenmeyi akılda tutarak motive etmek içindir. Zaman serilerinin uygulanışını anlamaya çalışırken, verilerin eğiliminin düşürülmesi gelecekteki değerlerin tahmin edilmesini mantıklı kılıyor gibi görünüyor. Örneğin gtemp, astsapaketteki zaman serileri şöyle görünür: Gelecek on yıllardaki artış eğilimi, …

1
Periyodik verilere uyması için periyodik spline'lar
Bu soruya yapılan bir yorumda , @whuber, periyodik verilere uyması için spline'ların periyodik bir versiyonunu kullanma olasılığını gösterdi. Bu yöntem, özellikle spline'ları tanımlayan denklemler ve bunların pratikte nasıl uygulanacağı hakkında daha fazla bilgi edinmek istiyorum (çoğunlukla Rkullanıcıyım, ancak ihtiyaç duyulursa MATLAB veya Python ile yapabilirim). Ayrıca, ama bu bir "sahip …

3
Test Hatasının CV tahmini Gerçek Test Hatasını neden hafife alıyor?
Anladığım kadarıyla, test hatasının k-katlı çapraz doğrulama tahmini genellikle gerçek test hatasını hafife alıyor. Neden böyle olduğunu kafam karıştı. Eğitim hatasının neden genellikle test hatasından daha düşük olduğunu görüyorum - çünkü modeli, hatayı tahmin ettiğiniz verilerle eğitiyorsunuz! Ancak bu, çapraz doğrulama için geçerli değildir - hatayı ölçtüğünüz kat, eğitim sırasında …

2
Beklentisi
Let X1X1X_1 , X2X2X_2 , ⋯⋯\cdots , Xd∼ N( 0 , 1 )Xd∼N(0,1)X_d \sim \mathcal{N}(0, 1) ve bağımsız. X 4 beklentisi nedir 1X41( X21+ ⋯ + X2d)2X14(X12+⋯+Xd2)2\frac{X_1^4}{(X_1^2 + \cdots + X_d^2)^2} ? E bulmak kolaydır ( X 2 1E ( X21X21+ ⋯ + X2d) = 1dE(X12X12+⋯+Xd2)=1d\mathbb{E}\left(\frac{X_1^2}{X_1^2 + \cdots + X_d^2}\right) …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.