İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Hangi derin öğrenme modeli, birbirini dışlamayan kategorileri sınıflandırabilir
Örnekler: İş tanımında bir cümle var: "İngiltere'de Java kıdemli mühendisi". Derin bir öğrenme modelini 2 kategori olarak tahmin etmek istiyorum: English ve IT jobs. Geleneksel sınıflandırma modeli kullanırsam, sadece softmaxson katmanda işlevli 1 etiket tahmin edebilir . Bu nedenle, her iki kategoride "Evet" / "Hayır" ı tahmin etmek için 2 …
9 machine-learning  deep-learning  natural-language  tensorflow  sampling  distance  non-independent  application  regression  machine-learning  logistic  mixed-model  control-group  crossover  r  multivariate-analysis  ecology  procrustes-analysis  vegan  regression  hypothesis-testing  interpretation  chi-squared  bootstrap  r  bioinformatics  bayesian  exponential  beta-distribution  bernoulli-distribution  conjugate-prior  distributions  bayesian  prior  beta-distribution  covariance  naive-bayes  smoothing  laplace-smoothing  distributions  data-visualization  regression  probit  penalized  estimation  unbiased-estimator  fisher-information  unbalanced-classes  bayesian  model-selection  aic  multiple-regression  cross-validation  regression-coefficients  nonlinear-regression  standardization  naive-bayes  trend  machine-learning  clustering  unsupervised-learning  wilcoxon-mann-whitney  z-score  econometrics  generalized-moments  method-of-moments  machine-learning  conv-neural-network  image-processing  ocr  machine-learning  neural-networks  conv-neural-network  tensorflow  r  logistic  scoring-rules  probability  self-study  pdf  cdf  classification  svm  resampling  forecasting  rms  volatility-forecasting  diebold-mariano  neural-networks  prediction-interval  uncertainty 

3
Çoklu doğrusallık mevcudiyetinde lineer regresyon katsayısının istatistiksel öneminin belirlenmesi
Farklı nüfus boyutlarına sahip bir grup şehrim var ve bir şehirdeki içki deposu sayısı ile DUI sayısı arasında pozitif bir doğrusal ilişki olup olmadığını görmek istedim. Bu ilişkinin anlamlı olup olmadığını belirlediğim yerde, tahmini regresyon katsayısının t-testine dayanmaktadır. Şimdi açıkça pop. Bir kentin büyüklüğü hem DUI'lerin sayısı hem de likör …

6
Hipotezin doğru olma olasılığını hesaplamak için p-değerini kullanma; başka ne gerekli?
Soru: P-değerlerinin yaygın bir yanlış anlaşılması , sıfır hipotezinin doğru olma olasılığını temsil etmeleridir. Bunun doğru olmadığını biliyorum ve sıfır hipotezinin doğru olduğu göz önüne alındığında, p değerlerinin sadece bu kadar aşırı bir örnek bulma olasılığını temsil ettiğini biliyorum . Bununla birlikte, sezgisel olarak, birincisini ikincisinden türetmek gerekir. Kimsenin bunu …

1
Naive Bayes daha popüler hale geliyor mu? Neden?
Bu, Ocak 2004-Nisan 2017'den ( bağlantı ) "Naive Bayes" ifadesi için elde edilen google trendler sonucudur . Bu rakama göre, Nisan 2017'de "Naive Bayes" için arama oranı, tüm zaman dilimindeki maksimumdan yaklaşık% 25 daha yüksektir. Bu, bu basit ve eski yöntemin daha fazla dikkat çektiği anlamına mı geliyor? Neden? Makul …

2
Sapma varyans ayrışımı: beklenen kare tahmini hatası için terim daha az indirgenemez hata
Hastie ve diğ. "İstatistiksel Öğrenmenin Unsurları" (2009) , ve veri oluşturma işlemini olarak değerlendirmektedir .Y= f( X) + εY=f(X)+ε Y = f(X) + \varepsilon E (ε)=0E(ε)=0\mathbb{E}(\varepsilon)=0Var ( ε ) =σ2εVar(ε)=σε2\text{Var}(\varepsilon)=\sigma^2_{\varepsilon} noktasındaki (s. 223, formül 7.9) beklenen kare tahmini hatasının aşağıdaki sapma varyans ayrışmasını sunarlar : benim Kendi işim belirtmiyorum ancak …

1
Gama ailesine sahip bir GLM'de alfa'nın pratik anlamı nedir?
Formun birkaç modeline uyuyorum. glm(DV ~ I(1/IV), family = Gamma(link = "log") ..ve farklı değişkenler için elde edilen modelleri karşılaştırmanın yollarını arıyorum. Alfa değerinin herhangi bir pratik kullanım olup olmadığını merak ediyorum? Aşağıdaki üç çizim için alfa değerleri 17.85, 9.03 ve 6.27'dir. Bu değerler verilerimi yorumlamama veya farklı değişkenleri karşılaştırmama …

1
Yüze kadar eklemeyen yüzdeler nasıl mümkün olabilir?
Aquaponics hakkında bu makaleyi okuyordum ve bazı istatistikler listelenen yüzdelerle ilgili hiçbir anlam ifade etmiyordu. Bu yüzdelerin var olmasına hangi yöntem izin verir? Yüzde olarak en yaygın olarak yetiştirilen su hayvanları tilapia (% 69), süs balıkları (% 43), yayın balığı (% 25), diğer su hayvanları (% 18), levrek (% 16), …

3
PCA her ikisi de n, p büyük olduğunda çok yavaş: Alternatifler?
Sorun Ayarı 2D olarak görselleştirmeye çalıştığım yüksek boyutlu (4096) veri noktalarına (görüntüler) sahibim. Bu amaçla, Karpathy'nin aşağıdaki örnek koduna benzer bir şekilde t-sne kullanıyorum . Scikit-öğrenme dokümantasyon ilk verilerin boyutunu düşürmek için PCA kullanılmasını önerir: Özellik sayısının çok yüksek olması durumunda boyut sayısını makul bir miktara (örneğin 50) düşürmek için …

4
Cox tehlike modeli hayatta kalma eğrisini nasıl yorumlayabilirim?
Cox orantılı tehlike modelinden sağkalım eğrisini nasıl yorumluyorsunuz? Bu oyuncak örneğinde, verilerdeki agedeğişken üzerinde bir cox orantılı tehlike modelimiz olduğunu kidneyve hayatta kalma eğrisini oluşturduğumuzu varsayalım . library(survival) fit <- coxph(Surv(time, status)~age, data=kidney) plot(conf.int="none", survfit(fit)) grid() Örneğin, zamanında hangi ifade doğrudur? ya da her ikisi de yanlış mı?200200200 Bildirim 1:% …

1
Normal dağılmış hatalar ve merkezi limit teoremi
Wooldridge'in Giriş Ekonometrisinde bir teklif var: Hatalar normal dağılımını haklı argüman genellikle böyle bir şey yapar: çünkü etkileyen birçok farklı gözlenmeyen faktörler toplamıdır , bunu sonuçlandırmak için merkezi limit teoremini çağırabileceği yaklaşık bir normal dağılım vardır.uuuyyyuuu Bu alıntı doğrusal model varsayımlarından biriyle ilgilidir, yani: u∼N(μ,σ2)u∼N(μ,σ2)u \sim N(μ, σ^2) burada uuu …




1
Bir zaman serisindeki gürültülü yamaları nasıl vurgulayabilirim?
Çok sayıda zaman serisi verim var - su seviyeleri ve hızlar zamana karşı. Hidrolik model simülasyonundan elde edilen çıktıdır. Modelin beklendiği gibi çalıştığını doğrulamak için inceleme sürecinin bir parçası olarak, verilerde "yalpalama" olmadığından emin olmak için her zaman serisini çizmek zorundayım (aşağıdaki örnekte küçük yalpalamaya bakınız). Modelleme yazılımının kullanıcı arayüzünü …

4
Sinir ağını regresyon için eğitmek her zaman ortalamayı öngörür
Ben görev bir görüntüde bir kutu (x, y) konumunu tahmin etmektir regresyon için basit bir evrişimsel sinir ağı, örneğin: Ağın çıktısında biri x, diğeri y için olmak üzere iki düğüm vardır. Ağın geri kalanı standart bir evrişimli sinir ağıdır. Kayıp, kutunun öngörülen konumu ile yer gerçeği konumu arasındaki standart ortalama …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.