İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


5
Doğrusal modellerin varsayımları ve artıklar normal olarak dağıtılmazsa ne yapmalı
Doğrusal regresyon varsayımlarının ne olduğu konusunda biraz kafam karıştı. Şimdiye kadar: açıklayıcı değişkenlerin tümü yanıt değişkeni ile doğrusal olarak ilişkilidir. (Durum böyleydi) açıklayıcı değişkenler arasında herhangi bir eşzamanlılık vardı. (çok az eşzamanlılık vardı). Cook'un modelimin veri noktalarındaki mesafeleri 1'in altındadır (bu durumda, tüm mesafeler 0,4'ün altındadır, bu nedenle etki noktası …

2
Zaman serileri nasıl kümelenir?
Küme analizi hakkında bir sorum var. 5 yıl boyunca güç kullanımlarına göre kümelenmesi gereken 3000 şirket var. Her şirketin 5 yıl boyunca her saat için değerleri vardır. Bazı şirketlerin zaman içinde kullanım gücünde aynı örüntüye sahip olup olmadığını öğrenmek istiyorum. Sonuçlar, güç kullanımının günlük tahmini için kullanılmalıdır. SPSS'de zaman serilerini …

5
Regresyonda Dengesiz Veriler için Örnekleme
Sınıflandırma bağlamında dengesiz verilerin ele alınması konusunda iyi sorular var , ancak insanların regresyon için örneklemek için ne yaptığını merak ediyorum. Sorunlu alanın işarete çok duyarlı olduğunu, ancak hedefin büyüklüğüne sadece biraz duyarlı olduğunu varsayalım. Bununla birlikte, büyüklük modelin sınıflandırma değil (pozitif ve negatif sınıflar) regresyon (sürekli hedef) olması gerektiği …



5
Bayes Teorem Sezgisi
Bayes teoreminin önceki , posterior , olasılık ve marjinal olasılık açısından sezgiye dayalı bir anlayışını geliştirmeye çalışıyorum . Bunun için aşağıdaki denklemi kullanıyorum: burada bir hipotezi veya inancı temsil eder ve veri veya kanıtları temsil eder. Posterior kavramını anladım - bu, önceki inancı ve bir olayın olasılığını birleştiren birleştirici bir …

4
Softmax çıktı neden Derin Öğrenme modelleri için iyi bir belirsizlik ölçütü değildir?
Bir süredir Konvolutional Sinir Ağları (CNN) ile çalışıyorum, çoğunlukla semantik segmentasyon / örnek segmentasyonu için görüntü verileri üzerinde. Belirli bir sınıf için piksel başına aktivasyonların ne kadar yüksek olduğunu görmek için genellikle ağ çıkışının softmax değerini bir "ısı haritası" olarak görselleştirdim. Düşük aktivasyonları "belirsiz" / "belirsiz" ve yüksek aktivasyonları "belirli" …

5
Ham veya dik polinom regresyonu?
Bir değişken gerileme isteyen üzerine . Bunu ham veya dik polinomları kullanarak yapmalı mıyım? Sitede bunlarla ilgilenen soruya baktım, ancak onları kullanma arasındaki farkın ne olduğunu gerçekten anlamıyorum. yyyx,x2,…,x5x,x2,…,x5x,x^2,\ldots,x^5 Neden sadece katsayılarını almak için "normal" bir gerileme yapamaz aitβiβi\beta_iy=∑5i=0βixiy=∑i=05βixiy=\sum_{i=0}^5 \beta_i x^i (p değerleri ve diğer tüm güzel şeyler ile birlikte) …

2
PCA zaman serisi verileri için uygulanabilir mi?
Temel Bileşen Analizinin (PCA) temel olarak kesitsel veriler için uygulanabileceğini anlıyorum. PCA, yılı zaman serisi değişkeni olarak belirterek ve PCA'yı normal şekilde çalıştırarak zaman serisi verileri için etkili bir şekilde kullanılabilir mi? Dinamik PCA'nın panel verileri için çalıştığını ve Stata'daki kodlamanın zaman serileri için değil panel verileri için tasarlandığını buldum. …
22 time-series  pca 


2
Neden istatistiklerde ve ML’de “çekirdek” ismi var?
Bu, işletim sistemleri ve lineer cebir bağlamındaki diğer SE sitelerinde de sorulmuştu, fakat aynı soru beni istatistiklerde ve makine öğreniminde kullanılan çekirdek yöntemleri ile ilgili rahatsız ediyor. Çoğunlukla, örneğin çekirdek yoğunluğu kestirimi veya SVM'lerde, çekirdeklerin bir tür benzerliği temsil ettiği söylenir, ancak 'çekirdek' adının nereden geldiğini ve sembolizminin ne olduğunu …

3
Olabilirlik tanımı ile Frequentist ve Bayesian arasında bir fark var mı?
Bazı kaynaklar olabilirlik fonksiyonunun şartlı olasılık olmadığını, bazıları ise olduğunu söylüyor. Bu benim için çok kafa karıştırıcı. Gördüğüm en kaynaklarına göre, parametre olan bir dağılım olasılığı , belirli bir olasılık fonksiyonları bir ürün olmalıdır n numuneleri X i :θθ\thetannnxixix_i L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(θ)=L(x1,x2,...,xn;θ)=∏i=1np(xi;θ)L(\theta) = L(x_1,x_2,...,x_n;\theta) = \prod_{i=1}^n p(x_i;\theta) Örneğin, Logistic Regression'da, en uygun …

3
Rasgele sayı üretecindeki bir tohum tam olarak nedir?
Her zamanki google aramayı vs. denedim, ancak bulduğum cevapların çoğu Python veya C ++ gibi belirli bir şekilde belirsiz ya da dile / kütüphaneye stdlib.haitti. Örnek olarak, çoğu tohumun rastgele sayı üretecinin başlangıç ​​noktası olduğunu ve aynı tohumun her zaman aynı rastgele sayıyı ürettiğini söylüyor . Bunun anlamı ne? Çıktı …

4
Merkezi Limit Teoremi neden simülasyonumda bozuluyor?
Diyelim ki aşağıdaki numaralarım var: 4,3,5,6,5,3,4,2,5,4,3,6,5 Bunlardan bazılarını örnek alıyorum, diğeri 5 diyorum ve 5 örneğin toplamını hesaplıyorum. Sonra birçok para elde etmek için tekrar tekrar tekrar ediyorum ve toplamların değerlerini, Orta Sınır Teoremi nedeniyle Gaussian olacak bir histograma çizdim. Fakat sayıları takip ederken, 4'ü büyük sayıyla değiştirdim: 4,3,5,6,5,3,10000000,2,5,4,3,6,5 Bunlardan …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.