İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Neden Bootstrapping'e ihtiyacımız var?
Şu anda Larry Wasserman'ın "Tüm İstatistikler" i okuyorum ve parametrik olmayan modellerin istatistiksel işlevlerini tahmin etme bölümünde yazdığı bir şeyden şaşkınım. O yazdı "Bazen bazı hesaplamalar yaparak istatistiksel bir işlevin tahmini standart hatasını bulabiliriz. Ancak diğer durumlarda standart hatanın nasıl tahmin edileceği açık değildir". Bir sonraki bölümde bu konuyu ele …

1
Metropolis-Hastings entegrasyonu - stratejim neden çalışmıyor?
entegre etmek istediğim bir fonksiyonum olduğunu varsayın Tabii ki 'nin uç noktalarda sıfıra gittiğini varsayarsak , patlama olmaz, güzel işlev. I ile ilgilenmek oldum bir yolu örnekleri bir listesini oluşturmak için Metropolis- Hastings yapısı kullanmaktır dağılımından orantılı için normalleştirme sabit eksik, N = \ int _ {- \ infty} ^ …

3
ETS () işlevi, geçmiş verilerle uyumlu olmayan tahminlerden nasıl kaçınılır?
Aylık tahmin hesaplamasını otomatikleştirmek için R'de bir alogorithm üzerinde çalışıyorum. Diğerlerinin yanı sıra, tahmin hesaplamak için tahmin paketinden ets () işlevini kullanıyorum. Çok iyi çalışıyor. Ne yazık ki, bazı belirli zaman serileri için elde ettiğim sonuç tuhaf. Lütfen, kullandığım kodun altında bulabilirsiniz: train_ts<- ts(values, frequency=12) fit2<-ets(train_ts, model="ZZZ", damped=TRUE, alpha=NULL, beta=NULL, …

3
sinir ağında tanh ve sigmoid
Bu konuda hala hızlanmaya çalıştığım için şimdiden özür dilerim. Benim nöron aktivasyon fonksiyonu için tanh (harita -1 1) vs sigmoid (harita 0 1) kullanarak artılarını ve eksilerini anlamaya çalışıyorum. Okuduğumdan beri, marjinal farklılıklarla küçük bir şey gibi geldi. Sorunlarım için pratikte sigmoidin eğitilmesinin daha kolay olduğunu ve garip bir şekilde …

1
Çok değişkenli Gauss verilerinin PCA bileşenleri istatistiksel olarak bağımsız mı?
Verilerimiz normalde çok değişkenli ise PCA bileşenleri (temel bileşen analizinde) istatistiksel olarak bağımsız mıdır? Eğer öyleyse, bu nasıl kanıtlanabilir / kanıtlanabilir? Soruyorum çünkü en iyi cevabın belirttiği bu yayını gördüm : PCA açık bir Gaussian varsayımı yapmaz. Verilerde açıklanan varyansı en üst düzeye çıkaran özvektörleri bulur. Temel bileşenlerin dikliği, verilerdeki …
16 pca  independence  svd 


2
Hangi dağılımlar için standart sapma için kapalı biçimli tarafsız bir tahminci vardır?
Normal dağılım için, aşağıdakiler tarafından verilen standart sapmanın tarafsız bir tahmincisi vardır: σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2−−−−−−−−−−−−√σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2\hat{\sigma}_\text{unbiased} = \frac{\Gamma(\frac{n-1}{2})}{\Gamma(\frac{n}{2})} \sqrt{\frac{1}{2}\sum_{k=1}^n(x_i-\bar{x})^2} Bu sonucun çok iyi bilinmemesinin nedeni , büyük bir ithalat meselesinden ziyade büyük ölçüde bir curio olduğu anlaşılıyor . Kanıt bu konuya dahil edilmiştir ; normal dağılımın temel özelliklerinden yararlanır: 1σ2∑k=1n(xi−x¯)2∼χ2n−11σ2∑k=1n(xi−x¯)2∼χn−12 \frac{1}{\sigma^2} \sum_{k=1}^n(x_i-\bar{x})^2 \sim …

1
evrişimli sinir ağlarındaki özellik haritalarının sayısı
Evrişimli sinir ağını öğrenirken, aşağıdaki şekle ilişkin sorularım var. 1) Katman 1'deki C1'in 6 özellik haritası var, bu altı evrişimsel çekirdek olduğu anlamına mı geliyor? Her evrişimsel çekirdek, girdiye dayalı bir özellik haritası oluşturmak için kullanılır. 2) Katman 2'deki S1'in 6 özellik haritası, C2'nin 16 özellik haritası vardır. S1'deki 6 …

2
Tedavisi mümkün olmayan gerçekten basit bir modele örnek olarak ne gösterilebilir?
Yaklaşık Bayes hesaplaması , temelde herhangi bir stokastik modele uymak için gerçekten harika bir tekniktir, olasılığın sürdürülemez olduğu modellere yöneliktir (örneğin, parametreleri sabitlerseniz modelden örnekleme yapabilirsiniz, ancak olasılığı sayısal, algoritmik veya analitik olarak hesaplayamazsınız). Bir kitleye yaklaşık Bayes hesaplaması (ABC) eklerken, gerçekten basit ama yine de biraz ilginç ve inatçı …

2
Neden biri `` rastgele '' güven veya güvenilir aralıklar kullanır?
Yakın zamanda, güveni ve güvenilir aralıklarında rastgeleliği içeren bir makale okuyordum ve bunun standart olup olmadığını merak ediyordum (ve eğer öyleyse, bunu yapmak neden makul bir şey). Gösterimi ayarlamak için, verilerimizin x∈Xx∈Xx \in X ve parametresi için aralıklar oluşturmakla ilgilendiğimizi varsayalım θ∈Θθ∈Θ\theta \in \Theta. Bir işlev oluşturarak oluşturulan güven / …

2
Uygun makine öğrenme algoritmasını seçmek için keşifsel veri analizi nasıl yapılır
Makine Öğrenmesi: Olasılıksal Bir Bakış (Kevin Murphy) ile makine öğrenimi üzerine çalışıyoruz. Metin her algoritmanın teorik temelini açıklarken, hangi durumda hangi algoritmanın daha iyi olduğunu ve ne zaman olduğunu, hangi durumda olduğumu nasıl söyleyeceğini söylemez. Örneğin, çekirdek seçimi için, verilerimin ne kadar karmaşık olduğunu ölçmek için keşifsel veri analizi yapmam …


3
Bir Evrimsel Sinir Ağındaki evrişim adımı ne yapar?
Bilgisayar görmedeki uygulamaları nedeniyle evrişimli sinir ağları (CNN) üzerinde çalışıyorum. Standart feed-foward sinir ağlarına zaten aşinayım, bu yüzden burada bazı insanların CNN'leri anlama konusunda ekstra adım atmama yardımcı olabileceğini umuyorum. CNN'ler hakkında şöyle düşünüyorum: Geleneksel ileri beslemeli NN'lerde, her bir öğenin "giriş katmanı" ndaki NN'ye girdiğimiz bir özellik vektöründen oluştuğu …

2
Standart sapma neden N'ye göre kareler toplamının sqrt'ı olarak değil, varyansın sqrt'ı olarak tanımlanıyor?
Bugün bir giriş istatistik dersi verdim ve bir öğrenci bana şu şekilde yeniden sorduğum bir soru ile geldi: "Standart sapma neden N üzerindeki karelerin toplamı sqrt olarak değil, varyans sql olarak tanımlanıyor?" Nüfus varyansını tanımlarız: σ2=1N∑(xi−μ)2σ2=1N∑(xi−μ)2\sigma^2=\frac{1}{N}\sum{(x_i-\mu)^2} Ve standart sapma: σ=σ2−−√=1N√∑(xi−μ)2−−−−−−−−−−√σ=σ2=1N∑(xi−μ)2\sigma=\sqrt{\sigma^2}=\frac{1}{\sqrt{N}}\sqrt{\sum{(x_i-\mu)^2}} . Σ ' ya verebileceğimiz yorumσσ\sigma , popülasyondaki birimlerin X …

3
Ward'ın kriteri değilse hclust () içindeki ward.D hangi algoritmayı uygular?
"Ward.D" seçeneği tarafından kullanılan (R sürümleri <= 3.0.3'teki tek Ward seçeneği "ward" ile eşdeğer) Ward'ın (1963) kümeleme ölçütünü uygulamazken, "ward.D2" seçeneği bu kriteri uygular ( Murtagh ve Legendre 2014). ( http://stat.ethz.ch/R-manual/R-patched/library/stats/html/hclust.html ) Görünüşe göre ward.D Ward'ın kriterlerini doğru bir şekilde uygulamıyor. Yine de ürettiği kümelenmeler konusunda iyi bir iş çıkarmış …
16 r  clustering  ward 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.