İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

5
Bir çalışmanın nasıl planlanacağına ilişkin referanslar
İstatistiklerle ilgili ortalama (medyan?) Bir konuşmada, kendinizi bu veya bu tür verileri analiz etme yöntemini tartışırken bulacaksınız. Deneyimlerime göre, istatistiksel analiz ile ilgili özel düşünceye sahip dikkatli çalışma tasarımı genellikle ihmal edilmektedir (biyoloji / ekoloji alanında çalışmak, bu hakim bir olay gibi görünmektedir). İstatistikçiler genellikle yetersiz (veya düpedüz yanlış) toplanmış …

4
Bağımsız olmayan gözlemlerle ANOVA
Bu sorunun ayrıntılı arka planı için üzgünüm: Bazen hayvan davranışı araştırmalarında, bir deneyci bir deneğin bir test cihazında önceden tanımlanmış farklı bölgelerde geçirdiği zaman miktarı ile ilgilenir. ANOVA kullanılarak analiz edilen bu tür verileri sıklıkla gördüm; ancak, ANOVA'nın gözlemlerin bağımsız olduğunu varsaydığı ve bu analizlerde asla bağımsız olmadıkları göz önüne …
11 anova 

2
Ses sınıflandırması için kıvrımlı bir derin inanç ağı nasıl anlaşılır?
"In hiyerarşik temsiller ölçeklenebilir denetimsiz öğrenme için Evrişimsel derin inanç ağları Lee ve diğerleri tarafından". ( PDF ) Evrişimli DBN'ler önerilmektedir. Yöntem, görüntü sınıflandırması için de değerlendirilir. Küçük köşeler ve kenarlar gibi doğal yerel görüntü özellikleri olduğu için bu mantıklı geliyor. In " Eğiticisiz özelliği konvolusyanla derin inanç ağları kullanarak …

10
Model oluşturma öngörüsünün yanı sıra nedenler?
Joshua Epstein "Neden Model?" 16 nedeni veren http://www.santafe.edu/media/workingpapers/08-09-040.pdf adresinden edinilebilir : Açıklayın (tahminden çok farklı) Rehber veri toplama Çekirdek dinamikleri aydınlatın Dinamik analojiler önerin Yeni soruları keşfedin Bilimsel bir zihin alışkanlığını teşvik edin Makul aralıklarla ilişkili (braket) sonuçlar Çekirdek belirsizliklerin aydınlatılması. Gerçek zamanlıya yakın kriz seçenekleri sunun Ödünç verme / …
11 modeling 

1
ANOVA'yı ikili veriler için nasıl uyarlayabilirim?
N denek için ikili sonuç değişkenini (örneğin, mezun olduktan sonra istihdam durumu, 1 = istihdam edilmiş, 0 = istihdam edilmemiş) tahmin etmek için kullandığım dört rakip modelim var. Model performansının doğal bir ölçüsü, modellerin her biri için doğru tahminlerin yüzdesi olan isabet oranıdır. Bana öyle geliyor ki, veriler ANOVA'nın altında …

1
Yöntem seçimi için iyi çerçeveler nelerdir?
Metot seçimi için teorik çerçevelere bakıyorum (not: model seçimi değil) ve çok az sistematik, matematiksel olarak motive edilmiş iş buldum. 'Yöntem seçimi' ile, bir soruna veya problem türüne göre uygun (veya daha iyi, optimal) yöntemi ayırt etmek için bir çerçeve kastediyorum. Bulduğum şey, parça parça ise, belirli yöntemler ve bunların …

3
MCMC programlarında hata ayıklamak için standart bir teknik var mı?
MCMC programlarında hata ayıklamak çok zordur. Zorluk, bazıları şunlardır: (a) Algoritmanın döngüsel yapısı Parametreleri diğer tüm parametrelere bağlı olarak tekrarlı olarak çiziyoruz. Bu nedenle, bir uygulama düzgün çalışmıyorsa, sorunu yinelemeli örnekleyicinin herhangi bir yerinde olabileceğinden hatayı izole etmek zordur. (b) Doğru cevap mutlaka bilinmemektedir. Yakınsama sağlayıp sağlamadığımızı anlamanın hiçbir yolu …
11 mcmc 



3
Ortalama merkezleme kovaryansı azaltır mı?
İki bağımsız olmayan rasgele değişkenim olduğunu ve çok fazla "sinyal" kaybetmeden aralarındaki kovaryansı olabildiğince azaltmak istediğimi varsayarsak, ortalama merkezleme yardımcı olur mu? Ortalama merkezlemenin korelasyonu önemli bir faktör azalttığı bir yerde okudum, bu yüzden kovaryans için de aynısını yapması gerektiğini düşünüyorum.


4
Bir korelasyon matrisinin sıfır öz değeri için yeterli ve gerekli koşullar
Verilen rasgele değişken , olasılık dağılımı ile , ilinti matrisi olumlu yarı tanımlı yani, özdeğerler pozitif veya sıfır.nnnXiXiX_iP(X1,…,Xn)P(X1,…,Xn)P(X_1,\ldots,X_n)Cij=E[XiXj]−E[Xi]E[Xj]Cij=E[XiXj]−E[Xi]E[Xj]C_{ij}=E[X_i X_j]-E[X_i]E[X_j] C'nin m sıfır öz değerine sahip olması için gerekli ve / veya yeterli olan koşullarıyla ilgileniyorum . Örneğin, yeterli bir koşul rastgele değişkenlerin bağımsız olmamasıdır: \ sum_i u_i X_i = Bazı …


2
Bir p-norm topundan eşit gürültü (
Ben boyutları bir p-norm topu gelen düzgün dağıtılmış gürültü üreten bir işlev yazmaya çalışıyorum :nnn ||x||p≤r||x||p≤r\begin{equation} ||x||_p \leq r \end{equation} Çevreler için olası çözümler buldum ( ) ( http://mathworld.wolfram.com/DiskPointPicking.html ), ancak bunu farklı değerleri için genişletmede sorun yaşıyorum .p=2p=2p = 2ppp Bunu sadece düzgün bir dağılımdan rastgele bir örnek çizerek …
11 simulation  noise 

3
K-araçları kümelemeyi başlatma yöntemleri
K-ortalamaları için başlangıç ​​tohumlarını (küme merkezleri) seçmek için mevcut teknolojiyle ilgileniyorum. Google, iki popüler seçeneğe yol açar: başlangıç ​​tohumlarının rastgele seçimi ve KMeans ++ seçim tekniğini kullanarak: Arthur & Vassilvitskii 2006 k-means ++: Dikkatli Tohumlamanın Avantajları Buradaki herkesin farkında olduğu ve bu kadar popüler olmayabilecek başka umut verici yöntemler var …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.