İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Karışım modellerinin MCMC tahmininde etiket değiştirme sorunu ile başa çıkmak için standart bir yöntem var mı?
Etiket değiştirme (yani arka dağılım, bileşen etiketlerinin değiştirilmesinde değişmez), karışım modellerini tahmin etmek için MCMC kullanılırken sorunlu bir sorundur. Konuyla başa çıkmak için standart (yaygın olarak kabul edilen) bir metodoloji var mı? Standart bir yaklaşım yoksa, etiket anahtarlama sorununu çözmek için önde gelen yaklaşımların artıları ve eksileri nelerdir?
15 bayesian  mcmc  mixture 

3
Büyük bir nüfusu yoklarken örneklem büyüklüğüne nasıl karar veriyorsunuz?
Avustralya şu anda bir seçim yapıyor ve anlaşılır bir şekilde medya her gün yeni siyasi anket sonuçları bildiriyor. 22 milyonluk bir ülkede, istatistiksel olarak geçerli bir sonuç elde etmek için nüfusun yüzde kaçının örneklenmesi gerekir? Çok büyük bir örnek kullanmanın sonuçları etkileyebileceği veya istatistiksel geçerliliğin örneklem büyüklüğü ile monoton olarak …

8
"Gidon" grafiklerine alternatif grafikler
Araştırma alanımda, verileri göstermenin popüler bir yolu, çubuk grafiklerin "tutamak çubukları" ile birlikte kullanılmasıdır. Örneğin, "Tutamak çubukları", yazara bağlı olarak standart hatalar ve standart sapmalar arasında değişir. Tipik olarak, her bir "bar" için numune boyutları oldukça küçüktür - yaklaşık altı. Bu araziler özellikle biyolojik bilimlerde popüler görünmektedir - örnekler için …

5
Biri diğer birkaç bilgisayardan bir ana bileşeni (PC) tahmin etmek için çoklu regresyon kullanabilir mi?
Bir süre önce, R-yardım posta listesindeki bir kullanıcı, bir regresyonda PCA skorlarını kullanmanın sağlamlığını sordu. Kullanıcı başka bir PC'deki varyasyonu açıklamak için bazı PC skorlarını kullanmaya çalışıyor (tüm tartışmaya buradan bakın ). Cevap hayırdı, bu ses değil çünkü PC'ler birbirine dik. Birisi bunun neden böyle olduğunu daha ayrıntılı olarak açıklayabilir …
15 regression  pca 


5
Aynı Anda Birçok Kez Serisi Nasıl Kullanılır?
25 dönem boyunca birkaç ürünün (1200 ürün) talebini içeren bir veri setim var ve her bir ürünün gelecek dönem için talebini tahmin etmem gerekiyor. İlk başta, ARIMA kullanmak ve her ürün için bir model eğitmek istedim, ancak ürün sayısı ve (p, d, q) parametrelerinin ayarlanması nedeniyle çok zaman alıcı ve …


5
Doğrusal regresyonda varsayımlara ihtiyaç nedir?
Doğrusal regresyonda, aşağıdaki varsayımları yaparız Her bir öngörücünün değer kümesinde yanıtın ortalaması , öngörücülerin Doğrusal bir işlevidir.( x 1 i , x 2 i , … )E(Yi)E(Yi)E(Y_i)(x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) hataları εiεiε_iBağımsızdır. εiεiε_i her bir değer kümesindeki ε_i hataları ( x_ (x1i,x2i,…)(x1i,x2i,…)(x_{1i}, x_{2i},…) Normal olarak dağıtılır. εiεiε_i her bir değer kümesindeki ε_i …

4
Yapay Sinir Ağı * nedir?
Biz eski defterleri gibi Sinir Ağları edebiyat, biz nöromorfik topolojileri ( "Sinir-Ağı" gibi bir mimariler) ile diğer yöntemleri tanımlamak için olsun. Ve Evrensel Yaklaşım Teoreminden bahsetmiyorum . Örnekler aşağıda verilmiştir. O zaman beni meraklandırıyor: Yapay bir Sinir Ağının tanımı nedir? Topolojisi her şeyi kapsar. Örnekler: Yaptığımız ilk kimliklerden biri, PCA …

4
Sırt regresyonunun eşdeğer formüllerinin kanıtı
İstatistiksel öğrenmede en popüler kitapları okudum 1- İstatistiksel öğrenmenin öğeleri. 2- İstatistiksel öğrenmeye giriş . Her ikisi de sırt regresyonunun eşdeğer iki formüle sahip olduğunu belirtiyor. Bu sonucun anlaşılabilir bir matematiksel kanıtı var mı? Ben de Cross Validated geçtim, ama orada kesin bir kanıt bulamıyorum. Dahası, LASSO da aynı kanıt …

1
Açıklayıcı modellemede yanlılığı en aza indirmek, neden? (Galit Shmueli'nin “Açıklamak ya da Tahmin Etmek”)
Bu soru Galit Shmueli'nin "Açıklamak ya da Tahmin Etmek " başlıklı makalesine atıfta bulunmaktadır . Profesör Shmueli özellikle bölüm 1.5, "Açıklama ve Tahmin Farklıdır" bölümünde şöyle yazar: Açıklayıcı modellemede odak, temel teorinin en doğru temsilini elde etmek için önyargıların en aza indirilmesidir. Gazeteyi her okuduğumda bu beni şaşırttı. Tahminlerdeki yanlılığı …

2
Sinir ağları ve diğer her şey
Google'dan buna tatmin edici bir cevap bulamadım . Tabii ki elimdeki veriler milyonlarca mertebede ise, derin öğrenme yoludur. Ve büyük veriye sahip olmadığımda belki de makine öğreniminde diğer yöntemleri kullanmanın daha iyi olduğunu okudum. Verilen neden aşırı uydurmadır. Makine öğrenimi: örn. Verilere bakmak, özellik çıkarma, toplanandan yeni özellikler hazırlamak vb. …

1
Newey-West (1987) ve Hansen-Hodrick (1980) karşılaştırması
Soru: Newey-West (1987) ve Hansen-Hodrick (1980) standart hatalarını kullanmak arasındaki temel farklar ve benzerlikler nelerdir? Hangi durumlarda bunlardan biri diğerine tercih edilmelidir? Notlar: Bu ayarlama prosedürlerinin her birinin nasıl çalıştığını biliyorum; ancak, çevrimiçi olarak veya ders kitabımda bunları karşılaştıracak hiçbir belge bulamadım. Referanslar bekliyoruz! Newey-West, "tümünü yakala" HAC standart hataları …

2
Zaman serisinin bu tahmini neden “oldukça zayıf”?
Yapay Sinir Ağlarının nasıl kullanılacağını öğrenmeye çalışıyorum. Bu dersi okuyordum . Sinir Ağı bir Zaman Serisine değeri tahmin etmek için değerini kullanarak taktıktan sonra , yazar aşağıdaki çizgiyi elde eder, burada mavi çizgi zaman serisidir, yeşil tren verisindeki tahmindir, kırmızı test verileri hakkında tahmin (bir test treni bölünmesi kullandı)tttt+1t+1t+1 ve …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.