İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Hesaplama Nakagawa ve Schielzeth en (2013) R2glmm yöntemi kullanarak karışık modellerinde
Karışık modellerde değerlerini hesaplama hakkında okuyordum ve R-sig SSS'sini okuduktan sonra, bu forumdaki diğer yayınlar (birkaçını bağlayacağım, ancak yeterli itibarım yok) ve kullandığım diğer referansları anladım Karışık modeller bağlamında değerleri karmaşıktır.R 2R2R2R^2R2R2R^2 Ancak, yakın zamanda bu iki makaleye rastladım. Bu yöntemler umut verici görünse de (bana göre) bir istatistikçi değilim …

2
Günlük veriler için çoklu regresyonda mevsimsellik yakalamak
Oldukça mevsimsel bir ürün için günlük satış verilerim var. Regresyon modelinde mevsimsellik yakalamak istiyorum. Üç aylık veya aylık verileriniz varsa, bu durumda sırasıyla 3 ve 11 kukla değişken oluşturabileceğinizi okudum - ancak günlük verilerle ilgilenebilir miyim? Üç yıllık günlük verilerim var. Bağımsız değişkenler fiyat noktası, promosyon bayrağı (evet / hayır) …

3
Gecikmeli bağımlı değişkene karşı artık otokorelasyon
Zaman serisinin modellenmesi sırasında, örneğin bir AR (1) işlemi (2) açıklayıcı değişken olarak gecikmeli bağımlı değişkeni (sağ tarafta) içerdiğinden (1) hata terimlerinin korelasyon yapısını modelleme olanağına sahiptir. Anlamak istiyorum, bazen gitmek için önemli nedenler (2). Ancak, (1) veya (2) veya her ikisini birden yapmanın metodolojik nedenleri nelerdir?


1
Ampirik bir CDF entegre etme
Ampirik bir dağılımım . Aşağıdaki gibi hesaplıyorumG ( x )G(x)G(x) x <- seq(0, 1000, 0.1) g <- ecdf(var1) G <- g(x) I göstermektedirler , yani saat süre pdf G ED olup.h ( x ) = dG / dxh(x)=dG,/dxh(x) = dG/dxhhhG,G,G Şimdi entegrasyonun üst limiti (örneğin, ) için bir denklemi çözmek …
13 r  integral  ecdf 

2
Kesikli veriler için çizgi grafikleri kullanmak yanlış mı?
Sıklıkla çizgi grafikleri olarak çizilen ayrık veri kümelerini gördüm, ancak bana göre çizgi, ayrık veri kümeleri için anlamsız olan ölçüm aralıkları arasındaki bir noktada bir değer verdi. Bu nedenle, ayrık veriler için çizgi grafiklerinin kullanılması yanlış mı? Örnek olarak, biri sürekli (kilom, sabahları günlük olarak ölçülür) ve bir ayrık (günde …

1
Ki-kare testi ve Chi-kare dağılımını anlama
Ki-kare testinin ardındaki mantığı anlamaya çalışıyorum. Ki kare testi . daha sonra sıfır hipotezini reddetmek ya da reddetmemek için bir p.value bulmak için Chi-kare dağılımı ile karşılaştırılır. : Gözlemler, beklenen değerlerimizi oluşturmak için kullandığımız dağılımdan geliyor. Örneğin, elde etme olasılığının beklediğimiz gibi ile verilip verilmediğini test edebiliriz . 100 kez …

2
Gözlemleri saklamadan çeyreklerin çevrimiçi tahmini
Çeyrekleri (Q1, medyan ve Q3) büyük bir veri setinde gözlemleri saklamadan gerçek zamanlı olarak hesaplamam gerekiyor. İlk önce P kare algoritmasını (Jain / Chlamtac) denedim ama memnun kalmadım (biraz fazla cpu kullanımı ve en azından veri setimdeki hassasiyetle ikna olmadım). Şimdi FAME algoritmasını ( Feldman / Shavitt ) medyanı anında …

4
Yanıt değişkeni, yıllık bir olayın (genellikle) gerçekleştiği yılın günü olan bir regresyon modeli
Bu özel durumda, bir gölün dontuğu güne değiniyorum. Bu "buzlanma" tarihi yalnızca yılda bir kez olur, ancak bazen hiç olmaz (kış sıcaksa). Yani bir yılda göl 20. günde (20 Ocak) donabilir ve başka bir yıl hiç donmayabilir. Amaç, buzlanma tarihinin sürücülerini bulmaktır. Tahminler her yıl sonbahar / kış hava sıcaklığı …


1
Firth Lojistik Regresyonunu Kuramsal Olarak Anlamak
Firth lojistik regresyonunu (lojistik regresyonda mükemmel / tam veya yarı-tam ayrımı ele alma yöntemi) anlamaya çalışıyorum, böylece basitleştirilmiş terimlerle başkalarına açıklayabilirim. Herkes Firth tahmininin MLE'de yaptığı değişikliğin açık bir açıklaması var mı? En iyi şekilde Firth (1993) 'i okudum ve puan fonksiyonuna bir düzeltme uygulandığını anlıyorum. Ben düzeltmenin kökeni ve …

2
KMEANS'taki k sayısını tahmin etmek için BIC kullanma
Şu anda oyuncak veri setim için BIC'yi hesaplamaya çalışıyorum (ofc iris (:). Sonuçları burada gösterildiği gibi çoğaltmak istiyorum (Şekil 5) Bu makale aynı zamanda BIC formülleri için kaynağım. Bu konuda 2 problemim var: Gösterim: ninin_i ben küme eleman = sayısıiii CiCiC_i i = küme merkez koordinatlarıiii xjxjx_j i = küme …


1
Sürekli değişken ile kategorik değişken arasındaki korelasyonu tahmin etmek için karşılıklı bilgileri kullanma
Başlığa gelince, fikir, sürekli bir değişken ile kategorik bir değişken arasında "korelasyon" ("B'yi Bildiğimde ne kadar biliyorum" olarak tanımlanır) olarak tanımlamak için MI ve sonrasında karşılıklı bilgileri kullanmaktır. Bu konuyla ilgili düşüncelerimi bir an sonra anlatacağım, ancak CrossValidated ile ilgili diğer bazı soruları / cevapları okumanızı tavsiye etmeden önce , …

3
Bayesian vs MLE, aşırı uyum sorunu
Bishop'un PRML kitabında, aşırı sığmanın Maksimum Olabilirlik Tahmini (MLE) ile ilgili bir sorun olduğunu ve Bayesian'ın bundan kaçınabileceğini söylüyor. Ama bence, aşırı takma, parametre tahmini yapmak için kullanılan yöntemle değil, model seçimi ile ilgili bir sorundur. Yani, diyelim ki ile oluşturulan bir veri kümesi sahibim, şimdi verilere uymak ve bulmak …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.