İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Sıklık ve öncelikler
Robby McKilliam bu yazının yorumunda şöyle diyor : Sıkça görülenler açısından, önceki bilgiyi modele dahil edememeniz için hiçbir neden olmadığı belirtilmelidir. Bu anlamda, sık görüş daha basittir, sadece bir modeliniz ve bazı verileriniz vardır. Önceki bilgileri modelden ayırmaya gerek yoktur Ayrıca, burada , @jbowman, sıkıcıların maliyet / ceza işleviyle düzenlemeyi …

2
Beklenmedik tablolar: ne tür testler ne zaman yapılır?
Eski chi-sq ve Fisher'ın kesin test tartışmasına ilişkin bu tartışmanın bir uzantısını görmek istiyorum , kapsamı biraz genişletiyoruz. Bir beklenmedik durum tablosunda, başımı döndürmek için yeterli olan birçok test var. Hangi testi ve ne zaman kullanmam gerektiğine dair bir açıklama ve tabii ki bir testin neden diğerine tercih edilmesi gerektiğine …



2
Regresyonumu ilk farklı değişkenlerle nasıl yorumlayabilirim?
İki zaman serim var: Piyasa riski primi için bir vekil (ERP; kırmızı çizgi) Devlet tahvili ile temsil edilen risksiz fiyat (mavi çizgi) Risksiz oranın ERP'yi açıklayıp açıklayamayacağını test etmek istiyorum. Bu vesileyle Tsay'ın (2010, 3. baskı, s.96) tavsiyelerini takip ettim: Financial Time Series: Doğrusal regresyon modelini takın ve artıkların seri …

2
R'de çoklu bağımlı değişkenlere sahip genelleştirilmiş doğrusal bir model nasıl yapılır?
Altı bağımlı değişken (veri saymak) ve birkaç bağımsız değişken var, bir MMR komut dosyası şöyle gider görüyorum: my.model <- lm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ IV1 + IV2 + ... + IVn) Ancak, verilerim sayıldığından, genelleştirilmiş doğrusal bir model kullanmak istiyorum ve bunu denedim: my.model <- glm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ IV1 + IV2 + ... + …

3
İstatistiksel anlamlılık için iki sınıflandırıcı doğruluk sonucunun t-testi ile karşılaştırılması
İki sınıflandırıcının doğruluğunu istatistiksel anlamlılık açısından karşılaştırmak istiyorum. Her iki sınıflandırıcı da aynı veri kümesinde çalıştırılır. Bu beni okuduğumdan bir örnek t-testi kullanmam gerektiğine inanıyor . Örneğin: Classifier 1: 51% accuracy Classifier 2: 64% accuracy Dataset size: 78,000 Kullanılacak doğru test bu mu? Öyleyse, sınıflandırıcı arasındaki doğruluk farkının önemli olup …


5
SVM'nin en iyi metaparametrelerini bulmak için hızlı yöntem (ızgara aramasından daha hızlıdır)
Hava kirleticilerinin kısa vadeli tahminini yapmak için SVM modellerini kullanıyorum. Yeni bir model eğitmek için bir SVM modeli için uygun metaparametreler bulmalıyım (yani C, gama vb.). Libsvm belgeleri (ve okuduğum diğer birçok kitap) bu parametreleri bulmak için ızgara aramayı kullanmanızı önerir - bu yüzden temelde bu parametrelerin her kombinasyonu için …

4
Lineer regresyonda artıkların dağılımının doğrulanması
Diyelim ki basit bir doğrusal regresyon , artıkları kaydettik ve artıkların dağılımı için bir histogram çizin. Tanıdık bir dağıtım gibi görünen bir şey alırsak, hata teriminin bu dağıtımda olduğunu varsayabilir miyiz? Diyelim ki, artıkların normal dağılıma benzediğini tespit edersek, popülasyonda hata teriminin normalliğini varsaymak mantıklı geliyor mu? Bence mantıklı, ama …

1
Bootstrap tabanlı güven aralığı
Bootstrap tabanlı güven aralığını incelerken, bir keresinde aşağıdaki ifadeyi okudum: Önyükleme dağıtımı sağa eğilirse, önyükleme tabanlı güven aralığı, uç noktaları sağa daha da ileriye taşımak için bir düzeltme içerir; bu mantıksız görünebilir, ancak doğru eylemdir. Yukarıdaki ifadenin altında yatan mantığı anlamaya çalışıyorum.


3
R'de zamana bağlı katsayılar - nasıl yapılır?
Güncelleme : Başka bir güncelleme için özür dilerim ama fraksiyonel polinomlar ve yardıma ihtiyacım olan rakip risk paketi ile bazı olası çözümler buldum. Sorun Zamana bağlı katsayı analizi R'de yapmanın kolay bir yolunu bulamıyorum. Değişkenlerimi katsayı almak ve zamana bağlı bir katsayıya (değişken değil) dönüştürmek ve zamana karşı varyasyon çizmek …

5
Tek değişkenli rastgele bir değişkenin ortalaması her zaman onun kuantil fonksiyonunun integraline eşit midir?
Sadece tek değişkenli rastgele değişkenin kantil fonksiyonunu (ters cdf) p = 0'dan p = 1'e entegre etmenin değişkenin ortalamasını oluşturduğunu fark ettim. Bu ilişkiyi daha önce duymadım, bu yüzden merak ediyorum: Bu her zaman böyle mi? Eğer öyleyse, bu ilişki yaygın olarak biliniyor mu? İşte python'da bir örnek: from math …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.