İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Arules kullanarak yeni veriler için uygun kurallar bulma
İlişkilendirme kuralları için madencilik işlemlerinde R (ve arules paketini) kullanıyorum. Yapmak istediğim kuralları oluşturmak ve daha sonra yeni verilere uygulamak. Örneğin, biri kurallı olan birçok kuralım olduğunu varsayalım {Beer=YES} -> {Diapers=YES}. Sonra kayıtlardan birinin bira satın aldım ama çocuk bezi değil yeni işlem verileri var. LHS'nin karşılandığı, ancak henüz RHS'nin …


2
Örneğin haftanın günlerine dayalı regresyon
Doğru yönde ilerlemek için biraz yardıma ihtiyacım var. Herhangi bir istatistik okuduğumdan beri uzun zaman oldu ve jargon değişmiş gibi görünüyor. Şunun gibi araba ile ilgili verilerim olduğunu düşünün: A şehrinden B şehrine yolculuk süresi A kasabasından B kasabasına uzaklık Motor boyutu Sürücü ayakkabısı boyutu Otomobil markası ve modeli Haftanın …

1
Hoeffding eşitsizliğinde kullanılan bir lemmanın kanıtını anlama
Larry Wasserman'ın Casella ve Berger'i birincil metin olarak kullanan İstatistik ders notlarını inceliyorum . 2 no'lu ders notları üzerinde çalışıyorum ve Hoeffding eşitsizliğinde kullanılan lemmanın türetilmesinde sıkıştım (s.2-3). Aşağıdaki notlarda ispatı yeniden veriyorum ve ispattan sonra nerede sıkıştığımı göstereceğim. baş kelime olduğunu olduğunu varsayalım . Sonra .E(X)=0E(X)=0\mathbb{E}(X) = 0a≤X≤ba≤X≤b a …

1
Olayları R Zaman Çizelgesinde Çizme
R için başlangıç ​​ve bitiş zamanlarının veri çerçevesini aşağıdaki gibi bir zaman çizelgesi grafiğine dönüştürebilen bir arsa kütüphanesi var mı: Y ekseni tek anlamı, eşzamanlılık ile yığınlanmasıdır, ancak her zaman eşzamanlılığı temsil etmez (ortadaki boşluğa bakın). Her gri kutu bir olaydır - veri çerçevesinden bir satır. Veri çerçevesinde iki sütun …

1
Bir kuaför muamma
Kuaförlerim Stacey her zaman mutlu bir yüze sahiptir, ancak genellikle zamanını yönetme konusunda stres altındadır. Bugün Stacey benim randevum için gecikmiş ve çok özür dileme. Saçımı alırken merak ettim: Standart randevuları ne kadar olmalı? (müşterinin temiz yuvarlak sayılar için tercihi bir an için yok sayılabilirse). Dikkate alınması gereken bir şey, …

4
Hastane tabanlı bir RCT'de kalış verilerinin uzunluğu en iyi nasıl analiz edilir?
Bir RCT'den hastanede kalış süresi (LOS) verilerini analiz etmenin en iyi yolu hakkında bir fikir birliği olup olmadığını bilmekle ilgileniyorum. Bu tipik olarak çok sağa eğik bir dağılımdır, böylece çoğu hasta birkaç gün ila bir hafta içinde taburcu edilir, ancak hastaların geri kalanı dağılımın sağ kuyruğunu oluşturan oldukça tahmin edilemez …

1
Artımlı IDF (Ters Belge Sıklığı)
In a text mining application, one simple approach is to use the tf−idftf−idftf-idf heuristic to create vectors as compact sparse representations of the documents. This is fine for the batch setting, where the whole corpus is known a-priori, as the idfidfidf requires the whole corpus idf(t)=log|D||{d:t∈d}|idf(t)=log⁡|D||{d:t∈d}| \mathrm{idf}(t) = \log \frac{|D|}{|\{d: …

3
Nasıl büyük terimlerin birçoğutoplamın yarısına kadar ekle?
Düşünün ∑Ni=1|Xi|∑i=1N|Xi|\sum_{i=1}^N |X_i| burada X1,…,XNX1,…,XNX_1, \ldots, X_N bulunur ve CLT bekletilir. En büyük terimlerin kaç tanesi toplam toplamın yarısını oluşturur? Örneğin, 10 + 9 + 8 ≈≈\approx (10 + 9 + 8 ……\dots + 1) / 2: terimlerin% 30'u toplamın yaklaşık yarısına ulaşır. Define sumbiggest( j;X1…XN)≡sum of the j biggest …

2
Lm için varsayılan tanı grafiklerine olası uzantılar (R ve genel olarak)?
Plot.lm işlevine biraz kazmaya başladım , bu işlev lm için altı grafik verir, bunlar: kalan değerlere uygun değerlere karşı bir arsa Sunulan değerlere karşı sqrt (| Artıklar |) 'nın Ölçek-Konum grafiği Normal QQ grafiği, Cook'un satır etiketlerine karşı mesafelerinin grafiği kaldıraçlara karşı artıkların bir arsası Cook'un kaldıraç / (1 kaldıraç) …

3
Film derecelendirme tahmini için sınıflandırma modeli
Veri madenciliği konusunda biraz yeniyim ve film derecelendirme tahmini için bir sınıflandırma modeli üzerinde çalışıyorum. IMDB'den veri setleri topladım ve modelim için bir karar ağacı ve en yakın komşu yaklaşımları kullanmayı planlıyorum. Hangi serbestçe kullanılabilir veri madenciliği aracının ihtiyacım olan işlevselliği sağlayabileceğini bilmek istiyorum.

1
Sıfır şişirilmiş Poisson dağılımının ortalaması ve varyansı
Herkes sıfır şişirilmiş Poisson beklenen değer ve varyans, olasılık kütle fonksiyonu ile nasıl gösterebilir f(y)={π+(1−π)e−λ,(1−π)λye−λy!,if y=0if y=1,2....f(y)={π+(1−π)e−λ,if y=0(1−π)λye−λy!,if y=1,2.... f(y) = \begin{cases} \pi+(1-\pi)e^{-\lambda}, & \text{if }y=0 \\ (1-\pi)\frac{\lambda^{y}e^{-\lambda}}{y!}, & \text{if }y=1,2.... \end{cases} burada olasılık gözlem binom işlemle sıfırdır ve olmasıdır Poisson ortalamasıdır türetilmiştir?ππ\piλλ\lambda Sonuç beklenen değer ve varyans .μ=(1−π)λμ=(1−π)λ\mu =(1-\pi)\lambdaμ+π1−πμ2μ+π1−πμ2\mu+ …

1
Bir zaman serisinin otokorelasyon fonksiyonundan ne okunmalı?
Bir zaman serisi verildiğinde, otokorelasyon fonksiyonu tahmin edilebilir ve örneğin aşağıda görüldüğü gibi çizilebilir: O zaman bu otokorelasyon fonksiyonundan zaman serileri hakkında ne okumak mümkün? Örneğin, zaman serilerinin durağanlığı hakkında mantık yürütmek mümkün mü? Düzenlendi : Burada daha fazla gecikme ile farklı serilerin ACF'sini ekledim

1
Orijinal verileri giriş olarak kullanırken predict () işlevi tarafından R'de döndürülen tahmini değerler nelerdir?
reg <- lm(y ~ x1 + x2, data=example)Bir veri kümesinde formun bir regresyonunu çalıştırdıktan sonra , kullanarak tahmin edilen değerleri alabilirim predict(reg, example, interval="prediction", level=0.95) Gerçek veri kümesini tahmin etmek için regresyonu kullanırken tahmin edilen değerlerin gerçekte ne anlama geldiğini merak ediyorum. Orijinal değerleri elde etmem gerekir mi?
11 r  regression 

2
Kategorik değişkenler arasındaki eşdeğerlik
Sürekli öngörücülerle ilgili eşzamanlılık hakkında çok şey var, ancak kategorik öngörücülerde bulabileceğim kadar çok değil. Aşağıda gösterilen bu tip verilerim var. İlk faktör genetik bir değişkendir (alel sayısı), ikinci faktör bir hastalık kategorisidir. Açıkça, genler hastalıktan önce gelir ve teşhise yol açan semptomları gösteren bir faktördür. Bununla birlikte, SPSS ile …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.