İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
SAS öğrenmesi gereken bir R kullanıcısı için kaynaklar
Her gün R kullanıyorum. Ben data.frames, Apply () fonksiyon ailesi, nesne yönelimli programlama, vectorization ve ggplot2 geoms / estetik açısından düşünüyorum. Öncelikle SAS kullanan bir kuruluşta çalışmaya başladım. SAS kullanıcıları için R öğrenmeyle ilgili bir kitap olduğunu biliyorum , ancak SAS kullanmayan R kullanıcıları için bazı iyi kaynaklar nelerdir?
18 r  sas 

2
Bir veritabanı için kalite güvencesi ve kalite kontrol (KG / KK) yönergeleri
Arka fon Birincil literatürden bir veri tabanına veri girişini denetliyorum . Veri girişi süreci hataya açıktır, özellikle kullanıcılar deneysel tasarımı yorumlamalı, grafik ve tablolardan veri çıkarmalı ve sonuçları standartlaştırılmış birimlere dönüştürmelidir. Veriler MySQL veritabanına bir web arayüzü üzerinden girilir. Şimdiye kadar> 20 değişken,> 100 tür ve> 500 alıntıdan 10 binden …

4
Ortalama ve Medyan özellikler
Birisi bana iki (a) ve (b) ifadesini birbirine bağlayacak matematiksel mantığı açıklayabilir mi? Bir dizi değer verelim (bazı dağılımlar). Şimdi, a) Medyan her değere bağlı değildir [sadece bir veya iki orta değere bağlıdır]; b) Medyan, ondan minimum mutlak sapma toplamı odağıdır. Ve aynı şekilde ve aksine, a) (Aritmetik) ortalama her …

3
Normal dağılımın belirli aralıklarını değerlendirin
Normal bir dağılımın CDF'si için kullanımı kolay bir formülün, içindeki karmaşık hata fonksiyonu nedeniyle biraz eksik olduğunu biliyorum. Bununla birlikte, için güzel bir formül olup olmadığını merak ediyorum . Veya bu sorun için "son teknoloji" yaklaşım ne olabilir.N(c−≤x&lt;c+|μ,σ2)N(c−≤x&lt;c+|μ,σ2)N(c_{-} \leq x < c_{+}| \mu, \sigma^2)

5
Bağımsızlıkla ilgili bu miktarın bir adı var mı?
Açıkçası A ve B olayları bağımsız iff Pr = Pr Pr . İlgili bir miktar Q tanımlayalım:(A∩B)(A∩B)(A\cap B)(A)(A)(A)(B)(B)(B) Q≡Pr(A∩B)Pr(A)Pr(B)Q≡Pr(A∩B)Pr(A)Pr(B)Q\equiv\frac{\mathrm{Pr}(A\cap B)}{\mathrm{Pr}(A)\mathrm{Pr}(B)} Böylece A ve B, Q = 1'den bağımsızdır (paydanın sıfır olmadığı varsayılarak). Q'nun aslında bir adı var mı? Şu anda beni kaçan bazı temel kavramlara atıfta bulunduğunu ve bunu bile …

3
Doğrusal karışık modellerin tuzakları
Doğrusal karma efekt modellerini kullanmanın bazı temel tuzakları nelerdir? Modelinizin uygunluğunu değerlendirirken test etmeniz / dikkat etmeniz gereken en önemli şeyler nelerdir? Aynı veri kümesinin modellerini karşılaştırırken, aranacak en önemli şeyler nelerdir?


4
Tufte eksenine ulaşmak için R grafiklerindeki kenarlıkları kaldırma
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. Aşağıdaki grafiği düşünün: x &lt;- 1:100 y1 &lt;- rnorm(100) y2 &lt;- rnorm(100)+100 par(mar=c(5,5,5,5)) plot(x,y1,pch=0,type="b",col="red",yaxt="n",ylim=c(-8,2),ylab="") axis(side=2, at=c(-2,0,2)) mtext("red line", side = 2, line=2.5, at=0) par(new=T) plot(x,y2,pch=1,type="b",col="blue",yaxt="n",ylim=c(98,108), ylab="") axis(side=4, …

10
Virgülle ayrılmış değer (CSV) dosyalarını düzenleme stratejisi
Veri analizi projelerinde çalıştığımda, verileri genellikle virgül veya sekmeyle ayrılmış (CSV, TSV) veri dosyalarında depolarım. Veriler genellikle özel bir veritabanı yönetim sistemine aittir. Birçok uygulamam için bu aşırı şeyler olurdu. CSV ve TSV dosyalarını Excel'de (veya muhtemelen başka bir Elektronik Tablo programı) düzenleyebilirim. Bunun yararları vardır: e-tablolar veri girmeyi kolaylaştırır …

10
Sosyal ağ veri kümeleri
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. Sınıflandırma görevleri için tercihen arff formatında sosyal ağ veri kümelerini (twitter, friendfeed, facebook, lastfm, vb.) Arıyorum. UCI ve Google üzerinden yaptığım aramalar şu ana kadar başarılı olamadı …

4
Yüksek oranda doğrusal korelasyona sahip iki öngörücü değişkenten birini kaldırabilir miyim?
Pearson Korelasyon Katsayısı'nı kullanarak, yüksek derecede korelasyona sahip birkaç değişkenim var ( 2 çift değişken için ρ=0.978ρ=0.978\rho = 0.978 ve ).ρ=0.989ρ=0.989\rho = 0.989 Nedeni bir değişken içinde kullanıldığı için bazı değişkenlerin derece ilişkilidir olan hesaplama başka değişken için. Misal: B=V/3000B=V/3000B = V / 3000 ve E= V∗ DE=V*DE = V …

5
Tahmin için lmer kullanma
Merhaba Hiç kullanmadığım çok düzeyli / karma modeller için doğal adaylar gibi görünen iki problemim var. Daha basit ve bir giriş olarak denemeyi umduğum, aşağıdaki gibidir: Veriler formun birçok satırına benziyor x y innergroup outergroup burada x, y'yi (başka bir sayısal değişken) gerilemek istediğim sayısal bir eşdeğerdir, her y bir …

5
Matris ayrışımı ile ilgili temel makaleler
Kısa bir süre önce Skillicorn'un matris ayrışmaları hakkındaki kitabını okudum ve bir lisans izleyicisini hedef aldığı için biraz hayal kırıklığına uğradım. Matris ayrışmaları hakkında (kendim ve başkaları için) temel makalelerden kısa bir kaynakça (anketler, ancak atılım kağıtları) derlemek istiyorum. Aklımda olan şey, SVD / PCA (ve sağlam / seyrek varyantlar) …


7
“Stokastik süreçleri” incelemek bir istatistikçi olarak bana nasıl yardımcı olacak?
Üniversitemde gelecek dönem yapılacak "STOKASTİK SÜREÇLERE GİRİŞ" adlı bir ders almam gerekip gerekmediğine karar vermek istiyorum. Öğretim görevlisine böyle bir kursu araştırmanın bir istatistikçi olarak bana nasıl yardımcı olacağını sordum, olasılıktan geldiği için çok az istatistik bildiğini ve soruma nasıl cevap vereceğini bilmediğini söyledi. İstatistiksel olarak stokastik süreçlerin önemli olduğunu …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.