İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


4
İki bağımsız oranın güç analizinde nasıl bir durma kuralı geliştirilebilir?
A / B test sistemleri üzerinde çalışan bir yazılım geliştiricisiyim. Sağlam bir istatistik geçmişim yok, ancak son birkaç aydır bilgi topluyorum. Tipik bir test senaryosu, bir web sitesindeki iki URL'nin karşılaştırılmasını içerir. Bir ziyaretçi ziyaret eder LANDING_URLve daha sonra rasgele URL_CONTROLveya ' ya yönlendirilir URL_EXPERIMENTAL. Bir ziyaretçi bir örnek oluşturur …

1
Kategorik özelliklere sahip bir SVM ile nasıl başa çıkılır?
35 boyutlu bir alanım var (nitelikler). Analitik sorunum basit bir sınıflandırma sorunudur. 35 boyuttan 25'inden fazlası kategoriktir ve her özellik 50'den fazla değer türünü alır. Bu senaryoda, sahte bir değişken getirmek de benim için işe yaramayacak. Çok sayıda kategorik özniteliği olan bir alanda nasıl SVM çalıştırabilirim?

2
Karma bir modelde gruplar rastgele veya sabit olarak değerlendirildiğinde eğim tahmininde büyük anlaşmazlık
Bazı model parametrelerinin bazı gruplama faktörleri arasında rasgele değiştiğine inandığımızda rastgele efektler (veya karışık efektler) kullandığımızı anlıyorum. Yanıtın bir gruplama faktörü üzerinde normalleştirildiği ve ortalandığı (mükemmel değil, oldukça yakın) bir modele uyma arzum var, ancak bağımsız bir değişken xherhangi bir şekilde ayarlanmadı. Bu beni gerçekten orada olsaydı aradığım etkiyi bulabilmem …

1
Merkezi limit teoremi ve büyük sayılar kanunu
Merkez Limit Teoremi (CLT) ile ilgili çok yeni bir sorum var: CLT'nin, iid rasgele değişkenlerinin ortalamasının yaklaşık olarak normal dağıldığını ( , burada , toplamların indeksidir) veya standart rasgele değişkenin standart normal dağılıma sahip olacağını belirtir.n→∞n→∞n \to \inftynnn Şimdi Büyük Sayılar Kanunu kabaca, iid rasgele değişkenlerin ortalamasının (olasılıkla ya da …

4
Tamsayı olmayan bir ardışık Bernoulli başarısı nasıl oluşturulur?
Verilen: İle bir sikke bilinmeyen önyargı (Baş).ppp Kesinlikle olumlu bir gerçek .a > 0a>0a > 0 Sorun: yanlılığı ile rastgele bir Bernoulli varyasyonu oluşturun .p apap^{a} Bunu nasıl yapacağını bilen var mı? Örneğin, ne zaman pozitif tam sayıdır, daha sonra bir bozuk parayı çevirebilirsiniz o zaman mesele '0' ise, aksi …
18 sampling 

3
Lmer cinsinden varyans-kovaryans matrisi
Karışık modellerin avantajlarından birinin, veriler için varyans-kovaryans matrisi (bileşik simetri, otoregresif, yapılandırılmamış, vb.) Belirtmelerine izin vermesidir. Ancak, lmerR'deki fonksiyon bu matrisin kolay tanımlanmasına izin vermez. Herkes hangi yapının lmervarsayılan olarak kullandığını ve neden kolayca belirtmenin bir yolu olmadığını biliyor mu?


3
İstatistik tarihinin dönemleri
Birçok bilim alanının tarihi, genellikle bazı önemli keşiflerle başlayan az sayıda zaman aralığına bölünebilir. Ama istatistik zaman çizelgesinde hiç benzer bir şey görmedim. Açıkçası, yeni bir dönemin başlangıç ​​noktaları olarak kabul edilebilecek bazı önemli tarihler vardır (Pascal + Fermat, Bayes, Pearson, Tukey, ..). İstatistik tarihini en azından kabaca az sayıda …
18 history 

1
Çoklu regresyondaki yordayıcılar arasında yüksek korelasyon ile nasıl başa çıkılır?
Aşağıdaki gibi bir makalede bir referans buldum: Tabachnick & Fidell'e (1996) göre, iki değişkenli korelasyonu .70'den fazla olan bağımsız değişkenler çoklu regresyon analizine dahil edilmemelidir. Sorun: Çoklu regresyon tasarımında,> .80, VIF'ler yaklaşık .2 - .3, Tolerans ~ 4-5 ile ilişkili 3 değişken kullandım. Bunlardan hiçbirini dışlayamıyorum (önemli öngörücüler ve sonuç). …

6
Önemli olan birçok şey tek seferlik şeyler olduğunda istatistikler neden yararlıdır?
Sadece ben miyim bilmiyorum, ama genel olarak istatistiklere çok şüpheliyim. Ben zar oyunları, poker oyunları, vb anlayabiliyorum. Çok küçük, basit, çoğunlukla müstakil tekrarlanan oyunlar iyidir. Örneğin, kenarındaki bozuk para, iniş kafalarının veya kuyruklarının ~% 50 olma olasılığını kabul edecek kadar küçüktür. % 95 kazanmayı hedefleyen 10 dolarlık bir poker oynamak …

1
, Tahmin süresi boyunca simülasyon
Zaman serisi verilerim var ve verilere uyacak model olarak kullandım. (I nadir bir olay görünce) (bir nadir bir olay bkz olmadığında) ya da 1 0 ya da bir gösterge rastgele değişkendir. için sahip olduğum önceki gözlemlere dayanarak, Değişken Uzunluk Markov Zinciri metodolojisini kullanarak için bir model geliştirebilirim . Bu , …

6
Çekirdek dışı veri analizi seçenekleri
SAS'ı 5 yıldan beri profesyonel olarak kullanıyorum. Dizüstü bilgisayarıma yükledim ve sıklıkla 1000-2.000 değişken ve yüz binlerce gözlem içeren veri kümelerini analiz etmek zorundayım. Benzer büyüklükteki veri kümeleri üzerinde analiz yapmama izin veren SAS'a alternatifler arıyordum. Diğer insanların bu gibi durumlar için ne kullandığını merak ediyorum. Bu kesinlikle bugün kullanılan …
18 r  sas  large-data 


5
Kategorik veya nitel değişkenlerle hangi özet istatistikler kullanılacak?
Açıklamak gerekirse, özet istatistikleri kastederken, Ortalama, Medyan Çeyrek aralıklarına, Varyansa, Standart Sapmaya değiniyorum. Bir tek değişkenli özetleyen zaman kategorik veya nitel hem göz önünde Nominal ve Ordinal davaları, mantıklı onun ortalama, medyan bulmak için, dörtte birlik kısım aralıkları, varyans ve standart sapma yapar? Eğer öyleyse, sürekli bir değişkeni özetlemekten farklı …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.