İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Akinator.com ve Naive Bayes sınıflandırıcı
Bağlam: Ben üniversitelerin istatistiklerinde (yarı unutulmuş) bazı deneyimlere sahip bir programcıyım. Son zamanlarda http://akinator.com üzerine tökezledim ve başarısız olmasına çalışmak için biraz zaman geçirdim. Kim değildi? :) Nasıl çalışabileceğini bulmaya karar verdim. İlgili blog gönderilerini okuduktan ve okuduktan ve bazı (sınırlı) bilgilerimi ortaya çıkan karışıma ekledikten sonra aşağıdaki modelle geliyorum …

2
Rastgele eğimli karma efekt regresyon modelinde bir MCMC hipotez testi nasıl yapılabilir?
Kütüphane languageR, lmer kullanarak karışık efekt regresyon modeline uyan sabit efektlerin MCMC anlamlılık testini yapmak için bir yöntem (pvals.fnc) sağlar. Ancak, pvals.fnc, lmer modeli rasgele eğimler içerdiğinde hata verir. Bu tür modellerin MCMC hipotez testi yapmanın bir yolu var mı? Öyleyse nasıl? (Bir cevabın kabul edilmesi için R'de işe yaramış …

3
SVM regresyonunu anlama: nesnel işlev ve “düzlük”
Sınıflandırma için SVM'ler bana sezgisel geliyor: en aza indirmenin maksimum marjı nasıl sağladığını anlıyorum . Ancak regresyon bağlamında bu amacı anlamıyorum. Çeşitli metinler ( burada ve burada ) bunu "düzlüğü" en üst düzeye çıkarmak olarak tanımlar. Bunu neden yapmak istiyoruz? Regresyonda ne "marj" kavramına eşdeğerdir?||θ||2||θ||2||\theta||^2 İşte birkaç girişimde bulunmaya çalışılan …
12 regression  svm 

3
Ayrık, sıralı yanıtlardan faktör puanları
Sıralı, ayrık değişkenleriniz olduğunda faktör puanlarını tahmin etmenin ilkeli bir yolu var mı? Ben , değişkenler sıra, ayrık. Her cevabın altında yatan, sürekli, normal olarak dağıtılmış bir değişken olduğu varsayımı yaparsam, polikrik bir korelasyon matrisi hesaplayabilirim. Daha sonra bu matris üzerinde bir faktör analizi yapabilir ve her değişken için faktör …

8
Bir istatistikçi ne yapar?
İstatistiksel olmayan arkadaşlarıma söylediğimde, istatistiklerde doktora yapan bir yüksek lisans öğrencisiyim, doğal olarak "oh, bir profesör olmak ister misin?" Onlara hayır diyorum aslında sanayide çalışmayı planlıyorum. Sonra cevap veriyorlar, "ve ne yapıyorlar?". Bu soruya iyi bir yanıt bulamadım. Onlara istatistikçilerin üzerinde çalıştığı bir dizi ilginç sorun vermek istiyorum, ancak cevabım …
12 careers 

3
Gruplar arasında ortalama sağkalım nasıl karşılaştırılır?
Bir tür kanser için farklı eyaletlerde Kaplan-Meier kullanarak medyan sağkalımı araştırıyorum. Devletler arasında oldukça büyük farklılıklar var. Tüm eyaletler arasındaki ortalama hayatta kalma oranını nasıl karşılaştırabilirim ve hangilerinin ülke genelindeki ortalama ortalama hayatta kalma süresinden önemli ölçüde farklı olduğunu nasıl belirleyebilirim?


3
Analiz için CDF ve PDF istatistiklerini kullanma
Bu çok genel bir soru olabilir ama umarım burada yardım bulabilirim. Üniversitemde bir RA işine başlıyorum ve konumum İnternet Trafik Analizi ile ilgili olacak. Analiz dünyasında oldukça yeniyim ama araştırma dünyasında sanırım çok yapmam gereken bu. Birkaç makaleden geçtim ve birçoğunda elde ettikleri sonuçları açıklamak için Olasılık Yoğunluğu (PDF), CDF, …


3
Nasıl bir beklenti hesaplarım
Eğer katlanarak dağıtılır parametresi ve 'in karşılıklı bağımsız, beklentisi neX iXiXbenX_i(i=1,...,n)(ben=1,...,n)(i=1,...,n)λλ\lambdaXiXbenX_i (∑i=1nXi)2(Σben=1nXben)2 \left(\sum_{i=1}^n {X_i} \right)^2 bakımından ve ve muhtemelen diğer sabitler?λnnnλλ\lambda Not: Bu soru /math//q/12068/4051 adresinde matematiksel bir yanıt almıştır . Okuyucular da buna bir göz atacaklardı.

3
Anketleri doğrulama
Tezim için bir anket tasarlıyorum. İlk örnek grubuna bir Cronbach alfa testi uyguladığım anketi doğrulama sürecindeyim. Ankete verilen yanıtlar Likert ölçeğinde; geçerliliğini test etmeye yardımcı olmak için başka testler önerebilir. İstatistik konusunda uzman değilim, bu yüzden herhangi bir yardım takdir edilecektir. Biraz araştırma yapıyordum ve bir Rasch analizi yapabileceğim görünüyor …

1
Kement uyumunu yeni gözlemlerle güncelleme
Çok büyük bir veri kümesine L1-düzenli doğrusal regresyon uyguluyorum (n >> s.) Değişkenler önceden biliniyor, ancak gözlemler küçük parçalar halinde geliyor. Her bir parçadan sonra kement uyumunu korumak istiyorum. Her yeni gözlem setini gördükten sonra tüm modeli yeniden sığdırabilirim. Bununla birlikte, çok fazla veri olduğu için bu oldukça verimsiz olacaktır. …
12 regression  lasso 

5
Lojistik regresyonda daha iyi temerrüt Sınıflandırması
Tam Açıklama: Bu ev ödevi. Veri kümesine bir bağlantı ekledim ( http://www.bertelsen.ca/R/logistic-regression.sav ) Amacım bu veri setinde kredi temerrütleri tahminini en üst düzeye çıkarmak. Şimdiye kadar bulduğum her model, varsayılan olmayanların% 90'ından fazlasını öngörüyor, ancak varsayılanların <% 40'ı, sınıflandırma verimliliğini genel olarak ~% 80 yapıyor. Değişkenler arasında etkileşim etkisi olup …
12 r  logistic  spss  self-study 

2
R acemi için Öğe Analizi
20 maddelik çok noktalı seçim testini değerlendirmeye çalışıyorum. Bu örnekte bulunabilecek gibi bir madde analizi yapmak istiyorum . Bu yüzden her soru için P-değeri ve toplamla korelasyonu ve seçilen seçeneklerin dağılımını istiyorum. Orada çeşitli istatistiksel yazılım paketleri hakkında hiçbir şey bilmiyorum, ama programlama konusunda rahat olduğum ve R açık kaynak …

3
Uyarlanabilir çekirdek yoğunluk tahmin edicileri?
Herhangi biri uyarlanabilir bir çekirdek yoğunluğu tahmincisi ile deneyimlerini rapor edebilir mi? (Birçok eşanlamlı vardır: uyarlanabilir | değişken | değişken genişlik, KDE | histogram | enterpolatör ...) Değişken çekirdek yoğunluğu tahmini , "örnek alanının farklı bölgelerindeki çekirdeğin genişliğini değiştiririz. İki yöntem vardır ..." aslında, daha fazlası: bazı yarıçaplardaki komşular, KNN …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.