İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Beklenti maksimizasyonu algoritması neden kullanılıyor?
Çok az bildiğim kadarıyla EM algoritması, olasılığın parametrelerine göre kısmi türevleri sıfıra ayarlarken maksimum olasılığını bulmak için kullanılabilir, analitik olarak çözülemeyen bir denklem seti verir. Ancak, bahsi geçen denklem setinin kısıtlaması bakımından maksimum bir olasılık bulmaya çalışmak için bazı sayısal teknikler kullanmak yerine EM algoritması gerekli midir?

2
Bir model modeli için regresyon ?
Bir web tartışma forumunun istatistikleri olan bir veri setine sahibim. Bir konunun olması beklenen cevap sayısının dağılımına bakıyorum. Özellikle, konuların cevap sayımlarının bir listesini içeren bir veri seti ve daha sonra bu sayıya sahip olan konuların sayısını oluşturdum. "num_replies","count" 0,627568 1,156371 2,151670 3,79094 4,59473 5,39895 6,30947 7,23329 8,18726 Veri kümesini …


2
Sınırlı Boltzmann makineleri vs çok katmanlı sinir ağları
Karşılaştığım bir sınıflandırma problemi için sinir ağı ile deneyler yapmak istiyordum. RBM'lerden bahseden gazetelere rastladım. Ama anladığım kadarıyla, çok katmanlı bir sinir ağına sahip olmaktan farklı değiller. Bu doğru mu? Dahası, R ile çalışıyorum ve RBM'ler için hazır paketler göremiyorum. Temelde yığılmış RBM'leri olan ama bunları R'de uygulama çabasına değip …

5
R's randomForest 32'den fazla seviyeyi kaldıramaz. Geçici çözüm nedir?
R'nin randomForest paketi, 32'den fazla seviye ile faktörü kaldıramaz. 32'den fazla seviye verildiğinde bir hata mesajı verir: 32'den fazla kategoriye sahip kategorik öngörücüleri işleyemez. Ancak sahip olduğum verilerin birkaç faktörü var. Bazılarında 1000+, bazılarında 100+ var. Hatta 52 olan birleşik devletlerin “devletine” sahiptir. İşte benim sorum. Neden böyle bir sınırlama …

3
Denetimli kümeleme veya sınıflandırma?
İkinci soru, web'de bir yerde, "denetimli kümeleme" hakkında konuştuğumda, kümelenmenin denetimsiz olduğunu bildiğim bir tartışmada buldum, peki "denetimli kümelenme" nin tam anlamı nedir? "Sınıflandırma" açısından fark nedir? Bunun hakkında konuşan birçok bağlantı var: http://www.cs.uh.edu/docs/cosc/technical-reports/2005/05_10.pdf http://books.nips.cc/papers/files/nips23/NIPS2010_0427.pdf http://engr.case.edu/ray_soumya/mlrg/supervised_clustering_finley_joachims_icml05.pdf http://www.public.asu.edu/~kvanlehn/Stringent/PDF/05CICL_UP_DB_PWJ_KVL.pdf http://www.machinelearning.org/proceedings/icml2007/papers/366.pdf http://www.cs.cornell.edu/~tomf/publications/supervised_kmeans-08.pdf http://jmlr.csail.mit.edu/papers/volume6/daume05a/daume05a.pdf vb ...

4
Doğal bir logaritmanın beklenen değeri
sabitleri ile biliyorum , bu yüzden verildiğinde , çözümü kolaydır. Ayrıca, bu durumda gibi doğrusal olmayan bir fonksiyon olduğunda ve bunu çözmek için bir yaklaşım yapmam gerektiğini uygulayamayacağınızı da biliyorum. Taylor ile. Benim sorum Peki nasıl çözerim ?? Ayrıca Taylor ile yaklaşık tahmin ediyorum?E(aX+b)=aE(X)+bE(aX+b)=aE(X)+bE(aX+b) = aE(X)+ba,ba,ba,b E(X)E(X)E(X)E(1/X)≠1/E(X)E(1/X)≠1/E(X)E(1/X) \neq 1/E(X)E(ln(1+X))E(ln⁡(1+X))E(\ln(1+X))

2
Ağırlıklı varyansta yanlılık düzeltmesi
Ağırlıksız varyans için Var(X):=1n∑i(xi−μ)2Var(X):=1n∑i(xi−μ)2\text{Var}(X):=\frac{1}{n}\sum_i(x_i - \mu)^2 , ortalamanın aynı verilerden hesaplandığı durumlarda önyargı düzeltilmiş örneklem varyansı vardır: Var(X):=1n−1∑i(xi−E[X])2Var(X):=1n−1∑i(xi−E[X])2\text{Var}(X):=\frac{1}{n-1}\sum_i(x_i - E[X])^2 Ağırlıklı ortalama ve varyansa bakıyorum ve ağırlıklı varyans için uygun önyargı düzeltmesinin ne olduğunu merak ediyorum. Kullanımı: mean(X):=1∑iωi∑iωiximean(X):=1∑iωi∑iωixi\text{mean}(X):=\frac{1}{\sum_i \omega_i}\sum_i \omega_i x_i Kullandığım "saf", düzeltilmemiş varyansı şudur: Var(X):=1∑iωi∑iωi(xi−mean(X))2Var(X):=1∑iωi∑iωi(xi−mean(X))2\text{Var}(X):=\frac{1}{\sum_i \omega_i}\sum_i\omega_i(x_i - \text{mean}(X))^2 …

3
A / B testi için numune boyutunu güvenle belirleme
A / B test aracı oluşturmak isteyen bir yazılım mühendisiyim . Sağlam bir istatistik geçmişim yok ama son birkaç gündür biraz okuma yapıyorum. Burada açıklanan metodolojiyi takip ediyorum ve aşağıdaki ilgili noktaları özetleyeceğim. Araç, tasarımcıların ve etki alanı uzmanlarının bir web sitesini belirli bir URL’de gelen trafiği iki veya daha …



3
Eşitsiz varyanslı regresyon modellemesi
Artıkların varyansının açıklayıcı değişkene açıkça bağlı olduğu bir lineer modele (lm) uymak istiyorum. Bunu yapmayı bildiğim yol, varyansı modellemek için Gamma ailesiyle birlikte glm kullanmak ve sonra tersini lm işlevindeki ağırlıklara koymaktır (örnek: http://nitro.biosci.arizona.edu/r/chapter31) .pdf ) Merak ediyordum: Tek teknik bu mu? Başka hangi yaklaşımlar önemlidir? Bu modelleme ile ilgili …

1
Tutarsız tahminciler hiç tercih edilir mi?
Tutarlılık açıkça doğal ve önemli bir özellik tahmincisidir, ancak tutarlı bir tahmin yerine tutarsız bir tahmin edici kullanmanın daha iyi olabileceği durumlar var mı? Daha özel olarak ise, bütün sonlu için makul bir tutarlı tahmincisi geride tutarsız tahmin edicinin orada örnekleridir (bazı uygun kayıp fonksiyonu ile ilgili olarak)?nnn


4
R de 100 değişkenli lineer model formülü yazma
Kilitli . Bu soru ve cevapları kilitli çünkü soru konu dışı, ancak tarihsel öneme sahip. Şu anda yeni cevaplar veya etkileşimler kabul etmiyor. R'de 100 parametresi olan bir model üzerinde doğrusal bir regresyon oluşturmak için R'de kolay bir yol var mı? Diyelim ki 10 değerinde bir Y vektörümüz ve 10 …
22 r 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.