İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
R'nin coxph () yöntemi tekrarlanan önlemleri tam olarak nasıl ele alır?
bağlam R'nin coxph () yönteminin nesneler için tekrarlanan girdileri (veya isterseniz hasta / müşteri) nasıl kabul ettiğini ve işlediğini anlamaya çalışıyorum. Bazıları bu Uzun formatı, bazıları ise 'tekrarlanan önlemler' olarak adlandırır. Örneğin, Yanıtlar bölümünde Kimlik sütununu içeren veri kümesine bakın: Değişen değişkenlere sahip Cox modelleri için en iyi paketler Ayrıca, …

1
Varyansı hesaplamak için medyanı kullanma
Son derece çarpık olan 1-B rastgele değişkenim var. Bu dağılımı normalleştirmek için ortalamadan ziyade medyan kullanmak istiyorum. sorum şu: ortalama yerine formülde medyan kullanarak dağılımın varyansını hesaplayabilir miyim? yani değiştirebilir miyim Var(X)=∑[(Xi−mean(X))2]/nVar(X)=∑[(Xi−mean(X))2]/n \mathrm{Var}(X) = \sum[(X_i - \mathrm{mean}(X))^2]/n ile Var(X)=∑[(Xi−median(X))2]/nVar(X)=∑[(Xi−median(X))2]/n \mathrm{Var}(X) = \sum[(X_i - \mathrm{median}(X))^2]/n Bunun arkasındaki akıl yürütme, varyansın bir …
10 variance  mean  median 

3
Regresyon'u veri aralığının dışında yansıtmak için kullanma tamam mı? asla tamam değil mi? bazen tamam mı?
Veri aralığının dışında projeksiyon yapmak için regresyon kullanma hakkındaki düşünceleriniz nelerdir? Doğrusal veya güç modeli şekline uyduğundan eminseniz, model veri aralığının ötesinde yararlı olamaz mı? Mesela fiyat bazında hacimim var. İnandığım veri aralığı dışındaki fiyatlar için projeksiyon yapabilmeliyiz. Senin düşüncelerin? VOL PRICE 3044 4.97 2549 4.97 3131 4.98 2708 4.98 …

1
Monte Carlo ile birleştirilmiş Varyasyon Bayes
Varyasyonel Bayes üzerinde okuyorum ve anladığım kadarıyla, (burada z , modelinizin gizli değişkenleri ve gözlemlenen veriler x ) bir işleve yaklaştığınız fikrine gelir. q (z) , q'nun q_i (z_i) olarak çarpanlara ayırdığı varsayılır; burada z_i , gizli değişkenlerin bir alt kümesidir. Daha sonra, optimal faktör q_i (z_i) şu şekilde gösterilebilir …

1
Word2vec'de çapraz entropi kaybının türevi
Ben cs224d çevrimiçi stanford sınıfı ders materyali ilk sorun seti ile yoluma çalışıyorum ve sorun 3A ile bazı sorunlar yaşıyorum: Softmax tahmin fonksiyonu ve çapraz entropi kaybı fonksiyonu ile atlama gram word2vec modeli kullanırken, biz degradeleri tahmin edilen sözcük vektörlerine göre hesaplamak istiyorum. Softmax fonksiyonu göz önüne alındığında: wben^= Pr …

2
Vaka-kontrol çalışmalarında hayatta kalma oranı eğilimleri
Hayatta kalma analizi yapmanın yanlış yolu nedeniyle reddedilen bir makale gönderdim. Hakem, “zaman eğilimlerine ilişkin hayatta kalma analizi daha karmaşık sansür yolları gerektirir” dışında başka hiçbir ayrıntı veya açıklama bırakmadı. Soru: Son yıllarda sigara içenler arasında aşırı ölüm riski azaldı mı? Veri: Almanya'da 25.000 sigara içicisi. 1995-2014 yılları arasında herhangi …

1
Bu seyreklik yorumu doğru mu?
removeSparseTermsFonksiyonun tmpaketteki belgelerine göre, seyreklik budur: A term-document matrix where those terms from x are removed which have at least a sparse percentage of empty (i.e., terms occurring 0 times in a document) elements. I.e., the resulting matrix contains only terms with a sparse factor of less than sparse. Öyleyse, …

6
Gösterim nasıl
Gösterim nasıl X∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2)okumak? bu muXXX normal dağılımı izler mi? VeyaXXX olan bir normal dağılım? Ya da belkiXXX yaklaşık normaldir .. Aynı dağılımı takip eden (veya kelimeler ne olursa olsun) birkaç değişken varsa ne olur? Nasıl yazılır?

3
Scikit Learn ile özellik seçiminden sonra filtrelenmiş özellikleri belirleme
İşte benim Python özellik seçim yöntemi için Kod : from sklearn.svm import LinearSVC from sklearn.datasets import load_iris iris = load_iris() X, y = iris.data, iris.target X.shape (150, 4) X_new = LinearSVC(C=0.01, penalty="l1", dual=False).fit_transform(X, y) X_new.shape (150, 3) Ancak yeni X (bağımlı değişken - X_new) aldıktan sonra, bu yeni güncellenen değişkente …

1
R'de çapraz doğrulayıcı kement regresyonu
R işlevi cv.glm (kütüphane: önyükleme), genelleştirilmiş doğrusal modeller için tahmini K-kat çapraz doğrulama tahmin hatasını hesaplar ve deltayı döndürür. Bu işlevi bir kement regresyonu (kütüphane: glmnet) için kullanmak mantıklı mı ve eğer öyleyse, bu nasıl yapılabilir? Glmnet kütüphanesi, en iyi dönüş parametresini elde etmek için çapraz doğrulamayı kullanır, ancak son …

3
arasındaki ilişki
OLS regresyonlarının ile ilgili çok temel bir soruR,2R,2R^2 OLS regresyonunu çalıştırın y ~ x1, bir , diyelim ki 0.3R2R2R^2 OLS regresyonunu çalıştırın y ~ x2, başka bir , diyelim 0.4R2R2R^2 şimdi y ~ x1 + x2 gerilemesi yapıyoruz, bu regresyonun R karesi ne değer olabilir? Bence çoklu regresyon için 0.4'den …

1
Keskinlik Oranı önemini test etme
Sharpe Oranlarının veya Bilgi Oranlarının önemini test etmenin uygun yolu nedir? Sharpe Oranları çeşitli özsermaye endekslerine dayanacaktır ve değişken yeniden inceleme dönemlerine sahip olabilir. Açıklandığı gibi gördüğüm bir çözüm, df yeniden inceleme süresinin uzunluğuna ayarlanmış bir Student t-testi uygular. Aşağıdaki endişeler nedeniyle yukarıdaki yöntemi uygulamak için tereddüt ediyorum: T-testinin çarpıklığa …

1
Ana bileşen puanları neden ilişkilendirilmiyor?
Varsayalım , ortalama merkezli verilerin bir matrisidir. Matris olduğu , var belirgin öz ve özvektörler , ... ortogonal olan.birA\mathbf AS = cov ( A )S=cov(A)\mathbf S=\text{cov}(\mathbf A)m × mm×mm\times mmmms1s1\mathbf s_1s2s2\mathbf s_2smsm\mathbf s_m -inci ana bileşen (bazı insanlar "puanlarının" olarak adlandırmak) olan vektör . Başka bir deyişle, sütunlarının doğrusal bir …

2
Kovalaştırma nedir?
Ben şanssız makine öğrenme "kova" net bir açıklama bulmak için dolaşmak. Şimdiye kadar anladığım şey, kovalamanın, bir dizi sürekli değerin bir ayrı değerle değiştirildiği dijital sinyal işlemedeki nicemlemeye benzer olmasıdır. Bu doğru mu? Kovalamanın uygulanmasının artıları ve eksileri (bilgi kaybetmenin bariz etkisinin yanı sıra) nelerdir? Kovalamanın nasıl uygulanacağına dair genel …

2
İç içe çapraz doğrulama - eğitim setindeki kfold CV ile model seçiminden farkı nedir?
Sıklıkla 5x2 çapraz doğrulamadan bahseden insanların iç içe çapraz doğrulamanın özel bir örneği olduğunu görüyorum . İlk sayının (burada: 5) iç döngüdeki kat sayısını ve ikinci sayı (burada: 2) dış döngüdeki kat sayısını ifade ettiğini varsayıyorum? Peki, bunun "geleneksel" model seçim ve değerlendirme yaklaşımından farkı nedir? "Geleneksel" derken veri kümesini …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.