İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Standart betaları orijinal değişkenlere geri dönüştürme
Bunun çok basit bir soru olduğunun farkındayım ama aradıktan sonra aradığım cevabı bulamıyorum. Ben betaların sırt tahminlerini hesaplamak için (sırt regresyonu) çalıştırmak değişkenleri standartlaştırmak gerekir bir sorun var. Daha sonra bunları orijinal değişkenler ölçeğine geri dönüştürmem gerekiyor. Ama bunu nasıl yaparım? İki değişkenli dava için bir formül buldum. β∗=β^SxSy.β∗=β^SxSy. \beta^* …

4
Rasgele kategorik veriler nasıl oluşturulur?
Diyelim ki A, B, C ve D değerlerini alabilen kategorik bir değişkenim var. 10000 rasgele veri noktası üretebilir ve her birinin frekansını nasıl kontrol edebilirim? Örneğin: A =% 10 B =% 20 C =% 65 D =% 5 Bunu nasıl yapabileceğime dair bir fikrin var mı?

2
Etki fonksiyonları ve OLS
Etki işlevlerinin nasıl çalıştığını anlamaya çalışıyorum. Birisi basit bir OLS regresyonu bağlamında açıklayabilir mi? yi=α+β⋅xi+εiyi=α+β⋅xi+εi\begin{equation} y_i = \alpha + \beta \cdot x_i + \varepsilon_i \end{equation} Burada için etki fonksiyonunu istiyorum .ββ\beta

1
Makine öğrenimi modelinin “kapasitesi” nedir?
Carl Doersch'in Variational Autoencoders üzerine olan bu eğitimini inceliyorum . İkinci sayfada şunları belirtir: Bu tür en popüler çerçevelerden biri, bu öğreticinin konusu olan Variational Autoencoder [1, 3]. Bu modelin varsayımları zayıftır ve backpropagation yoluyla eğitim hızlıdır. VAE'ler bir tahmin yapar, ancak yüksek kapasiteli modeller göz önüne alındığında bu yaklaşımın …




1
L-BFGS nasıl çalışır?
Bu makalenin amacı, düzenli log olasılığını en üst düzeye çıkararak bazı parametreleri optimize etmekti. Sonra Kısmi türevleri hesaplarlar. Ve sonra yazarlar, denklemi, birçok değişkenin pürüzsüz işlevlerini optimize etmek için standart bir yarı Newton prosedürü olan L-BFGS'yi kullanarak optimize ettiklerini belirtiyorlar (daha fazla ayrıntı yok). O nasıl çalışır ?

4
Ücretsiz kamu yararına veri barındırma? [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 4 yıl önce kapalı . Http://data.barrycarter.info/ adresinde birçok istasyon için saatlik ve günlük sıcaklık raporlarım var İnsanları indirmeye teşvik ediyorum, ancak 6.6G'de çok fazla bant …
14 dataset 

1
Neden burada bir gamma dağılımı seçtiler?
Kursum için yapılan egzersizlerden birinde Kaggle tıbbi veri seti kullanıyoruz . Alıştırma şöyle diyor: münferit ücretlerin dağılımını modellemek istiyoruz ve ayrıca bu dağıtım hakkındaki belirsizliğimizi yakalamak istiyoruz, böylece görebildiğimiz değer aralığını daha iyi yakalayabiliyoruz. Verileri yükleme ve ilk görünümü gerçekleştirme: Yukarıdakilerden, burada oyunda bir tür üstel benzeri dağılımın olduğundan şüphelenebiliriz. …

3
İki frekans dağılımı arasındaki istatistiksel “mesafe” nasıl ölçülür?
Yıl boyunca web sitesi kullanım sürelerinin araştırılmasını içeren bir veri analizi projesi yürütüyorum. Yapmak istediğim şey, kullanım şekillerinin ne kadar "tutarlı" olduğunu, örneğin haftada 1 saat boyunca kullanmayı içeren bir desene ne kadar yakın olduklarını veya her seferinde 10 dakika kullanmayı içeren bir deseni karşılaştırmaktır. haftada bir kez. Hesaplanabilecek birkaç …

2
Wolfram Mathworld olasılık yoğunluk fonksiyonu ile ayrı olasılık dağılımını tanımlayan bir hata yapıyor mu?
Genellikle, ayrı değişkenler üzerinde bir olasılık dağılımı, bir olasılık kütle fonksiyonu (PMF) kullanılarak tarif edilir: Sürekli rasgele değişkenlerle çalışırken, olasılık kütle fonksiyonu yerine olasılık yoğunluk fonksiyonu (PDF) kullanarak olasılık dağılımlarını tanımlarız. - Goodfellow, Bengio ve Courville tarafından Derin Öğrenme Ancak Wolfram Mathworld , ayrık değişkenler üzerindeki olasılık dağılımını tanımlamak için …


3
Bir güven aralığı ne zaman mantıklıdır, ancak ilgili güvenilir aralık ne zaman anlam ifade etmez?
Genellikle% 95 kapsama alanına sahip bir güven aralığının, posterior yoğunluğun% 95'ini içeren güvenilir bir aralığa çok benzediğidir. Bu, önceki durumda üniform veya ikinci durumda üniformaya yakın olduğunda olur. Bu nedenle, güvenilir bir aralığa yaklaşmak için bir güven aralığı sıklıkla kullanılabilir veya tersi de geçerlidir. Önemli olarak, güvenilir bir aralık olarak …

2
Sürekli verilerden kategorilere geçiş her zaman yanlış mıdır?
Verilerinizi nasıl ayarlayacağımı okuduğumda, sık sık karşılaştığım bir şey, bazı sürekli verileri kategorik verilere dönüştürmenin iyi bir fikir olmadığıdır, çünkü eşikler kötü bir şekilde belirlenirse çok iyi bir sonuç çıkarabilirsiniz. Bununla birlikte, şu anda bazı verilerim var (prostat kanseri hastaları için PSA değerleri), burada ortak fikir birliği 4'ün altındaysanız muhtemelen …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.