İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


1
Doğrusal regresyonda bağımsız değişkenler olarak bire bir oranların yorumlanması
Ben kategorik değişkenler kavramı ve kollearlık önlemek için temel olarak bir seviye sığdırmak için izin veren ilgili kukla değişken kodlama aşina. Bu tür modellerden parametre tahminlerinin nasıl yorumlanacağına da aşinayım: Temel kategoriye göre kategorik öngörücünün belirli bir donatılmış düzeyi için sonuçta öngörülen değişiklik. Emin olmadığım, bir toplamı oluşturan bağımsız değişkenler …



2
Gower mesafesi ikili değişkenler arasındaki farkı nasıl hesaplar?
Veri kümemde 73 örnekle 17 sayısal ve 5 ikili (0-1) değişkenim var. Bir küme analizi yürütmem gerekiyor. Gower mesafesinin karışık değişkenlere sahip veri kümeleri için iyi bir metrik olduğunu biliyorum. Ancak, Gower mesafesinin ikili değişkenler arasındaki farkı nasıl hesapladığını anlayamadım . Bana öyle geliyor ki Öklid mesafesinden farklı değil.

3
Coursera Machine Learning Course için Düzenli Doğrusal Regresyon Maliyet Fonksiyonunun Türetilmesi
Andrew Ng'in "Machine Learning" kursunu birkaç ay önce Coursera üzerinden aldım, matematik / türevlerin çoğuna dikkat etmedim ve bunun yerine uygulama ve pratikliğe odaklandım. O zamandan beri altta yatan teoriyi incelemeye başladım ve Prof. Ng'nin bazı derslerini tekrar gözden geçirdim. "Düzenli Doğrusal Regresyon" konulu konferansını okuyordum ve şu maliyet fonksiyonunu …

2
Nominal (dikotomatik olmayan) nominal değişken ile sayısal (aralık) veya sıralı değişken arasındaki korelasyon katsayısı
Sorunumun cevabını bulmaya çalışırken bu sitedeki tüm sayfaları zaten okudum ama kimse bana doğru olan gibi görünmüyor ... Öncelikle size birlikte çalıştığım veri türlerini açıklıyorum ... 300 kullanıcının her biri için bir tane olmak üzere çeşitli şehir adlarına sahip bir dizi vektörüm olduğunu varsayalım. Ayrıca her kullanıcının anketine veya her …

1
Her kod bloğundan önce mi, yoksa proje başına bir mi?
Sonuçların çoğaltılabilmesi için rastgele bir tohum ayarlamak standart bir tavsiyedir. Bununla birlikte, yalancı rasgele sayılar çizilirken tohum ilerletildiğinden, herhangi bir kod parçası ek bir sayı çekerse sonuçlar değişebilir . İlk bakışta, sürüm kontrolü, bunun için bir çözüm gibi görünüyor, çünkü en azından notlarınıza veya kağıdınızdaki sonuçları yazdığınızda sürümü geri döndürüp …

2
Gauss süreçlerinin faydaları
Gauss süreçlerinin faydalarıyla ilgili bu karışıklığa sahibim. Yani, doğrusal fonksiyonun verileri modellediğini tanımladığımız basit doğrusal regresyon ile karşılaştırmak. Bununla birlikte, Gaussian süreçlerde fonksiyonların dağılımını tanımlarız, fonksiyonun doğrusal olması gerektiğini özel olarak tanımlamıyoruz demektir. Fonksiyonun ne kadar pürüzsüz olması gerektiği ve hepsi gibi özellikleri tanımlayan, Gaussian olan fonksiyonun üzerinde bir öncül …

2
Bir RNA sekansı ve bir ChIP çip veri seti arasındaki gen listesi çakışmasının olasılığının hesaplanması
Umarım bu forumlardaki biri gen ekspresyon çalışmalarındaki bu temel problemde bana yardımcı olabilir. Deneysel ve kontrol dokusunun derin dizilimini yaptım. Daha sonra kontrol üzerindeki deney numunesinde genlerin kat zenginleştirme değerlerini elde ettim. Referans genomun ~ 15.000 geni vardır. İlgilenen numunemde 15.000 genin 3.000'i kontrole kıyasla belirli bir kesimin üzerinde zenginleştirildi. …

1
Parti normu neden öğrenilebilir ölçek ve kaymaya sahiptir?
Anladığım kadarıyla, parti normu tüm giriş özelliklerini bir katmana normal bir birim normal dağılımına normalleştirir, N(μ=0,σ=1)N(μ=0,σ=1)\mathcal{N}(\mu=0,\sigma=1). Ortalama ve varyansμ,σ2μ,σ2\mu, \sigma^2 mevcut mini parti için değerleri ölçülerek tahmin edilir. Normalleştirmeden sonra girişler skaler değerlerle ölçeklenir ve kaydırılır: x^′i=γx^i+βx^i′=γx^i+β\hat{x}_i' = \gamma \hat{x}_i + \beta (Burada yanılıyorsam beni düzeltin - burası biraz emin …

5
Sinir ağları / derin öğrenme tasarlamak ve uygulamak için görsel bir araç var mı? [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 10 ay önce kapalı . Kahve, Theano, TensorFlow, keras gibi makine öğrenimi ve derin öğrenme için çok sayıda kütüphane olduğunu biliyorum ... Ama benim için …

2
Rubin'in Nedensel Modelinde Tartışmasızlık - Layman'ın açıklaması
Rubin'in nedensel modelini uygularken, ihtiyacımız olan (test edilemez) varsayımlardan biri anlamsızlıktır, yani (Y(0),Y(1))⊥T|X(Y(0),Y(1))⊥T|X(Y(0),Y(1))\perp T|X LHS'nin karşı olgusal olduğu durumlarda, T tedavidir ve X kontrol ettiğimiz ortak değişkenlerdir. Bunu Rubin Nedensel Modeli hakkında fazla bir şey bilmeyen bir kişiye nasıl tarif edeceğini merak ediyorum. Teorik olarak bu varsayımı niye ihtiyacımız olduğunu …

2
Karar Ağaçları için kategorik özellikleri kodlamak için en iyi uygulamalar?
Doğrusal regresyon için kategorik özellikleri kodlarken, bir kural vardır: aptal sayısı toplam düzey sayısından daha az olmalıdır (eşzamanlılığı önlemek için). Karar Ağaçları için benzer bir kural var mı (torbalanmış, güçlendirilmiş)? Bunu soruyorum çünkü Python'daki standart bir uygulama, nseviyeleri benim için yetersiz görünen nmankenlere (sklearns ' OneHotEncoderveya Pandas' pd.get_dummies) genişletmek gibi …

1
Rastgele Orman kısmi bağımlılık grafiğindeki y ekseninin anlamı
RandomForestR paketini kullanıyorum ve Y ekseni değerlerini kısmi bağımlılık grafiklerinde nasıl yorumlayacağım konusunda kafam karıştı. Yardım belgeleri, planın "bir değişkenin sınıf olasılığı üzerindeki marjinal etkisinin grafiksel bir tasviri" olduğunu belirtir. Ancak, hala y ekseninin tam olarak neyi temsil ettiği konusunda kafam karıştı. Özellikle, negatif değerler ne anlama geliyor? Sınıfı doğru …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.