İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

4
İdeal bir deneme oluşturamadığınızda ne yapacağınıza dair ders kitapları / okumalar?
İstatistiksel eğitimim matematiksel istatistiklere dayanıyor ve bu yöntemleri MS'imde almak şu anda biraz şok edici; şu anda bu "uygulamalı" yöntemlerden bazılarını anlayabiliyorum çünkü sektörde tecrübem yok. Yöntem derslerimde bahsettiğimiz konulardan biri de deneysel tasarım fikri. Örneğin, K-12 öğrencilerinin test puanlarını yükselttiğini iddia eden bir eğitim programının etkinliği üzerine bir deney …

1
Gauss Süreci Regresyonunu sonsuz boyutlu temel fonksiyon görünümü ile anlama
Gauss süreç regresyonunun (GPR), (muhtemelen) sonsuz miktarda temel fonksiyon ile bayes lineer regresyonuna karşılık geldiği söylenir. Şu anda GPR kullanarak ne tür modeller ifade edebileceğime dair bir sezgi almak için bunu ayrıntılı olarak anlamaya çalışıyorum. Bunun GPR'yi anlamaya çalışmak için iyi bir yaklaşım olduğunu düşünüyor musunuz? Makine öğrenimi için Gauss …

5
Analiz geçmişi olmayan matematiksel istatistiklere giden yol: kendi kendine çalışma için ideal ders kitabı
Oldukça matematiksel olarak eğimliyim - lisansımda 6 yarıyıl Matematik vardı - ama biraz pratik dışı ve kısmi diferansiyel denklemler ve yol integralleri ile yavaş yavaş olsam da kavramlarım biraz pratikle geri geliyor. Matematiksel kanıtlar (matematiksel düşünme) veya analiz üzerine bir dersim olmadı. Lisansüstü düzeydeki olasılığı da anlıyorum - resmi olarak …

2
Python'da von Mises-Fisher dağıtımından örnekleme?
Python'da çok değişkenli von Mises-Fisher dağıtımından örneklemenin basit bir yolunu arıyorum . Scipy ve numpy modülündeki istatistik modülüne baktım ama sadece tek değişkenli von Mises dağılımını buldum. Herhangi bir kod var mı? Henüz bulamadım. Görünüşe göre, Wood (1994) bu bağlantıya göre vMF dağılımından örnekleme için bir algoritma tasarladı , ancak …

3
Bir veri serisinin segmentlerini farklı eğrilere uyacak şekilde programlı olarak nasıl tespit edebilirim?
Belirli bir veri kümesinin bölümlerini en uygun farklı eğrilere ayırmak için belgelenmiş algoritmalar var mı? Örneğin, bu veri grafiğine bakan çoğu insan bunu kolayca 3 parçaya böler: sinüzoidal segment, doğrusal segment ve ters üstel segment. Aslında, bu özel bir sinüs dalgası, bir çizgi ve basit bir üstel formülü ile yaptım. …

3
OLS tahmincisi türetmek için varsayımlar
Birisi benim için kısaca açıklayabilir mi, OLS tahmincisini hesaplamak için altı varsayımın her birine neden ihtiyaç duyulur? Sadece çoklu doğrusallık hakkında buldum - eğer mevcutsa (X'X) matrisini tersine çeviremeyiz ve sonuç olarak genel tahminciyi tahmin edemeyiz. Peki ya diğerleri (örneğin, doğrusallık, sıfır ortalama hatalar, vb.)?

3
menteşe kaybı ve lojistik kayıp avantajları ve dezavantajları / sınırlamaları
Menteşe kaybı ve günlük kaybımaks. ( 0 , 1 - ybenwTxben)maksimum(0,1-ybenwTxben)\text{max}(0, 1-y_i\mathbf{w}^T\mathbf{x}_i)günlük ( 1 + exp( - ybenwTxben) )günlük(1+tecrübe⁡(-ybenwTxben))\text{log}(1 + \exp(-y_i\mathbf{w}^T\mathbf{x}_i)) Aşağıdaki sorularım var: Menteşe kaybı her dezavantajları (örneğin belirtildiği gibi uçlara karşı duyarlıdır var http://www.unc.edu/~yfliu/papers/rsvm.pdf )? Birinin diğerine göre farkları, avantajları ve dezavantajları nelerdir?

4
Numune boyutu çok büyük olduğunda güven aralıkları
Sorum, özellikle dergi yayını için "büyük veriler kullanılarak örnekleme hatasının nasıl değerlendirileceği" şeklinde yeniden ifade edilebilir. İşte bir meydan okumayı gösteren bir örnek. Çok büyük bir veri kümesinden (> 100000 benzersiz hasta ve 100 hastaneden reçeteli ilaçları), belirli bir ilacı alan hastaların bir kısmını tahmin etmekle ilgileniyorum. Bu oranı elde …

1
Karışık efekt modelleri neden bağımlılığı çözüyor?
Öğrenci sınav notlarının, öğrencilerin çalıştığı saat sayısından nasıl etkilendiğini merak ettiğimizi varsayalım. Bu ilişkiyi keşfetmek için aşağıdaki doğrusal regresyonu yürütebiliriz : exam.gradesben= a + β1× saat okudu.ben+ ebenexam.gradesi=a+β1×hours.studiedi+ei \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i Ancak, birkaç farklı okuldan öğrencileri örneklersek, aynı okuldaki öğrencilerin farklı okullardaki öğrencilerden daha …

1
Lojistik regresyon ve destek vektör makineleri arasındaki fark nedir?
Lojistik regresyonun, eğitim örneklerini ayıran bir hiper düzlem bulduğunu biliyorum. Ayrıca destek vektör makinelerinin hiper düzlemi maksimum marjla bulduğunu da biliyorum. Benim sorum: lojistik regresyon (LR) ve destek vektör makineleri (SVM) arasındaki fark, SVM hiper düzlemi maksimum marjla bulurken LR'nin eğitim örneklerini ayıran herhangi bir hiper düzlem bulması mı? Yoksa …

1
Gecikme efekti eklemek neden Bayes hiyerarşik modelinde ortalama sapmayı artırır?
Arka plan: Şu anda çeşitli Bayes hiyerarşik modellerini karşılaştırarak bazı çalışmalar yapıyorum. verileri , katılımcı ve zaman için sayısal refah ölçüleridir . Katılımcı başına yaklaşık 1000 katılımcım ve 5 ila 10 gözlemim var. i jyben jyijy_{ij}beniijjj Çoğu boyuna veri kümesinde olduğu gibi, zamana daha yakın olan gözlemlerin birbirinden ayrı olanlardan …

2
GLM: bir dağıtım ve bağlantı işlevi seçimini doğrulama
Gauss dağılımı ve log link fonksiyonunu benimseyen genelleştirilmiş doğrusal bir modelim var. Modeli yerleştirdikten sonra, kalıntıları kontrol ediyorum: QQ grafiği, kalıntılar ile tahmin edilen değerler, artıkların histogramı (dikkatli olunması gerektiğini kabul ederek). Her şey iyi gözüküyor. Bu, bana göre, bir Gauss dağılımı seçiminin oldukça makul olduğunu gösteriyor. Ya da en …

2
Caret ve basic randomForest paketi aracılığıyla randomForest'ten farklı sonuçlar
Biraz kafam karıştı: Eğitimli bir modelin şapka ile sonuçları orijinal paketteki modelden nasıl farklı olabilir? Caret paketi ile RandomForest FinalModel kullanarak tahmin öncesi önişlemenin gerekli olup olmadığını okudum ? ama burada herhangi bir ön işleme kullanmıyorum. Caret paketini kullanarak ve farklı mtry değerleri için ayarlayarak farklı Rastgele Ormanlar yetiştirdim. > …

1
Kuantil ve medyandan ziyade ne zaman bronzluk ve medial kullanırız?
Wikipedia veya Wolfram Mathworld'de tantile veya medial için tanımları bulamıyorum, ancak aşağıdaki açıklama Bílková, D. ve Mala, I. (2012), " Gelir dağılımını modellerken L-moment yönteminin uygulanması Çek Cumhuriyeti'nde ", Avusturya İstatistik Dergisi , 41 (2), 125–132. Medial bir değeri Örnek medyan bir değerine eşit olduğu gibi (örnek) tantile 50 % …

1
Aynı Ortalama, Farklı Varyans
Bir yarışta sekiz koşucunuz olduğunu varsayalım; münferit çalışma sürelerinin dağılımı Normal'dir ve her birinin ortalama saniyesi vardır . Birinci koşucunun standart sapması en küçük, ikincisi en küçük, üçüncü en küçük, vb. Sekiz büyüktür. İki soru beni şaşırtıyor: (1) Birincinin sonuncusunu geçme olasılığı nedir ve (2) yarışı kazanma olasılığı en yüksek …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.