İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap



2
John Snow Kolera problemini çözmek için hangi istatistiksel model veya algoritma kullanılabilir?
John Snow Kolera salgını verilerine dayanarak, bir tür merkez üssünün coğrafi bir yaklaşımının nasıl geliştirileceğini öğrenmekle ilgileniyorum. Hangi istatistiki modellemenin, kuyuların nereye yerleştirildiğine dair önceden bilgi sahibi olmadan böyle bir problemi çözmek için kullanılabileceği. Genel bir sorun olarak, zamanın, bilinen noktaların yerini ve gözlemcinin yürüme yolunu bulabilirdin. Aradığım yöntem bu …

1
Lojistik regresyon için örnekleme 1 ve 0'ların gerçek oranını yansıtmalı mıdır?
Diyelim ki ağaçlarda yaşayan bazı hayvan türlerinin ağaçların özelliklerine bağlı olarak ortaya çıkma ihtimalini tahmin edebilecek lojistik regresyon modeli oluşturmak istediğimi varsayalım (fe yüksekliği). Her zaman olduğu gibi, zamanım ve param sınırlı, bu yüzden sadece sınırlı bir örneklem büyüklüğü toplayabiliyorum. Aşağıdaki sorularım var: Örneğimdeki 1 ve 0'ların oranı 1'lerin ve …

3
Görselleştirme için boyutsallık azaltma, t-SNE tarafından çözülen “kapalı” bir sorun olarak mı düşünülmeli?
Boyutsallığın azaltılması için -sne algoritması hakkında çok şey okudum . MNIST gibi "klasik" veri kümelerindeki performanstan, rakamların net bir şekilde ayrılmasını sağladığı için çok etkilendim ( orijinal makaleye bakın ):ttt Ayrıca, eğittiğim bir sinir ağı tarafından öğrenilen özellikleri görselleştirmek için de kullandım ve sonuçlardan çok memnun kaldım. Yani, anladığım kadarıyla: …

4
Yanılabilir bir Monty ile Monty Hall Sorunu
Monty, Kapının arkasında bir keçi olup olmadığını (veya boştu) mükemmel bir bilgiye sahipti. Bu gerçek, oyuncunun zaman içindeki başarı oranını “tahminleri” diğer Kapıya geçirerek iki katına çıkarmasını sağlar. Ya Monty'nin bilgisi mükemmelden azsa? Peki ya bazen Ödül gerçekten Keçi ile aynı Kapı aralığındaysa? SİZİN kapınızı seçip açana kadar bunu görmediniz …

10
Telafi verileri için en iyi terim?
Bir örnek yazıyorum ve bazı veriler oluşturdum. Okuyucunun net bir veri olmadığını açıkça belirtmek istiyorum, ama aynı zamanda bir örnek teşkil ettiği için kötülük izlenimi vermek istemiyorum. Bu özel verinin (sözde) rastgele bileşeni yoktur, bu yüzden bana 'benzetimin' uygun olmadığı anlaşılıyor. Eğer onu hayali ya da uydurma olarak adlandırırsam, sahte …

1
Nate Silver'ın Loess hakkında ne söylediğini açıklama
Geçenlerde sorduğum bir soruda , sevgisizlikle tahmin etmenin büyük bir "hayır-hayır" olduğu söylendi. Ancak, Nate Silver'ın FiveThirtyEight.com hakkındaki en son makalesinde, seçim tahminlerinde bulunmamak için loess kullanmayı tartıştı. Agresif ve muhafazakar tahminlerin ayrıntılarını loess ile tartışıyordu ama gelecek tahminlerini loess ile yapmanın geçerliliğini merak ediyorum? Bu tartışmayla ve sevgiyle benzer …

1
Bağımlı gözlemler için PCA'nın özellikleri
PCA'yı genellikle davaların kabul edildiğinin varsayıldığı veriler için boyutsallık azaltma tekniği olarak kullanıyoruz. Soru: Bağımlı, kimliği olmayan veriler için PCA uygulamasındaki tipik nüanslar nelerdir? PCA'nın kimlik bilgileri için geçerli olan hoş / faydalı özellikleri tehlikeye atılır (veya tamamen kaybolur)? Örneğin, veriler, çok değişkenli bir zaman serisi olabilir; bu durumda, otokorelasyon …

4
Optimizasyon algoritmaları neden diğer optimizasyon problemleri açısından tanımlanıyor?
Makine öğrenmesi için optimizasyon teknikleri üzerine biraz araştırma yapıyorum, ancak diğer optimizasyon problemleri açısından çok sayıda optimizasyon algoritması tanımladığımı şaşırdım. Aşağıdaki bazı örnekler göstermektedir. Örneğin https://arxiv.org/pdf/1511.05133v1.pdf Her şey güzel ve iyi görünüyor ama sonra bu yoktur argminxargminx\text{argmin}_x in zk + 1zk+1z^{k+1} güncellemesi .... böylece algoritma nedir bunun için çözer argminargmin\text{argmin} …

2
Sabit bir etkinin rastgele bir iç içe içine yerleştirilmesi veya R (aov ve lmer) 'de tekrarlanan ölçümlerin nasıl kodlanacağı mantıklı geliyor mu?
Ben bakarak edilmiş @conjugateprior tarafından / lm bu bakış llmer R formüller ve aşağıdaki girişi ile karıştı: Şimdi A'nın rastgele olduğunu, ancak B'nin sabit olduğunu ve B'nin A içinde iç içe olduğunu varsayalım. aov(Y ~ B + Error(A/B), data=d) lmer(Y ~ B + (1 | A:B), data=d) Aynı durum için …

1
Keras, SGD öğrenme hızı azalması nasıl çalışır?
Http://keras.io/optimizers/ belgelerine bakarsanız , SGD'de bozulma için bir parametre vardır. Bunun zamanla öğrenme oranını düşürdüğünü biliyorum. Ancak tam olarak nasıl çalıştığını çözemiyorum. lr = lr * (1 - decay) Üstel olduğu gibi öğrenme oranı ile çarpılan bir değer mi? Ayrıca modelimin hangi öğrenme hızını kullandığını nasıl görebilirim? model.optimizer.lr.get_value()Birkaç çağa uyum …


3
Bilgi teorisi OLMADAN Kullback-Leibler ıraksama
Cross Validated'in trollenmesinden sonra hala, KL bilgi ayrıntısını bilgi teorisi dünyasının dışında anlamaya daha yakın olduğumu hissetmiyorum. Bilgi teorisi açıklamasını daha kolay anlayabilmeniz için Matematik kökenli biri olarak oldukça garip. Anlayışımı bir bilgi teorisi altyapısından özetlemek için: Sınırlı sayıda sonuç içeren rastgele bir değişkenimiz varsa, sonucu ortalama olarak en kısa …

2
Son (üretime hazır) model tam verilerde mi yoksa sadece eğitim setinde mi eğitilmeli?
Eğitim setinde birkaç model eğittiğimi varsayalım, çapraz doğrulama setini ve test setinde ölçülen performansı kullanarak en iyisini seçtim. Şimdi son bir modelim var. Mevcut tüm verilerime veya sadece eğitim setinde eğitilmiş gemi çözümüne bakmalı mıyım? İkincisi, öyleyse neden? GÜNCELLEME: P.Windridge'in de belirttiği gibi, yeniden eğitilmiş bir modelin nakliyesi, temel olarak, …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.