İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Neden her zaman diğer tüm politikalardan daha iyi veya eşit olan en az bir politika vardır?
Takviye Öğrenimi: Giriş. İkinci baskı, devam ediyor ., Richard S. Sutton ve Andrew G. Barto (c) 2012, s. 67-68. Bir takviye öğrenme görevinin çözülmesi, kabaca uzun vadede çok ödül kazanan bir politika bulmak anlamına gelir. Sonlu MDP'ler için, en uygun politikayı tam olarak aşağıdaki şekilde tanımlayabiliriz. Değer işlevleri, ilkeler üzerinden …

3
Frisch-Waugh teoreminin faydası
İncelemediğim ekonometride Frish Waugh teoremini öğretmem gerekiyor. Arkasındaki matematiği anladım ve umarım bu fikir de "çok doğrusal bir modelden belirli bir katsayı için elde ettiğiniz katsayı, diğer regresörlerin etkisini" ortadan kaldırırsanız "basit regresyon modelinin katsayısına eşittir. Yani teorik fikir biraz havalı. (Tamamen yanlış anladıysam bir düzeltmeyi memnuniyetle karşılarım) Ancak bazı …

5
Sadece eğitim veri kümesinde keşifsel veri analizi yapmak daha mı iyi?
Veri kümesinde keşifsel veri analizi (EDA) yapıyorum. Sonra bağımlı bir değişkeni tahmin etmek için bazı özellikleri seçeceğim. Soru şu: EDA'yı sadece eğitim veri setimde yapmalı mıyım? Ya da eğitim ve test veri setlerine birlikte katılmalı mıyım, sonra da ikisi üzerinde EDA mı yapmalı ve bu analize dayalı özellikleri mi seçmeliyim?

2
Olasılık tahminleri ile tekrarlanan 10 kat çapraz doğrulama için ortalama ROC
Makine öğrenimi algoritması kullanarak yaklaşık 10.000 vakada tekrarlanan (10 kez) tabakalı 10 kat çapraz doğrulamayı kullanmayı planlıyorum. Her seferinde tekrarlama farklı rastgele tohumlarla yapılacaktır. Bu süreçte her durum için 10 olasılık tahmini örneği oluştururum. 10 misli çapraz validasyonun 10 tekrarının her biri için 1 olasılık tahmini Her vaka için 10 …
15 roc 

1
Arızi parametre sorunu
Her zaman arızi parametre sorununun gerçek özünü elde etmek için mücadele ediyorum. Çeşitli durumlarda doğrusal olmayan panel veri modellerinin sabit etki tahmin edicilerinin "iyi bilinen" tesadüfi parametre problemi nedeniyle ciddi şekilde önyargılı olabileceğini okudum. Bu sorunun net bir açıklamasını istediğimde tipik cevap şudur: Panel verilerinin T zaman aralıklarında N kişisi …

2
Sinir ağlarında toplu öğrenme yönteminde ağırlıklar nasıl güncellenir?
Birisi bana toplu iş yöntemini kullanarak nasıl bir sinir ağı kurmam gerektiğini söyleyebilir mi? Toplu modda, eğitim setindeki tüm numuneler için, ağdaki her nöron için hata, delta ve dolayısıyla delta ağırlıklarını hesapladığımızı ve sonra ağırlıkları hemen güncellemek yerine, biriktirdiğimizi ve daha sonra bir sonraki dönemde ağırlıkları güncelliyoruz. Ben de bir …

1
Etkileşim Terimlerini Rastgele Ormana Dahil Etme
Diyelim ki Y yanıtımız ve X1, ...., Xn tahmincileri var. Y'yi X1, ...., Xn'in doğrusal bir modeli aracılığıyla sığdırmaya çalışsaydık ve Y ve X1, ..., Xn arasındaki gerçek ilişki doğrusal değildi. X'leri bir şekilde dönüştürüp sonra modeli takarak modeli düzeltmek için. Dahası, X1, ..., XN'in diğer özelliklerden bağımsız olarak y'yi …

1
“Hedeflenen Maksimum Olabilirlik Beklentisi” nedir?
Mark van der Laan'ın makalelerini anlamaya çalışıyorum. Berkeley'de makine öğrenimi ile büyük ölçüde örtüşen problemler üzerinde çalışan teorik bir istatistikçi. Benim için bir problem (derin matematiğin yanı sıra) genellikle tamamen farklı bir terminoloji kullanarak tanıdık makine öğrenme yaklaşımlarını tanımlamasıdır. Temel kavramlarından biri "Hedeflenen Maksimum Olabilirlik Beklentisi" dir. TMLE, kontrolsüz bir …

2
Top-n accuracy'nin tanımı nedir?
Görüntü sınıflandırması hakkında bilimsel bir makale okuyorum. Deneysel sonuçlarda ilk 1 ve ilk 5 doğruluğundan bahsediyorlar, ancak terimi hiç duymadım ya da google kullanarak bulamıyorum. Birisi bana bir tanım verebilir veya bir yere yönlendirebilir mi? :)

4
Hangi değişkenler hangi PCA bileşenlerini açıklar ya da tam tersi?
Bu verileri kullanma: head(USArrests) nrow(USArrests) Ben böyle bir PCA yapabilirsiniz: plot(USArrests) otherPCA <- princomp(USArrests) Yeni bileşenleri otherPCA$scores ve aşağıdaki bileşenlerle açıklanan varyans oranı summary(otherPCA) Ama hangi değişkenlerin çoğunlukla hangi temel bileşenler tarafından açıklandığını bilmek istersem? Ve tam tersi: örneğin PC1 veya PC2 en çok tarafından açıklanıyor murdermu? Bunu nasıl yapabilirim? …

2
Negatif ACF (otokorelasyon fonksiyonu) nasıl yorumlanır?
Bu yüzden petrol iadelerinin ACF / PACF'sini planladım ve bazı pozitif otokorelasyon görmeyi bekliyordum ama sürprizime göre sadece negatif önemli otokorelasyon elde ediyorum. Yukarıdaki grafiği nasıl yorumlamalıyım? Daha önce düştüğünde petrol geri dönüşlerinin artma eğilimi olduğunu ve tam tersini gösteriyorlar, bu nedenle salınım davranışı. Yanılıyorsam lütfen beni düzeltin.


2
Ölçeklendirme doğrusal SVM sınıflandırması için neden önemlidir?
Doğrusal SVM sınıflandırmasını gerçekleştirirken, örneğin ortalamanın çıkarılması ve standart sapmaya bölünmesi ve daha sonra test verilerinin, egzersiz verilerinin ortalama ve standart sapması ile ölçeklendirilmesi yoluyla eğitim verilerinin normalleştirilmesi genellikle yararlıdır. Bu işlem neden sınıflandırma performansını önemli ölçüde değiştirir?

3
Sıralanan listelerin karşılaştırılması
Diyelim ki ve içeren iki grup, her biri en önemlisi en önemlisi 25 maddeden oluşur. Bu sıralamaları karşılaştırmanın en iyi yolları nelerdir?n 2n1n1n_1n2n2n_2 Açıkçası, 25 Mann-Whitney U testi yapmak mümkündür, ancak bu, çok fazla olabilen (ve sıkı kullanımda, çoklu karşılaştırma soruları ortaya çıkarır) yorumlanması için 25 test sonucuyla sonuçlanır. Ayrıca, …

4
KNN'de bağlarla, ağırlıklarla oylama ve oylama
Bir kNN algoritması programlıyorum ve aşağıdakileri bilmek istiyorum: Tie-sonları: Çoğunluk oylamasında net bir kazanan yoksa ne olur? Örneğin, en yakın tüm k komşuları farklı sınıflardan veya k = 4 için A sınıfı 2 komşu ve B sınıfı 2 komşu var mı? Aynı mesafeye sahip daha fazla komşu olduğu için en …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.