İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


4
Çoklu regresyon yapılırken istatistiksel yazılım tarafından aykırı olarak işaretlenmiş durumları silmek mi istiyorsunuz?
Çoklu regresyon analizleri yapıyorum ve verilerimdeki aykırı değerlerin silinip silinmemesi gerektiğinden emin değilim. Endişelendiğim veriler SPSS kutucuklarında "daireler" olarak gözüküyor, ancak yıldız işareti yok (bu onların 'o kadar da' kötü olmadıklarını düşünmeme neden oluyor). Endişelendiğim davalar çıktıdaki "casewise diagnostics" tablosunun altında görünüyor - bu nedenle bu davaları silmeli miyim?

2
PCA ve asimptotik PCA arasındaki fark nedir?
1986 ve 1988'deki iki makalede , Connor ve Korajczyk, varlık getirilerini modellemeye yönelik bir yaklaşım önerdi. Bu zaman serileri, genellikle zaman dönemi gözlemlerinden daha fazla varlığa sahip olduğundan, varlık getirilerinin kesitsel kovaryanslarında bir PCA gerçekleştirmeyi teklif etmişlerdir. Bu yönteme Asimptotik Temel Bileşen Analizi diyorlar (izleyiciler PCA'nın asimptotik özelliklerini hemen düşündüğü …
23 pca  econometrics 

5
Sınıflandırma ağaçlarına alternatifler, daha iyi tahmine dayalı (örneğin: CV) performans?
Daha iyi tahmin gücü sağlayabilecek Sınıflandırma Ağaçlarına bir alternatif arıyorum. Ele aldığım verilerin hem açıklayıcı hem de açıklanmış değişkenler için faktörleri var. Bu bağlamda rastgele ormanlara ve sinir ağlarına rastladığımı hatırlıyorum, daha önce hiç denememiş olmama rağmen, böyle bir modelleme görevi için başka iyi bir aday var mı (açıkça R'de)?

2
İstatistiksel adli tıp: Benford ve ötesi
Üçüncü bir tarafça üretilen bilimsel çalışmalarda sahtekarlık, anormallikler, sahtekarlık vb. Tespit etmek için hangi geniş yöntemler vardır? (Bunu en son Marc Hauser meselesiyle sormaya motive oldum .) Genellikle seçim ve muhasebe sahtekarlığı için, Benford Yasasının bir türevi belirtildi. Bunun, örneğin Marc Hauser davasına nasıl uygulanabileceğinden emin değilim , çünkü Benford …

2
Kümelenme değişkenleri, aralarındaki korelasyonlara dayanarak
Sorular: Büyük bir korelasyon matrisim var. Bireysel korelasyonları kümelemek yerine, değişkenleri birbirleriyle olan korelasyonlarına göre kümelemek istiyorum, yani eğer A ve B değişkenleri C ila Z değişkenleriyle benzer korelasyonlara sahipse, o zaman A ve B aynı kümenin parçası olmalıdır. Bunun iyi bir gerçek hayat örneği, farklı varlık sınıflarıdır - varlık …


9
Sayım verileri için zaman serileri, sayımlar <20
Geçenlerde bir tüberküloz kliniği için çalışmaya başladım. Halen tedavi ettiğimiz TBC vakalarının sayısını, uygulanan testlerin sayısını vb. Tartışmak için periyodik olarak görüşüyoruz. Bu sayıları modellemeye başlamak istiyorum, böylece sadece sıra dışı olup olmadığını tahmin etmiyoruz. Ne yazık ki, zaman serilerinde çok az eğitim aldım ve maruz kalmamın çoğu, sürekli veri …

5
Bu “saf” karıştırma algoritmasının nesi yanlış?
Bu, bir diziyi rastgele karıştırmayla ilgili bir Stackoverflow sorusunun devamıdır . Kişinin "saf" geçici uygulamalara dayanmak yerine bir diziyi karıştırmak için kullanması gereken algoritmalar ( Knuth-Fisher-Yates Shuffle gibi ) vardır. Artık saf algoritmamın bozulduğunu ispatlamakla (ya da yanlışlamakla) ilgileniyorum (olduğu gibi: eşit olasılıkla tüm olası izinleri üretmiyor). İşte algoritma: Birkaç …

1
Xgboost algoritmasında min_child_weight açıklaması
Min_child_weight parametresinin xgboost içindeki tanımı şöyledir: Bir çocukta ihtiyaç duyulan minimum örnek ağırlığı (kendir) toplamı. Ağaç bölüm adımı, örneğin ağırlık toplamının min_child_weight değerinden daha az olduğu bir yaprak düğümüyle sonuçlanırsa, oluşturma işlemi daha fazla bölümlendirme yapacaktır. Doğrusal regresyon modunda, bu sadece her düğümde olması gereken minimum örnek sayısına karşılık gelir. …

1
Dikkat mekanizmaları tam olarak nedir?
Son birkaç yılda çeşitli Derin Öğrenme makalelerinde dikkat mekanizmaları kullanılmıştır. Open AI araştırma başkanı Ilya Sutskever onları coşkuyla övdü: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Purdue Üniversitesi'nden Eugenio Culurciello, RNN'lerin ve LSTM'lerin tamamen dikkat odaklı sinir ağları lehine terk edilmesi gerektiğini iddia etti: https://towardsdatascience.com/the-fall-of-rnn-lstm-2d1594c74ce0 Bu bir abartı gibi gözüküyor, ancak tamamen dikkat temelli modellerin sıra …

1
Hamiltonian Monte Carlo vs. Sıralı Monte Carlo
Bu iki MCMC şemasının farklı uygulama alanlarının yanı sıra göreceli değerler ve dezavantajlar hakkında bir fikir edinmeye çalışıyorum. Hangisini ne zaman ve neden kullanırsın? Biri ne zaman başarısız olabilir, diğeri başarısız olabilir (örneğin, HMC nerede uygulanabilir, ancak SMC nerede değil) Çok saf bir şekilde verilen bir yöntem, bir yönteme diğerine …

3
Yüksek hiç işe yaramaz mı?
Bu soru edildi göç o Çapraz doğrulanmış üzerinde yanıtlanabilir çünkü yığın taşması gelen. 3 yıl önce göç etti . İstatistiklerde, doğrusal regresyonlar yapıyoruz, bunların başlangıcı. Genel olarak, ne kadar yüksekse o kadar iyi olduğunu biliyoruz , ancak yüksek bir işe yaramaz bir model olacağı bir senaryo var mı?R,2R2R^2R,2R2R^2

2
Neden iki farklı lojistik kayıp formülasyonu / gösterimi var?
İki tür lojistik kayıp formülasyonu gördüm. Kolayca aynı olduklarını kolayca gösterebiliriz, tek fark etiketinin tanımıdır .yyy Formülasyon / gösterim 1, :y∈{0,+1}y∈{0,+1}y \in \{0, +1\} L(y,βTx)=−ylog(p)−(1−y)log(1−p)L(y,βTx)=−ylog⁡(p)−(1−y)log⁡(1−p) L(y,\beta^Tx)=-y\log(p)-(1-y)\log(1-p) burada lojistik fonksiyon bir gerçek sayı harita, 0,1 aralığı. βTxp=11+exp(−βTx)p=11+exp⁡(−βTx)p=\frac 1 {1+\exp(-\beta^Tx)}βTxβTx\beta^T x Formülasyon / gösterim 2, :y∈{−1,+1}y∈{−1,+1}y \in \{-1, +1\} L(y,βTx)=log(1+exp(−y⋅βTx))L(y,βTx)=log⁡(1+exp⁡(−y⋅βTx)) L(y,\beta^Tx)=\log(1+\exp{(-y\cdot \beta^Tx})) …

2
En Yüksek Yoğunluklu Bölge (HDR) nedir?
Olarak istatistiksel çıkarımlar , sorun 9.6b, bir "yüksek yoğunluklu bölge (HDR)" bahsedilmektedir. Ancak bu terimin tanımını kitapta bulamadım. Benzer bir terim En Yüksek Arka Yoğunluktur (HPD). Ancak bu bağlamda uyuşmuyor, çünkü 9.6b önceki hakkında hiçbir şeyden bahsetmiyor. Ve önerilen çözümde sadece "açıkça bir HDR" yazıyor .c ( y))c(y)c(y) Yoksa HDR …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.