İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Lojistik regresyonda düzeltilmiş oran oranını anlamama yardımcı olun
Bir gazetede lojistik regresyon kullanımını anlamaya çalışırken zorlanıyordum. Burada bulunan makalede katarakt cerrahisi sırasında komplikasyon olasılığını tahmin etmek için lojistik regresyon kullanılmaktadır . Beni şaşırtan şey, makalenin aşağıdaki gibi tanımlanan taban oranına 1 oran oranını atayan bir model sunmasıdır: Risk profili tüm risk göstergeleri için referans grubunda olan (yani Tablo …

2
Aşırı öğrenme makinesi: hepsi ne hakkında?
Bir yıldan uzun süredir Aşırı Öğrenme Makinesi (ELM) paradigmasını düşünüyor, uyguluyor ve kullanıyorum ve ne kadar uzun süre yaparsam, bunun gerçekten iyi bir şey olduğundan şüphe duyuyorum. Ancak benim düşüncem, alıntılar ve yeni yayınları bir ölçü olarak kullanırken - sıcak bir konu gibi görünen bilimsel toplulukla çelişiyor gibi görünüyor. ELM, …
20 regression 

2
Hipotez testi ve zaman serileri için önemi
İki popülasyona bakıldığında olağan bir önem testi, mümkünse t-testi, eşleştirilmiş t-testidir. Bu dağılımın normal olduğunu varsayar. Bir zaman serisi için anlamlılık testi üreten benzer basitleştirici varsayımlar var mı? Özellikle farklı muamele gören oldukça küçük iki fare popülasyonuna sahibiz ve haftada bir kez kilo veriyoruz. Her iki grafik de, bir grafik …

1
Xgboost'ta overfit hakkında tartışma
Kurulumum şu şekildedir: "Uygulamalı Öngörücü Modelleme" kılavuz ilkelerini takip ediyorum. Böylece ilişkili özellikleri filtreledim ve aşağıdakilerle sonuçlandım: Eğitim setinde 4900 veri noktası ve test setinde 1600 veri noktası. 26 özelliğim var ve hedef sürekli bir değişken. caretPaketi kullanarak modelleri eğitmek için 5 kat çapraz geçerlilik uygularım . Bir MARS modeli …

2
K-araçlarının yakınsaklığının kanıtı
Bir ödev için, k-anlamına gelen sonlu sayıda adımda yakınsadığına dair bir kanıt sunmam istendi. Ben yazdım: CCCE(C)=∑xmini=1k∥x−ci∥2E(C)=∑xmini=1k‖x−ci‖2E(C)=\sum_{\mathbf{x}}\min_{i=1}^{k}\left\Vert \mathbf{x}-\mathbf{c}_{i}\right\Vert ^{2}E(C)E(C)E(C) Adım 2, her bir veri noktasını en yakın küme merkezine göre etiketleyen adıma atıfta bulunur ve adım 3, merkezlerin bir ortalama alınarak güncellendiği adımdır. Bu, sınırlı sayıda adımda yakınsamayı kanıtlamak için …


2
Üstel Ailenin Avantajları: Neden çalışmalı ve kullanmalıyız?
Burada çıkarım okuyorum. Birisinin üstel ailenin avantajlarını numaralandırmasını istiyorum. Üstel aileye göre, f(x|θ)=h(x)exp{η(θ)T(x)−B(θ)}f(x|θ)=h(x)exp⁡{η(θ)T(x)−B(θ)}\begin{align*} f(x|\theta) = h(x)\exp\left\{\eta(\theta)T(x) - B(\theta)\right\} \end{align*} desteği parametresine bağlı olmayan . İşte öğrendiğim bazı avantajlar:θθ\theta (a) Çok çeşitli dağıtımları içerir. (b) Neyman-Fisher teoremine göre doğal yeterli istatistik .T(x)T(x)T(x) (c) in moment üretme fonksiyonu için güzel bir formül …


2
MAE'yi en aza indirmek neden ortalamaları değil medyanı tahmin etmeye neden olur?
Rob J Hyndman ve George Athanasopoulos tarafından hazırlanan Tahmin: İlkeler ve Uygulama ders kitabından , özellikle doğruluk ölçümü ile ilgili bölüm : MAE'yi en aza indiren bir tahmin yöntemi, medyanın tahminlerine yol açarken, RMSE'yi en aza indirmek, ortalamanın tahminlerine yol açacaktır. Birisi MAE'yi en aza indirmenin neden ortalama değil medyanın …
19 forecasting  mean  median  rms  mae 

1
Kutu grafiklerinin geçmişi nedir ve “kutu ve bıyık” tasarımı nasıl gelişti?
Birçok kaynak, klasik "kutu arsa" tasarımını John Tukey ve 1970'teki "şematik arsa" sına tarihlendiriyor . Tasarım o zamandan beri nispeten durağan kalıyor , Edward Tufte'nin kutu arsalarının cut-down versiyonu yakalanmıyorken, keman grafikleri - kutu grafiğinin daha bilgilendirici bir çeşidi olsa da - daha az popüler. Cleveland'ın bıyıkların 10. ve 90. …

4
Madeni para çevirmelerinin örnek boyutunu artırmak normal eğri yaklaşımını neden iyileştirmiyor?
Ben okuyorum İstatistik (Freeman, Pisani'yi Purves) kitap ve bir madeni para söylemek 50 kez, sayılan kafaları sayısını atmış bir örneğini yeniden oluşturmaya çalışıyorum ve bu demek 1,000 kez tekrarlanır. İlk olarak, fırlatma sayısını (örnek büyüklüğü) 1000'de tuttum ve tekrarları arttırdım. Tekrarlama sayısı arttıkça, veriler normal eğriye daha iyi uyar. Sonra, …

3
Kız arkadaşın geleceği söyleyip söyleyemeyeceğini nasıl anlarsınız (yani hisse senetlerini tahmin edebilir)?
Kız arkadaşım yakın zamanda büyük bir bankada satış ve ticaret yapan bir iş buldu. Yeni işinden dolayı, ay sonunda stokların yukarı veya aşağı olup olmadığını tahmin edebileceğine inanıyor (% 80 doğrulukla bile yapabileceğine inanıyor!) Ben çok şüpheci. Bir dizi hisse seçeceği bir deney yapmayı kabul ettik ve önceden belirlenmiş bir …

4
Korelasyon ve nedensellik arasındaki ilişkiler
Wikipedia başlıklı korelasyon nedensellik anlamına gelmez , A ve B ile ilişkili iki olay için olası farklı ilişkiler şunları içerir: A, B'ye neden olur (doğrudan nedensellik); B, A'ya neden olur (ters nedensellik); A ve B, ortak bir nedenin sonuçlarıdır, ancak birbirlerine neden olmazlar; A ve B'nin her ikisi de (açık …


1
Aynı dağılımdan iki numune alınırsa parametrik olmayan test
Örneklerin veya popülasyonun dağılımları hakkında herhangi bir varsayımda bulunmadan iki popülasyonun aynı popülasyondan alındığı hipotezini test etmek istiyorum. Bunu nasıl yapmalıyım? Wikipedia'dan izlenimim, Mann Whitney U testinin uygun olması gerektiğidir, ancak pratikte benim için işe yaramıyor gibi görünüyor. Somutluk için, büyük (n = 10000) ve normal olmayan (bimodal), benzer (aynı …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.