İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

5
Korelasyonu bulmak için ondalık sayılar kullanmak istatistiksel olarak geçerli bir yaklaşım mı?
İlişkilendirilmemiş 1.449 veri noktası örneğim var (r kare 0.006). Verileri analiz ederken, bağımsız değişken değerlerini pozitif ve negatif gruplara bölerek, her grup için bağımlı değişkenin ortalamasında anlamlı bir fark olduğunu gördüm. Bağımsız değişken değerleri kullanarak noktaları 10 kutuya (ondalık) bölmek, ondalık sayı ve ortalama bağımlı değişken değerleri (r-kare 0,27) arasında …

2
Lojistik regresyon ve sıralı bağımsız değişkenler
Bu gönderiyi buldum: Evet. Katsayı, sıra tahmininde her değişiklik artışı için günlük oranlarındaki değişikliği yansıtır. Bu (çok yaygın) model spesifikasyonu, öngörücünün artışları boyunca doğrusal bir etkiye sahip olduğunu varsayar. Varsayımı test etmek için, sıralı değişkeni tek bir yordayıcı olarak kullandığınız bir modeli, yanıtları ayrıklaştırdığınız ve bunları birden çok yordayıcı olarak …


1
İki Pearson korelasyonunun gücü nasıl karşılaştırılır?
Bir gözden geçiren tarafından bir tabloda sunulan Pearson korelasyonlarının (r-değerleri) birbirleriyle karşılaştırılıp karşılaştırılamayacağı sorulmuştur, böylece biri diğerinden "daha güçlü" olduğunu iddia edebilir (sadece gerçek r-değerlerini göz ardı etmekten başka) . Bunu nasıl yapardın? Bu yöntemi buldum http://vassarstats.net/rdiff.html ancak bunun geçerli olup olmadığından emin değilim.

1
Rasgele değişkenlerin fonksiyonlarının olasılık dağılımı?
Bir şüphem var: gerçek değerli rastgele değişkenleri düşünün XXXve her ikisi de olasılık alanında tanımlanmıştır .ZZZ(Ω,F,P)(Ω,F,P)(\Omega, \mathcal{F},\mathbb{P}) Let , burada gerçek değerli bir fonksiyondur. beriY:=g(X,Z)Y:=g(X,Z)Y:= g(X,Z)g(⋅)g(⋅)g(\cdot)YYY rastgele değişkenlerin bir fonksiyonudur, rastgele bir değişkendir. İzin Vermek x:=X(ω)x:=X(ω)x:=X(\omega) yani XXX. Dır-dir P(Y|X=x)=P(g(X,Z)|X=x)P(Y|X=x)=P(g(X,Z)|X=x)\mathbb{P}(Y|X=x)=\mathbb{P}(g(X,Z)|X=x) eşittir P(g(x,Z))P(g(x,Z))\mathbb{P}(g(x,Z))?

2
Bir kümenin bir örneğini kullanarak birden çok kümenin kesişim boyutunun tahmin edilmesi
En az 2 kümenin kesişimleri tarafından oluşturulan bir kümenin boyutunu hesaplamak için gereken bir algoritma üzerinde çalışıyorum. Daha spesifik olarak: z=|A0∩…∩An|z=|A0∩…∩An| z = \left |A_0 \cap \ldots \cap A_n \right | Kesişen kümeler SQL sorguları tarafından oluşturulur ve işleri hızlı tutma çabasıyla, her sorgudan önce bir sayı alırım, sonra en …
10 error  sample 

1
GAM P-Değerlerini Nasıl Yorumlayabilirim?
Benim adım Hugh ve ben bazı keşif analizleri yapmak için genelleştirilmiş katkı modelleri kullanan bir doktora öğrencisiyim. MGCV paketinden gelen ve anlayışımı kontrol etmek isteyen p-değerlerinin nasıl yorumlanacağından emin değilim (1.7-29 sürümünü kullanıyorum ve Simon Wood'un bazı belgelerine başvurdum). Önce diğer CV sorularını aradım, ancak en alakalı olanlar özellikle GAM …
10 p-value  mgcv 

2
Politika yineleme algoritması neden en uygun ilke ve değer işlevine yakınsar?
Andrew Ng'in pekiştirme öğrenimi hakkındaki ders notlarını okuyordum ve politika yinelemesinin neden ve optimum politika en iyi değer fonksiyonuna dönüştüğünü anlamaya çalışıyordum .V∗V∗V^*π∗π∗\pi^* Politika yinelemesini hatırlayın: Initialize π randomlyRepeat{Let V:=Vπ \for the current policy, solve bellman's eqn's and set that to the current VLet π(s):=argmaxa∈A∑s′Psa(s′)V(s′)}Initialize π randomlyRepeat{Let V:=Vπ \for the …

2
Lme4 kullanan karma efektli modellerde etkileşim terimi için P değeri
Ben kullanarak bazı davranışsal verilerin analiz ediyorum lme4yılında Rçoğunlukla ardından Bodo Kış mükemmel öğreticiler , ama düzgün etkileşimleri hallediyorum ben anlamıyorum. Daha kötüsü, bu araştırmaya dahil olan hiç kimse karışık modeller kullanmaz, bu yüzden işlerin doğru olduğundan emin olmak konusunda biraz şaşırıyorum. Sadece yardım için bir çığlık atmak yerine, sorunu …


3
Verilerin olasılık dağılımını tahmin etmek için parametrik olmayan farklı yöntemler
Bazı verilerim var ve ona düzgün bir eğri uydurmaya çalışıyordum. Bununla birlikte, bu konuda çok fazla önceki inanç veya çok güçlü ön kavrayışlar (sorumun geri kalanında ima edilenler hariç) veya belirli dağıtımlar uygulamak istemiyorum. Sadece pürüzsüz bir eğriye uydurmak istedim (veya gelebilecek olasılık dağılımını iyi bir şekilde tahmin etmek istedim). …

2
Bir olasılık oranı ile tehlike oranı arasında herhangi bir fonksiyonel fark var mı?
Lojistik regresyonda, 2 oran oranı, öngörücüde bir birimlik artış göz önüne alındığında olayın 2 kat daha muhtemel olduğu anlamına gelir. Cox regresyonunda, 2'lik bir tehlike oranı, öngörücüde bir birim artış göz önüne alındığında olayın her zaman noktasında iki kat daha sık olacağı anlamına gelir. Bunlar pratik olarak aynı şey değil …

1
Bir uzlaşma sıralamasının güvenilirliği nasıl ölçülür (Kemeny-Snell kitabından problem)
Farz et ki kkk uzmanlardan her biri bir dizi nnnnesneleri sırayla veya tercih edin. Sıralamalarda bağlara izin ver. John Kemeny ve Laurie Snell 1962 yılındaki "Sosyal Bilimlerdeki Matematiksel Modeller" adlı kitaplarında bir sonraki problemi çözmeyi öneriyorlar: PROJE 111. Bir uzlaşma sıralamasının güvenilirliğini ölçmek için:kkkUzmanlar. Örneğin, bu, tek bir uzmanın sıralamasını …


3
Hangisi daha iyi, stl veya ayrışma?
R kullanarak zaman serisi analizi yapıyorum. Verilerimi trend, mevsimsel ve rastgele bileşenlere ayırmalıyım. 3 yıllık haftalık verilerim var. R - stl()ve 'de iki fonksiyon buldum decompose(). Bunun stl()çarpımsal ayrışma için iyi olmadığını okudum . Biri bana bu fonksiyonların hangi senaryoda kullanılabileceğini söyleyebilir mi?
10 r  time-series 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.