İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
İleri aşamalı regresyon algoritması nedir?
Belki de sadece yorgunum, ama İleri Stagewise Regresyon algoritmasını anlamaya çalışırken sorun yaşıyorum. Gönderen "İstatistiksel Öğrenme Elements" sayfa 60: İleri-aşamalı regresyon (FS), ileri-aşamalı regresyondan daha da kısıtlıdır. Bu, [ortalama] y değerine eşit bir kesişme ve başlangıçta hepsi 0 olan, katsayıları olan ortalanmış tahmin edicilerle ileri-adım regresyon gibi başlar. Her adımda …

1
R kullanarak ikilik veriler (ikili değişkenler) üzerinde bir faktör analizi örneği üzerinden bir adım aramak
Bazı ikili verilerim var, sadece ikili değişkenler var ve patronum tetraforik korelasyon matrisi kullanarak bir faktör analizi yapmamı istedi. Daha önce kendime buradaki örneklere ve UCLA'nın istatistik sitesine ve bunun gibi diğer sitelere göre farklı analizleri nasıl çalıştıracağımı öğretebildim , ancak dikotom üzerine bir faktör analizi örneğine bir adım bulamıyorum …

2
Sayımın standart hatası
Nadir bir hastalığın mevsimine göre olay vakaları veri kümem var. Örneğin, ilkbaharda 180, yazın 90, sonbaharda 45 ve kış aylarında 210 vaka olduğunu varsayalım. Bu sayılara standart hatalar eklemenin uygun olup olmadığı konusunda mücadele ediyorum. Araştırma hedefleri, gelecekte tekrarlayabilecek hastalık insidansında mevsimsel bir model aradığımız anlamında yetersizdir. Böylece, sezgisel olarak, …


1
Rasgele efektli modeller için lmer ile varyans bileşenleri nasıl tahmin edilir ve lme sonuçlarıyla karşılaştırılır
İki farklı kaynak popülasyondan gelen farklı aileleri yetiştirdiğim bir deney yaptım. Her aileye iki tedaviden biri verildi. Deneyden sonra her bireyin çeşitli özelliklerini ölçtüm. Tedavinin veya kaynağın etkisinin yanı sıra etkileşimlerini de test etmek için, rastgele faktör olarak ailesi ile doğrusal bir karma etki modeli kullandım, yani lme(fixed=Trait~Treatment*Source,random=~1|Family,method="ML") Şimdiye kadar …
14 r  anova  variance  lme4-nlme 


3
Gizli Markov model eşiği
MFCC ve gizli markov modelleri kullanarak ses tanıma için bir konsept sistemi kanıtı geliştirdim. Sistemi bilinen sesler üzerinde test ettiğimde umut verici sonuçlar veriyor. Sistem, bilinmeyen bir ses girildiğinde en yakın eşleşme ile sonuç döndürür ve skor, onu tanımlamak için o kadar da farklı değildir, örneğin: 3 gizli markov modelini …

2
veya
Bu açıkça sadece bir tanım veya konvansiyon meselesidir ve neredeyse hiç pratik önemi yoktur. Eğer 0.05 geleneksel değere ayarlanır, bir olan p istatistiksel olarak anlamlı olmadığını kabul 0.0500000000000 değeri ...? İstatistiksel anlamlılığı tanımlama kuralı genellikle p &lt; α veya p ≤ α olarak kabul edilir mi?αα\alphapppp&lt;αp&lt;αp < \alphap≤αp≤αp \leq \alpha


1
Kategorik değişkenler (R cinsinden) için mevcut olan farklı kodlama türleri nelerdir ve bunları ne zaman kullanırsınız?
Doğrusal bir model veya karışık bir model takarsanız, kategorik veya nominal bir değişkenin, kukla koşullandırma (R varsayılanı) ve efekt kodlaması gibi paramaterlerin tahmin edildiği bir dizi değişkene dönüştürülmesi için farklı kodlama türleri vardır. Etkileşimleriniz olduğunda efekt kodlamanın (bazen sapma veya kontrast kodlama olarak adlandırılır) tercih edildiğini duydum, ancak olası kontrastlar …

3
Kısa belgeler için konu modelleri
Bu sorudan esinlenerek , çok kısa metinlerin büyük koleksiyonları için konu modelleri üzerinde herhangi bir çalışma yapılıp yapılmadığını merak ediyorum. Benim sezgim Twitter'ın bu modeller için doğal bir ilham kaynağı olması. Bununla birlikte, bazı sınırlı deneylerden, standart konu modellerinin (LDA, vb.) Bu tür veriler üzerinde oldukça düşük performans gösterdiği görülmektedir. …

2
Çok terimli bir lojistik regresyon yapmak için glm algoritmalarını kullanabilir miyim?
Projemde istatistiksel analiz için spotfire (S ++) kullanıyorum ve büyük bir veri kümesi için multinomiyal lojistik regresyon çalıştırmak zorundayım. En iyi algoritma mlogit olacağını biliyorum, ama ne yazık ki bu s ++ mevcut değildir. Ancak, bu regresyon için glm algoritması kullanma seçeneğim var. Burada iki şeyi açıklığa kavuşturmak istiyorum: 1. …

5
Keşif faktörü analizi ile R ve SPSS arasındaki tutarsızlıkları yorumlama
Bilgisayar bilimi yüksek lisans öğrencisiyim. Bir araştırma projesi için keşifsel faktör analizi yapıyorum. Projeyi yöneten meslektaşlarım SPSS kullanıyor, ben R kullanmayı tercih ediyorum. İki istatistiksel paket arasında büyük bir tutarsızlık bulunana kadar bu önemli değildi. Ekstraksiyon yöntemi olarak temel eksen faktoringini kullanıyoruz (lütfen PCA ve faktör analizi arasındaki farkın farkında …

2
Lojistik regresyon hakkında soru
10 yıllık bir süre boyunca (1997-2006) bir dizi bağımsız değişkenin çatışmasının varlığını veya yokluğunu (bağımlı değişken) modellemek için ikili lojistik regresyon yapmak istiyorum, her yıl 107 gözlem var. Bağımsızlarım: arazi bozulması (2 tip bozulma için kategorik); nüfus artışı (0- hayır; 1-evet); geçim türü (0 - tip 1; 1 - tip …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.