İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Anomali tespiti için eksik değerlere sahip zaman serilerinde STL
Bazı eksik gözlemleri olan bir dizi iklim verisinde anormal değerleri tespit etmeye çalışıyorum. İnternette arama yaparken birçok mevcut yaklaşım buldum. Bunlardan stl ayrışması, eğilim ve mevsimsel bileşenleri ortadan kaldırmak ve geri kalanını incelemek anlamında çekici görünüyor. STL Okuma : Loess'e Dayalı Mevsimsel Trend Ayrıştırma Prosedürü , stldeğişkenlik atama ayarlarını belirleme …

1
Neden bir kovaryans matrisinin öz ve svd ayrışmaları seyrek verilere dayalı olarak farklı sonuçlar verir?
Seyrek / gappy veri kümesine dayalı bir kovaryans matrisi ayrıştırmaya çalışıyorum. Lambda (açıklanan varyans) toplamının, hesaplandığı gibi svd, giderek gappy verilerle güçlendirildiğini fark ediyorum . Boşluklar olmadan svdve eigenaynı sonuçları ver. Bu bir eigenayrışma ile gerçekleşmez . Kullanmaya yönelmiştim svdçünkü lambda değerleri her zaman pozitif, ama bu eğilim endişe vericidir. …
12 r  svd  eigenvalues 


2
Binned verilerin üçüncü çeyreği nasıl tahmin edilir?
Üçüncü çeyreği, nüfusun dörtte birinden fazlasını içeren açık bir aralığa aitse belirlemek için herhangi bir teknik hile var mı (bu nedenle aralığı kapatamıyorum ve standart formülü kullanamıyorum)? Düzenle Bir şeyi yanlış anladığımda az çok tam bağlam sunacağım. İki sütun ve 6 satırlı bir tabloda düzenlenmiş verilerim var. Her sütun ile …

2
randomForest sınıflandırma yerine regresyonu seçer
Ben randomForest paketi R ve iris verileri kullanarak, oluşturulan rastgele orman bir sınıflandırma olduğunu ama 700 özellikleri (özellikler 28x28 piksel görüntüde her piksel) özellikleri olan bir veri kümesi kullandığınızda ve etiket sütun adlı label, randomForestüretilen regresyon. Aşağıdaki satırı kullanıyorum: rf <- randomForest(label ~ ., data=train) Sınıflandırma yerine regresyon nasıl kullanılır? …
12 r  random-forest 

1
R'de tekrarlanan ölçümlerle doğrusal regresyon
Tekrarlanan bir ölçüm tasarımı için R'de doğrusal regresyonun nasıl gerçekleştirileceğini anlayamadım. Bir de önceki soruya (hala cevaplanmamış) o kullanmamayı bana önerildi lmkarışık modeller kullanma yerine ancak. Ben lmşu şekilde kullandım: lm.velocity_vs_Velocity_response <- lm(Velocity_response~Velocity*Subject, data=mydata) (veri kümesiyle ilgili daha fazla ayrıntı yukarıdaki bağlantıda bulunabilir) Ancak internette R kodu ile doğrusal regresyon …


2
Pozitif korelasyon ve negatif regresör katsayısı işareti
Bir regresör ile bir yanıt ( +0,43) arasında pozitif bir korelasyon elde etmek ve bundan sonra bu regresör için uygun regresyon modelinde negatif bir katsayı elde etmek mümkün müdür ? Bazı modeller arasında regresörün işaretindeki değişikliklerden bahsetmiyorum. Katsayı işareti daima kalır. Takılan modelin kalan değişkenleri işaretin değişmesini etkileyebilir mi?

1
hiyerarşik Bayes modelleri ve ampirik Bayes
HBM ve EB'nin hiperparametrelerin "oyunda" örneklendiği / tahmin edildiği / vs olduğu iki alternatif olduğunu düşünür müsünüz? Bu ikisi arasında açıkça bir bağlantı var. HBM'yi EB'den daha "tam olarak Bayesci" olarak düşünür müsünüz? "Tamamen Bayesci" olmak ile diğer alternatifler arasındaki farkların neler olduğunu görebileceğim bir yer var mı? Teşekkürler.

4
AIC (veya BIC) kullanarak PCA modeli seçimi
Bir PCA'da çıkarılacak uygun sayıda faktörü seçmek için Akaike Bilgi Ölçütünü (AIC) kullanmak istiyorum. Tek sorun, parametre sayısını nasıl belirleyeceğimi bilmiyorum. Bir matrisi düşünün , burada değişken sayısını ve gözlem sayısını temsil eder , öyle ki . Kovaryans matrisi simetrik olduğundan, maksimum olasılık tahmini AIC'deki parametre sayısını eşit olarak ayarlayabilir …

1
Günlüğe kaydedilen değişkenler neden kullanılır?
Muhtemelen, bu çok temel bir soru ama bunun için sağlam bir cevap bulamıyorum. Umarım burada yapabilirim. Şu anda kendi yüksek lisans tezime hazırlık olarak kağıtları okuyorum. Şu anda, tweetler ve borsa özellikleri arasındaki ilişkiyi araştıran bir makale okuyorum. Hipotezlerinden birinde, "artan tweet hacminin ticaret hacmindeki artışla ilişkili olduğunu" ileri sürüyorlar. …

5
Bayesyalılar, yaklaşımlarının sıkça kullanılan yaklaşımla genelleştiği / örtüştüğü durumlar olduğunu hiç iddia ediyorlar mı?
Bayesyalılar yaklaşımlarının sıklıkçı yaklaşımı genelleştirdiğini hiç iddia ediyorlar mı, çünkü biri bilgilendirici olmayan öncelikler kullanabilir ve bu nedenle tipik bir sıklıkçı model yapısını kurtarabilir mi? Herkes beni gerçekten kullanılmışsa, bu argüman hakkında okuyabileceğim bir yere yönlendirebilir mi? EDIT: Bu soru belki tam olarak ifade etmek istediğim gibi değil ifade edilir. …


3
Eksik değerleri olan bir matrisin SVD'si
Bir Netflix tarzı öneri matrisim olduğunu ve belirli bir kullanıcı için gelecekteki potansiyel film derecelendirmelerini öngören bir model oluşturmak istediğimizi varsayalım. Simon Funk yaklaşımını kullanarak, tam matris ile madde-kullanıcı-kullanıcı-matrisi arasındaki Frobenius normunu bir L2 düzenleyici terim ile en aza indirmek için stokastik gradyan inişi kullanılır. Pratikte, insanlar, hesaplama matrisinin eksik …

2
Yapı bağımsızlığını belirlemede açımlayıcı ve doğrulayıcı faktör analizi arasındaki fark
Araştırmacılar genellikle çok benzer öğelere sahip iki ölçü kullanırlar ve farklı şeyleri ölçtüklerini iddia ederler (örneğin, "Arabaların etrafındayken daima endişeleniyorum"; "Arabalardan korkuyorum"). Otomobillerden Korku Ölçüsü ve Kaygı Ölçeği varsayımsal önlemlerini çağıralım. Gerçekten farklı gizli yapıları değerlendiriyorlarsa veya aynı şeyi ölçüyorlarsa ampirik olarak test etmekle ilgileniyorum. Bunu yapmanın en iyi iki …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.