İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

5
Öğrenme için kaynaklar (sadece yayınlanmayacak) istatistik / matematik yoluyla R
R yoluyla istatistiksel ve matematiksel kavramları öğrenmek için kaynak örnekleri (R kodu, R paketleri, kitaplar, kitap bölümleri, makaleler, linkler vb.) İle ilgileniyorum (diğer dillerden de olabilir, ancak R en sevdiğim lezzet.) Buradaki zorluk, materyalin öğrenilmesinin sadece algoritmayı yapan bir kodun nasıl çalıştırılacağına değil, programlamaya dayanmasıdır. Bu yüzden (örneğin) R'li Linear …

4
Bu durumda en az kare çözüm neden kötü sonuçlar veriyor?
Piskopos tarafından "Örüntü tanıma ve makine öğrenmesi" nin 4. bölümünde sayfa 204'te En Az kare çözümünün neden kötü sonuç verdiğini anlamadığım bir görüntü var: Önceki paragraf, en küçük karelere sahip çözümlerin aşağıdaki resimde gördüğünüz gibi aykırılıklara karşı sağlam olmadıkları gerçeğiyle ilgiliydi, ancak diğer görüntüde neler olup bittiğini ve LS'nin neden …

3
SVD'yi ortak bir filtreleme sorununa uyguladığınızda ne olur? İkisi arasındaki fark nedir?
İşbirlikçi filtrelemede, doldurulmamış değerlere sahibiz. Bir kullanıcının bir film izlemediğini varsayalım ve oraya bir 'na' koymamız gerektiğini varsayalım. Eğer bu matrisin SVD'sini alacaksam, o zaman bir sayı koymalıyım - 0 diyelim. Şimdi matrisi çarparsam, benzer kullanıcıları bulmak için bir yöntemim var (hangi kullanıcıların birbirine daha yakın olduğunu bularak) küçültülmüş boyutsal …

2
Dairesel verilerle varyans eşitliği nasıl test edilir
8 farklı örneklemde (her biri farklı bir popülasyondan) değişkenlik miktarını karşılaştırmakla ilgileniyorum. Bunun oran verisi ile çeşitli yöntemlerle yapılabileceğinin farkındayım: F-testi varyans eşitliği, Levene testi, vb. Bununla birlikte, verilerim dairesel / yöne (yani rüzgar yönü ve genel olarak açısal veriler veya günün saati gibi periyodiklik gösteren veriler). Bazı araştırmalar yaptım …

3
Karşılaştırma ve zıtlık, p değerleri, anlamlılık düzeyleri ve tip I hatası
Herhangi birinin p-değerlerinin, anlamlılık seviyesinin ve tip I hatasının tanımları ve kullanımlarıyla ilgili kısa bir özet verip veremeyeceğini merak ediyordum. P-değerlerinin "en azından gerçekten gözlediğimiz en yüksek düzeyde bir test istatistiği elde etme olasılığı" olarak tanımlandığını, bir anlamlılık seviyesinin ise p-değeri önemli olup olmadığını ölçmek için rastgele bir kesim değeri …

3
Olumlu olmayan kesin bir kovaryans matrisi verilerim hakkında bana ne söyler?
Çok değişkenli gözlemlerim var ve tüm değişkenler arasındaki olasılık yoğunluğunu değerlendirmek istiyorum. Verilerin normal dağıldığı varsayılır. Düşük sayıdaki değişkenlerde her şey beklediğim gibi çalışır, ancak daha büyük sayılara geçmek kovaryans matrisinin pozitif olarak kesinleşmemesine neden olur. Matlab'daki problemi azalttım: load raw_data.mat; % matrix number-of-values x number of variables Sigma = …

1
İki sinyali nasıl hizalayabilir / senkronize edebilirim?
Biraz araştırma yapıyorum ancak analiz aşamasında sıkıştı (istatistik derslerime daha fazla dikkat etmeliydim). İki eşzamanlı sinyal topladım: hacim ve göğüs genişlemesinde değişiklik için entegre akış hızı. Sinyalleri karşılaştırmak istiyorum ve nihayetinde göğüs genişleme sinyalinden hacim almayı umuyorum. Ama önce verilerimi hizalamak / senkronize etmek zorundayım. Kayıt tam olarak aynı anda …

4
Regresyon analizi ile varyans analizi arasındaki fark?
Bu soru Matematiksel Yığın Değişim Borsası'ndan taşınmıştır , çünkü Çapraz Doğrulamada yanıtlanabilmiştir. 7 yıl önce göç etti . Şu an regresyon analizi ve varyans analizi hakkında öğreniyorum. Regresyon analizinde sabit bir değişkeniniz vardır ve değişkenin diğer değişkenle nasıl gittiğini bilmek istersiniz. Varyans analizinde örneğin bilmek istersiniz: Bu belirli hayvan yemi …
21 regression 

1
MCMC tabanlı regresyon modellerinde rezidüel teşhis
Geçenlerde bir MCMC algoritması (gerçekte R'de MCMCglmm işlevini kullanarak) kullanarak Bayesian çerçevesindeki regresyon karma modellerini yerleştirmeye başladım. Tahmin sürecinin yakınlaşmasının nasıl teşhis edildiğini anladığımı düşünüyorum (iz, büyü parsel, otokorelasyon, arka dağılım ...). Bayesian çerçevesinde beni vuran şeylerden biri de bu teşhisi yapmak için çok çaba sarfedilmiş gibi görünmekle birlikte, takılı …

4
Tahmin edicilerin çoklu regresyonda önemi: Kısmi ve standart katsayılar
Kısmi ile katsayılar arasındaki doğrusal ilişkinin tam ilişkisinin ne olduğunu ve faktörlerin önemini ve etkisini göstermek için yalnızca birini mi yoksa ikisini mi kullanmam gerektiğini merak ediyorum .R,2R,2R^2 Bildiğim kadarıyla summary, katsayıların tahminlerini alıyorum ve anovaher faktör için karelerin toplamı ile - bir faktörün karelerinin toplamının karelerin toplamı artı kalıntıların …

3
Kabitli istifleme / montaj modelleri
Sık sık kendimi caretR kullanarak birkaç farklı öngörü modeli eğitirken buluyorum. Bunları hepsini aynı çapraz onaylama katları üzerinde eğiteceğim caret::: createFolds, sonra bunları kullanarak çapraz onaylanmış hataya dayalı en iyi modeli seçeceğim. Bununla birlikte, birkaç modelden elde edilen medyan tahmin genellikle bağımsız bir test setindeki en iyi tekli modelden daha …
21 r  caret  ensemble 

3
PCA, boyutluluk örneklem sayısından büyük olduğunda
Bir sınıflandırıcıya geçmem gereken 14000 veri noktası (boyut) içeren 10 kişi için 10 sinyal / kişi (yani 100 örnek) bulunan bir senaryoya rastladım. Bu verinin boyutunu azaltmak istiyorum ve PCA bunu yapmanın yolu gibi görünüyor. Ancak, PCA'nın örneklerini yalnızca örnek sayısının boyut sayısından büyük olduğu yerlerde bulabildim. SVD kullanarak PC'leri …

3
Büyük veri için ilk adım ( , )
Her gözlemin birkaç bin seyrek ve muhtemelen gereksiz sayısal ve kategorik değişkenlere sahip olduğu, günde milyarlarca gözlem ayarında büyük bir veriyi analiz ettiğinizi varsayalım. Diyelim ki bir regresyon problemi, bir dengesiz ikili sınıflandırma problemi ve bir de “hangi tahmin edicilerin en önemli olduğunu bulma” görevi var. Soruna nasıl yaklaşılacağı konusundaki …

5
Veri madenciliğinde yeni devrimci yol?
Aşağıdaki alıntı, sürekli olarak başarılı bir riskten korunma fonu yöneticisi Jaffray Woodriff ile yapılan röportajdan Schwager'in Hedge Fonu Market Wizzards'dan (Mayıs 2012) alınmıştır: "Veri madenciliğinde insanların en büyük hatalarından bazıları neler?" Pek çok insan, eğitim için örnek veriyi ve test için örnek veriyi kullandıkları için iyi olduklarını düşünüyor. Daha sonra …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.