İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Hata oranı lambda Düzenleme parametresinin Dışbükey işlevi midir?
Ridge veya Lasso'daki lambda düzenleme parametresini seçerken önerilen yöntem lambda'nın farklı değerlerini denemek, Doğrulama Kümesindeki hatayı ölçmek ve son olarak en düşük hatayı döndüren lambda değerini seçmektir. F (lambda) = hatası Convex ise bu benim için bir sorun değil. Böyle olabilir mi? Bu eğrinin birden fazla yerel minimi olabilir (bu, …

2
Olasılık olarak Karşılıklı Bilgi
Ortak entropi üzerinde karşılıklı bilgi olabilir mi: 0 ≤ Ben( X, Y)'H( X, Y)≤ 10≤ben(X,Y)'H(X,Y)≤1 0 \leq \frac{I(X,Y)}{H(X,Y)} \leq 1 "X'den Y'ye bir parça bilgi aktarma olasılığı" olarak tanımlanabilir mi? Çok naif olduğum için üzgünüm, ama hiçbir zaman bilgi teorisi üzerinde çalışmadım ve sadece bununla ilgili bazı kavramları anlamaya çalışıyorum.

1
Bayes dikeni ve slab cezalandırılmış yöntemlere karşı
Steven Scott'ın BSTS R paketi hakkındaki slaytlarını okuyorum (onları burada bulabilirsiniz: slaytlar ). Bir noktada, yapısal zaman serisi modeline birçok regresörün dahil edilmesinden bahsederken, regresyon katsayılarının başak ve slab önceliklerini tanıtır ve cezalandırılmış yöntemlerle karşılaştırıldığında daha iyi olduklarını söyler. Scott, 100 öngörücü içeren bir veri kümesi örneğine atıfta bulunarak şöyle …


5
OLS tahmincisinin ölçek eşdeğeri olduğunu mu gösteriyorsunuz?
Ölçek eşdeğerliğinin resmi bir tanımı yok, ama burada İstatistiksel Öğrenmeye Giriş bu konuda s. 217: Standart en küçük kareler katsayıları ... ölçek : sabit bir çarpmak , en küçük kareler katsayısı tahminlerinin faktörüyle ölçeklenmesine yol açar .XjXjX_jccc1/c1/c1/c Basit olması için, genel doğrusal modelini varsayalım , burada \ mathbb {R} ^ …

1
RandomForest ve sınıf ağırlıkları
Bir cümlede soru: Birisi rastgele bir orman için iyi sınıf ağırlıklarının nasıl belirleneceğini biliyor mu? Açıklama: Dengesiz veri kümeleriyle oynuyorum. RPaketi randomForest, çok az pozitif örnek ve çok sayıda negatif örnekle çok çarpık bir veri kümesi üzerinde bir model eğitmek için kullanmak istiyorum . Biliyorum, başka yöntemler var ve sonunda …
11 r  random-forest 

1
Netflix neden beş yıldızlı derecelendirme sisteminden benzer / beğenmeme sistemine geçiyor?
Netflix, önerilerini kullanıcının gönderdiği diğer filmler / şovlara dayandırırdı. Bu derecelendirme sisteminin beş yıldızı vardı. Artık Netflix, kullanıcıların filmleri / şovları beğenmesine / beğenmemesine (beğenmeme / beğenmeme) izin veriyor. Filmleri derecelendirmenin daha kolay olduğunu iddia ediyorlar. Bu 2 yönlü sınıflandırma, 5 yönlü sınıflandırma sisteminden istatistiksel olarak daha az öngörücü olmaz …

2
Anlamlı olmayan sonuçları rapor etmeli miyim?
Bir Kruskal Wallis testi yaptım ve bazı sorular için p değeri önemli değil. Bunu, df, test istatistiği ve p-değerini belirterek anlamlıymış gibi rapor eder miyim? Bu yüzden böyle bir şey olurdu, bir Kruskal Wallis testi yapıldı, ancak sonuçların anlamlı olmadığı bulundu H (3) = 2.119, p> 0.05 (ya da burada …

1
Hem sırt hem de kement ayrı olarak iyi performans gösterdiğinde ancak farklı katsayılar üretildiğinde sonuçlar nasıl yorumlanır
Hem Kement hem de Ridge ile bir regresyon modeli kullanıyorum (0-5 arasında değişen ayrı bir sonuç değişkenini tahmin etmek için). Modeli çalıştırmadan önce, kullandığım SelectKBestyöntemi scikit-learngelen özellik kümesi azaltmak için 250 ile 25 . İlk özellik seçimi olmadan, hem Kement hem de Ridge daha düşük doğruluk puanlarına neden olur [bu, …

2
Geometrik ortalama, hangi sürekli dağılımın ortalamasının tarafsız bir tahmincisidir?
Kapalı formda ifade edilebilir sürekli bir dağılım var mıdır, ortalamaları numunelerin geometrik ortalaması bu ortalama için tarafsız bir tahmin edicidir? Güncelleme: Az önce örneklerimin pozitif olması gerektiğini fark ettim (ya da geometrik ortalama olmayabilir) belki de sürekli doğru kelime değildir. Rastgele değişkenin negatif değerleri için sıfır olan ve pozitif değerler …


2
Kutu ve bıyık grafiklerini okuma: gruplar arasındaki önemli farklılıkları çözmek mümkün mü?
Bu kutu ve bıyık planına baktığımızı varsayalım: Perşembe ve Cuma günleri arasında, çoğu zaman uyuduğunda önemli bir fark olduğu görüşünde. Peki bu istatistiksel olarak geçerli bir varsayım mı? İç çeyrek aralıklarının hiçbirinin Perşembe ve Cuma günleri arasında çakışmamasından dolayı önemli farklılıkları fark edebilir miyiz? Perşembe ve Cuma günlerinin üst ve …

2
Ortogonal olarak yapamıyorsanız, ham yapın (polinom regresyonu)
için polinom regresyonu yaparken , insanlar bazen ham polinomları, bazen de ortogonal polinomları kullanırlar. Ama kullandıklarında tamamen keyfi görünüyor.XYYYXXX Burada ve burada ham polinomlar kullanılır. Fakat burada ve burada , dik polinomlar doğru sonuçları veriyor gibi görünüyor. Ne, nasıl, neden ?! Bunun aksine, bir ders kitabından (örneğin ISLR ) polinom …


2
Büzülme akıllıca uygulanırsa, daha verimli tahminciler için her zaman daha iyi çalışır mı?
Aynı parametrenin tutarlı tahmin edicileri olan ve iki tahmincim olduğunu ve ile anlamında . Dolayısıyla, asimptotik olarak daha etkilidir . Bu iki tahminci farklı kayıp fonksiyonlarına dayanmaktadır. β 2β0√βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2β0β0\beta_0V1≤V2 β 1 β 2n−−√(βˆ1−β0)→dN(0,V1),n−−√(βˆ2−β0)→dN(0,V2)n(β^1−β0)→dN(0,V1),n(β^2−β0)→dN(0,V2)\sqrt{n}(\widehat{\beta}_1 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_1), \quad \sqrt{n}(\widehat{\beta}_2 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_2)V1≤V2V1≤V2V_1 \leq V_2βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2 Şimdi, tahmincilerimin sonlu örnek özelliklerini …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.