İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Dinamik tavsiye sistemleri
Bir Tavsiye Sistemi , farklı kullanıcıların derecelendirmeleri arasındaki korelasyonu ölçecek ve belirli bir kullanıcıya ilgisini çekebilecek öğeler hakkında önerilerde bulunacaktır. Bununla birlikte, tatlar zamanla değişir, bu nedenle eski derecelendirmeler mevcut tercihleri yansıtmayabilir veya tam tersi. Bir keresinde "çok iğrenç değil" olarak değerlendireceğiniz bir kitaba "mükemmel" koyabilirsiniz. Dahası, çıkarların kendileri de …

3
Bir okul çocuğuna istatistik ve makine öğrenimi hakkında ne söylenebilir?
Gelecek hafta evde yerel bir okuldan stajyerimiz olacak. Kısa stajının arkasındaki kavram, gerçek dünyanın nasıl çalıştığı ve belirli işlerin neyle uğraştığı, günlük çalışmanın nasıl göründüğü vb. Hakkında bir fikir edinmek. Şimdi merak ettim ki, böyle küçük bir çocuğa İstatistik ve Makine Öğrenimi hakkında ne söyleyebilir / gösterebilir / gösterebilir ki …

2
Kategorik özellikleri makine öğrenimi için sayılara kodlama
Yapay sinir ağları gibi birçok makine öğrenimi algoritması sayıları ele almayı beklemektedir. Yani, kategorik verileriniz olduğunda, dönüştürmeniz gerekir. Kategorik olarak, örneğin: Araba markaları: Audi, BMW, Chevrolet ... Kullanıcı kimlikleri: 1, 25, 26, 28 ... Kullanıcı kimlikleri sayı olsa da, bunlar yalnızca etiketlerdir ve yaş veya para toplamı gibi süreklilik açısından …

1
Neden farklı topolojilerde farklı tahmin edicilerin yakınsama davranışlarını tartışmalıyız?
Farklı fonksiyonel uzayda tahminlerin yakınsamasından bahseden Cebirsel Geometri ve İstatistiksel Öğrenme Teorisi kitabının ilk bölümünde Bayes kestiriminin Schwartz dağılım topolojisine karşılık geldiğinden bahsederken, maksimum olabilirlik kestirimi sup-norm topolojisine karşılık gelir. (sayfa 7'de): Örneğin, sup-norm, -normu, Hilbert uzayının zayıf topolojisi , Schwartz dağılım topolojisi vb. yakınsamasının fonksiyon alanının topolojisine güçlü bir …

3
Birisi zaman serisi benzerliğini belirlemek için dinamik zaman eğrilmesini açıklayabilir mi?
Zaman serilerini karşılaştırmak için dinamik zaman çözgüsü ölçüsünü kavramaya çalışıyorum. Bunun gibi üç zaman serisi veri setim var: T1 <- structure(c(0.000213652387565, 0.000535045478866, 0, 0, 0.000219346347883, 0.000359669104424, 0.000269469145783, 0.00016051364366, 0.000181950509461, 0.000385579332948, 0.00078170803205, 0.000747244535774, 0, 0.000622858922454, 0.000689084895259, 0.000487983408564, 0.000224744353298, 0.000416449765747, 0.000308388157895, 0.000198906016907, 0.000179549331179, 9.06289650172e-05, 0.000253506844685, 0.000582896161212, 0.000386473429952, 0.000179839942451, 0, 0.000275608635737, 0.000622665006227, 0.00036075036075, …

1
Eşitlik ve eşitsizlik kısıtlamaları için Kısıtlı Optimizasyon kütüphanesi
Optimizasyon işlevime uygun kısıtlı bir optimizasyon kütüphanesi seçimi için herhangi bir öneriniz var mı? Ben ai) doğrusal eşitlik ve eşitsizlik kısıtlamaları ile doğrusal olmayan bir işlevi en aza indiriyorum ve ii) işlevin gradyanını ve kendirini kullanıyorum. Eğer yardımcı olursa, en aza indirdiğim fonksiyon Kullback-Liebler ıraksamasıdır . constrOptim sadece eşitsizlik kısıtlamalarıyla …

5
Sıfır içeren giriş verilerine bir Weibull dağılımı nasıl eklenir?
Emekli bir araştırmacı tarafından teslim edilen mevcut bir tahmin algoritmasını yeniden oluşturmaya çalışıyorum. İlk adım, gelecekteki değerleri tahmin etmek için kullanılacak bir şekil ve ölçek elde etmek için gözlemlenen bazı verileri bir Weibull dağılımına sığdırmaktır. Bunu yapmak için R kullanıyorum. İşte benim kod bir örnek: x<-c(23,19,37,38,40,36,172,48,113,90,54,104,90,54,157,51,77,78,144,34,29,45,16,15,37,218,170,44,121) f<-fitdistr(x, 'weibull') Giriş dizisinde …

4
“Moderasyon” mu “etkileşim” mi?
Birçok bağlamda birbirinin yerine kullanılan bu iki terimle karşılaştım. Temel olarak, bir moderatör (M) X ve Y arasındaki ilişkiyi etkileyen bir faktördür. Moderasyon analizi genellikle bir regresyon modeli kullanılarak yapılır. Örneğin, cinsiyet (M) "ürün araştırması" (X) ve "ürün satın alımı" (Y) arasındaki ilişkiyi etkileyebilir. Etkileşimde, X1 ve X2 Y'yi etkilemek …

3
Kesik dağılım ne anlama geliyor?
Dinamik bir sistemin sıradan bir diferansiyel denklem modelinin duyarlılık analizi hakkındaki bir araştırma makalesinde yazar, bir model parametresinin Normal dağılım (ortalama = 1e-4, std = 3e-5) aralığına kesilmiş olarak dağılımını sağlamıştır [0.5e -4 1.5e-4]. Daha sonra modelin simülasyonları için bu kesik dağılımdan örnekler kullanır. Bu kesik dağılımdan kesik bir dağılım …

2
ARMA / ARIMA, karma efekt modellemesi ile nasıl ilişkilidir?
Panel veri analizinde, otomatik korelasyon sorunları (yani gözlemler zaman içinde bireyler içinde kümelenir) ile başa çıkmak için rastgele / karışık efektlere sahip çok seviyeli modeller kullandım. . ARMA / ARIMA benzer sorunları ele almak için tasarlandı. Çevrimiçi bulduğum kaynaklar, ya serileri (ARMA / ARIMA) ya da karma efekt modellerini tartışıyor, …

8
Makine öğrenimi için “sıcak algoritmalar” nelerdir?
Bu, makine öğrenmesini öğrenmeye başlayan birinden naif bir sorudur. Bu günlerde Marsland'dan "Makine Öğrenimi: Algoritmik bir bakış açısı" kitabını okuyorum. Bir tanıtım kitabı olarak yararlı buluyorum, ama şimdi şu anda en iyi sonuçları veren gelişmiş algoritmalara girmek istiyorum. Çoğunlukla biyoinformatikle ilgileniyorum: biyolojik ağların kümelenmesi ve biyolojik dizilerde örüntüler bulmak, özellikle …

1
Dengesiz sınıfları fazla / az örnekleme yaparken, doğruluğu en üst düzeye çıkarmak yanlış sınıflandırma maliyetlerini en aza indirmekten farklı mıdır?
Her şeyden önce, Veri Madenciliği kitaplarının Dengesiz Veri Kümeleri ile nasıl başa çıkılacağını açıklayan bazı ortak düzenleri tanımlamak istiyorum . Genellikle ana bölüm Dengesiz Veri Kümeleri olarak adlandırılır ve bu iki alt bölümü kapsar: Maliyete Duyarlı Sınıflandırma ve Örnekleme Teknikleri. Nadir bir sınıfla ilgili bir sorunla karşı karşıya kaldığınızda hem …

4
İstatistiksel bağlam nasıl sindirilir?
Öncelikle, varsayalım değil bu ilginç sitenin tüm aktif üyeleri iş olarak istatistikçiler bulunmaktadır. Aksi takdirde aşağıdaki soru sorulmasının anlamı yoktur! Onlara elbette saygı duyuyorum, ama kavramsal olmaktan ziyade biraz daha pratik bir açıklamaya ihtiyacım var. Tanımlamak için Wikipedia'dan bir örnekle başlıyorum point process: S, Borel σ-cebiri B (S) ile donatılmış …


3
Levene test fonksiyonu R'de nasıl kullanılır?
Ben istatistiklere bir yeniyim ve R ve Levene işlevini kullanmayla ilgili bir sorunum var (iki örneğin varyansının eşitliğini kontrol etmek istiyorum). Belgeler, çalıştırmam gerektiğini söylüyor: levene.test (y, grup) Ama y ve grup olarak ne koymalıyım bilmiyorum? Varyans eşitliğini kontrol etmek istediğim iki farklı örneğim var. Örneğin değerlerinden birini y, ikincisini …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.