İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
VIF, durum Dizini ve özdeğerler
Şu anda veri kümelerimdeki çoklu bağlantıyı değerlendiriyorum. Hangi VIF eşik değerleri ve altındaki / yukarıdaki koşul indeksi bir sorun olduğunu gösteriyor? VIF: VIF bir sorun olduğunu duydum .≥10≥10\geq 10 İki problem değişkeni kaldırıldıktan sonra her değişken için VIF . Değişkenlerin daha fazla tedaviye ihtiyacı var mı veya bu VIF iyi …

2
Boxplot'ta medyan yerine ortalamayı göster [kapalı]
Kapalı. Bu soru konu dışı . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Sorunuzu güncelleyin o yüzden -konu üzerinde Çapraz doğrulanmış için. 5 ay önce kapalı . Bir kutu grafiğini python matplotblib ile çizerken, grafiğin yarısındaki çizgiler dağıtımın medyanıdır. Bunun yerine çizgi ortalamaya sahip olma olasılığı var …

2
Gibbs örneklemesinde koşulların tamamı nereden geliyor?
Metropolis-Hastings ve Gibbs örneklemesi gibi MCMC algoritmaları, eklem posterior dağılımlarından örnekleme yollarıdır. Metropolis-acele etmeyi oldukça kolay anladığımı ve uygulayabildiğimi düşünüyorum - sadece bir şekilde başlangıç ​​noktalarını seçiyorsunuz ve posterior yoğunluk ve teklif yoğunluğu tarafından yönlendirilen 'parametre boşluğunu' rastgele yürüyorsunuz. Gibbs örneklemesi, bir kerede yalnızca bir parametreyi güncellerken, diğerlerini sabit tutarken, …
15 bayesian  mcmc  gibbs 

2
Rasgele sayılar ve çok çekirdekli paket
R'de programlama yaparken, çok çekirdekli paketi birkaç kez kullandım. Ancak, rastgele sayıları nasıl işlediğine dair bir açıklama görmedim. OpenMP'yi C ile kullandığımda, uygun bir paralel RNG kullanmaya dikkat ediyorum, ancak R ile mantıklı bir şey olduğunu varsayıyorum. Herkes mantıklı bir şey olduğunu doğrulayabilir mi? Misal Dokümantasyondan, x <- foreach(icount(1000), .combine …


4
Karışık efekt modellerinin aynı sayıda serbestlik derecesi ile karşılaştırılması
Burada soyutlamaya çalışacağım bir deneyim var. Önünüzde üç beyaz taşı fırlattığımı ve onların konumları hakkında bir yargıya varmanızı istediğimi düşünün. Taşların çeşitli özelliklerini ve cevabınızı kaydediyorum. Bunu birkaç konu üzerinde yapıyorum. İki model üretiyorum. Birincisi, size en yakın taşın cevabınızı tahmin etmesi, diğeri ise taşların geometrik merkezinin cevabınızı öngörmesidir. Yani, …

4
Zaman serilerinin istatistiksel benzerliği
Birinin periyot, maksimum, minimum, ortalama vb. gerçek veriler varsayılan modele ne kadar uyuyor? Serideki veri noktalarının sayısı 10 ile 50 arasında değişecektir. Benim çok basit bir ilk düşüncem sinüs dalgasının yönlü hareketine bir değer atfetmekti, yani +1 +1 +1 +1 -1 -1 -1 -1 -1 -1 -1 -1 +1 +1 …

3
Bazılarınız istatistiksel çalışmanızı başkalarıyla paylaşmak ve paylaşmak için Google Dokümanlar e-tablosunu kullanıyor mu?
Çoğunuzun Google Dokümanlar'ın hala ilkel bir araç olduğunu düşündüğünü biliyorum. Matlab veya R ve Excel bile değil. Yine de, sadece bir tarayıcının işletim yeteneğini kullanan (ve çok farklı çalışan birçok tarayıcıyla uyumlu) bu web tabanlı yazılımın gücünde şaşkına döndüm. Bu forumda aktif olan Mike Lawrence, Google Dokümanlar'ı kullanarak onunla oldukça …

5
Grafiksel olarak çok sayıda veri göstermenin iyi bir yolu
Konut verileri için 14 değişken ve 345.000 gözlem içeren bir proje üzerinde çalışıyorum (yıl, kare görüntüleri, satılan fiyat, ikamet yeri vb.). İyi grafik teknikleri ve güzel çizim teknikleri içeren R kütüphaneleri bulmaya çalışmakla ilgileniyorum. Zaten ggplot ve kafeste neyin iyi çalışacağını görüyorum ve bazı sayısal değişkenlerim için keman grafikleri yapmayı …

10
Veri madenciliği yazılım araçlarının incelenmesi
Mühendis olarak eğitilmiş olmama rağmen, veri madenciliğiyle daha fazla ilgilendiğimi fark ettim. Şu anda alanı daha fazla araştırmaya çalışıyorum. Özellikle, var olan farklı yazılım araçları kategorilerini ve her kategoride hangi araçların ve neden önemli olduğunu anlamak istiyorum. ("En iyi" araçları söylemediğimi unutmayın, sadece önemli olanlar bir alev savaşı başlattığımız sürece.) …

4
Meta-analizin iyi bir giriş tedavisi aranması
(İstatistikçi olmayan) bir meslektaş, tıbbi dergiler için incelediği makalelerde meta-analizlerle karşılaşıyor ve kendini eğitebilmesi için iyi bir giriş seviyesi tedavi arıyor. Herhangi bir tavsiye? Favoriler? Kitaplar, monograflar, teknik olmayan anket makaleleri iyi olurdu. (Evet, Wikipedia girişini ve Jerry Dallal'ın güzel küçük makalesi gibi bir Google aramasıyla kolayca erişilebilen diğer şeyleri …

9
Hangi kitaplar bilgisayar bilimleri için geçerli olduğu için hesaplama istatistiklerine genel bir bakış sağlar?
Bir yazılım mühendisi olarak, istatistiksel algoritmalar, veri madenciliği, makine öğrenimi, Bayes ağları, sınıflandırma algoritmaları, sinir ağları, Markov zincirleri, Monte Carlo yöntemleri ve rasgele sayı üretimi gibi konularla ilgileniyorum. Şahsen bu tekniklerin hiçbiriyle uygulamalı çalışma zevkim olmadı, ama kaputun altında onları kullanan ve onlar hakkında daha fazla bilgi edinmek isteyen yazılımlarla …

5
Makine öğrenimi tekniklerinin küçük örnek klinik çalışmalarda uygulanması
Bir sınıflandırma bağlamında ilginç öngörücüler izole etmek olduğunda küçük örnek klinik çalışmalarda Rastgele Ormanlar veya cezalandırılmış regresyon (L1 veya L2 cezası veya bunların bir kombinasyonu ile) gibi makine öğrenme tekniklerini uygulamak hakkında ne düşünüyorsunuz? Model seçimi ile ilgili bir soru değil, değişken etki / önem için en uygun tahminlerin nasıl …

5
James-Stein 'vahşi doğada' küçülüyor mu?
James-Stein büzülme fikri ile alınıyorum (yani, muhtemelen bağımsız normallerden oluşan bir vektörün tek bir gözleminin doğrusal olmayan bir işlevi, 'daha iyi' nin kare hata ile ölçüldüğü rasgele değişkenlerin ortalamalarının daha iyi bir tahmincisi olabilir. ). Ancak, bunu uygulamalı çalışmalarda hiç görmedim. Açıkçası yeterince iyi değilim. James-Stein'ın uygulamalı bir ortamda tahmini …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.