İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Temel bileşen analizi ile yazışma analizinin kullanılması
İntertidal topluluklarla ilgili bir veri setini analiz ediyorum. Veriler kuadratlarda yüzde örtüsü (deniz yosunu, kıskaç, midye, vb.) Tür sayısı açısından yazışma analizi (CA) ve doğrusal çevresel (tür değil) eğilimler için daha yararlı bir şey olarak temel bileşen analizi (PCA) hakkında düşünmeye alışkınım . PCA veya CA'nın yüzde kapak için daha …



3
İstatistiksel ekoloji hakkında kitaplar?
Bu sorunun daha önce sorulduğunu biliyorum: Ekolojik çalışmalar için referans kitabı ama aradığım şey bu değil. Ne aradığım kimse istatistiksel ekoloji hakkında iyi bir kitap (veya kanonik bir referans) tavsiye eğer? İstatistikleri çok iyi anlıyorum, böylece kitap gerçekten herhangi bir seviyede olabilir. Kitabı kendime ekolojide istatistiğin uygulanması hakkında her şeyden …

4
Sürekli bağımlı değişken için lojistik regresyon kullanma
Son zamanlarda araştırma makalem için bir revizyon aldım ve aşağıdaki incelemenin makalemdeki yorumu: bir modelden elde edilen sonuçlar oldukça ikna edici değildir, özellikle doğrusal regresyon genellikle aykırı değerlerle başa çıkmada eksikliklere sahiptir. Yazarların lojistik regresyonu denemelerini ve ilgili sonuçları güncel sonuçlarla karşılaştırmasını öneriyorum. Benzer gözlemler elde edilirse, sonuçlar daha katı …

2
Tahmin Aralığı Hesaplama
Burada aşağıdaki veriler var . Hidrokarbon yüzdesi 1.0 olduğunda ortalama saflıkta% 95 güven aralığını hesaplamaya çalışıyorum. R harfine şunu giriyorum. > predict(purity.lm, newdata=list(hydro=1.0), interval="confidence", level=.95) fit lwr upr 1 89.66431 87.51017 91.81845 Ancak, bu sonucu kendim nasıl elde edebilirim? Aşağıdaki denklemi kullanmaya çalıştım. sn e w=s2( 1 +1N-+(xn e w-x¯)2∑ …


1
Geleneksel bir anlamı var mı
Bayesian eğri uydurma hakkında bir makale okuyordum ( Dimatteo ve ark., Serbest düğüm kamaları ile Bayes eğri uydurma, 2001 ) ve sembolü ile . Kağıt boyunca birkaç kez kullanılır, ancak asla açıkça tanımlanmaz. Birkaç google ve stackexchange aramasından sonra, simge ne yaygın olarak kullanılmıyor ne de geleneksel olarak tanımlanıyor gibi …

1
Keman çizimleri yorumu
Keman parsellerini kullanarak farklı grupların dağılımını karşılaştırıyorum, ancak bulduğum çevrimiçi kaynakların çoğu sadece parsellerin nasıl yapılacağı ve sonuçların çok temel yorumlanmasıyla ilgili (medyan varyasyon, veriler kümelenmiş veya değil). Keman grafiklerini doğru bir şekilde yorumlamak için rehberim olarak izleyebileceğim ayrıntılı örnekler arıyorum.


2
Hassasiyet ve özgüllüğü birleştiren sınıflandırıcı performans ölçüsü mü?
Birden fazla sınıflandırıcı kullanarak sınıflandırma yaptığım 2 sınıf etiketli veri var. Ve veri kümeleri dengelidir. Sınıflandırıcıların performansını değerlendirirken, sınıflandırıcının sadece gerçek pozitifleri değil, aynı zamanda gerçek negatifleri de belirlemede ne kadar doğru olduğunu göz önünde bulundurmam gerekir. Bu nedenle, doğruluk kullanırsam ve sınıflandırıcı pozitiflere karşı önyargılıysa ve her şeyi pozitif …

3
İlk kez öğretmen için öneriler (Biyoistatistiğe Giriş)
Bu sonbaharda birinci sınıfımı öğretiyorum (Biyoistatistiğe Giriş). İstatistikleri daha iyi öğretmek için önerisi olan var mı? Belki de ilk öğretmeninizin kullanmasını istediğiniz bir örnek? Pagano ve Gauvreau'nun Biyoistatistik İlkelerini kullanıyorum. DETAYLARI DÜZENLE Bu sınıf, haftada iki kez 1,5 saat boyunca toplanan çevrimiçi bir sınıftır. Öğrenciler küçük bir tablet / kalem …

5
Sınıf etiketlerinin yaklaşık% 100'ü bir sınıfa ait olduğunda bir sınıflandırıcının performansı nasıl ölçülür?
Verilerimde, olarak belirtilen bir sınıf değişkenim var . Bu sınıf değişkeni değerleri (ikili) şeklindedir. neredeyse tüm gözlemleri 0'dır (% 100'e yakın, daha kesin olarak% 97). Farklı sınıflandırma modelleri üzerinde bir "performans" testi istiyorum (doğruluk olabilir). Olmaktan korktuğum, gözlemleri her zaman sınıf 0'da sınıflandıran bir sınıflandırma modelim varsa, o zaman bu …

1
Deneylerin (optimal) istatistiksel tasarımı için iyi, kullanışlı ve karakteristik deneyler
Deneysel tasarımın uygulanabileceği fenomenler, alternatif geçerli tasarım stratejilerinden daha fazladır. Bu doğru olmalıdır, ancak bir deneyi düzgün bir şekilde tasarlamanın birçok yolu vardır. Farklı tipteki en uygun deney tasarımları için değeri ve nüansı gerçekten gösteren en iyi "problemler" nelerdir? (A, D, E, C, V, phi, ....) Kitaplar, bağlantılar, makaleler, referanslar …

1
Yüzdelikleri yordayıcı olarak kullanmak - iyi fikir?
Doğrusal regresyon kullanarak bir müşterinin günlüğünü (harcamasını) öngören bir sorun düşünüyorum. Hangi özellikleri girdi olarak kullanacağımı düşünüyor ve değişkenin yüzdelik değerini girdi olarak kullanmanın uygun olup olmadığını merak ediyorum. Mesela şirketlerin gelirini girdi olarak kullanabilirim. Merak ettiğim şey bunun yerine şirketin gelir yüzdelik dilimini kullanıp kullanamayacağım. Başka bir örnek kategorik …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.