İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


8
“Lab notebook” yazılımı için fikirler?
Bu yüzden bu garip bir uyum, ama gerçekten herhangi bir site için garip bir uyum olduğunu düşünüyorum, bu yüzden burada, veri-crunching kardeşlerim arasında denemek düşündüm. Biyolojiden epidemiyoloji ve biyoistatistiklere geldim ve yine de bu alandan kesinlikle bazı alışkanlıklar alıyorum. Bunlardan biri laboratuvar defteri tutmak. Analizle ilgili düşünceleri, kararları, takıntıları, vb. …

2
Binom regresyonu ile lojistik regresyon arasındaki fark nedir?
Her zaman lojistik regresyonu, link fonksiyonunun lojistik fonksiyon olduğu özel bir binom regresyon vakası olarak düşündüm (bunun yerine bir probit fonksiyonu). Yine de sahip olduğum başka bir sorunun cevabını okurken, kafam karışmış gibi görünebilir ve lojistik regresyon ile lojistik regresyon ile binom regresyon arasında bir fark vardır. Fark ne?

3
Piklerin spektral yoğunluktaki önemini test etme
Bazen zaman serilerinde periyodikliği analiz etmek için spektral yoğunluk grafiğini kullanırız. Normalde grafiği görsel inceleme ile analiz eder ve sonra periyodiklik hakkında bir sonuç çıkarmaya çalışırız. Ancak istatistikçiler, arsadaki ani artışların beyaz gürültüden istatistiksel olarak farklı olup olmadığını kontrol etmek için herhangi bir test geliştirdiler mi? R-uzmanları spektral yoğunluk analizi …

2
Momentleri kullanarak bir tamsayı akışı için yaklaşık miktarları hesapla?
göç math.stackexchange . Uzun bir tamsayı akışı işliyorum ve çok fazla veri saklamadan akış için çeşitli yüzdelikleri yaklaşık olarak hesaplayabilmek için birkaç dakikayı izlemeyi düşünüyorum. Birkaç andan itibaren persentilleri hesaplamanın en basit yolu nedir? Yalnızca az miktarda veri depolamayı içeren daha iyi bir yaklaşım var mı?

6
Basit doğrusal regresyon çıktı yorumu
Ben korelasyon olup olmadığını belirlemek için 2 değişken doğal günlüğünde basit bir doğrusal regresyon çalıştırın. Benim çıktı şu: R^2 = 0.0893 slope = 0.851 p < 0.001 Kafam karıştı. değerine baktığımda, çok yakın olduğu için iki değişkenin birbiriyle ilişkili olmadığını söyleyebilirim . Bununla birlikte, regresyon çizgisinin eğimi neredeyse (arsada neredeyse …

2
Oran verisini dönüştürme: arcsin karekökü yeterli olmadığında
Yüzde / orantı verileri için arsin kare kök dönüşümüne (daha güçlü?) Bir alternatif var mı? Şu anda üzerinde çalıştığım veri setinde, bu dönüşümü uyguladıktan sonra belirgin heteroseladastisite kalıyor, yani artık değerlere karşı yerleştirilmiş değerlerin çizimi hala çok fazla bakımlı. Yorumlara yanıt vermek için düzenlendi: veriler, bir bağışın% 0-100'ünü% 10'un katlarına …

2
Psikolojide gözlemsel çalışmaları analiz etmek için yapısal eşitlik modellemesinin kullanılıp kullanılmayacağı
Bu sorunun istatistiksel danışmanlık ortamlarında çok geliştiğini fark ettim ve düşüncelerinizi almaya hevesliyim. bağlam Genellikle yaklaşık olarak bir çalışma yapan araştırma öğrencileriyle konuşurum: Gözlemsel çalışma Örnek boyutu 100, 200, 300 vb. Olabilir. Çoklu psikolojik ölçekler ölçülmüştür (örneğin, belki de kaygı, depresyon, kişilik, tutumlar, diğer klinik ölçekler, belki de zeka vb.) …

3
R'de çok terimli bir logit modeli nasıl kurulur ve tahmin edilir?
JMP'de bir multinomial logit modeli çalıştırdım ve her bir parametre tahmini için AIC ve ki-kare p-değerlerini içeren sonuçları geri aldım. Modelin bir kategorik sonucu ve 7 kategorik açıklayıcı varyasyonu vardır. Sonra nnet paketindeki multinomişlevi kullanarak, R aynı modeli inşa düşündüğüm uygun . Kod temel olarak: fit1 <- multinom(y ~ x1+x2+...xn,data=mydata); …
20 r  logistic  multinomial  logit  jmp 

2
StackExchange soruları için “ilginçlik” işlevi
StackExchange siteleri için bir veri madenciliği paketi bir araya getirmeye çalışıyorum ve özellikle, "en ilginç" soruları belirlemeye çalışırken sıkışmış. Soru puanını kullanmak istiyorum, ancak görüşlerin sayısı nedeniyle önyargıyı kaldırıyorum, ancak buna titizlikle nasıl yaklaşacağımı bilmiyorum. İdeal dünyada, soruları hesaplayarak sıralayabilirim; burada , oyların toplamı ve , görüntülenme sayısıdır. Ne de …

10
Hangisi sıfır hipotezi? Bilim teorisi, mantık ve istatistik arasındaki çatışma?
Sıfır hipotezini belirlemede temel mantığı anlamakta güçlük çekiyorum . Bu cevapta , açıkça kabul edilen genel önermenin, sıfır hipotezinin, hiçbir etkisinin olmayacağı, her şeyin aynı kaldığı, yani güneş altında yeni hiçbir şeyin olmadığı hipotezi olduğu belirtilmektedir. Alternatif hipotez, kanıtlamaya çalıştığınız şeydir, örneğin yeni bir ilacın vaatlerini yerine getirdiği. Şimdi bilim …

2
Mevsimsel ayrışma yönteminin seçilmesi
Mevsimsel düzeltme , daha ileri araştırmalar için verilerin önişleminde önemli bir adımdır. Ancak araştırmacının trend döngüsü-mevsimsel ayrışma için bir dizi seçeneği vardır. En yaygın (ampirik literatürdeki atıf sayısına göre değerlendirilir) rakip mevsimsel ayrışma yöntemleri X-11 (12) -ARIMA, Tramo / Koltuklar (her ikisi de Demetra + 'da uygulanır ) ve ' …


4
Ortalama korelasyon değerleri
Diyelim ki Y, değişkenin Xfarklı deney koşulları altında değişkene nasıl bağlı olduğunu test ediyorum ve aşağıdaki grafiği elde ediyorum : Yukarıdaki grafikteki kesik çizgiler, her veri dizisi (deney düzeneği) için doğrusal regresyonu temsil eder ve açıklamadaki sayılar, her veri serisinin Pearson korelasyonunu gösterir. Ben arasına "ortalama korelasyon" (veya "ortalama korelasyon") …

1
NYTimes'de istatistiksel yöntemin kötüye kullanılması hakkında makale
Bu makaleye atıfta bulunuyorum: http://www.nytimes.com/2011/01/11/science/11esp.html Aşağıdaki deneyi düşünün. Bir madalyonun kafalara doğru hafif ağırlıklı olduğuna inanmak için bir neden olduğunu varsayalım. Bir testte, madeni para 1000 üzerinden 527 kez geliyor. Bu madalyonun ağırlıklı olduğuna dair önemli bir kanıt mı? Klasik analiz evet diyor. Adil bir madeni para ile, 1.000 döndürmede …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.