İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Kırpma yüzdesi ile kırpılmış ortalama grafiğini nasıl yorumlayabilirim?
Bir ödev sorusunun bir kısmı için, en küçük ve en büyük gözlemi silerek ve sonucu yorumlayarak bir veri kümesi için kesilmiş ortalamaları hesaplamam istendi. Kesilen ortalama, eşi görülmemiş ortalamadan daha düşüktü. Benim yorumum, bunun altında yatan dağılımın olumlu bir şekilde eğrilmiş olmasıydı, bu nedenle sol kuyruk sağ kuyruktan daha yoğundu. …

3
Doğrusal regresyonda kullanılacak Gauss Temeli fonksiyon parametrelerini anlama
Gauss temel işlevini doğrusal regresyon uygulamasına uygulamak istiyorum. Ne yazık ki temel işlevi birkaç parametreleri anlamakta zorlanıyorum. Özellikle ve .σμμ\muσσ\sigma Veri setim 10.000 x 31 bir matristir. 10.000 örnek ve 31 özellik. Ben okudum "Her temel işlevi giriş vektörü x skaler bir değere dönüştürür". Bu yüzden x'in 1 örnek olduğunu …

4
Aykırı değerleri kaldırmak için iyi bir form mu?
Yazılım derlemeleri için istatistikler üzerinde çalışıyorum. Başarılı / başarısız ve geçen süre için her yapı için veri var ve biz bu / hafta ~ 200 üretiyoruz. Başarı oranının toplanması kolaydır,% 45'inin herhangi bir hafta geçtiğini söyleyebilirim. Ancak geçen süreyi de toplamak istiyorum ve verileri çok kötü bir şekilde yanlış tanıtmadığımdan …

2
SAS PROC GLIMMIX neden bir binom glmm için glmer'den (lme4) çok farklı rastgele eğimler veriyor?
Ben, R'ye daha aşina bir kullanıcıyım ve dört habitat değişkeni için 5 yaşın üzerindeki yaklaşık 35 kişi için rastgele eğimler (seçim katsayıları) tahmin etmeye çalışıyorum. Yanıt değişkeni, bir konumun "kullanıldı" (1) veya "kullanılabilir" (0) habitat (aşağıda "kullanım") olup olmadığıdır. Windows 64 bit bilgisayar kullanıyorum. R sürüm 3.1.0, aşağıdaki veri ve …

3
ve rezidüel sapma serbestlik derecelerini kullanarak lojistik regresyon katsayılarının test edilmesi
Özet: Standart normal dağılım yerine lojistik regresyon katsayılarının testleri için dağılımının (rezidüel sapmaya dayalı serbestlik dereceleriyle) kullanımını destekleyen herhangi bir istatistiksel teori var mı ?ttt Bir süre önce SAS PROC GLIMMIX'a bir lojistik regresyon modeli takarken, varsayılan ayarların altında lojistik regresyon katsayılarının standart normal dağılım yerine dağılımı kullanılarak test edildiğini …

3
Verilerin sıfır ortalaması olması fikri
Sıklıkla, bir veri kümesinin bir boyutunu / özelliğini, ortalamanın tüm öğelerden kaldırılmasıyla sıfır ortalama olarak görüyorum. Ama bunu neden yapacağımı hiç anlamadım? Bunu bir önişleme adımı olarak yapmanın etkisi nedir? Sınıflandırma performansını artırıyor mu? Veri kümesi hakkında bir şeyler yanıtlamaya yardımcı olur mu? Verileri anlamak için bir görselleştirme yaparken yardımcı …

1
R'de arabuluculuk analizinden elde edilen çıktıları kavrama
Paketin skeçini kullanarak kafamı R'deki arabuluculuk paketinin etrafına getirmeye çalışıyorum. mediate()Fonksiyonun çıktısını anlamak için uğraşıyorum . require("mediation") require("sandwich") data("framing") med.fit <- lm(emo ~ treat + age + educ + gender + income, data = framing) out.fit <- glm(cong_mesg ~ emo + treat + age + educ + gender + income, …
12 r  mediation 

3
Verileri Yeniden Şekillendirmek / Yeniden Yapılandırmak için en iyi yol nedir?
Ben bir laboratuvar için araştırma görevlisiyim (gönüllü). Ben ve küçük bir grup, büyük bir çalışmadan alınan bir veri kümesi için veri analizi ile görevlendirildik. Ne yazık ki, veriler bir tür çevrimiçi uygulama ile toplanmış ve verilerin en kullanışlı biçimde çıkması için programlanmamıştır. Aşağıdaki resimler temel sorunu göstermektedir. Bunun "Yeniden Şekillendirme" …
12 r  excel  data-cleaning 

4
Bir trend durağan serisi ARIMA ile modellenebilir mi?
ARIMA (X) ile modelleme için gereken sabit seriler hakkında bir sorum / karışıklığım var. Bunu daha çıkarsama (bir müdahalenin etkisi) olarak düşünüyorum, ancak çıkarımın karşıt tahmininin yanıtta herhangi bir fark yaratıp yaratmadığını bilmek istiyorum. Soru: Okuduğum tüm tanıtım kaynakları, serinin durağan olması gerektiğini, bu bana mantıklı geldiğini ve arimadaki "I" …

3
Üstel üst sınır
Diyelim ki IID rasgele değişkenleri ve dağıtım . Biz bir örneğini gözlemlemek için gidiyoruz 'şu şekilde s: let bağımsız varsayalım, rastgele değişkenler hepsi ' ın ve 'ler bağımsızdır ve örneklem boyutunu tanımlayın . 'hangisinin ler gösterir numunede olan s', ve tanımlanan örnek başarıların kısmını okumak isteyen X1,…,XnX1,…,XnX_1,\dots,X_nBer(θ)Ber(θ)\mathrm{Ber}(\theta)XiXiX_iY1,…,YnY1,…,YnY_1,\dots,Y_nBer(1/2)Ber(1/2)\mathrm{Ber}(1/2)XiXiX_iYiYiY_iN=∑ni=1YiN=∑i=1nYiN=\sum_{i=1}^n Y_iYiYiY_iXiXiX_iε>0PrZ={1N∑ni=1XiYi0ifN>0,ifN=0.Z={1N∑i=1nXiYiifN>0,0ifN=0. Z = …

3
A / B testi için hangi istatistiksel test kullanılır?
Her biri 1000 numuneden oluşan iki grup var. Her grupta 2 miktar ölçüyoruz. Birincisi ikili bir değişkendir. İkincisi, ağır kuyruk dağılımını takip eden gerçek bir sayıdır. Her bir metrik için hangi grubun en iyi performansı gösterdiğini değerlendirmek istiyoruz. Aralarından seçim yapabileceğiniz birçok istatistiksel test vardır: insanlar z-testi önerir, diğerleri t-testi …
12 ab-test 

2
Normal olarak dağılmış X ve Y'nin normal olarak dağılmış artıklara neden olma olasılığı daha yüksektir?
Burada doğrusal regresyonda normallik varsayımının yanlış yorumlanması tartışılmıştır ('normallik' artıklardan ziyade X ve / veya Y'yi ifade eder) ve poster normal olarak dağılmamış X ve Y'ye sahip olmanın mümkün olup olmadığını sorar ve hala normal olarak dağılmış kalıntıları vardır. Benim sorum: normal olarak dağıtılan X ve Y'nin normal olarak dağıtılan …


1
Neden her zaman bootstrap CI kullanmıyorsunuz?
Bootstrap CI'lerin (ve bartikülerdeki BCa) normal olarak dağıtılan verilerde nasıl performans gösterdiğini merak ediyordum. Çeşitli dağıtım türlerindeki performanslarını inceleyen çok fazla iş var gibi görünüyor, ancak normal olarak dağıtılan veriler üzerinde hiçbir şey bulamadı. İlk önce çalışmak bariz bir şey gibi göründüğünden, sanırım kağıtlar çok eski. R önyükleme paketini kullanarak …

3
Bilinmeyen dağılım verileri nasıl normalleştirilir
Belirli bir türde tekrarlanan ölçüm verilerinin en uygun karakteristik dağılımını bulmaya çalışıyorum. Temel olarak, jeoloji dalımda, bir olayın ne kadar zaman önce gerçekleştiğini (kaya eşik sıcaklığının altında soğutulmuş) bulmak için sıklıkla numunelerden (kaya parçaları) minerallerin radyometrik tarihlendirmesini kullanırız. Tipik olarak, her bir numuneden birkaç (3-10) ölçüm yapılacaktır. Daha sonra ortalama …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.