İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


2
Genelleştirilmiş Doğrusal Karışık Modeller: Teşhis
Rastgele bir kesişim lojistik regresyonum var (tekrarlanan ölçümler nedeniyle) ve özellikle aykırı değerler ve etkili gözlemlerle ilgili bazı teşhisler yapmak istiyorum. Göze çarpan gözlemler olup olmadığını görmek için artıklara baktım. Ama aynı zamanda Cook'un mesafesi veya DFFITS gibi bir şeye bakmak istiyorum. Hosmer ve Lemeshow (2000), ilişkili veriler için model …

5
Sürekli rasgele değişkenin sabit bir nokta alma olasılığı
Sürekli rasgele değişkenler için olasılık yoğunluk fonksiyonunun olarak olarak tanımlandığı bir giriş istatistik sınıfındayım . integralinin anlıyorum ama bunu sürekli rastgele değişken sezgilerimle düzeltemiyorum. Diyelim ki X, trenin geldiği dakikadan bu yana geçen dakika sayısına rastgele bir değişkendir. Trenin tam olarak 5 dakika sonra gelme olasılığını nasıl hesaplayabilirim? Bu olasılık …

1
Başka bir testin sonucuna göre hipotez testleri yapılması üzerine makale
Başka bir istatistiksel testin sonucuna dayalı bir istatistiksel test seçmenin problemli olduğu iyi bilinmektedir, çünkü p-değerlerini yorumlamak imkansızdır (örn . Başka bir sonuca dayalı bir istatistiksel test seçmek (örn. Normalite) ) . Bununla birlikte, bu hala birçok uygulamada standart bir uygulamadır ve genellikle uygulamalı makalelerde fark edilmemiş veya tartışılmamıştır. Literatüre …

1
Sigmoid eğrinin düz kısmının eğiminin hesaplanması
Bana bu görev verildi ve çok şaşırdım. Bir meslektaşım benden aşağıdaki grafiğin ve değerlerini tahmin etmemi istedi :xupperxupperx_{upper}xlowerxlowerx_{lower} Eğri aslında kümülatif bir dağılımdır ve x bir tür ölçümdür. Kümülatif fonksiyon düzleşmeye ve düz olmaktan sapmaya başladığında x'in karşılık gelen değerlerinin ne olduğunu bilmek ister. Bir noktada eğimi bulmak için farklılaşmayı …

1
Tahmin aralığı = güvenilir aralık?
Tahmin aralığının ve güvenilir aralığın aynı şeyi değerlendirip değerlendirmediğini merak ediyorum. Örneğin, doğrusal bir regresyon ile, takılan değerlerin tahmin aralığını tahmin ettiğinizde, değerinizin düşmesini beklediğiniz aralığın sınırlarını tahmin edersiniz. Bir güven aralığının tersine, ortalama değer gibi bir dağıtım parametresine değil, açıklanan değişkeninizin belirli bir X değeri için alabileceği değere ( …

1
Hiyerarşik Gamma-Poisson modeli için aşırı yoğunluk
Verileri bir hiyerarşik model içerisinde burada \ lambda \ sim \ textrm {Gama} (\ a \ P) uygulamada tipik olarak görünmektedir değerlerine (seçilmek için \ alfa, \ beta) gama dağılımının ortalaması ve varyansı kabaca y verilerinin ortalaması ve varyansı ile kabaca eşleşecektir (örneğin, Clayton ve Kaldor, 1987 "Hastalık Haritalaması için …

2
Küçük numunelerle randomizasyon güvenilir midir?
Jerome Cornfield şunu yazdı: Balıkçı devriminin en iyi meyvelerinden biri, rasgeleleştirme fikriydi ve birkaç başka şey üzerinde anlaşan istatistikçiler en azından bu konuda anlaştılar. Ancak bu anlaşmaya ve klinik ve diğer deney şekillerinde randomize tahsis prosedürlerinin yaygın olarak kullanılmasına rağmen, mantıksal durumu, yani tam olarak yerine getirdiği işlev hala belirsizdir. …

1
R'de yapılan bir önyüklemenin çıktısını anlama (tsboot, MannKendall)
R'deki tsboot çağrısının yorumlanmasıyla ilgili bir sorum var. Hem Kendall hem de önyükleme paketinin belgelerini kontrol ettim, ancak eskisinden daha akıllı değilim. Örneğin test paketinin Kendall'ın tau olduğu Kendall paketindeki örneği kullanarak bir bootstrap çalıştırdığımda: library(Kendall) # Annual precipitation entire Great Lakes # The Mann-Kendall trend test confirms the upward …
11 r  bootstrap 

2
“Kademeli regresyon” nasıl çalışır?
Bir probit modeline uyması için aşağıdaki R kodunu kullandım: p1 <- glm(natijeh ~ ., family=binomial(probit), data=data1) stepwise(p1, direction='backward/forward', criterion='BIC') Ben yok ne olduğunu bilmek istiyorum stepwiseve backward/forwardtam olarak ne yapacağını ve nasıl değişkenleri seçmek?


2
Birden çok engellenmiş veri kümesinde yapılan testlerde havuzlanmış p değerleri nasıl elde edilir?
Amelia'yı R'de kullanarak, birden fazla gizli veri kümesi elde ettim. Bundan sonra, SPSS'de tekrarlanan bir ölçüm testi yaptım. Şimdi, test sonuçlarını havuzlamak istiyorum. Rubin kurallarını (R'deki herhangi bir çoklu imputasyon paketi aracılığıyla uygulanır) havuz araçlarını ve standart hataları havuzlamak için kullanabileceğimi biliyorum, ancak p-değerlerini nasıl havuzlayabilirim? Mümkün mü? R'de bunu …

1
Çapraz doğrulama kullanırken ortalama hassasiyet ve hatırlama
2 sınıf etiketli veriler için birden fazla sınıflandırıcı kullanarak sınıflandırma yaptım ve 5 kat çapraz doğrulama kullandım. Her kat için tp, tn, fp ve fn hesapladım. Sonra her test için doğruluk, kesinlik, geri çağırma ve F-skorunu hesapladım. Sorum şu: Sonuçları ortalamak istediğimde, ortalama doğrulukları aldım, ancak hassasiyeti, hatırlamayı ve F-puanını …

4
Genelleştirilmiş bir artırılmış regresyon modelinde ağaç sayısı nasıl seçilir?
GBM'deki ağaç sayısını seçmek için bir strateji var mı? Özellikle, ntreesiçinde argüman Rbireyin gbmfonksiyonu. Neden ntreesen yüksek değere ayarlamamanız gerektiğini anlamıyorum . Daha fazla sayıda ağacın birden fazla GBM'den elde edilen sonuçların değişkenliğini açıkça azalttığını fark ettim. Çok sayıda ağacın aşırı sığmaya yol açacağını düşünmüyorum. Düşüncesi olan var mı?

2
Hangi ortamlarda örnek boyutu arttıkça güven aralıkları daha iyi olmazdı?
Bir blog gönderisinde , "Ben WG Cochrane ilk gözlem (kabaca 1970'lerde) bir gözlem ortamında güven aralıklarla, küçük örnek boyutları sıfır kapsama alanı sağlayan yeterince büyük örnekleri ile daha iyi kapsama neden olduğuna inanıyorum!" Şimdi, CI genişliğinin artan örnek boyutu ile 0'a yaklaşması gerektiğini varsayıyorum, ancak kapsamın aynı anda kötüleşeceği fikri …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.