İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


3
Neden örnek büyük olduğunda ortalamayı tahmin etmek için T-dağılımını kullanmıyorsunuz?
Temel istatistik dersleri, örneklem büyüklüğü n büyük olduğunda (genellikle 30 veya 50'nin üzerinde) bir nüfus parametresinin ortalamasını tahmin etmek için genellikle normal bir dağılım kullanılmasını önerir . Öğrencinin T-dağılımı, numunenin standart sapmasındaki belirsizliği açıklamak için daha küçük numune boyutları için kullanılır. Numune boyutu büyük olduğunda, numune standart sapması popülasyon standart …

3
Nedensellik ile karıştırılmış gerçek Korelasyon örnekleri
Nedensel bir ilişkinin bir korelasyon kanıtından uygunsuz bir şekilde çıkarıldığı özel, gerçek vakalar arıyorum. Özellikle, aşağıdaki ölçütleri karşılayan örneklerle ilgileniyorum: Nedensel ilişkinin varlığı, dikkate değer etkilere sahip olacak kadar geniş bir gerçek olarak kabul edildi (kamu politikası, söylem, bireysel kararlar, vb.). Bağlantı yalnızca korelasyonel kanıtlar temelinde çıkardı (belki de tutarlı …

3
Pdf ve pmf ve cdf aynı bilgileri içeriyor mu?
Pdf ve pmf ve cdf aynı bilgileri içeriyor mu? Benim için pdf tüm olasılığı belirli bir noktaya verir (temel olarak olasılık altındaki alan). Pmf belirli bir noktanın olasılığını verir. Cdf belirli bir noktadaki olasılığı verir. Bana göre pdf ve cdf aynı bilgiye sahip, ancak pmf xdağıtımda bir noktaya olasılık vermediği …


1
Stokastik fonksiyon için kök bulma
Farzedelim ki fonksiyonumuz sadece bir miktar gürültüyle gözlemleyebiliriz. F ( x ) 'i doğrudan hesaplayamayız , sadece f ( x ) + η burada η bazı rastgele gürültüdür. (Uygulamada: Monte Carlo yöntemini kullanarak f ( x ) değerini hesaplıyorum .)f(x)f(x)f(x)f(x)f(x)f(x)f(x)+ηf(x)+ηf(x) + \etaηη\etaf(x)f(x)f(x) Hangi yöntemleri köklerini bulmak için mevcuttur , yani …

2
İstatistiksel bir test p-değerini sıfır verebilir mi?
Sıfıra yakın bir değer (bazı istatistiksel yazılımlar tarafından sıfıra yuvarlanmış) değil, tam anlamıyla sıfır değeri demek istiyorum. Eğer öyleyse, sıfır hipotezinin doğru olduğunu varsayarak elde edilen verileri elde etme olasılığının da sıfır olduğu anlamına mı gelir? Bu tür sonuçları getirebilecek istatistiksel testler nelerdir (bazı örnekler)? "Boş hipotez olasılığı" ifadesini kaldırmak …

2
Ordinal lojistik regresyonun yorumu
Bu sıralı lojistik regresyon R: koştu: mtcars_ordinal <- polr(as.factor(carb) ~ mpg, mtcars) Modelin bu özetini aldım: summary(mtcars_ordinal) Re-fitting to get Hessian Call: polr(formula = as.factor(carb) ~ mpg, data = mtcars) Coefficients: Value Std. Error t value mpg -0.2335 0.06855 -3.406 Intercepts: Value Std. Error t value 1|2 -6.4706 1.6443 -3.9352 …

9
Rand endeksi hesaplama
Bir küme algoritmasının Rand Endeksi'ni nasıl hesaplayacağımı anlamaya çalışıyorum, ancak doğru ve yanlış negatifleri nasıl hesaplayacağım noktasında sıkıştım. Şu anda, Bilgi Edinme Anına Giriş kitabından bir örnek kullanıyorum (Manning, Raghavan ve Schütze, 2009). 359 Sayfasında Rand endeksinin nasıl hesaplanacağı hakkında konuşuyorlar. Bu örnek için üç küme kullanırlar ve kümeler aşağıdaki …
17 clustering 


3
“Test istatistiği” bir değer mi yoksa rastgele bir değişken mi?
Şimdi ilk İstatistikler dersimi alan bir öğrenciyim. "Test istatistiği" terimiyle kafam karıştı. Aşağıda (bunu bazı ders kitaplarında gördüm), , belirli bir örnekten hesaplanan belirli bir değer gibi görünüyor. t = ¯ x - μ 0tttt=x¯¯¯−μ0s/n−−√t=x¯−μ0s/n t=\frac{\overline{x} - \mu_0}{s / \sqrt{n}} Ancak, aşağıda (bunu diğer bazı kitaplarda gördüm), rastgele bir değişken …

1
R kare değeri modelleri karşılaştırmak için uygun mu?
Otomobil seri ilan sitelerinde mevcut fiyatları ve özellikleri kullanarak, otomobil fiyatlarını tahmin etmek için en iyi modeli belirlemeye çalışıyorum. Bunun için scikit-öğrenim kütüphanesinden birkaç model ve pybrain ve neurolab'dan sinir ağı modelleri kullandım. Şu ana kadar kullanılan bir yaklaşım, bazı örneklerle veri sabit bir miktar (makine öğrenme algoritmaları) çalıştırmak ve …


1
Otokorelasyonlu artık paternler, uygun korelasyon yapılarına sahip modellerde bile ve en iyi modellerin nasıl seçileceği?
bağlam Bu soru R kullanır, ancak genel istatistiksel konularla ilgilidir. Ölüm faktörlerinin (hastalık ve parazitliğe bağlı ölüm yüzdesi) zaman içinde güve popülasyonu büyüme hızı üzerindeki etkilerini analiz ediyorum, burada larva popülasyonları 8 yıl boyunca yılda bir kez 12 bölgeden örneklendi. Nüfus artış hızı verileri zaman içinde net fakat düzensiz döngüsel …

1
R'deki “efektler” işlevi ne işe yarar?
Efektler ()R için yardım dosyasındaki açıklamayı anlamıyorum () : lmVeya tarafından takılan doğrusal bir model için aov, etkiler, montaj işlemi sırasında QR ayrışımı tarafından üretilen ardışık dikey alt uzaylar üzerine veri yansıtılarak elde edilen ilişkisiz tek serbestlik dereceli değerlerdir. Herkes bunun ne anlama geldiğini açıklayabilir mi? Dik alt uzaylar, QR …
17 r  regression 

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.