İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Seri korelasyon ile birim köküne sahip olmak arasındaki fark nedir?
Zaman serilerimi ve zaman dizisi olmayan kavramları karıştırıyor olabilirim, ancak seri korelasyon sergileyen bir regresyon modeli ile birim kökü gösteren bir model arasındaki fark nedir? Buna ek olarak, seri korelasyonu test etmek için neden bir Durbin-Watson testi kullanabilirsiniz, ancak birim kökler için bir Dickey-Fuller testi kullanmalısınız? (Ders kitabımda bunun nedeni …

6
Excel'deki çeyrekler
Ben genellikle temel istatistiklerde kullanılırken kullanılan çeyreklik tanımı ile ilgileniyorum. Bir Stat 101 tipi kitabım var ve sadece sezgisel bir tanım veriyor. "Verilerin yaklaşık dörtte biri ilk çeyrekte veya altına düşüyor ..." Ancak, veri kümesi için Q1, Q2 ve Q3 değerlerini hesapladığı bir örnek veriyor 5, 7, 9, 10, 11, …
10 excel  quantiles 

1
Neden sezgilerimize olasılıkla güvenemeyiz?
Eğer bunun netleştiği bir durum varsa Monty Hall problemi vardır. Büyük Paul Erdos bile bu sorundan kandırıldı. Cevaplaması zor olabilecek sorum, bir cevaptan o kadar emin olabileceğimiz ihtimalin ne olduğudur, sezgisel bir argüman ediniriz ve yine de yanlış oluruz. İlk basamaklarla ilgili Benford yasası ve bekleme süresi paradoksu bunun gibi …

3
İstatistiksel anlamlılık kullanarak iki farklı modelin doğruluğu nasıl karşılaştırılır
Zaman serisi tahmini üzerinde çalışıyorum. İki veri ve . Üç tahmin modelim var: . Bu modellerin tümü, veri kümesi örnekler kullanılarak eğitilir ve performansları, veri kümesi örnekler kullanılarak ölçülür . Performans metriklerinin MSE (veya başka bir şey) olduğunu varsayalım. Veri kümesi için ölçülen modellerin MSE olan ve . Bir modelin …

1
Student-t hatalarıyla gerilemeler işe yaramaz mı?
Lütfen düzenlemeye bakın. Ağır kuyruklu verileriniz olduğunda, student-t hatalarıyla gerileme yapmak sezgisel bir şey gibi görünüyor. Bu olasılığı keşfederken, şu makaleyle karşılaştım: Breusch, TS, Robertson, JC ve Welsh, AH (01 Kasım 1997). İmparatorun yeni giysileri: çok değişkenli t regresyon modelinin eleştirisi. Statistica Neerlandica, 51, 3.) ( bağlantı , pdf ) …


1
İki örnek permütasyon testinde kuyrukları ikiye katlama
Varsayalım ki iki örneğimiz var ve bunların aynı dağılımdan çekilip çizilmediğini belirlemek istiyoruz, A, B örnekleri bazı tamsayılardan oluşuyor. Bunu iki örnekli permütasyon testi kullanarak, özellikle örneklerin ortalamalarındaki farklılıkların gözlemlenen fark kadar aşırı olduğu permütasyonlara bakarak test edersek: iki kuyruklu p- kuyruğa bakarak ve olasılığı iki katına çıkararak değer? Ders …

4
Belirli bir baz çifti dizisi bulma olasılığı
Olasılık hakkında düşünmek her zaman sayımda ne kadar kötü olduğumu fark etmemi sağlıyor ... Bir dizi göz önünde temel harfleri , her biri eşit olasılıkla görünmesi. Bu sekansın, uzunluğunda ilgilenilen belirli bir baz çift sekansı içermesi olasılığı nedir ?nnnr ≤ nA,T,C, and GA,T,C, and GA,\; T, \; C, \text{ and …

3
Metin belgesi için özellik vektörü oluşturmak için bigram (N-gram) modeli kullanma ile ilgili
Metin madenciliği için geleneksel özellik yapım yaklaşımı, kelime torbası yaklaşımıdır ve belirli bir metin belgesini karakterize eden özellik vektörünü ayarlamak için tf-idf kullanılarak geliştirilebilir. Şu anda, özellik vektörü oluşturmak için bi-gram dil modeli veya (N-gram) kullanmaya çalışıyorum, ancak bunu nasıl yapacağımı tam olarak bilmiyorum? Sadece kelime torbası yaklaşımını izleyebilir miyiz, …

3
Kümeleme dağılımları
Birkaç dağıtımım var (aşağıdaki şekilde 10 dağıtım). Aslında bunlar histogramlardır: x ekseni üzerinde bir çözeltideki bazı parçacıkların boyutları olan 70 değer vardır ve her x değeri için karşılık gelen y değeri, boyutu x değeri civarında olan parçacıkların oranıdır. Bu dağılımları kümelemek istiyorum. Şu anda örneğin Öklid mesafesiyle hiyerarşik bir kümeleme …
10 clustering 

1
Marjinal ve koşullu modeller arasındaki fark
Bir marjinal modeli her bir kümenin içinde korelasyon oluşturuyor. Bir koşullu modeli de dikkate her kümedeki korelasyonu alır. Sorularım: Marjinal bir model bir popülasyondaki ana etkileri modellerken, bir koşullu model bir küme ve bir popülasyondaki temel etkileri modeller mi? Marjinal bir modelin katsayılarının yorumlanması temelde "normal model" ile aynıdır. Peki …


2
Dichotomous ve sürekli değişken arasındaki korelasyon
İkili ve sürekli değişken arasındaki ilişkiyi bulmaya çalışıyorum. Bu konudaki temel çalışmamdan bağımsız t-testi kullanmak zorunda olduğumu ve bunun için ön koşulun değişkenin dağılımının normal olması gerektiğine karar verdim. Normalliği test etmek için Kolmogorov-Smirnov testi yaptım ve sürekli değişkenin normal olmadığını ve eğri olduğunu gördüm (yaklaşık 4.000 veri noktası için). …



Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.