İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

3
Kümelenmenin veri çıktısı nasıl çizilir?
Bir veri kümesini (işaretler kümesi) kümelemeyi denedim ve 2 küme aldım. Grafiksel olarak temsil etmek istiyorum. (X, y) koordinatlarına sahip olmadığım için temsili biraz karıştı. Ayrıca bunu yapmak için MATLAB / Python işlevi arıyor. DÜZENLE Bence veri yayınlamak soruyu daha açık hale getiriyor. Python (scipy kullanarak) kmeans kümeleme kullanarak yaptığım …

2
R'nin artırılmış Dickey Fuller testindeki k gecikmesini anlama
R'de bazı birim kök testleri ile oynadım ve k lag parametresinden ne yapacağımdan tam olarak emin değilim. Ben artırılmış kullanılan Dickey Fuller testi ve Philipps Perron testi gelen tseries paketinde. Açıkçası varsayılan parametresi (için ) sadece serinin uzunluğuna bağlıdır. Farklı -değerleri seçersem wrt için oldukça farklı sonuçlar elde ederim. null …
15 r  time-series  trend 

1
“Heywood Kasası” nın kesin tanımı nedir?
"Heywood Case" terimini, gayri resmi olarak, çevrimiçi, 'sonlu tepki' sayısal olarak yinelenen varyans tahmininin sayısal kesinlik sorunları nedeniyle negatif hale geldiği durumlara atıfta bulunmak için gayri resmi olarak kullanıyordum. (Veri eklemek ve eski verileri kaldırmak için Welford'un yönteminin bir varyantını kullanıyorum.) Sayısal hata veya modelleme hatası nedeniyle bir varyans tahmininin …

3
Neden ortalama 0 ve standart sapma 1 dağılımları her zaman kullanılır?
İstatistiklerim kendi kendine öğretildi, ancak okuduğum birçok malzeme ortalama 0 ve standart sapma 1 olan bir veri kümesine işaret ediyor. Bu durumda: Ortalama 0 ve SD 1 neden güzel bir mülk? Bu örnekten çizilen rastgele bir değişken neden 0.5'e eşittir? 0.001 çizim şansı 0.5 ile aynıdır, bu yüzden düz dağıtım …


3
GAM vs GLM ne zaman kullanılır?
Bunun potansiyel olarak geniş bir soru olabileceğini fark ettim, ama bir GLM (Genelleştirilmiş doğrusal model) üzerinde bir GAM (Genelleştirilmiş katkı modeli) kullanımını gösteren genelleştirilebilir varsayımlar olup olmadığını merak ediyordum. Birisi kısa süre önce bana GAM'ların yalnızca veri yapısının "katkı maddesi" olduğunu düşündüğümde kullanılması gerektiğini söyledi, yani x eklemelerinin y'yi tahmin …

1
Neden tek bir ReLU bir ReLU öğrenemez?
Bir takip gelince Benim sinir ağı bile Öklid mesafe öğrenemez Hatta daha ve tek relu için (rastgele ağırlığı) tek relu eğitmek çalıştı basitleştirilmiş. Bu, en basit ağdır ve yine de birleşemediği zamanın yarısıdır. İlk tahmin hedefle aynı yönde ise, hızlı bir şekilde öğrenir ve doğru 1 ağırlığına yaklaşır: İlk tahmin …


3
Kullback-Leibler (KL) diverjansının maksimum değeri nedir
Python kodumda KL sapmasını kullanacağım ve bu öğreticiyi aldım . Bu derste KL ıraksama uygulamak oldukça basittir. kl = (model * np.log(model/actual)).sum() Anlıyorum gibi, olasılık dağılımı modelve actual<= 1 olmalıdır. Benim sorum, k'nin maksimum bağlı / maksimum değeri nedir? Kodumda maksimum sınır için olduğu gibi kl mesafesinin maksimum değerini bilmeliyim.

4
Sıfır hipotezinin kabulü
Bu, istatistik ve diğer bilimlerin kesişimi hakkında bir tartışma sorusudur. Sıklıkla aynı problemle karşılaşıyorum: alanımdaki araştırmacılar, p değeri önem seviyesinden daha az olmadığında hiçbir etki olmadığını söyleme eğilimindedir. Başlangıçta sık sık hipotez testinin böyle olmadığını söyledim. Bu sorunun ne sıklıkta ortaya çıktığı göz önüne alındığında, bu konuyu daha deneyimli istatistikçilerle …

3
Makine öğreniminde veri eksikliği problemini çözme yöntemleri
Makine öğrenme algoritmalarını kullanarak tahminlerde bulunmak istediğimiz herhangi bir veritabanı, bazı özellikler için eksik değerler bulacaktır. Bu sorunu ele almak, eksik değerlere sahip satırları karakteristiklerin ortalama değerleriyle dolana kadar hariç tutmak için birkaç yaklaşım vardır. Temelde bağımlı değişken (Y) eksik değerleri olan sütunların her biri ancak tablonun satırları ile olacak …

2
Makine öğreniminde Bayes Hatası nedir?
http://www.deeplearningbook.org/contents/ml.html Sayfa 116, bayes hatasını aşağıdaki gibi açıklar İdeal model, verileri üreten gerçek olasılık dağılımını bilen bir kahin. Böyle bir model bile birçok problemde hala hataya neden olacaktır, çünkü dağıtımda hala gürültü olabilir. Denetimli öğrenme durumunda, x'den y'ye eşleme doğal olarak stokastik olabilir veya y, x'e dahil olanların yanı sıra …


1
Diferansiyel entropi nasıl yorumlanır?
Kısa bir süre önce , ayrı bir olasılık dağılımının entropisi hakkındaki bu makaleyi okudum . Entropiyi, kullandığınız kelimelerin olasılık dağılımı göz önüne alındığında, kodlamanız en uygun olduğunda bir mesajı kodlamak için gereken beklenen sayı bitleri (en azından entropi tanımınızda kullanıldığında) olarak düşünmenin güzel bir yolunu tanımlar.log2log2\log_2 Bununla birlikte, buradaki gibi …

2
Hassas hatırlama eğrisinde "taban çizgisi" nedir
Hassas hatırlama eğrisini anlamaya çalışıyorum, hassasiyet ve hatırlamanın ne olduğunu anlıyorum ama anlamadığım şey "temel" değer. Bu bağlantıyı okuyordum https://classeval.wordpress.com/introduction/introduction-to-the-precision-recall-plot/ ve "Mükemmel bir sınıflandırıcının bir Hassas-Geri Çağırma eğrisi" bölümünde gösterildiği gibi taban kısmını anlamıyorum, ne işe yarar? ve bunu nasıl hesaplıyoruz? Sadece seçtiğimiz rastgele bir başlangıç ​​noktası mı? Örneğin, retweet,status_countvb …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.