İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
Dizeleri ortak temalara göre nasıl gruplandırabilirim?
Örneğin, programlama ile ilgili diğer dizelerle programlama hakkında dizeleri, fizikle ilgili dizeleri fizikle ilgili diğer dizelerle vb. Gruplandırmaya çalışıyorum. Sorunun göze çarpan teorik dilsel yönüne rağmen, aslında bunu programlama / yazılım kullanarak yapmak istiyorum. Özet: Çok sayıda dizge göz önüne alındığında, bunları semantik temaya göre gruplandırmaya nasıl giderim? Özel uygulama: …

2
Doğrusallığa ulaşmak için en iyi dönüşüm nasıl seçilir?
Çoklu doğrusal regresyon yapmak ve sonra yeni değerleri az tahmin ile tahmin etmek istiyorum. Yanıt değişkenim -2 ile +7 arasında ve üç öngörücü var (yaklaşık +10 - +200 aralığında). Dağılım neredeyse normaldir. Ancak cevap ve öngörücüler arasındaki ilişki doğrusal değildir, araziler üzerinde eğriler görüyorum. Örneğin bunun gibi: http://cs10418.userapi.com/u17020874/153949434/x_9898cf38.jpg Doğrusallığa ulaşmak …


3
Bir insan listesindeki n insanın, y insan listesinden rastgele bir x insan seçiminde olma olasılığı nedir?
Eğer değiştirmeden 363 kişilik bir havuzdan 232 kişi seçersem, bu seçimdeki 12 belirli kişiden oluşan bir listeden 2'sinin olasılığı nedir? Bu, 232 spot için 363 katılımcının olduğu ultra yarış için rastgele bir beraberlik. Seçimin belirli bir 12 kişilik gruba karşı önyargılı olup olmadığı konusunda bir tartışma var. Bunu hesaplamaya yönelik …

1
Çapraz rastgele efektler ve dengesiz veriler
İki çapraz rastgele efektim olduğunu düşündüğüm bazı verileri modelliyorum. Ancak veri kümesi dengeli değil ve bunu hesaba katmak için ne yapılması gerektiğinden emin değilim. Verilerim bir dizi etkinliktir. Bir istemci, bir görevi yerine getirmek için başarılı olan veya olmayan bir sağlayıcıyla buluştuğunda bir olay oluşur. Binlerce müşteri ve sağlayıcı vardır …


3
Doğrusal model Değişen varyans
Aşağıdaki doğrusal model var: Kalıntıların heterosensedastisitesini ele almak için bağımlı değişkene bir log dönüşümü olarak uygulamaya çalıştım fakat artıklar üzerinde aynı fan çıkışı etkisini görüyorum. DV değerleri nispeten küçüktür, bu nedenle günlüğü almadan önce +1 sabit ilavesi bu durumda muhtemelen uygun değildir.log(Y+1)log⁡(Y+1)\log(Y + 1) > summary(Y) Min. :-0.0005647 1st Qu.: …

1
SEM modelleme konusunda yardım (OpenMx, polycor)
SEM'i uygulamaya çalıştığım bir veri kümesi ile ilgili çok fazla sorunum var. 5 göstergeli A, B, C, D, E gizli faktörlerinin varlığını varsayalım. A1 - A5 (sıralı faktörler), B1 - B3 (kantitatif), C1, D1, E1 (son üç sıralı faktörün tümü, yalnızca E1 için 2 seviye ile) Tüm faktörler arasındaki kovaryanslarla …


1
Fisher çekirdeklerinin ötesinde
Bir süre, olasılıklar modellerden çekirdekler inşa etmenin bir yolu gibi göründüğü için Fisher Çekirdekleri popüler olabilir gibi görünüyordu. Ancak, bunların pratikte nadiren kullanıldığını gördüm ve çok iyi çalışmazlar. Fisher Information'ın hesaplamasına güveniyorlar - alıntı yapmak Wikipedia: Fisher bilgisi, f'nin doğal logaritmasının with'sine göre ikinci türev beklentisinin negatifidir. Bilgi, curve'nın maksimum …

3
Düzensiz aralıklardaki toplu verilere dayanarak nasıl tahmin yapılır?
Otomattaki ürünlerin satışını tahmin etmeye çalışıyorum. Sorun, makinenin düzensiz aralıklarla doldurulması ve her dolumda, makinenin son dolumundan bu yana toplu satışları kaydedebilmemizdir (yani günlük satış verilerine sahip değiliz). Temelde, düzensiz aralıklarla toplu satışlar için verilerimiz var. Aralıklar genellikle 2 gün ile 3 hafta arasındadır. Bir satış makinesi ve bir ürün …

1
Çok büyük zaman serisi veri kümeleriyle başa çıkmak
Çok büyük bir veri kümesine erişimim var. Veriler, dört türden birinden müzikal alıntıları dinleyen insanların MEG kayıtlarından alınmıştır. Veriler aşağıdaki gibidir: 6 Konular 3 Deneysel tekrarlar (çağlar) Dönem başına 120 Deneme 275 MEG kanalından 500Hz'de (= 4000 örnek) deneme başına 8 saniye veri Yani burada her "örnek" [4000x275] boyutunda bir …

3
Büyük veri kümelerinden öğrenirken yaklaşımlar?
Temel olarak, büyük veri kümelerine karşı öğrenmenin iki yaygın yolu vardır (zaman / alan kısıtlamaları ile karşılaştığınızda): Hile :) - eğitim için sadece bir "yönetilebilir" alt kümesini kullanın. Doğruluk kaybı, azalan getiriler yasası nedeniyle ihmal edilebilir - modelin tahmini performansı, tüm eğitim verileri buna dahil edilmeden çok önce düzleşir. Paralel …

3
Otomatik veri temizleme
Sık karşılaşılan bir sorun ML'nin verilerin kalitesinin düşük olmasıdır: özellik değerlerindeki hatalar, yanlış sınıflandırılan örnekler vb. Bu sorunu ele almanın bir yolu verileri manuel olarak gözden geçirmek ve kontrol etmektir, ancak başka teknikler var mı? (Eminim vardır!) Hangileri daha iyi ve neden?

1
MFCC'ler bir geri alma sistemine müziği temsil etmek için en uygun yöntem midir?
Bir sinyal işleme tekniği, Mel frekans Cepstrum , genellikle bir makine öğrenme görevinde kullanılmak üzere bir müzik parçasından bilgi çıkarmak için kullanılır. Bu yöntem kısa vadeli bir güç spektrumu verir ve katsayılar girdi olarak kullanılır. Müzik erişim sistemlerini tasarlarken, bu katsayılar bir parçanın karakteristiği olarak kabul edilir (açıkçası mutlaka benzersiz …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.