İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


4
OR dağılımı (olasılık oranı) nedir?
% 95 CI (güven aralıkları) ile "VEYA" sunan bir sürü makalem var. Makalelerden gözlemlenen OR için P değerini tahmin etmek istiyorum. Bunun için OR dağılımı ile ilgili bir varsayım lazım. Hangi dağıtımı güvenli bir şekilde üstlenebilir / kullanabilirim?

1
Ağırlıklı verilere sahip iki örnekli T testi
Her bir numunenin T-testinin varsayımlarına uyduğu iki bağımsız örnek arasındaki farkı test etmek için iki örnekli bir T testi yapmak istiyorum (her dağılımın bağımsız olduğu ve eşit varyansla aynı şekilde normal olarak dağıtıldığı varsayılabilir) . Temel iki örnekli T testinin tek komplikasyonu verinin ağırlıklandırılmasıdır. Ağırlıklı araçlar ve standart sapmalar kullanıyorum, …
13 t-test 


4
Verileri toplama ve analiz etmenin en iyi yolları
Kısa süre önce kendime öğretmeye başladım Makine Öğrenimi ve Veri Analizi Kendimi büyük veri kümeleri oluşturma ve sorgulama ihtiyacı üzerine bir tuğla duvara çarptım. Mesleki ve kişisel hayatımda topladığım verileri almak ve analiz etmek istiyorum, ancak aşağıdakileri yapmanın en iyi yolundan emin değilim: Bu verileri nasıl saklamalıyım? Excel? SQL? ?? …


1
Destek vektör makinesi büyük verilerde kullanılabilir mi?
SVM hakkında sahip olduğum sınırlı bilgi ile, kısa ve şişman bir veri matrisi (birçok özellik ve çok fazla örnek değil) iyidir , ancak büyük veriler için iyi değildir.XXX Ben bir nedeni Çekirdek Matrix anlamak bir olduğunu matrisi, verilerdeki durumlarda sayısıdır. 100K verisi varsa, çekirdek matrisi elemente sahip olacak ve ~ …

3
Büyük veri ayarı için doğrusal regresyon nasıl paralel / dağıtılmış şekilde çalıştırılır?
Çok büyük bir lineer regresyon problemi üzerinde çalışıyorum, veri boyutu o kadar büyük ki bir makine kümesinde saklanmaları gerekiyor. Tüm örnekleri tek bir makinenin belleğine (hatta diske) toplamak çok büyük olacak Bu verileri regresyon yapmak için, paralel bir yaklaşım düşünüyorum, yani her bir kutuda regresyon çalıştırın ve daha sonra her …



2
Optimum numune boyutuna ulaşılmadan önce A / B testini durdurmak neden yanlıştır?
Şirketimde A / B testlerinin sonuçlarını (web sitesi varyasyonlarında çalıştırılır) sunmaktan sorumluyum. Testi bir ay boyunca yürütüyoruz ve daha sonra, anlamlılığa ulaşana kadar (veya testi uzun süre çalıştırdıktan sonra önem kazanılmazsa vazgeçene kadar) p değerlerini düzenli aralıklarla kontrol ediyoruz, şimdi öğrendiğim bir şey yanlış bir uygulamadır . Bu uygulamayı şimdi …


1
Genel olarak, çıkarım yapmak tahmin yapmaktan daha mı zor?
Sorum şu gerçeğe dayanıyor. Makine öğrenimi ile ilgili yayınların yanı sıra bloglar, dersler ve kitaplar okuyorum. Benim izlenimim, makine öğrenimi uygulayıcılarının, istatistikçilerin / ekonometrilerin önem verdiği birçok şeye kayıtsız görünmeleridir. Özellikle, makine öğrenimi uygulayıcıları çıkarım üzerine tahmin doğruluğunu vurgular. Böyle bir örnek Andrew Ng'nin Coursera'da Machine Learning'i alırken oldu . …


4
Eğilim skor eşleştirmesi neden nedensel çıkarım için çalışır?
Eğilim skor eşleştirmesi gözlemsel çalışmalarda nedensel çıkarımlar yapmak için kullanılır (bakınız Rosenbaum / Rubin makalesi ). Neden çalıştığının ardındaki basit sezgi nedir? Başka bir deyişle, neden tedaviye katılma olasılığının iki grup için eşit olduğundan emin olursak, karıştırıcı etkiler ortadan kalkar ve sonucu tedavi hakkında nedensel sonuçlar çıkarmak için kullanabiliriz?

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.