İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Sinir Ağı modellemesi etkili bir şekilde nasıl yapılır?
Gözlem sayısının ve değişken sayısının oranı ne olmalıdır? Sinir ağı modelinde aşırı sığdırmayı nasıl tespit edebilir ve aşırı sığmayı önlemenin yolları nelerdir? Sinir Ağı ile sınıflandırma yapmak istiyorsam, sınıfların eşit sıklıkta olması gerekir mi? Lütfen bana yardım et.

6
İstatistik dersine yardımcı olabilecek kısa çevrimiçi videolar
İstatistik ders verirken, ara sıra kısa video eklemek de yararlı olabilir. İlk düşüncelerim şunları içeriyordu: İstatistiksel kavramların animasyonları ve görselleştirmeleri Belirli bir tekniğin uygulanmasına ilişkin hikayeler İstatistiksel bir fikirle ilgili mizahi videolar Bir istatistikçi veya istatistik kullanan bir araştırmacı ile röportajlar İstatistik öğretirken kullandığınız veya yararlı olacağını düşündüğünüz videolar var …


4
Kategorik veriler nasıl özetlenir?
Aşağıdaki sorunla mücadele ediyorum, umarım istatistikçiler için kolay bir sorundur (istatistiklere biraz maruz kalan bir programcıyım). Bir ankete verilen yanıtları özetlemem gerekiyor (yönetim için). Anketin farklı alanlarda gruplandırılmış 100'den fazla sorusu vardır (alan başına yaklaşık 5 ila 10 soru). Tüm cevaplar kategoriktir (sıralı bir ölçekte, "hiç değil", "nadiren" ... "günlük …

1
İki bağımsız numunenin aynı eğri boşluğu için test edilmesi
Aynı çarpıklığa sahip popülasyonlardan geldikleri sıfır hipotezi için iki bağımsız örneği test etmek için hangi testler mevcuttur? Eğriltmenin sabit bir sayıya eşit olup olmadığı konusunda klasik bir 1-örnek testi vardır (test 6. örnek momentini içerir!); örneklemli bir test için basit bir çeviri var mı? Verilerin çok yüksek anlarını içermeyen teknikler …

3
Yanıtları, Box-Cox dönüştürülmüş verilerinde orijinal birimler cinsinden ifade edin
Bazı ölçümler için bir analizin sonuçları dönüştürülmüş ölçekte uygun şekilde sunulur. Bununla birlikte, çoğu durumda, sonuçları orijinal ölçüm ölçeğinde sunmak arzu edilir (aksi takdirde çalışmanız az çok değersizdir). Örneğin, log dönüştürülmüş veri durumunda, kaydedilen değerlerin ortalaması ortalamanın günlüğü olmadığı için orijinal ölçekte yorumlama ile ilgili bir sorun ortaya çıkar. Günlük …

3
Mesafeleri ve hacimleri tanımlamak için bilgi geometrisini kullanmak… faydalı mı?
Olasılık dağılımları alanında Fisher's Information metriğini doğal bir yerel metrik olarak kullanmayı ve daha sonra mesafeleri ve hacimleri tanımlamak için entegre etmeyi savunan geniş bir literatüre rastladım . Peki bu "entegre" miktarlar aslında herhangi bir şey için yararlı mıdır? Hiçbir teorik gerekçe ve çok az pratik uygulama bulamadım. Bir adam …

5
Veri görselleştirme tekniklerinin bilişsel işlenmesi / yorumlanması
Farklı görselleştirme tekniklerinin etkinliğini (anlaşılabilirlik) araştıran araştırmalar bilen var mı? Örneğin, insanlar bir görselleştirme biçimini diğerine göre ne kadar çabuk anlıyor? Görselleştirme ile etkileşim insanların verileri hatırlamasına yardımcı olur mu? Bu çizgiler boyunca her şey. Görselleştirmelere örnek olarak şunlar verilebilir: dağılım grafikleri, grafikler, zaman çizelgeleri, haritalar, etkileşimli arabirimler (Paralel Koordinatlar …


5
Farklı uzunluktaki zaman serileri için SVD boyutsallık azalması
Tekil Değer Ayrışmasını boyutsallık azaltma tekniği olarak kullanıyorum. NBoyut vektörleri göz önüne alındığında D, fikir, ilişkisiz boyutların dönüştürülmüş bir uzayındaki özellikleri temsil etmek, bu da bu alanın özvektörlerindeki verilerin bilgilerinin çoğunu azalan bir önem sırasına yoğunlaştırmaktır. Şimdi bu prosedürü zaman serisi verilerine uygulamaya çalışıyorum. Sorun şu ki, tüm diziler aynı …

3
Doğrusal Karışık Efekt Modelleri
LME modellerinin, doğruluk verilerinin analizinde (yani, psikoloji deneylerinde) daha geleneksel olduğunu, geleneksel yaklaşımların (örneğin ANOVA) yapamayacağı binom ve normal olmayan dağılımlarla çalışabildiklerini duydum. LME modellerinin bu diğer dağıtımları dahil etmelerine izin veren matematiksel temeli nedir ve bunu açıklayan teknik olmayan bazı makaleler nelerdir?

4
Veri anonimleştirme yazılımı
Kilitli . Bu soru ve cevapları kilitlidir çünkü soru konu dışıdır, ancak tarihsel önemi vardır. Şu anda yeni yanıtları veya etkileşimleri kabul etmiyor. İyi veri anonimleştirme yazılımının farkında olan var mı? Ya da belki de R için veri anonimleştirme yapan bir paket? Açıkçası, kırılmaz anonimleştirme beklememek - sadece zorlaştırmak istiyorum.
13 software 

4
İki popülasyonun örnekten ayrılması
İki grup veri tek bir veri kümesinden ayırmaya çalışıyorum. Popülasyonlardan birinin normal olarak dağıldığını ve numunenin en az yarısı kadar olduğunu varsayabilirim. İkincisinin değerleri, birincinin değerlerinden daha düşük veya daha yüksektir (dağılım bilinmemektedir). Ne yapmaya çalışıyorum normal dağıtılmış nüfusu diğerine kapsayacak üst ve alt sınırları bulmaktır. Benim varsayım bana başlangıç …


5
Tahmin için ne zaman birden fazla model kullanılır?
Bu oldukça genel bir soru: Tipik olarak, birden fazla farklı model kullanmanın bir örnek seriden zaman serisini tahmin etmeye çalışırken bir modelden daha iyi performans gösterdiğini gördüm. Model kombinasyonunun tek bir modelden daha iyi performans göstereceğini gösteren iyi makaleler var mı? Birden fazla modeli birleştirme konusunda en iyi uygulamalar var …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.