İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

2
R'de düzeltme paketi içinde PCA ve k katlama çapraz doğrulama
Az önce Coursera'daki Makine Öğrenimi dersinden bir ders izledim. Profesörün denetimli öğrenme uygulamalarında ön işleme verileri için PCA'yı tartıştığı bölümde, PCA'nın sadece eğitim verileri üzerinde yapılması gerektiğini ve daha sonra eşlemenin çapraz doğrulama ve test setlerini dönüştürmek için kullanıldığını söylüyor. Ayrıca bkz. PCA ve tren / test bölümü . Ancak, …

2
Birisi Poisson modeli için artık sapma / df'nin ~ 1 olması gerektiğini söylediğinde, yaklaşık ne kadardır?
Poisson model uyumunun artık sapmanın serbestlik derecelerine bölünmesini içeren aşırı dağılmış olup olmadığını kontrol etme tavsiyesini sık sık gördüm. Ortaya çıkan oran "yaklaşık 1" olmalıdır. Soru, "yaklaşık" için hangi aralıktan bahsediyoruz - alternatif model formlarını dikkate almak için alarmları ayarlaması gereken oran nedir?

5
Eğitim verilerinin arttırılmasının genel sistem doğruluğu üzerinde nasıl bir etkisi vardır?
Birisi benim için olası örneklerle özetleyebilir mi, hangi durumlarda eğitim verilerinin arttırılması genel sistemi iyileştirir? Daha fazla eğitim verisi eklemenin, muhtemelen verilerin üzerine sığabileceğini ve test verileri üzerinde iyi doğruluk sağlayamayacağını ne zaman tespit ederiz? Bu çok spesifik olmayan bir sorudur, ancak belirli bir duruma özgü olarak cevaplamak istiyorsanız, lütfen …

2
IID örnekleme testi
Örneklemenin IID (Bağımsız ve Özdeş Dağıtılmış) olup olmadığını nasıl test eder veya kontrol edersiniz? Gauss ve Özdeşçe Dağıtılmış demek istemiyorum, sadece IID. Ve aklıma gelen fikir, numuneyi tekrar tekrar eşit büyüklükte iki alt numuneye ayırmak, Kolmogorov-Smirnov testini yapmak ve p-değerlerinin dağılımının düzgün olup olmadığını kontrol etmektir. Bu yaklaşım hakkında herhangi …

3
Mevcut bir formül veya analizden veri simülasyonu için genel bir yöntem var mı?
Deneysel bir tasarım veri çerçevesinden verilerin de novo simülasyonu. R'ye odaklanarak (diğer dil çözümleri harika olurdu). Bir deney veya anket tasarlarken, verileri simüle etmek ve bu simüle edilmiş veriler üzerinde bir analiz yapmak, tasarımın avantajları ve zayıflıkları hakkında müthiş bir fikir verebilir. Böyle bir yaklaşım, istatistiksel testlerin anlaşılması ve doğru …

3
İstatistiksel altyapısı olmayan kişilere genelleştirilmiş doğrusal modelleri nasıl açıklarsınız?
İstatistiksel arka planı olmayan kitleye istatistiksel teknikleri açıklamakta her zaman zorlanırım. Böyle bir kitleye GLM'nin ne olduğunu açıklamak isteseydim (istatistiksel jargon çıkarmadan), en iyi ya da en etkili yol ne olurdu? Genelde GLM'yi üç bölümle açıklarım - (1) tepki değişkeni olan rastgele bileşen, (2) doğrusal öngörücüler olan sistematik bileşen ve …

2
Sunucu yanıt süresini modellemek için en yaygın olarak hangi dağıtım kullanılır?
Bu sunucu uygulamasına yapılan her isteği tamamlamak için geçen zamanı ölçtüğüm sunucu uygulaması tabanlı bir uygulamam var. Zaten ortalama ve maksimum gibi basit istatistikleri hesaplıyorum; Ancak biraz daha karmaşık analizler yapmak istiyorum ve bunu yapmak için, bu tepki sürelerini doğru bir şekilde modellemem gerektiğine inanıyorum. Elbette, yanıt sürelerinin iyi bilinen …

4
İstatistiksel analizin belirli yönlerini gösteren iyi veri kümeleri nelerdir?
Bunun öznel olduğunu anlıyorum, ancak favori veri setlerimiz ve onları ilginç kıldığını düşündüğümüz hakkında konuşmanın güzel olacağını düşündüm. Orada zengin bir veri var ve tüm API'lerle (örneğin, Datamob ) klasik veri kümeleri (örneğin, R verileri ) ile birlikte, bunun çok ilginç tepkilere sahip olabileceğini düşünüyorum. Örneğin, "Boston Housing" veri kümesi …
16 dataset 

2
Sayı verileri ve aşırı dağılımlı bir gerilemede Poisson veya yarı poisson?
Sayım verilerim var (muhtemelen birçok faktöre bağlı olarak müşteri sayımı ile talep / teklif analizi). Normal hatalarla doğrusal bir regresyon denedim, ancak QQ grafiğim gerçekten iyi değil. Cevabın bir günlük dönüşümünü denedim: bir kez daha, kötü QQ-plot. Şimdi Poisson Hataları ile bir gerileme deniyorum. Tüm önemli değişkenlere sahip bir modelle …

6
Hesaplama hızı R?
Mevcut büyük stokastik modellerimizden birini SAS'tan ve yeni bir dile taşımakla görevlendirildim. Şahsen, geleneksel bir derlenmiş dili tercih ediyorum, ancak PI, daha önce hiç kullanmadığım R'yi kontrol etmemi istiyor. Modeli SAS'tan çıkarma motivasyonumuz (1) birçok kişinin buna erişimi yoktur, çünkü SAS pahalıdır, (2) yorumlanmış bir dilden uzaklaşmak istiyoruz ve (3) …
16 r  computing 


1
Regresyonda verileri merkezleme ve standartlaştırma ihtiyacı
Bazı regülasyonlarla doğrusal regresyon düşünün: Örn , küçülten Bul | | A x - b | | 2 + λ | | x | | 1xxx||Ax−b||2+λ||x||1||Ax−b||2+λ||x||1||Ax - b||^2+\lambda||x||_1 Genellikle A sütunları sıfır ortalama ve birim normlara sahip olacak şekilde standartlaştırılırken, sıfır ortalamaya sahip olacak şekilde ortalanır. Standartlaşma ve merkezleme nedenine …

2
Dikgen bir projeksiyon projeksiyon matrisi neden simetriktir?
Ben bu konuda çok yeniyim, umarım soru safsa beni affedersin. (Bağlam: Davidson & MacKinnon'un "Ekonometrik Teori ve Yöntemler" kitabından ekonometri öğreniyorum ve bunu açıklamıyorlar; Luenberger'in tahminlerini biraz daha ileri düzeyde ele alan optimizasyon kitabına da baktım , ancak şanssız). İlişkili projeksiyon matrisi P ile birlikte dikey bir projeksiyon sahip olduğumu …

1
Ağırlıklı Öklid mesafesi ne zaman kullanılır ve kullanılacak ağırlıklar nasıl belirlenir?
Her verinin farklı ölçekten oluştuğu bir veri setim var . Her hesaplama için bir kıyaslama değerim var. Her verinin kıyaslama değerine ne kadar yakın olduğunu bilmek istiyorum.nnn Ağırlıklı Öklid Mesafesini şu şekilde kullanmayı düşündüm: dx , b= ( ∑ni = 1wben( xben- bben)2) )1 / 2dx,b=(Σben=1nwben(xben-bben)2))1/2\hspace{0.5in} d_{x,b}=\left( \sum_{i=1}^{n}w_i(x_i-b_i)^2)\right)^{1/2} nerede xbenxben\hspace{0.5in}x_i …

4
Klasik doğrusal model - model seçimi
5 olası regresörlü klasik bir doğrusal modelim var. Birbirleriyle ilişkisizdirler ve cevapla oldukça düşük korelasyona sahiptirler. Regresörlerin 3'ünün t istatistiği için önemli katsayıları olan bir modele geldim (p <0.05). Kalan 2 değişkenin birini veya her ikisini eklemek, eklenen değişkenler için t istatistiği için p> 0.05 verir. Bu beni 3 değişken …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.