İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

6
Zaman serilerinde kararlılık testi
Belirli bir zaman serisi dengelendiğinde test için standart (veya en iyi) bir yöntem var mı? Biraz motivasyon Bir değer veren stokastik bir dinamik sistemim var xtxtx_t her seferinde t ∈ Nt∈Nt \in \mathbb{N}. Bu sistem zaman adımına kadar bazı geçici davranışlara sahiptirt*t∗t^* ve sonra ortalama bir değer etrafında stabilize olur …


2
'Karışımsız' parçaların karışım sırasına göre dağılımı
olarak eşleştirilmiş gözlemlerim olduğunu varsayalım için . Let ile ve göstermektedirler inci gözlenen en büyük değeri . ın (koşullu) dağılımı nedir? (ya da eşit şekilde, bunun )Xi∼N(0,σ2x),Yi∼N(0,σ2y),Xi∼N(0,σx2),Yi∼N(0,σy2),X_i \sim \mathcal{N}\left(0,\sigma_x^2\right), Y_i \sim \mathcal{N}\left(0,\sigma_y^2\right),i=1,2,…,ni=1,2,…,ni=1,2,\ldots,nZi=Xi+Yi,Zi=Xi+Yi,Z_i = X_i + Y_i,ZijZijZ_{i_j}jjjZZZXijXijX_{i_j}YijYijY_{i_j} Olduğunu, dağılımı nedir şartına olmanın inci en büyük gözlemlenen değerlere ?XiXiX_iZiZiZ_ijjjnnnZZZ Ben tahmin ediyorum …

2
Küresel olarak optimize edilebilir bir maliyet fonksiyonu formüle ederek bir probleme yaklaşmanın avantajları
Bu oldukça genel bir sorudur (yani istatistiklere özgü olması gerekmez), ancak yazarların aşağıdaki yaklaşımı izlemeyi tercih ettiği makine öğrenimi ve istatistiksel literatürde bir eğilim fark ettim: Yaklaşım 1 : Küresel olarak optimal bir çözüm bulmanın mümkün olduğu bir maliyet fonksiyonunu formüle ederek (örn. Dışbükey bir maliyet fonksiyonunu formüle ederek) pratik …


1
Boyutsal küçültme / çok boyutlu ölçeklemenin sonuçları nasıl yorumlanır?
Verilerin yapısını daha iyi anlamak için 6 boyutlu bir veri matrisinin hem SVD ayrışmasını hem de çok boyutlu ölçeklendirmesini yaptım. Ne yazık ki, tüm tekil değerler aynı sıraya sahiptir, bu da verilerin boyutsallığının gerçekten 6 olduğunu gösterir. Ancak, tekil vektörlerin değerlerini yorumlayabilmek istiyorum. Örneğin, birincisi her boyutta (yani (1,1,1,1,1,1)) az …

3
Yerden tasarruf sağlayan kümeleme
Gördüğüm çoğu kümeleme algoritması, daha büyük veri kümelerinde sorunlu hale gelen tüm noktalar arasında bire bir mesafeler oluşturmakla başlar. Bunu yapmayan var mı? Yoksa bir çeşit kısmi / yaklaşık / kademeli yaklaşımda mı? Hangi kümeleme algoritması / uygulaması O (n ^ 2) alanından daha az yer kaplıyor? Algoritmaların bir listesi …

3
K-Ortalamalar Algoritmasında Döngü
Wiki'ye göre en yaygın kullanılan yakınsama kriteri “değerlendirme değişmemiştir”. Böyle bir yakınsama kriteri kullanırsak bisikletin olup olmayacağını merak ediyordum. Birisi bisiklete binme örneği veren veya bunun imkansız olduğunu kanıtlayan bir makaleye atıfta bulunursa memnun olurum.

5
Anomali tespiti için otomatik eşik tespiti
Bir dizi anormallik skoru ile çalışıyorum (arka plan bilgisayar ağlarında anomali tespitidir). Her dakika, ağın mevcut durumunun "beklenmedik" veya anormal olduğunu söyleyen anomali puanı . Puan ne kadar yüksek olursa, mevcut durum o kadar anormal olur. 5'e yakın puanlar teorik olarak mümkündür ancak neredeyse hiç gerçekleşmez.xt∈ [ 0 , 5 …

3
Kategorik değişkenlerin 'Bilmiyorum / Reddedildi' seviyelerini tedavi etmek
Lojistik Regresyon kullanarak Diyabet Tahminini modelleniyorum. Kullanılan veri kümesi Hastalık Kontrol Merkezi'nin (CDC) Davranışsal Risk Faktörü Gözetim Sistemi'dir (BRFSS ). Bağımsız değişkenlerden biri de Yüksek Tansiyon. Aşağıdaki seviyelerde kategoriktir: 'Evet', 'Hayır', 'Bilmiyorum / Reddedildi'. Modeli oluştururken 'Bilmiyorum / Reddedildi' satırlarını kaldırmalı mıyım? Bu satırları modelden korumak veya kaldırmak için ne …

1
Ortak değişkenlerin bazı eksik verileri olduğunda GEE / lojistik model uyumunu nasıl değerlendirebilirim?
Verilerime iki genelleştirilmiş tahmin denklemi (GEE) modeli taktım: 1) Model 1: Sonuç uzunlamasına Evet / Hayır değişken (A) (yıl 1,2,3,4,5) uzunlamasına sürekli öngörücü (B) 1,2,3,4,5 yıldır. 2) Model 2: Sonuç aynı uzunlamasına Evet / Hayır değişkeni (A), ancak şimdi tahmin edicim 1. yıl değerine sabitlenmiş yani zamanla değişmez (B) olmaya …
9 logistic  gee 

4
2 X 3 masasında çoklu post-hoc ki-kare testleri nasıl yapılır?
Veri setim, toplam organizma ölümünü veya bir organizmanın kıyı, orta kanal ve açık deniz olmak üzere üç yer tipinde hayatta kalmasını içeriyor. Aşağıdaki tablodaki sayılar site sayısını temsil eder. 100% Mortality 100% Survival Inshore 30 31 Midchannel 10 20 Offshore 1 10 % 100 mortalitenin meydana geldiği site sayısının site …

1
Sıra korelasyonu için ARMA eşdeğeri var mı?
ARMA / ARIMA modellerinin iyi çalışmadığı son derece doğrusal olmayan verilere bakıyorum. Yine de, bazı otokorelasyon görüyorum ve doğrusal olmayan otokorelasyon için daha iyi sonuçlar elde ettiğinden şüpheleniyorum. 1 / Rütbe korelasyonu için PACF'ye eşdeğer mi? (R? cinsinden) 2 / doğrusal olmayan / sıralama korelasyonu için bir eşdeğer ARMA modeli …


4
Doğrusal regresyon katsayı tahminlerine analitik çözüm
Matris notasyonunu anlamaya çalışıyorum ve vektörler ve matrislerle çalışıyorum. Şu anda çoklu regresyonda katsayı tahmin vektörünün nasıl hesaplandığını anlamak istiyorum .β^β^\hat{\beta} Temel denklem ddβ(y−Xβ)′(y−Xβ)=0.ddβ(y−Xβ)′(y−Xβ)=0. \frac{d}{d\boldsymbol{\beta}} (\boldsymbol{y}-\boldsymbol{X\beta})'(\boldsymbol{y}-\boldsymbol{X\beta}) = 0 \>. Şimdi burada bir vektör \ beta için nasıl çözerimββ\beta ? Düzenleme : Bekleyin, sıkıştım. Şimdi buradayım ve nasıl devam edeceğimi bilmiyorum: …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.