İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Basit doğrusal regresyondaki kesişim ve eğim tahminleri bağımsız mıdır?
Doğrusal bir model düşünün yi=α+βxi+ϵiyi=α+βxi+ϵiy_i= \alpha + \beta x_i + \epsilon_i ve en küçük kareler kullanılarak ve eğimi ve kesişimine ilişkin tahminler . Bu matematiksel istatistik referansı , ve ifadelerinin bağımsız olduklarını (teoremlerini kanıtlarken) ifade eder.α^α^\hat{\alpha}β^β^\hat{\beta}α^α^\hat{\alpha}β^β^\hat{\beta} Nedenini anladığımdan emin değilim. Dan beri α^=y¯−β^x¯α^=y¯−β^x¯\hat{\alpha}=\bar{y}-\hat{\beta} \bar{x} Bu ve ile ilişkili olduğu anlamına …

1
Verimli evrişim (R cinsinden)
Evrişimi hesaplamak / değerlendirmek istiyorum g( x ) =∫Df( x - t ) ϕ ( t ) dt ,g(x)=∫Df(x−t)ϕ(t)dt,g(x)=\int_D f(x-t) \phi(t) dt, burada bir yoğunluktur ve , kompakt destek ile düzgün bir fonksiyondur . Evrişim kapalı formda mevcut değildir ve bunu sayısal olarak entegre etmem gerekiyor. Sorum şu: Bunu yapmanın …
9 r  convolution 


1
Seyrek girdilere sahip Sinir Ağları için hangi kurallara uyulmalıdır?
Son derece seyrek girişlerim var, örneğin bir giriş görüntüsünde belirli özelliklerin yerleri. Ayrıca, her özellik birden çok algılamaya sahip olabilir (bunun sistemin tasarımı üzerinde bir etkisi olup olmadığından emin değilsiniz). Bu, bu özelliğin varlığını temsil eden ON piksellerine sahip bir k kanalı 'ikili görüntü' olarak sunacak veya tam tersi. Böyle …

4
Dağıtımı bilmediğinizde nasıl örneklenir
İstatistiklere oldukça yeni başladım (başlangıç ​​seviyesi bir kaç Uni kursu) ve bilinmeyen dağılımlardan örnek almayı merak ediyordum. Özellikle, temeldeki dağıtım hakkında hiçbir fikriniz yoksa, temsili bir örnek alacağınızı "garanti etmenin" bir yolu var mı? Açıklamak için örnek: servetin küresel dağılımını anlamaya çalıştığınızı varsayalım. Herhangi bir birey için, bir şekilde onların …

1
Kement modelinden hariç tutulan veya dahil edilen değişkenler nasıl yorumlanır?
Diğer mesajlardan, bir kement modeline giren yordayıcı değişkenlere 'önem' veya 'önem' atfedemediğim için aldım çünkü bu değişkenlerin p-değerlerini veya standart sapmalarını hesaplamak hala devam eden bir çalışmadır. Bu nedenle, kement modelinden HARİÇ EDİLEN değişkenlerin 'ilgisiz' veya 'önemsiz' olduğunu söyleyemeyeceğini söylemek doğru mu? Öyleyse, hariç tutulan veya bir kement modeline dahil …

2
Bir istatistikçi olarak kalifiye olmak için “İstatistik” alanında yüksek lisans yapmam gerekir mi? [kapalı]
Kapalı . Bu soru görüş temelli . Şu anda cevapları kabul etmiyor. Bu soruyu geliştirmek ister misiniz? Bu yayını düzenleyerek gerçekler ve alıntılarla yanıtlanabilmesi için soruyu güncelleyin . 5 yıl önce kapalı . Üniversitemden yeni mezun oldum ve lisans derecem İstatistik bölümünde. İstatistikleri gerçekten seviyorum ve muhtemelen istatistikçi olarak geçimini …
9 careers 

1
1. persentilin örnekleme dağılımını elde etmek için bootstrap kullanma
Bir popülasyondan (250 büyüklüğünde) bir örnek var. Nüfusun dağılımını bilmiyorum. Ana soru: Ben 1'in bir nokta tahminini istiyorum st nüfusun -percentile ve sonra benim tahmini noktadaki% 95 güven aralığı istiyorum. Benim nokta tahmini örnek 1 olacak st -percentile. İfade ediyorumxxx. Bundan sonra, nokta tahmini etrafında güven aralığı oluşturmaya çalışıyorum. Burada …

1
Neden bu çoklu impütasyon düşük kalite?
Aşağıdaki R kodunu düşünün: > data <- data.frame( a=c(NA,2,3,4,5,6),b=c(2.2,NA,6.1,8.3,10.2,12.13),c=c(4.2,7.9,NA,16.1,19.9,23)) > data a b c 1 NA 2.20 4.2 2 2 NA 7.9 3 3 6.10 NA 4 4 8.30 16.1 5 5 10.20 19.9 6 6 12.13 23.0 Gördüğünüz gibi, verileri kabaca tasarladım c = 2*b = 4*a. Bu nedenle, …

2
Bu “Reddit Birleşik Devletleri” grafiği nasıl oluşturulur?
Aşağıda s. James Dowdell tarafından yapılmış olsa da Christian Rudder'ın Dataclysm'in 202'si. Kullanıcıların bağlantılar, yorumlar ve oylar gönderebileceği reddit.com'da ilgi alanları olan çeşitli ilk 200 alt kredi arasındaki ilişkileri gösterir . Bunlar bu sitedeki etiketlere benzer. Alt düzenleme bölgelerinin büyüklüğü popülerliklerini temsil eder. Altdizimler çapraz yorumlama ile gruplandırılır ve daha …

1
Kement formülasyonları arasındaki bağlantı
Bu soru aptal olabilir, ancak Kement regresyonunun iki farklı formülasyonu olduğunu fark ettim . Kement sorununun, kare kaybı artı -1 ceza teriminden oluşan ve aşağıdaki gibi ifade edilen hedefi en aza indirmek olduğunu biliyoruz:LLLminβ∥y−Xβ∥22+λ∥β∥1minβ‖y−Xβ‖22+λ‖β‖1 \min_\beta \|y - X \beta\|_2^2 + \lambda \|\beta\|_1 \; Ancak sık sık Lasso tahmincisinin \ hat …
9 lasso 

1
Ölçüm hatasına göre öncelikleri seçme
Bir enstrümanın ölçüm hatası varsa uygun olanı nasıl hesaplarsınız? Bu paragraf Cressie'nin "Mekansal-Geçici Veriler için İstatistikler" kitabından alınmıştır: Genellikle, ölçüm-hata varyansı ile ilgili olarak, oldukça bilgilendirici bir parametre modelinin belirlenmesine izin veren bazı önceden bilgilerin mevcut olması söz konusudur. Örneğin, şartlı olarak bağımsız ölçüm hatalarını varsayarsak G a u ( …

1
Negatif binom, 2 bilinmeyen varsa üstel ailede olduğu gibi ifade edilemez mi?
Dispersiyon parametresinin bilinen bir sabit olduğu göz önüne alındığında, negatif binom dağılımını üstel dağılım ailesi olarak ifade etmek için bir ödev verdim. Bu oldukça kolaydı, ama neden bu parametreyi sabit tutmamızı istediklerini merak ettim. İki parametrenin bilinmemesi ile doğru forma sokmanın bir yolunu bulamadım. Çevrimiçi baktığımda bunun mümkün olmadığını iddia …

1
Permütasyon testleri: bir test istatistiği seçme kriterleri
Permütasyon testlerini düzenli olarak kullanıyorum ve basitliklerini seviyorum. En çok, yazarın örnekler boyunca test istatistikleri seçiminde oldukça yaratıcı göründüğü Good'un "Örnekleme yöntemleri" kitabından öğrendim. Ayrıca bu yazı , test istatistiği seçme konusunda büyük bir özgürlük olduğu izlenimini veriyor. Bir test istatistiğinin uyması gereken teorik gereklilikler olup olmadığını merak ediyorum . …

1
Bir dönüşüm altında gözlemlenen Fisher bilgileri
Y. Pawitan'ın "Tüm Olasılıkta: Olasılık Kullanarak İstatistiksel Modelleme ve Çıkarım" dan yeniden parametreleştirme olasılığı θ↦g(θ)=ψθ↦g(θ)=ψ\theta\mapsto g(\theta)=\psi olarak tanımlanır L∗(ψ)=max{θ:g(θ)=ψ}L(θ)L∗(ψ)=max{θ:g(θ)=ψ}L(θ) L^*(\psi)=\max_{\{\theta:g(\theta)=\psi\}} L(\theta) böylece ggg bire bir ise, L∗(ψ)=L(g−1(ψ))L∗(ψ)=L(g−1(ψ))L^*(\psi)=L(g^{-1}(\psi)) (s. 45). Ben eğer belirten Egzersiz 2.20 göstermeye çalışıyorum θθ\theta is sayıl (ve bunu tahmin ggg sıra skaler fonksiyon olması gerekiyordu), sonra I∗(g(θ^))=I(θ^)∣∣∣∣∂g(θ^)∂θ^∣∣∣∣−2,I∗(g(θ^))=I(θ^)|∂g(θ^)∂θ^|−2, …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.