İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
LASSO neden mükemmel öngörücü çiftimi yüksek boyutta bulamıyor?
Mükemmel bir tahmin çifti bulabildiğini test etmek için R'de LASSO regresyonu ile küçük bir deney yapıyorum. Parite şöyle tanımlanır: f1 + f2 = sonuç Buradaki sonuç, 'yaş' adı verilen önceden belirlenmiş bir vektördür. F1 ve f2, yaş vektörünün yarısını alıp değerlerin geri kalanını 0'a ayarlayarak oluşturulur, örneğin: age = [1,2,3,4,5,6], …


1
Bayes Ağlarından Yapay Sinir Ağlarına: çok değişkenli regresyon çok çıkışlı bir ağa nasıl aktarılabilir
Bayesian Hiyerarşik Doğrusal Model ile uğraşıyorum , burada onu tanımlayan ağ. YYY , bir süpermarketteki bir ürünün günlük satışlarını temsil eder (gözlemlenir). XXX , fiyatlar, promosyonlar, haftanın günü, hava durumu, tatiller dahil olmak üzere bilinen bir gerileme matrisidir. 1SSS , her bir ürünün bilinmeyen gizli envanter seviyesidir, bu da en …

1
Mükemmel regresyon davası için lojistik regresyonun neden işe yaramayacağına dair sezgisel bir açıklama var mı? Düzenleme eklemek neden bunu düzeltir?
Lojistik regresyonda mükemmel ayrılma hakkında birçok iyi tartışmamız var. Bu şekilde, R lojistik regresyon mükemmel ayırma (Hauck-Donner fenomeni) ile sonuçlanmıştır. Şimdi ne olacak? ve lojistik regresyon modeli yakınsama yapmaz . Şahsen hala neden bir sorun olacağı ve düzenlileştirme eklemenin sorunu çözeceği için sezgisel olmadığını hissediyorum. Bazı animasyonlar yaptım ve faydalı …

1
Kademeli regresyon kullanımından kaynaklanan uluyanlar
Regresyon modellerinde aşamalı / ileri / geri seçim problemlerinin farkındayım. Yöntemleri kınayan ve daha iyi alternatiflere işaret eden çok sayıda araştırmacı vakası vardır. İstatistiksel bir analizde var olan hikayeler olup olmadığını merak ettim: kademeli regresyon kullandı; son modele dayanarak bazı önemli sonuçlar çıkarmıştır sonuç yanlıştı, bireyin, araştırmalarının veya örgütlerinin olumsuz …

5
Çoklu regresyon varsayımları: normalite varsayımı sabit varyans varsayımından nasıl farklıdır?
Bunların çoklu regresyon modelini kullanma koşulları olduğunu okudum: modelin kalıntıları neredeyse normaldir, artıkların değişkenliği neredeyse sabittir artıklar bağımsızdır ve her değişken sonuçla doğrusal olarak ilişkilidir. 1 ve 2 arasındaki farklar nelerdir? Burada bir tane görebilirsiniz: Yukarıdaki grafik, 2 standart sapma uzaklığındaki kalıntıların Y-hat'tan 10 uzakta olduğunu söylüyor. Bu, artıkların normal …


5
Bir kalıbı 4 dışında herhangi bir sayıya düşene kadar yuvarlayın. Sonuç> 4 olma olasılığı nedir?
Bir oyuncuya adil, altı taraflı bir kalıp verilir. Kazanmak için 4'ten büyük bir sayı (yani 5 veya 6) yuvarlaması gerekir. Eğer 4 yuvarlarsa, yine yuvarlanmalı. Kazanma ihtimali nedir? Bence kazanma olasılığı, tekrar tekrar şöyle ifade edilebilir:P(W)P(W)P(W) P(W)=P(r=5∪r=6)+P(r=4)⋅P(W)P(W)=P(r=5∪r=6)+P(r=4)⋅P(W) P(W) = P(r = 5 \cup r = 6) + P(r = 4) …

3
Çalışma ortamında doğru istatistikler yapmak mı?
Bu sorunun nereye ait olduğundan emin değilim: Çapraz Onaylı veya İşyeri. Ama sorum belirsiz bir şekilde istatistiklerle ilgili. Bu soru (ya da sanırım sorular) bir "veri bilimi stajyeri" olarak çalışmam sırasında ortaya çıktı. Bu lineer regresyon modelini yapıyordum ve kalan arsaları inceliyordum. Heteroskedastisite belirtisi gördüm. Heteroskedastisitenin güven aralığı ve t-testi …
20 careers 

6
3x3 korelasyon matrisinin tamamlanması: verilen üç katsayının iki katsayısı
Bir röportajda bana bu soru soruldu. Diyelim ki formda bir korelasyon matrisi var ⎡⎣⎢10.60.80.61γ0.8γ1⎤⎦⎥[10.60.80.61γ0.8γ1]\begin{bmatrix}1&0.6&0.8\\0.6&1&\gamma\\0.8&\gamma&1\end{bmatrix} Bu korelasyon matrisi göz önüne alındığında gama değerini bulmam istendi. Özdeğerlerle bir şeyler yapabileceğimi düşündüm, çünkü bunların hepsi 0'dan büyük veya 0'a eşit olmalıdır (Matrix pozitif semidefinite olmalıdır) - ama bu yaklaşımın cevabı vereceğini düşünmüyorum. Bir …

2
F istatistiğinin F dağılımını izlediğinin kanıtı
Bu sorunun ışığında: OLS modelindeki katsayıların (nk) serbestlik derecesine sahip bir t dağılımını izlediğinin kanıtı Nedenini anlamak isterim F=(TSS−RSS)/(p−1)RSS/(n−p),F=(TSS−RSS)/(p−1)RSS/(n−p), F = \frac{(\text{TSS}-\text{RSS})/(p-1)}{\text{RSS}/(n-p)}, burada ppp model parametrelerinin bir sayı olmaktadır ve nnn gözlem sayısı ve TSSTSSTSS toplam varyans, RSSRSSRSS kalıntı varyans, bir aşağıda Fp−1,n−pFp−1,n−pF_{p-1,n-p} dağılımı. İtiraf etmeliyim ki, nereden başlayacağımı bilemeyeceğim …

1
Dalgacık-alan gauss süreçleri: kovaryans nedir?
Okumayı ettik Maraun ve arkadaşları , "Dalgacık Durağan olmayan Gauss süreçleri: Synthesis, kestirim ve önemli test" Dalgacık çarpanları ile belirtilebilir durağan olmayan GP bir sınıfını tanımlar (2007). Böyle bir GP'nin gerçekleştirilmesi: Burada η ( t ) , beyaz gürültü, W g sürekli dalgacık dalgacık ile ilgili olarak dönüşümüdür gr , …

3
Neden AUC = 1 bile sınıflandırıcı numunelerin yarısını yanlış sınıflandırmıştır?
Olasılıkları döndüren bir sınıflandırıcı kullanıyorum. AUC'yi hesaplamak için pROC R-paketi kullanıyorum. Sınıflandırıcıdan çıktı olasılıkları: probs=c(0.9865780, 0.9996340, 0.9516880, 0.9337157, 0.9778576, 0.8140116, 0.8971550, 0.8967585, 0.6322902, 0.7497237) probs"1" sınıfında olma olasılığını gösterir. Gösterildiği gibi, sınıflandırıcı '1' sınıfındaki tüm örnekleri sınıflandırmıştır. Gerçek etiket vektörü: truel=c(1, 1, 1, 1, 1, 0, 0, 0, 0, 0) …

3
Bozuk parayı çevirmenin sonucunu doğru tahmin etme şansını en üst düzeye çıkarmak için, her zaman en olası sonucu seçmeli miyim?
Bu ev ödevi değil. Bu basit istatistik probleminde mantığımın doğru olup olmadığını anlamak istiyorum. Diyelim ki bir kafayı çevirme olasılığının P( H)P(H)P(H) ve kuyruğu çevirme olasılığının olduğu 2 taraflı bir param var 1 - P( H)1−P(H)1-P(H). Tüm döndürmelerin bağımsız olasılıklara sahip olduğunu varsayalım. Şimdi diyelim ki madalyonun bir sonraki kapakta …

1
Geometrik bir karışımdan nasıl simüle edebiliriz?
Eğer f1,…,fkf1,…,fkf_1,\ldots,f_k benzetim yapabileceğim, yani bir algoritmanın mevcut olduğu bilinen yoğunluklardır. ve ürün ∏i=1kfi(x)αiα1,…,αk>0∏i=1kfi(x)αiα1,…,αk>0\prod_{i=1}^k f_i(x)^{\alpha_i}\qquad \alpha_1,\ldots,\alpha_k>0 entegre edilebilir,fifif_i 'ssimülatörlerini kullanarak bu ürün yoğunluğundan benzetim yapmak için genel bir yaklaşım varmı?

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.