İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap


1
Gelman'ın 8 okul örneğinde, bireysel tahminin standart hatası neden biliniyor?
Bağlam: Gelman'ın 8 okullu örneğinde (Bayesian Veri Analizi, 3. baskı, Ch 5.5) 8 okulda koçluğun etkisini test eden sekiz paralel deney vardır. Her deney, koçluğun etkinliği ve ilgili standart hata için bir tahmin verir. Daha sonra yazarlar koçluk etkisinin 8 veri noktası için aşağıdaki gibi hiyerarşik bir model oluştururlar: yi∼N(θi,sei)θi∼N(μ,τ)yi∼N(θi,sei)θi∼N(μ,τ) …

1
Aşamalı AIC - Bu konuyu çevreleyen tartışmalar var mı?
Bu sitede, p-değerlerine dayalı, AIC, BIC vb. Bu prosedürlerin neden değişkenlerin seçimi için genel olarak oldukça zayıf olduğunu anlıyorum. gung'un buradaki muhtemelen ünlü gönderisi nedenini açıkça göstermektedir; sonuçta, sadece veri taraması olan hipotezi ortaya koyduğumuz aynı veri kümesinde bir hipotezi doğrularız. Ayrıca, p-değerleri, çarpıklık ve uç değerler gibi büyük ölçüde …

2
LASSO ve Bayes perspektifinden sırt: ayar parametresi ne olacak?
LASSO ve sırt gibi cezalandırılmış regresyon tahmin edicilerinin, belirli öncelikleri olan Bayesci tahmin edicilere karşılık geldiği söylenir. Sanırım (Bayes istatistikleri hakkında yeterince bilgim yok), sabit bir ayar parametresi için önceden karşılık gelen bir beton var. Şimdi bir frekansçı ayar parametresini çapraz doğrulamayla optimize edecektir. Bunu yapmanın bir Bayesian eşdeğeri var …

11
Bu diktatör oyunu örneğinde nedensellikten korelasyon çıkarabilir misiniz?
Sadece iki değişkenle sunulduğumuz sınavı geçtim. Bir diktatörün 100 USD verildiği ve kendisi için ne kadar gönderileceğini veya tutabileceğini seçebilen bir diktatör oyununda, yaş ile katılımcıların ne kadar para tutmaya karar verdikleri arasında pozitif bir korelasyon vardı. Benim düşüncem, nedenselliği bundan çıkaramazsın çünkü nedenselliği korelasyondan çıkaramazsın. Sınıf arkadaşım yapabileceğinizi düşünüyor, …


7
“Normal Dağılım” için ortalama = medyan = mod olması gerekiyor mu?
Lisansüstü istatistik profesörümle "normal dağılımlar" konusunda bir tartışma içerisindeyim. Gerçekten normal bir dağılım elde edebilmek için ortalama = medyan = moda sahip olması gerektiğini, tüm verilerin çan eğrisi altında yer alması ve ortalama etrafında mükemmel simetrik olması gerektiğini iddia ediyorum. Bu nedenle, teknik olarak, gerçek çalışmalarda neredeyse hiç normal dağılım …


3
Neden basit en küçük kareler katsayılarını bulmak için “normal denklemleri” kullanmıyorsunuz?
Bu listeyi burada gördüm ve en küçük kareleri çözmenin birçok yolu olduğuna inanamadım. Wikipedia'daki "normal denklemler" oldukça basit bir yol gibi görünüyordu: α^β^=y¯−β^x¯,=∑ni=1(xi−x¯)(yi−y¯)∑ni=1(xi−x¯)2α^=y¯−β^x¯,β^=∑i=1n(xi−x¯)(yi−y¯)∑i=1n(xi−x¯)2 {\displaystyle {\begin{aligned}{\hat {\alpha }}&={\bar {y}}-{\hat {\beta }}\,{\bar {x}},\\{\hat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})(y_{i}-{\bar {y}})}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}\end{aligned}}} Öyleyse neden sadece onları kullanmıyorsunuz? Mark L'nin ilk bağlantısında SVD veya …

3
“İstatistiksel deney” ile “istatistiksel model” arasındaki fark nedir?
AW van der Vaart, asimtotik istatistikleri takip ediyorum (1998). Bir istatistiksel modelden farklı olduklarını iddia ederek istatistiksel deneylerden bahseder, ancak ikisini de tanımlamaz. Benim sorum: (1) bir istatistiksel deney, (2) bir istatistiksel model ve (3) istatistiksel deneyi her zaman herhangi bir istatistiksel modelden farklı kılacak temel bileşen nedir?

1
Test: Sınıflandırıcıya karar sınırını söyleyin
Aşağıdaki 6 karar sınırı verilmiştir. Karar sınırları violett çizgileridir. Noktalar ve çarpılar iki farklı veri kümesidir. Hangisinin bir olduğuna karar vermeliyiz: Doğrusal SVM Çekirdek SVM (2. sıra polinom çekirdeği) Algılayıcı Lojistik regresyon Sinir Ağı (10 düzeltilmiş doğrusal birim içeren 1 gizli katman) Sinir Ağı (10 tanh birimli 1 gizli katman) …


1
Maksimum olasılık ve momentler yöntemi ne zaman aynı tahmin edicileri üretir?
Geçen gün bu soru soruldu ve daha önce hiç düşünmemiştim. Sezgim her tahmincinin avantajlarından geliyor. Maksimum olasılık tercihen veri oluşturma sürecinden emin olduğumuz zamandır, çünkü momentler yönteminin aksine, tüm dağılım bilgisini kullanır. MoM tahmincileri sadece anlarda bulunan bilgileri kullandığından, tahmin etmeye çalıştığımız parametre için yeterli istatistikler tam olarak verilerin anları …

2
Beta regresyonu yanıt değişkenindeki neden 0 ve 1'lerle tam olarak ilgilenemiyor?
Beta regresyonunun (yani beta dağılımlı GLM ve genellikle logit bağlantı fonksiyonu), kesirler, oranlar veya olasılıklar gibi 0 ve 1 arasında değerler alarak bağımlı değişken değişken yanıtı ele alması önerilir: Bir sonuç için regresyon (oran veya kesir) 0 ile 1 arasında . Bununla birlikte, yanıt değişkeninin en az bir kez 0 …


Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.