İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Daniel Wilks (2011) neden temel bileşen gerilemesinin “önyargılı olacağını” söylüyor?
In Atmosferik Bilimlerde İstatistiksel Yöntemler öngörüleri arasında çok güçlü intercorrelations (3. Baskı, sayfa 559-560) varsa, Daniel Wilks notları çoklu lineer regresyon problemlerine yol açabilir: Çoklu doğrusal regresyonda ortaya çıkabilecek bir patoloji, güçlü karşılıklı korelasyonlara sahip bir dizi öngörücü değişkenin, kararsız bir regresyon ilişkisinin hesaplanmasına neden olabilmesidir. (...) Daha sonra temel …
13 regression  pca  bias 


2
Tahmin, istatistikçilerin kabiliyetini yargılamak için 'altın kriter' midir?
Geçen hafta Faraway'in R (1. baskı) ders kitabı doğrusal modellerini okuyordum . Faraway'in "İstatistiksel Strateji ve Model Belirsizliği" adlı bir bölümü vardı. O yapay bir çok karmaşık model kullanılarak bazı verileri oluşturduğunu (sayfa 158) açıklanan, sonra veriyi modellemek ve öğrencileri tahmin sonuçları karşılaştırmak için öğrencilerini istedi vs okuma sonuçları. Ne …

1
Oranlar basitleştirildi
Oranları anlama konusunda biraz sorun yaşıyorum ve bunları nasıl yorumlayacağımla ilgili temel bir açıklama istiyorum. Oranlarla ilgili çeşitli yayınlar buldum, ancak çoğu anlamaya çalıştığımdan daha karmaşık. Oranları nasıl yorumladığımın bir örneği: Eğer bir olayın olasılığı 3'e 1 ise, olay gerçekleşmeyen her 1 seferde 3 kez olacaktır. Bu yorumun doğru olup …

1
"Öz" ün bir matrisin tersine çevrilmesine nasıl yardımcı olduğunu açıklayın
Benim sorum geoR:::.negloglik.GRFveya içinde kullanılan bir hesaplama tekniği ile ilgili geoR:::solve.geoR. Doğrusal karışık model kurulumunda: burada β ve b sırasıyla sabit ve rastgele etkilerdir. Ayrıca, Σ = cov ( Y )Y=Xβ+Zb+eY=Xβ+Zb+e Y=X\beta+Zb+e ββ\betabbbΣ=cov(Y)Σ=cov(Y)\Sigma=\text{cov}(Y) Etkileri tahmin ederken , normalde böyle bir şey kullanılarak yapılabilen hesaplanması gerekir , ancak bazen ( X …

5
Sonsuz rulo serisinden seçilen bir kalıbın ortalama değeri
Bir çift zar sonsuz sayıda döndürürsem ve her zaman ikisinin daha yüksek değerini seçersem, en yüksek değerlerin beklenen ortalaması 3,5'i aşar mı? Bir milyon zar attığımda ve her seferinde en yüksek değeri seçtiğimde, her bir ruloda altı adet bulunabileceği ihtimalleri ezici görünüyor. Dolayısıyla, beklenen ortalama 5.999999999999 gibi bir şey olmalı …
13 dice 

1
İşbirlikçi Filtrelemede Son Teknoloji
Kısmen gözlenen bir matrisi veya daha genel olarak tensörü tamamlamak için işbirlikçi filtreleme (CF) projesi üzerinde çalışıyorum. Sahaya yeni başlayan biriyim ve bu proje için sonunda yöntemimizi, günümüzde, CF'de son teknoloji olan önerilen yöntemlerin kendileriyle karşılaştırıldığı bilinen diğer yöntemlerle karşılaştırmam gerekiyor. Araştırmam aşağıdaki yöntemleri ortaya çıkardı. Gerçekten de, bu makalelerin …


3
Doğrusal regresyon: OLS ve MLE kimliğini veren normal olmayan herhangi bir dağılım?
Bu soru, buradaki yorumlardaki uzun tartışmadan esinlenmiştir: Doğrusal regresyon normal dağılımı nasıl kullanır? Her zamanki doğrusal regresyon modelinde, burada sadece tek bir öngörücü ile yazılmış basitlik için: burada x i bilinen sabitler ve ϵ i sıfır ortalama bağımsız hata terimleridir. Ayrıca hatalar için normal dağılımlar varsa, olağan en küçük kareler …

1
Bu ne tür bir grafik?
Belirsiz soru için özür dilerim ama bu grafik Biddle ve ark. 2009 ve daha önce böyle bir şeyle karşılaşmadım. Eğimli kenarları olan bir çubuk grafik, bazen 'boynuz'. Bunlar ne anlama geliyor? Bu grafik türünün bir adı var mı? Https://meta.stackexchange.com/questions/244083/site-for-asking-about-charts başına Ben Academia sormak için en iyi yer olduğunu düşündüm.

7
Sonuçlara “neredeyse” veya “bir şekilde” önemli olarak bakmak yanlış mı?
Benzer bir soruya ilişkin genel fikir birliği, Sonuçların "son derece anlamlı" olduğunu belirtmek yanlış mı? "yüksek derecede önemli" ifadesinin, önceden belirlenmiş önem eşiğinizin çok altında p değeri olan bir ilişkilendirmenin gücünü tanımlamak için spesifik, ancak spesifik olmayan bir yol olmasıdır. Ancak, eşiğinizin biraz üzerinde olan p değerlerini açıklamaya ne dersiniz …

3
kukla değişkenleri merkezleme ve ölçeklendirme
Hem kategorik değişkenleri hem de sürekli değişkenleri içeren bir veri setim var. Kategorik değişkenleri her seviye için ikili değişkenler olarak dönüştürmem önerildi (yani, A_level1: {0,1}, A_level2: {0,1}) - Bence bazıları buna "kukla değişkenler" adını verdiler. Bununla birlikte, tüm veri kümesini yeni değişkenlerle ortalamak ve ölçeklendirmek yanıltıcı olur mu? Değişkenlerin "açık …

1
Denetimli boyut azalması
15K etiketli örneklerden (10 gruptan) oluşan bir veri setim var. Boyutların azaltılmasını etiketlerin bilgisini dikkate alan 2 boyuta uygulamak istiyorum. PCA gibi "standart" denetimsiz boyutsallık azaltma tekniklerini kullandığımda, saçılma grafiğinin bilinen etiketlerle ilgisi yok gibi görünüyor. Aradığım şeyin bir adı var mı? Bazı çözüm referanslarını okumak istiyorum.

1
PCA'nın daima koordinat eksenlerini döndürdüğü göz önüne alındığında, "döndürülmüş" ve "döndürülmemiş" ana bileşenler nelerdir?
Anladığım kadarıyla, ana bileşenler, maksimum varyans yönleriyle hizalamak için koordinat eksenlerini döndürerek elde edilir. Yine de, "döndürülmemiş ana bileşenler" hakkında okumaya devam ediyorum ve istatistik yazılımım (SAS) bana döndürülmemiş olanların yanı sıra varimax döndürülmüş ana bileşenleri de veriyor. Burada kafam karıştı: temel bileşenleri hesapladığımızda, eksenler zaten döndürülmüş durumda; Peki neden …

1
Derin ağ LSTM katmanı nasıl eğitilir
Metin sınıflandırmak için bir lstm ve ileri beslemeli ağ kullanıyorum. Metni tek sıcak vektörlere dönüştürüyorum ve her birini lstm'ye besliyorum, böylece tek bir gösterim olarak özetleyebiliyorum. Sonra diğer ağa besliyorum. Ama lstm'yi nasıl eğitebilirim? Metni sıralamak istiyorum - eğitim yapmadan mı beslemeliyim? Ben sadece sınıflandırıcı giriş katmanına besleyebilir tek bir …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.