İstatistikler ve Büyük Veri

İstatistik, makine öğrenmesi, veri analizi, veri madenciliği ve veri görselleştirmesi ile ilgilenen kişiler için soru cevap

1
Nadir olayları nasıl tahmin edebiliriz?
Sigorta riski tahmin modelini geliştirmek için çalışıyorum. Bu modeller, havayolu no-show tahmini, donanım arıza tespiti, vb. Gibi "nadir olaylara" sahiptir. Veri setimi hazırlarken sınıflandırmayı uygulamaya çalıştım, ancak negatif vakaların yüksek oranı nedeniyle yararlı sınıflandırıcılar alamadım . Bir lise istatistik dersinin ötesinde istatistik ve modelleme verileri konusunda çok fazla deneyimim yok, …

1
Nadir bir olay için kesme olasılığı nasıl seçilir Lojistik Regresyon
1000 pozitif ile 100.000 gözlemim (9 kukla gösterge değişkeni) var. Bu durumda Lojistik Regresyon iyi çalışmalıdır, ancak kesim olasılığı beni şaşırtıyor. Ortak literatürde, 1 ve 0'ları tahmin etmek için% 50 kesme seçiyoruz. Modelim ~% 1 maksimum değer verdiğinden bunu yapamam. Yani bir eşik 0,007'de veya onun etrafında bir yerde olabilir. …


3
Büyük bir ikili veri kümesini birkaç kategoriye kümelemek için hangi algoritmayı kullanmalıyım?
Büyük (650K satır * 62 sütun) ikili veri matrisi (yalnızca 0-1 girişleri) var. Matris çoğunlukla seyrek: yaklaşık% 8 doldurulur. Bunu 5 gruba ayırmak istiyorum - 1'den 5'e kadar adlandırın. Hiyerarşik kümelemeyi denedim ve boyutu işleyemedim. Ayrıca 62 uzunluk 650K bit vektörleri göz önünde bulundurarak çekiçleme mesafesine dayalı k-ortalama kümeleme algoritması …

1
Kuantil regresyon tahmin formülü
Kuantil regresyon tahmin edicisinin iki farklı temsilini gördüm. Q ( βq) = ∑i : yben≥ x'benβnq∣ yben- x'benβq∣ + ∑i : yben&lt; x'benβn( 1 - q) ∣ yben- x'benβq|S(βq)=Σben:yben≥xben'βnq|yben-xben'βq|+Σben:yben&lt;xben'βn(1-q)|yben-xben'βq|Q(\beta_{q}) = \sum^{n}_{i:y_{i}\geq x'_{i}\beta} q\mid y_i - x'_i \beta_q \mid + \sum^{n}_{i:y_{i}< x'_{i}\beta} (1-q)\mid y_i - x'_i \beta_q \mid ve Q ( …

2
Standart hatayı türetmek için genel yöntem
Hiçbir yerde standart hatalar elde etmek için genel bir yöntem bulamıyorum. Google'a, bu web sitesine ve hatta ders kitaplarına baktım, ancak bulabildiğim tek şey ortalama, varyans, oran, risk oranı vb.Için standart hataların formülü ve bu formüllere nasıl ulaşıldığı değil. Herhangi bir organ basit bir şekilde açıklayabilir veya hatta beni açıklayan …

1
Geri dönüştürülmüş güven aralıkları
Rastlamak olması bu tartışmanın geri-dönüştürülmüş güven aralıkları sözleşmeler üzerinde soru yükselterek ediyorum. Bu makaleye göre, log-normal rastgele değişkenin ortalaması için geri dönüştürülmüş CI nominal kapsamı: LCL(X)=exp(Y+var(Y) UCL ( X) = exp( Y+ var ( Y)2+ zvar ( Y)n+ var ( Y)22 ( n - 1 )------------√) UCL(X)=exp⁡(Y+var(Y)2+zvar(Y)n+var(Y)22(n−1))\ UCL(X)= \exp\left(Y+\frac{\text{var}(Y)}{2}+z\sqrt{\frac{\text{var}(Y)}{n}+\frac{\text{var}(Y)^2}{2(n-1)}}\right) L …

1
Eğriltme normal dağılımı için parametre tahminleri
Eğriltme için formülik parametre tahminleri nelerdir? Yapabiliyorsanız, MLE veya Mom yoluyla türetme de harika olurdu. Teşekkürler Düzenle . Ben araziler tarafından görsel olarak söyleyebilirim bir dizi veri var biraz sola eğri. Ortalama ve varyansı tahmin etmek ve sonra uygunluk testi yapmak istiyorum (bu yüzden parametre tahminlerine ihtiyacım var). Sadece çarpıklığı …

2
Ortalama korelasyon katsayısının önemi
Feragatname: Bu sorunun başka bir soruya çok benzediğini düşünüyorsanız, birleştirilmesinden memnun olurum. Ancak, başka bir yerde tatmin edici bir cevap bulamadım (ve henüz yorum veya upvote için "itibar" yok), bu yüzden kendim yeni bir soru sormak en iyi olacağını düşündüm. Sorum şu. 12 insan deneğin her biri için, bağımsız bir …

3
En küçük kareler ne zaman kötü bir fikir olurdu?
Bir regresyon modelim varsa: burada ve ,Y=Xβ+εY=Xβ+ε Y = X\beta + \varepsilon V[ε]=Id∈Rn×nV[ε]=Id∈Rn×n\mathbb{V}[\varepsilon] = Id \in \mathcal{R} ^{n \times n}E[ε]=(0,…,0)E[ε]=(0,…,0)\mathbb{E}[\varepsilon]=(0, \ldots , 0) ne zaman kullanarak ediyorum , en küçük kareler tahmincisi ait , bir tahmincisi için kötü bir seçim olabilir?βOLSβOLS\beta_{\text{OLS}}ββ\beta En küçük kareler kötü çalışıyor bir örnek anlamaya çalışıyorum. …

1
SurveyMonkey rastgele olmayan bir örnek aldığınız gerçeğini yoksayar mı?
SurveyMonkey, nüfus büyüklüğünüze bağlı olarak belirli bir hata veya güven aralığı aralığı için hangi örnek boyutuna ihtiyacınız olduğunu anlamanız için adımlar ve bir grafik içerir. SurveyMonkey örnek boyutu Bu grafik, yalnızca ankete yanıt vermek için rahatsız olan insanları aldığınız için rastgele bir örnek alamayacağınız gerçeğini görmezden geliyor mu? Bu soru …

1
Olabilirlik Oranı Testi ve Wald testi R'de glm için farklı sonuç verir
Genelleştirilmiş, Doğrusal ve Karışık Modellerden bir örnek üretiyorum . MWE'm aşağıda: Dilution &lt;- c(1/128, 1/64, 1/32, 1/16, 1/8, 1/4, 1/2, 1, 2, 4) NoofPlates &lt;- rep(x=5, times=10) NoPositive &lt;- c(0, 0, 2, 2, 3, 4, 5, 5, 5, 5) Data &lt;- data.frame(Dilution, NoofPlates, NoPositive) fm1 &lt;- glm(formula=NoPositive/NoofPlates~log(Dilution), family=binomial("logit"), data=Data) summary(object=fm1) …

3
Hangi mesafe kullanılır? ör. manhattan, öklid, Bray-Curtis, vb.
Ben bir topluluk ekologu değilim, ama bugünlerde topluluk ekolojisi verileri üzerinde çalışıyorum. Bu mesafelerin matematiği dışında anlayamadığım şey, kullanılacak her mesafe ve hangi durumlarda uygulanabileceğine ilişkin ölçütlerdir. Örneğin, sayım verileriyle ne kullanılır? İki konum arasındaki eğim açısını bir mesafeye nasıl dönüştürebilirim? Veya iki yerde sıcaklık veya yağış? Her mesafe için …

3
İlk temel bileşen sınıfları ayırmaz, ancak diğer bilgisayarlar yapar; bu nasıl mümkün olabilir?
PCA'yı, örnekleri iki sınıfa ayırmak için denetimli makine öğreniminde kullanılacak daha küçük değişkenler kümesi, yani temel bileşenler olarak çalıştırmak için çalıştırdım. PCA'dan sonra PC1 verilerdeki varyansın% 31'ini, PC2% 17'sini, PC3% 10'unu, PC4% 8'ini, PC5% 7'sini ve PC6% 6'sını oluşturur. Ancak, iki sınıf arasındaki PC'ler arasındaki ortalama farklılıklara baktığımda, şaşırtıcı bir …

4
Python'da Temel Bileşen Analizi ve Regresyon
SAS'ta yaptığım bazı çalışmaları Python'da nasıl çoğaltılacağını anlamaya çalışıyorum. Çoklu doğrusallığın bir sorun olduğu bu veri kümesini kullanarak Python'da temel bileşen analizi yapmak istiyorum. Scikit-learn ve istatistik modellerine baktım, ancak çıktılarını nasıl alacağımı ve SAS ile aynı sonuç yapısına nasıl dönüştüğünü bilmiyorum. Birincisi, SAS, kullandığınızda korelasyon matrisinde PCA yapıyor gibi …

Sitemizi kullandığınızda şunları okuyup anladığınızı kabul etmiş olursunuz: Çerez Politikası ve Gizlilik Politikası.
Licensed under cc by-sa 3.0 with attribution required.