Thống kê và dữ liệu lớn

Q & A cho những người quan tâm đến thống kê, học máy, phân tích dữ liệu, khai thác dữ liệu và trực quan hóa dữ liệu




1
Tìm các ngoại lệ trên một âm mưu phân tán
Tôi có một tập hợp các điểm dữ liệu được cho là ngồi trên một locus và theo một mẫu, nhưng có một số điểm phân tán từ các locus chính gây ra sự không chắc chắn trong phân tích cuối cùng của tôi. Tôi muốn có được một locus …

1
Những thông số của một mô hình tuyến tính tổng quát với mã hóa hiệu ứng có gì?
library(lme4) out <- glmer(cbind(incidence, size - incidence) ~ period + (1 | herd), data = cbpp, family = binomial, contrasts = list(period = "contr.sum")) summary(out) Fixed effects: Estimate Std. Error z value Pr(>|z|) (Intercept) -2.32337 0.22129 -10.499 < 2e-16 *** period1 0.92498 0.18330 5.046 4.51e-07 *** period2 -0.06698 0.22845 -0.293 …

2
Các giá trị CP (Độ phức tạp chi phí) được tính như thế nào trong RPART (hoặc cây quyết định nói chung)
Theo những gì tôi hiểu, đối số cp cho rparthàm giúp cắt tỉa trước cây theo cách tương tự như đối số minsplit hoặc minbucket. Điều tôi không hiểu là cách tính giá trị CP. Ví dụ df<-data.frame(x=c(1,2,3,3,3,4), y=as.factor(c(TRUE, TRUE, FALSE, TRUE, FALSE, FALSE)), method="class") mytree<-rpart(y ~ x, data = …
9 r  cart  rpart 

1
So sánh phần dư giữa hồi quy OLS và không OLS
Giả sử bạn muốn để ước lượng một mô hình tuyến tính: ( nnn quan sát phản ứng, và p+1p+1p+1 dự đoán) E(yi)=β0+∑j=1pβjxijE(yi)=β0+∑j=1pβjxij\mathbb{E}(y_i) = \beta_0 + \sum_{j=1}^p \beta_j x_{ij} Một cách để làm điều này là thông qua giải pháp OLS, tức là chọn các hệ số sao cho tổng …




2
Tôi có thể thực hiện phân tích sức mạnh kiểm tra t cho các nhóm có kích thước không đồng đều tạo ra 2 mức tối thiểu khác nhau không?
Nó thường đơn giản để làm một Power Analysisphép tính minimum sample size, đặc biệt là trong R là môi trường tính toán thống kê ưa thích của tôi. Tuy nhiên, tôi đang được yêu cầu thực hiện Phân tích sức mạnh khác một chút so với bất kỳ điều …

1
Lý thuyết giá trị cực đoan: Thông số GEV logic
Phân phối hợp lý thuộc về miền thu hút tối đa của Gumbel , trong đó: FlogN(x;μ,σ)=Φ(lnx−μσ)FlogN(x;μ,σ)=Φ(ln⁡x−μσ)F^{logN}(x; \mu,\sigma)=\Phi\left(\frac{\ln x - \mu}{\sigma}\right), FGum(x;μ,β)=e−exp(−x−μβ)FGum(x;μ,β)=e−exp⁡(−x−μβ)F^{Gum}(x;\mu,\beta) = e^{-\exp\left({-\frac{x-\mu}{\beta}}\right)} Câu hỏi của tôi : Chúng ta có μ=μμ=μ\mu=\mu và σ=βσ=β\sigma=\beta ? Các phân phối tổng quát cực trị cũng sử dụng ký hiệu β=σβ=σ\beta=\sigma (Gumbel …

2
Làm thế nào để chuẩn bị các tương tác của các biến phân loại trong scikit-learn?
Cách tốt nhất để chuẩn bị các tương tác của các tính năng phân loại trước khi phù hợp với scikit-learn là gì? Với statsmodelstôi có thể thuận tiện nói theo kiểu R smf.ols(formula = 'depvar ~ C(var1)*C(var2)', data=df).fit()(tương tự trong Stata với regress depvar i.var1##i.var2). Có thể sklearn.preprocessing.PolynomialFeatures(trong v0.15, …


1
Dư lượng trong hồi quy poisson
Hướng dẫn cho người mới bắt đầu Zuur 2013 về GLM & GLMM đề nghị xác thực hồi quy Poisson bằng cách vẽ các phần dư của Pearsons theo các giá trị được trang bị. Zuur tuyên bố chúng ta không nên thấy phần dư xuất hiện khi giá trị …

Khi sử dụng trang web của chúng tôi, bạn xác nhận rằng bạn đã đọc và hiểu Chính sách cookieChính sách bảo mật của chúng tôi.
Licensed under cc by-sa 3.0 with attribution required.