Глава 6

Линейная регрессия по прямой

[15/100%]
Показать
LaTeX
Задача 6.1

Пусть F=β^12∑i(xi−xˉ)2/S2F = \widehat{\beta }_{1}^{2} \sum_{i}\left(x_{i}-\bar{x}\right)^{2} / S^{2} — FF-статистика для проверки H:β1=0H: \beta_{1} = 0 для прямой линии. Используя обозначения раздела 6.1.5, докажите, что

x~0−xˉ=FF+(n−2)(x^0−xˉ). \tilde{x}_{0}-\bar{x} = \frac{F}{F+(n-2)}\left(\widehat{x}_{0}-\bar{x}\right) .
?
Задача 6.2

Выведите FF-статистику для проверки гипотезы о том, что две прямые пересекаются в точке (a,b)(a, b).

?
Задача 6.3

Получите оценку и доверительный интервал для горизонтального расстояния между двумя параллельными прямыми.

?
Задача 6.4

Покажите, как преобразовать следующее уравнение к прямой линии, чтобы α\alpha и β\beta можно было оценить методом наименьших квадратов:

y=αβαsin⁡2θ+βcos⁡2θ. y = \frac{\alpha \beta }{\alpha \sin ^{2} \theta +\beta \cos ^{2} \theta } .
?
§
Задача 6a.1

При подгонке прямой Yi=β0+β1xi+εi(i=1,2,…,n)Y_{i} = \beta_{0}+\beta_{1} x_{i}+\varepsilon_{i}(i = 1,2, \ldots , n) докажите, что Yˉ\bar{Y} и β^1\widehat{\beta }_{1} некоррелированы. Если Y^0=β^0+β^1x0\widehat{Y}_{0} = \widehat{\beta }_{0}+\widehat{\beta }_{1} x_{0}, выведите отсюда, что

Var⁡[Y^0]=σ2{1n+(x0−xˉ)2∑(xi−xˉ)2} \operatorname {Var}\left[\widehat{Y}_{0}\right] = \sigma ^{2}\left\{ \frac{1}{n}+\frac{\left(x_{0}-\bar{x}\right)^{2}}{\sum \left(x_{i}-\bar{x}\right)^{2}}\right\}
?
Задача 6a.2

Используя обозначения раздела 6.1.2, докажите, что ϕ^=−β^0/β^1\widehat{\phi } = -\widehat{\beta }_{0} / \widehat{\beta }_{1} является оценкой максимального правдоподобия для ϕ\phi.

?
Задача 6a.3

Дана общая линейная регрессионная модель; покажите, как найти доверительный интервал для отношения a1Tβ/a2Tβ\mathbf{a}_{1}^{T} \mathbf{\beta } / \mathbf{a}_{2}^{T} \mathbf{\beta } двух линейных параметрических функций.

?
Задача 6a.4

Используя обозначения раздела 6.1.5, покажите, что при xˉ=0\bar{x} = 0

x^0−x~0x^0=1−r2 \frac{\widehat{x}_{0}-\tilde{x}_{0}}{\widehat{x}_{0}} = 1-r^{2}

где rr — коэффициент корреляции пар (xi,Yi)\left(x_{i}, Y_{i}\right).

?
§
Задача 6b.1

Пусть Y1,Y2,…,YnY_{1}, Y_{2}, \ldots , Y_{n} — независимые случайные величины такие, что для i=1,2,…,ni = 1,2, \ldots , n

E[Yi∣X=xi]=β1xi \mathbb {E}\left[Y_{i} \mid X = x_{i}\right] = \beta _{1} x_{i}

и

Var⁡[Yi∣X=xi]=σ2wi−1(wi>0) \operatorname {Var}\left[Y_{i} \mid X = x_{i}\right] = \sigma ^{2} w_{i}^{-1} \quad \left(w_{i} > 0\right)
?
(a)

Если условное распределение YY при заданном xx является распределением типа III (масштабированным гамма-распределением),

f(y∣x)=1axpΓ(p)yp−1exp⁡(−y/ax)0≤y<∞,p>0 f(y \mid x) = \frac{1}{a_{x}^{p} \Gamma (p)} y^{p-1} \exp \left(-y / a_{x}\right) \quad 0 \leq y < \infty , \quad p > 0

где αx\alpha_{x} — функция от xx, и wi−1=xi2w_{i}^{-1} = x_{i}^{2}, докажите, что оценка максимального правдоподобия для β1\beta_{1} также является взвешенной оценкой наименьших квадратов.

(b)

Если условное распределение YY при заданном xx является пуассоновским, и wi−1=xiw_{i}^{-1} = x_{i}, покажите, что оценка максимального правдоподобия — это в точности взвешенная оценка наименьших квадратов.

Задача 6b.2

Дана модель Yi=β1xi+εi(i=1,2,…,n)Y_{i} = \beta_{1} x_{i}+\varepsilon_{i}(i = 1,2, \ldots , n), где εi\varepsilon_{i} независимо распределены как N(0,σ2wi−1),wi>0N\left(0, \sigma^{2} w_{i}^{-1}\right), w_{i} > 0; покажите, как предсказать x0x_{0} для заданного значения Y0Y_{0} величины YY. Кратко опишите метод построения доверительного интервала для x0x_{0}.

?
Задача 6b.3

Дана линия регрессии

Yi=β0+β1xi+εi(i=1,2,…,n) Y_{i} = \beta _{0}+\beta _{1} x_{i}+\varepsilon _{i} \quad (i = 1,2, \ldots , n)

где εi\varepsilon_{i} независимы, E[εi]=0\mathbb {E}\left[\varepsilon_{i}\right] = 0 и Var⁡[εi]=σ2xi2\operatorname {Var}\left[\varepsilon_{i}\right] = \sigma^{2} x_{i}^{2}; покажите, что взвешенное оценивание наименьших квадратов эквивалентно обычному оцениванию наименьших квадратов для модели

Yixi=β1+β0xi+δi. \frac{Y_{i}}{x_{i}} = \beta _{1}+\frac{\beta _{0}}{x_{i}}+\delta _{i} .
?
§
Задача 6c.1

Используя обозначения примера 6.2, докажите, что оценки наименьших квадратов для αk\alpha_{k} и общего наклона β\beta (при нулевой гипотезе параллельности) даются формулами

α~k=Yˉk−β~xˉk \tilde{\alpha }_{k} = \bar{Y}_{k}-\tilde{\beta } \bar{x}_{k}

и

β~=∑k∑i(Yki−Yˉk.)(xki−xˉk.)∑k∑i(xki−xˉk.)2 \tilde{\beta } = \frac{\sum _{k} \sum _{i}\left(Y_{k i}-\bar{Y}_{k .}\right)\left(x_{k i}-\bar{x}_{k .}\right)}{\sum _{k} \sum _{i}\left(x_{k i}-\bar{x}_{k .}\right)^{2}}

Докажите, что

RSSH3=∑k∑i(Yki−Yˉk⋅)2−β~2∑k∑i(xki−xˉk⋅)2. \mathrm{RSS}_{H_{3}} = \sum _{k} \sum _{i}\left(Y_{k i}-\bar{Y}_{k} \cdot \right)^{2}-\tilde{\beta }^{2} \sum _{k} \sum _{i}\left(x_{k i}-\bar{x}_{k} \cdot \right)^{2} .

Если β^k\widehat{\beta }_{k} — оценка наименьших квадратов для βk\beta_{k} в общей модели, докажите, что

RSSH1−RSS=∑kβ^k2∑i(xki−xˉk.)2−β~2∑k∑i(xki−xˉk.)2 \mathrm{RSS}_{H_{1}}-\mathrm{RSS} = \sum _{k} \widehat{\beta }_{k}^{2} \sum _{i}\left(x_{k i}-\bar{x}_{k} .\right)^{2}-\tilde{\beta }^{2} \sum _{k} \sum _{i}\left(x_{k i}-\bar{x}_{k} .\right)^{2}
?
Задача 6c.2

В примере 6.3 найдите оценки наименьших квадратов для α\alpha и β\beta, когда верна H2H_{2}.

?
Задача 6c.3

В примере 6.4 выведите следующие результаты.

?
(a)

Покажите, что оценки наименьших квадратов для α\alpha и βk\beta_{k} при H3H_{3} задаются формулами

(N−x1.2∑ix1i2−⋯−xK.2∑ixKi2)αT=(Y..−x1⋅⋅∑iY1ix1i∑ix1i2−⋯−xK⋅⋅∑iYKixKi∑ixKi2) \begin{aligned} & \left(N-\frac{x_{1.}^{2}}{\sum _{i} x_{1 i}^{2}}-\cdots -\frac{x_{K .}^{2}}{\sum _{i} x_{K i}^{2}}\right) \alpha ^{T} \\ & \quad \quad = \left(Y . .-\frac{x_{1 \cdot } \cdot \sum _{i} Y_{1 i} x_{1 i}}{\sum _{i} x_{1 i}^{2}}-\cdots -\frac{x_{K \cdot } \cdot \sum _{i} Y_{K i} x_{K i}}{\sum _{i} x_{K i}^{2}}\right) \end{aligned}

и

βkT=∑i(Yki−αT)xki∑ixki2(k=1,2,…,K) \beta _{k}^{T} = \frac{\sum _{i}\left(Y_{k i}-\alpha ^{T}\right) x_{k i}}{\sum _{i} x_{k i}^{2}} \quad (k = 1,2, \ldots , K)
(b)

Когда значения xx одинаковы для каждой прямой, так что nk=nn_{k} = n и xki=xi(k=1,2,…,K)x_{k i} = x_{i}(k = 1,2, \ldots , K), докажите, что

αT=Yˉ..−xˉ∑∑Yki(xi−xˉ)K∑(xi−xˉ)2=Yˉ..−xˉ∑kβ^kK,Var⁡[αT]=σ2∑xi2nK∑(xi−xˉ)2 \begin{gathered} \alpha ^{T} = \bar{Y} . .-\frac{\bar{x} \sum \sum Y_{k i}\left(x_{i}-\bar{x}\right)}{K \sum \left(x_{i}-\bar{x}\right)^{2}} = \bar{Y} . .-\bar{x} \frac{\sum _{k} \widehat{\beta }_{k}}{K}, \\ \operatorname {Var}\left[\alpha ^{T}\right] = \frac{\sigma ^{2} \sum x_{i}^{2}}{n K \sum \left(x_{i}-\bar{x}\right)^{2}} \end{gathered}

и

RSS⁡H3=∑k∑iYki2−(∑∑Ykixi)2∑xi2−(αT)2Kn∑(xi−xˉ)2∑xi2 \operatorname {RSS}_{H_{3}} = \sum _{k} \sum _{i} Y_{k i}^{2}-\frac{\left(\sum \sum Y_{k i} x_{i}\right)^{2}}{\sum x_{i}^{2}}-\left(\alpha ^{T}\right)^{2} K n \frac{\sum \left(x_{i}-\bar{x}\right)^{2}}{\sum x_{i}^{2}}

Указание: Yˉ\bar{Y}. и β^k\widehat{\beta }_{k} некоррелированы.

Задача 6c.4

Примеры из раздела 6.4 являются частными случаями следующей задачи.

Рассмотрим модель

G:E[Y]=X1β1+X2β2=Xβ G: \mathbb {E}\left[Y\right] = \mathbf{X}_{1} \mathbf{\beta }_{1}+\mathbf{X}_{2} \mathbf{\beta }_{2} = \mathbf{X} \mathbf{\beta }

где Xi\mathbf{X}_{i} имеет размер n×pin \times p_{i} и ранг pi(i=1,2)p_{i}(i = 1,2). Мы хотим проверить гипотезу HH о том, что все элементы β2\mathbf{\beta }_{\mathbf{2}} равны (некоторому β\beta, т.е. β2=1p2β\mathbf{\beta }_{2} = \mathbf{1}_{p_{2}} \beta).

?
(a)

Если β~\tilde{\beta } — оценка наименьших квадратов для β\beta при HH, покажите, что

β~=1p2TX2T(In−P1)Y1p2TX2T(In−P1)X21p2 \tilde{\beta } = \frac{\mathbf{1}_{p_{2}}^{T} \mathbf{X}_{2}^{T}\left(\mathbf{I}_{n}-\mathbf{P}_{1}\right) \mathbf{Y}}{\mathbf{1}_{p_{2}}^{T} \mathbf{X}_{2}^{T}\left(\mathbf{I}_{n}-\mathbf{P}_{1}\right) \mathbf{X}_{2} \mathbf{1}_{p_{2}}}

где P1=X1(X1TX1)−1X1T\mathbf{P}_{1} = \mathbf{X}_{1}\left(\mathbf{X}_{1}^{T} \mathbf{X}_{1}\right)^{-1} \mathbf{X}_{1}^{T}.

(b)

Если β^2\widehat{\mathbf{\beta }}_{\mathbf{2}} — оценка наименьших квадратов для β2\mathbf{\beta }_{\mathbf{2}} при GG, докажите, что

RSSH−RSS⁡G=(β^2−β~1p2)TX2T(In−P1)Y \mathrm{RSS}_{H}-\operatorname {RSS}_{G} = \left(\widehat{\mathbf{\beta }}_{2}-\tilde{\beta } \mathbf{1}_{p_{2}}\right)^{T} \mathbf{X}_{2}^{T}\left(\mathbf{I}_{n}-\mathbf{P}_{1}\right) \mathbf{Y}
(c)

Если Y^G\widehat{\mathbf{Y}}_{G} — подогнанная регрессия для GG, докажите, что

Y^G=P1Y+(In−P1)X2β^2 \widehat{\mathbf{Y}}_{G} = \mathbf{P}_{1} \mathbf{Y}+\left(\mathbf{I}_{n}-\mathbf{P}_{1}\right) \mathbf{X}_{2} \widehat{\mathbf{\beta }}_{2}

и

RSS⁡H−RSS⁡G=(1p2β~−β^2)TX2T(In−P1)X2(1p2β~−β^2) \operatorname {RSS}_{H}-\operatorname {RSS}_{G} = \left(\mathbf{1}_{p_{2}} \tilde{\beta }-\widehat{\mathbf{\beta }}_{2}\right)^{T} \mathbf{X}_{2}^{T}\left(\mathbf{I}_{n}-\mathbf{P}_{1}\right) \mathbf{X}_{2}\left(\mathbf{1}_{p_{2}} \tilde{\beta }-\widehat{\mathbf{\beta }}_{2}\right)

Указание: Для (а) и (б) примените теорему 3.6 с Z\mathbf{Z}, равным X2\mathbf{X}_{2} и 1p2\mathbf{1}_{p_{2}} соответственно. Для пункта (в) заметьте, что RSS⁡G−RSS⁡H=∥Y^G−Y^H∥2\operatorname {RSS}_{G}-\operatorname {RSS}_{H} = \left\| \widehat{\mathbf{Y}}_{G}-\widehat{\mathbf{Y}}_{H}\right\|^{2}.