Глава 10

Отклонения от предположений: диагностика и способы устранения

[28/100%]
Показать
LaTeX
Задача 10.1

Рассмотрим регрессию с регрессионной матрицей X\mathbf{X} и МНК-оценкой β^\widehat{\mathbf{\beta }}. Предположим, что добавлен новый случай с данными (x,Y\mathbf{x}, Y). Покажите, что сумма квадратов остатков увеличивается на величину e2/(1+xT(XTX)−1x)e^{2} /\left(1+\mathbf{x}^{T}\left(\mathbf{X}^{T} \mathbf{X}\right)^{-1} \mathbf{x}\right), где e=Y−xTβ^e = Y-\mathbf{x}^{T} \widehat{\mathbf{\beta }}.

?
Задача 10.2

Рассмотрим удаление переменной xjx_{j} из регрессии. Пусть H\mathbf{H} и Hj\mathbf{H}_{j} — шляпные матрицы с включённым и без включённого соответствующего столбца x(j)\mathbf{x}^{(j)}.

?
(a)

Покажите, что

H=Hj+(In−Hj)x(j)x(j)′(In−Hj)x(j)′(In−Hj)x(j) \mathbf{H} = \mathbf{H}_{j}+\frac{\left(\mathbf{I}_{n}-\mathbf{H}_{j}\right) \mathbf{x}^{(j)} \mathbf{x}^{(j) \prime }\left(\mathbf{I}_{n}-\mathbf{H}_{j}\right)}{\mathbf{x}^{(j) \prime }\left(\mathbf{I}_{n}-\mathbf{H}_{j}\right) \mathbf{x}^{(j)}}
(b)

Пусть ηij=[(In−Hj)x(j)]i\eta_{i j} = \left[\left(\mathbf{I}_{n}-\mathbf{H}_{j}\right) \mathbf{x}^{(j)}\right]_{i}. Покажите, что если hih_{i} и hi(j)h_{i}^{(j)} — диагональные элементы матриц H\mathbf{H} и Hj\mathbf{H}_{j}, то

hi=hi(j)+ηij2∑kηkj2(10.72) h_{i} = h_{i}^{(j)}+\frac{\eta _{i j}^{2}}{\sum _{k} \eta _{k j}^{2}} \tag {10.72}
(c)

Объясните, как второе слагаемое в правой части (10.72) можно интерпретировать как рычаг (leverage) ii-го случая на графике добавленной переменной для переменной jj. Как можно использовать графики добавленных переменных, чтобы определить, какие переменные вносят вклад в рычаг наблюдения jj?

Задача 10.3

Корреляция, существующая между остатками в регрессии, усложняет обнаружение отклонений от стандартной регрессионной модели. По этой причине были предложены различные подходы к построению независимых и одинаково распределённых величин, «похожих на остатки». Например, Тейл [Theil, 1965, 1968] (см. также Гроссман и Стайан [Grossman and Styan, 1972]) ввёл BLUS-остатки e^\widehat{\mathbf{e}}, обладающие следующими свойствами: (i) e^=AY\widehat{\mathbf{e}} = \mathbf{A Y} для некоторой матрицы A\mathbf{A} размера (n−p)×n(n-p) \times n (т.е. линейность). (ii) Var⁡[e^]=σ2In−p\operatorname {Var}\left[\widehat{e}\right] = \sigma^{2} \mathbf{I}_{n-p} (т.е. скалярность). (iii) E[e^]=0\mathbb {E}\left[\widehat{e}\right] = 0 (т.е. несмещённость). (iv) Матрица A\mathbf{A} выбирается так, чтобы минимизировать E[∥e^−ε1∥2]\mathbb {E}\left[\left\| \widehat{\mathbf{e}}-\varepsilon_{1}\right\|^{2}\right], где ε1\varepsilon_{1} — некоторый фиксированный (n−p)(n-p)-мерный подвектор вектора ε\varepsilon (т.е. наилучшесть).

Таким образом, BLUS-остатки — это Nn−p(0,σ2In−p)N_{n-p}\left(\mathbf{0}, \sigma^{2} \mathbf{I}_{n-p}\right) линейная комбинация Y\mathbf{Y}, наилучшим образом приближающая некоторое (n−pn-p)-подмножество ошибок.

?
(a)

Предположим, что X\mathbf{X} имеет полный ранг pp. Пусть Q=(Q1,Q2)\mathbf{Q} = \left(\mathbf{Q}_{1}, \mathbf{Q}_{2}\right) — ортогональная матрица размера n×nn \times n, такая что столбцы Q1\mathbf{Q}_{1} образуют ортонормированный базис для C(X)\mathcal{C}(\mathbf{X}). (Например, Q\mathbf{Q} может быть матрицей, возникающей в QR-разложении, обсуждаемом в разделе 11.3.) Покажите, что любая матрица A\mathbf{A}, удовлетворяющая условиям (ii) и (iii) выше, должна иметь вид TQ2T\mathbf{T Q}_{2}^{T} для некоторой ортогональной матрицы T\mathbf{T} размера (n−p)×(n−p)(n-p) \times (n-p).

(b)

Пусть J\mathbf{J} — подматрица матрицы In\mathbf{I}_{n} размера (n−p)×n(n-p) \times n, такая что ε1=Jε\varepsilon_{1} = \mathbf{J} \varepsilon. Покажите, что

E[∥e^−ε1∥2]=2σ2[n−p−tr⁡(TQ2TJT)] \mathbb {E}\left[\left\| \widehat{\mathbf{e}}-\varepsilon _{1}\right\| ^{2}\right] = 2 \sigma ^{2}\left[n-p-\operatorname {tr}\left(\mathbf{T} \mathbf{Q}_{2}^{T} \mathbf{J}^{T}\right)\right]
(c)

Пусть Q2TJT=UΔVT\mathbf{Q}_{2}^{T} \mathbf{J}^{T} = \mathbf{U} \mathbf{\Delta } \mathbf{V}^{T} — сингулярное разложение матрицы Q2TJT\mathbf{Q}_{2}^{T} \mathbf{J}^{T} (ср. A.12). Покажите, что

tr⁡(TQ2TJT)≤tr⁡(Δ) \operatorname {tr}\left(\mathbf{T} \mathbf{Q}_{2}^{T} \mathbf{J}^{T}\right) \leq \operatorname {tr}(\mathbf{\Delta })

причём равенство достигается тогда и только тогда, когда T=VUT\mathbf{T} = \mathbf{V} \mathbf{U}^{T}. Отсюда покажите, что A=VUTQ2T\mathbf{A} = \mathbf{V} \mathbf{U}^{T} \mathbf{Q}_{2}^{T}. Указание: покажите, что tr⁡[(V−TU)Δ(V−TU)T]=2[tr⁡(Δ)−tr⁡(TQ2TJT)]\operatorname {tr}\left[(\mathbf{V}-\mathbf{T U}) \mathbf{\Delta }(\mathbf{V}-\mathbf{T U})^{T}\right] = 2\left[\operatorname {tr}(\mathbf{\Delta })-\operatorname {tr}\left(\mathbf{T} \mathbf{Q}_{2}^{T} \mathbf{J}^{T}\right)\right].

§
Задача 10a.1

Докажите (10.14).

?
Задача 10a.2

Покажите, что если случайная величина BB имеет бета-распределение (12α,12β)\left(\frac{1}{2} \alpha , \frac{1}{2} \beta \right), то F=βB{α(1−B)}−1F = \beta B\left\{ \alpha (1-B)\right\}^{-1} имеет распределение Fα,βF_{\alpha , \beta }. Выразите BB через FF.

?
Задача 10a.3
?
(a)

Выразите eie_{i} в виде ei=ciT(In−H)εe_{i} = \mathbf{c}_{i}^{T}\left(\mathbf{I}_{n}-\mathbf{H}\right) \varepsilon для подходящего вектора ci\mathbf{c}_{i}.

(b)

Покажите, что (n−p)−1ri2(n-p)^{-1} r_{i}^{2} можно записать в виде

(n−p)−1ri2=ZTQZZT(In−H)Z (n-p)^{-1} r_{i}^{2} = \frac{\mathbf{Z}^{T} \mathbf{Q} \mathbf{Z}}{\mathbf{Z}^{T}\left(\mathbf{I}_{n}-\mathbf{H}\right) \mathbf{Z}}

где Q=(1−hi)−1(In−H)ciciT(In−H)\mathbf{Q} = \left(1-h_{i}\right)^{-1}\left(\mathbf{I}_{n}-\mathbf{H}\right) \mathbf{c}_{i} \mathbf{c}_{i}^{T}\left(\mathbf{I}_{n}-\mathbf{H}\right) и Z∼Nn(0,In)\mathbf{Z} \sim N_{n}\left(\mathbf{0}, \mathbf{I}_{n}\right).

(c)

Докажите, что Q\mathbf{Q} является матрицей проектирования (т.е. покажите, что Q2=Q\mathbf{Q}^{2} = \mathbf{Q} и QT=Q\mathbf{Q}^{T} = \mathbf{Q}).

(d)

Покажите, что (In−H)−Q\left(\mathbf{I}_{n}-\mathbf{H}\right)-\mathbf{Q} является матрицей проектирования, и докажите, что ZTQZ\mathbf{Z}^{T} \mathbf{Q Z} и ZT((In−H)−Q)Z\mathbf{Z}^{T}\left(\left(\mathbf{I}_{n}-\mathbf{H}\right)-\mathbf{Q}\right) \mathbf{Z} независимы. Отсюда докажите, что (n−p)−1ri2(n-p)^{-1} r_{i}^{2} имеет бета-распределение [12,12(n−p−1)]\left[\frac{1}{2}, \frac{1}{2}(n-p-1)\right].

Задача 10a.4

Покажите, что (1−hi)2+∑j≠ihij2=(1−hi)\left(1-h_{i}\right)^{2}+\sum_{j \neq i} h_{i j}^{2} = \left(1-h_{i}\right).

?
§
Задача 10b.1
?
(a)

Покажите, что при условии, что регрессионная матрица X\mathbf{X} содержит столбец единиц, ∑i=1n(xij−xˉj)ei=0\sum_{i = 1}^{n}\left(x_{i j}-\bar{x}_{j}\right) e_{i} = 0 для каждого jj.

(b)

Используйте пункт (а) для доказательства (10.21).

Следующие упражнения требуют знакомства с таким вычислительным пакетом, как S-PLUS, R или Matlab. Мы приводим некоторый код на R в помощь читателям.

Задача 10b.2
?
(a)

Сгенерируйте набор регрессионных данных согласно модели

Yi=1+xi1+2sign⁡(xi2)∣xi2∣1/3+εi(i=1,…,100) Y_{i} = 1+x_{i 1}+2 \operatorname {sign}\left(x_{i 2}\right)\left|x_{i 2}\right|^{1 / 3}+\varepsilon _{i} \quad (i = 1, \ldots , 100)

где xi1x_{i 1} и xi2x_{i 2} выбираются из независимых распределений N(0,1)N(0,1), а ошибки εi\varepsilon_{i} выбираются из N(0,σ2)N\left(0, \sigma^{2}\right), где σ=0.25\sigma = 0.25. Это можно сделать в S-PLUS или R с помощью следующего фрагмента кода eps<-rnorm(100,sd=0.25) x1<-rnorm(100) x2<-rnorm(100) y<-1+x1+2*sign(x2)*abs(x2)^(1/3)+eps

(b)

Постройте график частных остатков для x2x_{2}. Насколько хорошо кривая на графике выявляет преобразование, необходимое для линеаризации регрессионной поверхности? Используйте код reg.stuff<-lm(y~x1+x2) betahat2<-coef(reg.stuff)[3] estar2<-betahat2*x2+residuals(reg.stuff) plot(x2,estar2)

(c)

Теперь постройте другой набор данных, такой же, как раньше, но с x2x_{2}, имеющим корреляцию ρ=0.95\rho = 0.95 с x1x_{1}. Используйте тот же код, но определите x2x_{2} строками rho<-0.95 x2<-rho*x1+sqrt(1-rho^2)*rnorm(100)

(d)

Постройте график частных остатков для нового x2x_{2}. Что вы замечаете?

Задача 10b.3

Постройте набор данных, как в упражнении 2, но с

Yi=1+xi1+εi(i=1,…,100) Y_{i} = 1+x_{i 1}+\varepsilon _{i} \quad (i = 1, \ldots , 100)

так что коэффициент β2\beta_{2} равен нулю. Задайте корреляцию ρ\rho между x1x_{1} и x2x_{2} равной 0.999. Что график частных остатков говорит о значимости x2x_{2} в модели? Сгенерируйте новый набор с ρ=0\rho = 0. Что теперь говорит график? Чему этот пример учит вас относительно использования графиков частных остатков для оценки значимости добавления переменных?

?
Задача 10b.4

Повторите упражнение 3, используя графики добавленной переменной вместо графиков частных остатков. Возникает ли у графиков добавленной переменной проблема с коррелированными данными? Используйте код на R resy<-residuals(lm(yx1)) resx2<-residuals(lm(x2x1)) plot(resy,resx2) для построения графика добавленной переменной.

?
Задача 10b.5

Постройте набор данных, как в упражнении 2(а), но с x2x_{2}, порождаемым как

xi2=xi12+ui(i=1,…,100) x_{i 2} = x_{i 1}^{2}+u_{i} \quad (i = 1, \ldots , 100)

где uiu_{i} имеют распределение N(0,0.1)N(0,0.1). Это создаст ситуацию, в которой график частных остатков, как ожидается, не сработает, согласно аргументам Кука [Cook, 1993], поскольку E[x2∣x1]=x12\mathbb {E}\left[\mathbf{x}_{2} \mid x_{1}\right] = x_{1}^{2}, что далеко от линейности. Действительно ли график не срабатывает? Повторите с x2x_{2}, являющимся линейной функцией x1x_{1}. Что происходит теперь?

?
§
Задача 10c.1

Продифференцируйте (10.35) и возьмите математическое ожидание, чтобы вывести (10.37).

?
Задача 10c.2
?
(a)

Пусть G=Σ−1X(XTΣ−1X)−1\mathbf{G} = \mathbf{\Sigma }^{-1} \mathbf{X}\left(\mathbf{X}^{T} \mathbf{\Sigma }^{-1} \mathbf{X}\right)^{-1}, и пусть Q\mathbf{Q} — ортонормированный базис для C(X)⊥\mathcal{C}(\mathbf{X})^{\perp }, так что QQT=In−X(XTX)−1XT\mathbf{Q} \mathbf{Q}^{T} = \mathbf{I}_{n}-\mathbf{X}\left(\mathbf{X}^{T} \mathbf{X}\right)^{-1} \mathbf{X}^{T}. Проверьте, что GTΣQ=0\mathbf{G}^{T} \mathbf{\Sigma } \mathbf{Q} = \mathbf{0} и что GTΣG=(XTΣ−1X)−1\mathbf{G}^{T} \mathbf{\Sigma } \mathbf{G} = \left(\mathbf{X}^{T} \mathbf{\Sigma }^{-1} \mathbf{X}\right)^{-1}.

(b)

Пусть M=(Σ1/2Q,Σ1/2G)\mathbf{M} = \left(\mathbf{\Sigma }^{1 / 2} \mathbf{Q}, \mathbf{\Sigma }^{1 / 2} \mathbf{G}\right). Покажите, что M\mathbf{M} имеет полный ранг, так что M(MTM)−1MT=In\mathbf{M}\left(\mathbf{M}^{T} \mathbf{M}\right)^{-1} \mathbf{M}^{T} = \mathbf{I}_{n}.

(c)

Используя (б), докажите (10.38).

(d)

Используя тот факт, что [det⁡(M)]2=det⁡(MTM)[\operatorname {det}\left(\mathbf{M}\right)]^{2} = \operatorname {det}\left(\mathbf{M}^{T} \mathbf{M}\right), докажите (10.39).

Задача 10c.3
?
(a)

Предположим, что Y=(Y1,…,Yn)T\mathbf{Y} = \left(Y_{1}, \ldots , Y_{n}\right)^{T}, где YiY_{i} независимы и одинаково распределены как N(μ,σ2)N\left(\mu , \sigma^{2}\right). Найдите ограниченное правдоподобие для QTY\mathbf{Q}^{T} \mathbf{Y}.

(b)

Покажите, что в этом примере REML-оценка σ2\sigma^{2} совпадает с обычной несмещённой оценкой S2=(n−1)−1∑i=1n(Yi−Yˉ)2S^{2} = (n-1)^{-1} \sum_{i = 1}^{n}\left(Y_{i}-\bar{Y}\right)^{2}. Таким образом, в этом случае REML-оценка несмещённа, а ОМП — нет.

Задача 10c.4

Предположим, что Y1,…,YnY_{1}, \ldots , Y_{n} — гамма-случайные величины с плотностями

fi(y)=1Γ(r)λiryr−1exp⁡(−y/λi) f_{i}(y) = \frac{1}{\Gamma (r) \lambda _{i}^{r}} y^{r-1} \exp \left(-y / \lambda _{i}\right)

так что E[Yi]=rλi=μi\mathbb {E}\left[Y_{i}\right] = r \lambda_{i} = \mu_{i}, скажем, и Var⁡[Yi]=r−1μi2\operatorname {Var}\left[Y_{i}\right] = r^{-1} \mu_{i}^{2}. Найдите преобразование, которое сделает дисперсии YiY_{i} приближённо равными.

?
§
Задача 10d.1

Пусть Z(1),…,Z(n)Z_{(1)}, \ldots , Z_{(n)} — порядковые статистики, вычисленные по случайной выборке из распределения N(0,1)N(0,1). Тогда (см., например, David [1981], Azzalini [1996: p. 301]) плотность Z(i)Z_{(i)} равна

n!(i−1)!(n−i)!Φ(z)i−1[1−Φ(z)]n−iϕ(z) \frac{n!}{(i-1)!(n-i)!} \Phi (z)^{i-1}[1-\Phi (z)]^{n-i} \phi (z)

где Φ\Phi и ϕ\phi — соответственно функция распределения и плотность стандартного нормального распределения.

?
(a)

Выполнив замену переменной, покажите, что

E[Z(i)]=B(i,n−i+1)−1∫01Φ−1(y)yi−1(1−y)n−idy \mathbb {E}\left[Z_{(i)}\right] = B(i, n-i+1)^{-1} \int _{0}^{1} \Phi ^{-1}(y) y^{i-1}(1-y)^{n-i} d y

где B(i,n−i+1)B(i, n-i+1) — бета-функция (A.13.6).

(b)

Используя определение интеграла, покажите, что

E[Z(i)]≈∑j=1nΦ−1[(j−0.5)/n]wij \mathbb {E}\left[Z_{(i)}\right] \approx \sum _{j = 1}^{n} \Phi ^{-1}[(j-0.5) / n] w_{i j}

где

wij=B(i,n−i+1)−1∫(j−1)/nj/nyi−1(1−y)n−idy w_{i j} = B(i, n-i+1)^{-1} \int _{(j-1) / n}^{j / n} y^{i-1}(1-y)^{n-i} d y
(c)

Объясните, почему веса wijw_{i j} в сумме дают 1.

(d)

Прокомментируйте точность приближения

E[Z(i)]≈Φ−1[(i−0.5)/n] \mathbb {E}\left[Z_{(i)}\right] \approx \Phi ^{-1}[(i-0.5) / n]
Задача 10d.2

Предположим, что g(y,λ)g(y, \lambda ) — семейство монотонно возрастающих преобразований, таких что g(Yi,λ)g\left(Y_{i}, \lambda \right) имеет распределение N(xiTβ,σ2)N\left(\mathbf{x}_{i}^{T} \beta , \sigma^{2}\right).

?
(a)

Покажите, что логарифм правдоподобия для Y1,…,YnY_{1}, \ldots , Y_{n} равен

c−n2log⁡σ2−12σ2∑i=1n[g(yi,λ)−xiTβ]2+∑i=1nlog⁡∣∂g(yi,λ)∂yi∣ c-\frac{n}{2} \log \sigma ^{2}-\frac{1}{2 \sigma ^{2}} \sum _{i = 1}^{n}\left[g\left(y_{i}, \lambda \right)-\mathbf{x}_{i}^{T} \beta \right]^{2}+\sum _{i = 1}^{n} \log \left|\frac{\partial g\left(y_{i}, \lambda \right)}{\partial y_{i}}\right|
(b)

Покажите, что в случае преобразования Джона-Дрейпера логарифм правдоподобия равен

c−n2log⁡σ2−12σ2∑i=1n[g(yi,λ)−xiTβ]2+(λ−1)∑i=1nlog⁡(1+∣yi∣) c-\frac{n}{2} \log \sigma ^{2}-\frac{1}{2 \sigma ^{2}} \sum _{i = 1}^{n}\left[g\left(y_{i}, \lambda \right)-\mathbf{x}_{i}^{T} \beta \right]^{2}+(\lambda -1) \sum _{i = 1}^{n} \log \left(1+\left|y_{i}\right|\right)
Задача 10d.3

Покажите, что при фиксированном λ\lambda значения β\beta и σ2\sigma^{2}, минимизирующие (10.47), равны

β∗=(XTX)−1XTEλ∗[Y] \beta _{*} = \left(\mathbf{X}^{T} \mathbf{X}\right)^{-1} \mathbf{X}^{T} \mathbb {E}_{\lambda _{*}}\left[\mathbf{Y}\right]

и

σ∗2=n−1{Eλ∗[YT(In−P)Y]+tr⁡(Var⁡λ∗[Y]P)} \sigma _{*}^{2} = n^{-1}\left\{ \mathbb {E}_{\lambda _{*}}\left[\mathbf{Y}^{T}\left(\mathbf{I}_{n}-\mathbf{P}\right) \mathbf{Y}\right]+\operatorname {tr}\left(\operatorname {Var}_{\lambda _{*}}\left[\mathbf{Y}\right] \mathbf{P}\right)\right\}

где EλE_{\lambda } обозначает математическое ожидание относительно hλh_{\lambda }, а P=X(XTX)−1XT\mathbf{P} = \mathbf{X}\left(\mathbf{X}^{T} \mathbf{X}\right)^{-1} \mathbf{X}^{T}.

?
§
Задача 10e.1

Рассмотрим линейную функцию dTβ\mathbf{d}^{T} \mathbf{\beta } от β\mathbf{\beta }. Покажите, что изменение оценки dTβ^\mathbf{d}^{T} \widehat{\mathbf{\beta }} при удалении ii-го наблюдения равно

dTβ^(i)−dTβ^=(CTd)iei/(1−hi), \mathbf{d}^{T} \widehat{\mathbf{\beta }}(i)-\mathbf{d}^{T} \widehat{\mathbf{\beta }} = \left(\mathbf{C}^{T} \mathbf{d}\right)_{i} e_{i} /\left(1-h_{i}\right),

где C\mathbf{C} — «улавливающая» матрица (XTX)−1XT\left(\mathbf{X}^{T} \mathbf{X}\right)^{-1} \mathbf{X}^{T}.

?
Задача 10e.2

Покажите, что

YD−XDβ^(D)=(I−HD)−1[YD−XDβ^(D)] \mathbf{Y}_{D}-\mathbf{X}_{D} \widehat{\mathbf{\beta }}(D) = \left(\mathbf{I}-\mathbf{H}_{D}\right)^{-1}\left[\mathbf{Y}_{D}-\mathbf{X}_{D} \widehat{\mathbf{\beta }}(D)\right]
?
Задача 10e.3

Предположим, что мы удаляем множество наблюдений DD. Покажите, что версия «удаления dd»

det⁡(XA(D)TXA(D))det⁡(XAXA) \frac{\operatorname {det}\left(\mathbf{X}_{A}(D)^{T} \mathbf{X}_{A}(D)\right)}{\operatorname {det}\left(\mathbf{X}_{A} \mathbf{X}_{A}\right)}

статистики Эндрюса-Прегибона может быть записана как

det⁡(Id−HD)[1−eDT(Id−HD)−1eDRSS⁡] \operatorname {det}\left(\mathbf{I}_{d}-\mathbf{H}_{D}\right)\left[1-\frac{\mathbf{e}_{D}^{T}\left(\mathbf{I}_{d}-\mathbf{H}_{D}\right)^{-1} \mathbf{e}_{D}}{\operatorname {RSS}}\right]
?
Задача 10e.4

Пусть hi,Ah_{i, A} — ii-й диагональный элемент шляпной матрицы, построенной по (X,Y\mathbf{X}, \mathbf{Y}), а не по X\mathbf{X}. Покажите, что AP(i)=1−hi,AA P(i) = 1-h_{i, A}. Указание: используйте результаты раздела 10.6.3.

?
Задача 10e.5

Кривая влияния для оценки наименьших квадратов β^\widehat{\mathbf{\beta }} была получена в примере 3.22. Выборочный вариант функции влияния (ФВ) (ср. раздел 3.13.3) можно определить, взяв z0=(xi,Yi),t=−1/(n−1),F\mathrm{z}_{0} = \left(\mathbf{x}_{i}, Y_{i}\right), t = -1 /(n-1), F как эмпирическую функцию распределения F^n\widehat{F}_{n}, и рассмотрев разность [T(Ft)−T(F)]/t\left[T\left(F_{t}\right)-T(F)\right] / t вместо производной. Это приводит к выборочной кривой влияния SICi\mathrm{SIC}_{i}, задаваемой формулой

SICi=−(n−1){T[(n−1)−1(nF^n−δi)]−T(F^n)} \mathrm{SIC}_{i} = -(n-1)\left\{ T\left[(n-1)^{-1}\left(n \widehat{F}_{n}-\delta _{i}\right)\right]-T\left(\widehat{F}_{n}\right)\right\}

где δi\delta_{i} помещает массу 1 в точку (xi,Yi\mathbf{x}_{i}, Y_{i}).

?
(a)

Покажите, что (n−1)−1(nF^n−δi)(n-1)^{-1}\left(n \widehat{F}_{n}-\delta_{i}\right) — эмпирическая функция распределения, вычисленная по оставшимся (n−1)(n-1) точкам, когда ii-е наблюдение удалено из выборки.

(b)

Отсюда покажите, что для функционала оценки наименьших квадратов TT

SICi=(n−1)(β^(i)−β^) \mathrm{SIC}_{i} = (n-1)(\widehat{\mathbf{\beta }}(i)-\widehat{\mathbf{\beta }})
(c)

Величина SICi\mathrm{SIC}_{i} является вектором. Общую скалярную меру можно получить, рассмотрев величину

Di(M,c)=c−1(SICi)TM(SICi) D_{i}(\mathbf{M}, c) = c^{-1}\left(\mathrm{SIC}_{i}\right)^{T} \mathbf{M}\left(\mathbf{S I C}_{i}\right)

где M\mathbf{M} — положительно определённая матрица, а cc — положительная константа. Покажите, что если выбрать M=XTX\mathbf{M} = \mathbf{X}^{T} \mathbf{X} и c=pS2/(n−1)2c = p S^{2} /(n-1)^{2}, мы получим расстояние Кука.

Подробнее о подходе к обнаружению выбросов на основе функции влияния см. Cook and Weisberg [1982, Chapter 3] и Chatterjee and Hadi [1988, Chapter 5].

§
Задача 10f.1

Покажите, что наибольшее собственное значение λ˘MAX \breve{\lambda }_{\text{MAX }} матрицы X˘TX˘\breve{\mathbf{X}}^{T} \breve{\mathbf{X}} удовлетворяет

1≤λ˘MAX⁡≤p 1 \leq \breve{\lambda }_{\operatorname {MAX}} \leq p
?
Задача 10f.2

Покажите, что

E[∥Xβ^−Xβ∥2]=σ2+E[∥X∗γ^−X∗γ∥2] \mathbb {E}\left[\left\| \mathbf{X} \widehat{\mathbf{\beta }}-\mathbf{X} \mathbf{\beta }\right\| ^{2}\right] = \sigma ^{2}+\mathbb {E}\left[\left\| \mathbf{X}^{*} \widehat{\mathbf{\gamma }}-\mathbf{X}^{*} \gamma \right\| ^{2}\right]
?
Задача 10f.3

Докажите, что при априорных распределениях из раздела 10.7.3 апостериорное среднее γ\gamma — это в точности гребневая оценка (10.64).

?
Задача 10f.4

Докажите, что при априорных распределениях из раздела 10.7.3 априорное распределение α^\widehat{\mathbf{\alpha }} есть Np−1[0,σ2(Λ−1+k−1Ip−1)]N_{p-1}\left[\mathbf{0}, \sigma^{2}\left(\mathbf{\Lambda }^{-1}+k^{-1} \mathbf{I}_{p-1}\right)\right].

?