4.7

Сравнение рисков

[20/0%]
Показать
LaTeX
Задача 4.7.1

Для ситуации примера 7.1:

?
(a)

Эмпирическая байесовская оценка θ\boldsymbol {\theta }, использующая несмещённую оценку τ2/(σ2+τ2)\tau^{2} /\left(\sigma^{2}+\tau^{2}\right), равна

δEB=(1−(p−2)σ2∣x∣2)x, \delta ^{\mathrm{EB}}=\left(1-\frac{(p-2) \sigma ^{2}}{|\mathbf{x}|^{2}}\right) \mathbf{x},

— оценке Джеймса—Стейна.

(b)

Эмпирическая байесовская оценка θ\boldsymbol {\theta }, использующая маргинальную MLE-оценку τ2/(σ2+τ2)\tau^{2} /\left(\sigma^{2}+\tau^{2}\right), равна

δEB=(1−pσ2∣x∣2)+x, \delta ^{\mathrm{EB}}=\left(1-\frac{p \sigma ^{2}}{|\mathbf{x}|^{2}}\right)^{+} \mathbf{x},

что напоминает положительную часть оценки Стейна.

Задача 4.7.2

Следствие 7.2 утверждает: пусть X∼Np(θ,σ2I)X \sim N_{p}(\theta , \sigma^{2} I), и пусть оценка δ\delta имеет вид δ(x)=x−g(x)\delta (\mathbf{x})=\mathbf{x}-g(\mathbf{x}), где g(x)={gi(x)}g(\mathbf{x})=\left\{ g_{i}(\mathbf{x})\right\} дифференцируема. Если Eθ[∣(∂/∂xi)gi(X)∣]<∞\mathbb {E}_{\theta }\left[\left|(\partial / \partial x_{i}) g_{i}(X)\right|\right]<\infty для i=1,…,pi=1, \ldots , p, то

R(θ,δ)=Eθ[∣θ−δ(X)∣2]=pσ2+Eθ[∣g(X)∣2]−2σ2∑i=1pEθ[∂∂xigi(X)]. R(\theta , \delta )=\mathbb {E}_{\theta }\left[\left|\theta -\delta (X)\right|^{2}\right]=p \sigma ^{2}+\mathbb {E}_{\theta }\left[\left|g(X)\right|^{2}\right]-2 \sigma ^{2} \sum _{i=1}^{p} \mathbb {E}_{\theta }\left[\frac{\partial }{\partial x_{i}} g_{i}(X)\right].

Докажите следствие 7.2. Обязательно проверьте, что условия на g(x)g(\mathbf{x}) достаточны, чтобы допустить рассуждение с интегрированием по частям. [Stein (1973,1981)(1973,1981) развивает эти представления в нормальном случае.]

?
Задача 4.7.3

Вывод несмещённой оценки риска (следствие 7.2) можно распространить на более общую модель в экспоненциальном семействе — модель следствия 3.3, где X=X1,…,Xp\mathbf{X}=X_{1}, \ldots , X_{p} имеет плотность

pη(x)=e∑i=1pηixi−A(η)h(x). p_{\boldsymbol {\eta }}(\mathbf{x})=e^{\sum _{i=1}^{p} \eta _{i} x_{i}-A(\boldsymbol {\eta })} h(\mathbf{x}).
?
(a)

Байесовская оценка η\boldsymbol {\eta } при квадратичной функции потерь равна

E[ηi∣x]=∂∂xilog⁡m(x)−∂∂xilog⁡h(x). \mathbb {E}\left[\eta _{i} \mid \mathbf{x}\right]=\frac{\partial }{\partial x_{i}} \log m(\mathbf{x})-\frac{\partial }{\partial x_{i}} \log h(\mathbf{x}).

Покажите, что риск E[η∣X]]\mathbb {E}\left[\eta \mid \mathbf{X}\right]] имеет несмещённую оценку

∑i=1p[∂2∂xi2(log⁡h(x)−2log⁡m(x))+(∂∂xilog⁡m(x))2]. \sum _{i=1}^{p}\left[\frac{\partial ^{2}}{\partial x_{i}^{2}}(\log h(\mathbf{x})-2 \log m(\mathbf{x}))+\left(\frac{\partial }{\partial x_{i}} \log m(\mathbf{x})\right)^{2}\right].

[Указание: теорема 3.5 и задача 3.4.]

(b)

Покажите, что риск эмпирической байесовской оценки

E[ηi∣x,λ^]=∂∂xilog⁡m(x∣λ^(x))−∂∂xilog⁡h(x). \mathbb {E}\left[\eta _{i} \mid \mathbf{x}, \hat{\lambda }\right]=\frac{\partial }{\partial x_{i}} \log m(\mathbf{x} \mid \hat{\lambda }(\mathbf{x}))-\frac{\partial }{\partial x_{i}} \log h(\mathbf{x}).

из теоремы 6.3 имеет несмещённую оценку

∑i=1p[∂2∂xi2(log⁡h(x)−2log⁡m(x∣λ^(x)))+(∂∂xilog⁡m(x∣λ^(x)))2] \sum _{i=1}^{p}\left[\frac{\partial ^{2}}{\partial x_{i}^{2}}(\log h(\mathbf{x})-2 \log m(\mathbf{x} \mid \hat{\lambda }(\mathbf{x})))+\left(\frac{\partial }{\partial x_{i}} \log m(\mathbf{x} \mid \hat{\lambda }(\mathbf{x}))\right)^{2}\right]
(c)

Используя результаты пункта (b), выведите несмещённую оценку риска положительной части оценки Стейна из (7.7.10).

Задача 4.7.4

Проверьте (7.7.9) — выражение для байесовского риска δτ0\delta^{\tau_{0}}. (Задача 3.12 может оказаться полезной.)

?
Задача 4.7.5

Общий вид эмпирической байесовской оценки (7.7.3) задаётся как

δc(x)=(1−cσ2∣x∣2)x, \delta ^{c}(\mathbf{x})=\left(1-\frac{c \sigma ^{2}}{|\mathbf{x}|^{2}}\right) \mathbf{x},

где cc — положительная константа.

?
(a)

Используя следствие 7.2, проверьте, что

Eθ[∣θ−δc(X)∣2]=pσ2+cσ4[c−2(p−2)]Eθ[1∣X∣2]. \mathbb {E}_{\theta }\left[\left|\boldsymbol {\theta }-\delta ^{c}(\mathbf{X})\right|^{2}\right]=p \sigma ^{2}+c \sigma ^{4}[c-2(p-2)] \mathbb {E}_{\theta }\left[\frac{1}{|\mathbf{X}|^{2}}\right].
(b)

Покажите, что байесовский риск при Θ∼Np(0,τ2I)\Theta \sim N_{p}\left(0, \tau^{2} I\right) задаётся формулой

r(π,δc)=σ2[p+cσ2σ2+τ2(cp−2−2)] r\left(\pi , \delta ^{c}\right)=\sigma ^{2}\left[p+\frac{c \sigma ^{2}}{\sigma ^{2}+\tau ^{2}}\left(\frac{c}{p-2}-2\right)\right]

и минимизируется при выборе c=p−2c=p-2.

Задача 4.7.6

Для модели

X∣θ∼Np(θ,σ2I),θ∣τ2∼Np(μ,τ2I): \begin{align} \mathbf{X} \mid \boldsymbol {\theta } & \sim N_{p}\left(\boldsymbol {\theta }, \sigma ^{2} I\right), \\ \boldsymbol {\theta } \mid \tau ^{2} & \sim N_{p}\left(\mu , \tau ^{2} I\right): \end{align}

Покажите, что:

?
(a)

Эмпирическая байесовская оценка, использующая несмещённую оценку τ2/(σ2+τ2)\tau^{2} /\left(\sigma^{2}+\tau^{2}\right), является оценкой Стейна

δiJS(x)=μi+(1−(p−2)σ2Σ(xi−μi)2)(xi−μi). \delta _{i}^{\mathrm{JS}}(\mathbf{x})=\mu _{i}+\left(1-\frac{(p-2) \sigma ^{2}}{\Sigma \left(x_{i}-\mu _{i}\right)^{2}}\right)\left(x_{i}-\mu _{i}\right).
(b)

Если p≥3p \geq 3, байесовский риск при квадратичной функции потерь оценки δJS\delta^{\mathrm{JS}} равен r(τ,δJS)=r(τ,δτ)+2σ4/(σ2+τ2)r\left(\tau , \delta^{\mathrm{JS}}\right)=r\left(\tau , \delta^{\tau }\right)+ 2 \sigma^{4} /\left(\sigma^{2}+\tau^{2}\right), где r(τ,δτ)r\left(\tau , \delta^{\tau }\right) — байесовский риск байесовской оценки.

(c)

Если p<3p<3, байесовский риск δJS\delta^{\mathrm{JS}} бесконечен. [Указание: Покажите, что если Y∼χm2Y \sim \chi_{m}^{2}, то E[1/Y]<∞⟺m<3]\mathbb {E}\left[1 / Y\right]< \infty \Longleftrightarrow m<3].

Задача 4.7.7

Для модели

X∣θ∼Np(θ,σ2I),θ∣τ2∼N(μ,τ2I) \begin{align} \mathbf{X} \mid \boldsymbol {\theta } & \sim N_{p}\left(\boldsymbol {\theta }, \sigma ^{2} I\right), \\ \boldsymbol {\theta } \mid \tau ^{2} & \sim N\left(\mu , \tau ^{2} I\right) \end{align}

байесовский риск обычной оценки Стейна

δi(x)=μi+(1−(p−2)σ2Σ(xi−μi)2)(xi−μi) \delta _{i}(\mathbf{x})=\mu _{i}+\left(1-\frac{(p-2) \sigma ^{2}}{\Sigma \left(x_{i}-\mu _{i}\right)^{2}}\right)\left(x_{i}-\mu _{i}\right)

равномерно больше, чем у её положительной части

δi+(x)=μi+(1−(p−2)σ2Σ(xi−μi)2)+(xi−μi). \delta _{i}^{+}(\mathbf{x})=\mu _{i}+\left(1-\frac{(p-2) \sigma ^{2}}{\Sigma \left(x_{i}-\mu _{i}\right)^{2}}\right)^{+}\left(x_{i}-\mu _{i}\right).
?
Задача 4.7.8

Теорема 7.5 верна в большей общности, чем только для нормального распределения. Предположим, что X\mathbf{X} распределена согласно многомерной версии экспоненциального семейства pη(x)p_{\eta }(x) из (33.7),

pη(x)=eη′x−A(η)h(x),−∞<xi<∞, p_{\eta }(\mathbf{x})=e^{\eta ^{\prime } \mathbf{x}-A(\eta )} h(\mathbf{x}), \quad -\infty <x_{i}<\infty ,

и используется многомерное сопряжённое априорное распределение [обобщающее (3.19)].

?
(a)

Покажите, что E[X∣η]=∇A(η)\mathbb {E}\left[\mathbf{X} \mid \eta \right]=\nabla A(\eta ).

(b)

Если μ=0\mu =0 в априорном распределении (см. 3.19), покажите, что r(τ,δ)≥r(τ,δ+)r(\tau , \delta ) \geq r\left(\tau , \delta^{+}\right), где δ(x)=[1−B(x)]x\delta (\mathbf{x})=[1-B(\mathbf{x})] \mathbf{x} и δ+(x)=[1−B(x)]+x\delta^{+}(\mathbf{x})=[1-B(\mathbf{x})]^{+} \mathbf{x}.

(c)

Если μ≠0\mu \neq 0, оценка δ(x)\delta (\mathbf{x}) изменяется на μ+δ(x−μ)\mu +\delta (\mathbf{x}-\mu ). Установите результат, аналогичный пункту (b), для этой оценки.

Задача 4.7.9
?
(a)

Для модели (7.7.15) покажите, что маргинальное распределение XiX_{i} — отрицательное биномиальное (a,1/b+1)(a, 1 / b+1); то есть

P(Xi=x)=(a+x−1x)(bb+1)x(1b+1)a \mathbb {P}\left(X_{i}=x\right)=\binom {a+x-1}{x}\left(\frac{b}{b+1}\right)^{x}\left(\frac{1}{b+1}\right)^{a}

с E[Xi]=ab\mathbb {E}\left[X_{i}\right]=a b и var Xi=ab(b+1)X_{i}=a b(b+1).

(b)

Если X1,…,XmX_{1}, \ldots , X_{m} независимые одинаково распределённые согласно отрицательному биномиальному распределению из пункта (a), покажите, что условное распределение Xj∣∑1mXiX_{j} \mid \sum_{1}^{m} X_{i} — отрицательное гипергеометрическое распределение, задаваемое как

P(Xj=x∣∑1mXi=t)=(a+x−1x)((m−1)a+t−x−1t−x)(ma+t−1t) \mathbb {P}\left(X_{j}=x \mid \sum _{1}^{m} X_{i}=t\right)=\frac{\binom {a+x-1}{x}\binom {(m-1) a+t-x-1}{t-x}}{\binom {m a+t-1}{t}}

с E[Xj]=t/m\mathbb {E}\left[X_{j}\right]=t / m и var Xj=(m−1)t(ma+t)/m2(ma+1)X_{j}=(m-1) t(m a+t) / m^{2}(m a+1).

Задача 4.7.10

Для ситуации примера 7.6:

?
(a)

Покажите, что байесовская оценка при функции потерь Lk(λ,δ)L_{k}(\lambda , \delta ) из (7.7.16) задаётся формулой (7.7.17).

(b)

Проверьте (7.7.19) и (7.7.20).

(c)

Вычислите байесовские риски r(0,δ1)r\left(0, \delta^{1}\right) и r(1,δ0)r\left(1, \delta^{0}\right). Какая оценка, δ0\delta^{0} или δ1\delta^{1}, более робастна?

Задача 4.7.11

Для ситуации примера 7.6 вычислите байесовский риск эмпирической байесовской оценки (7.7.20) при k=0k=0 и 1. При каких значениях неизвестного гиперпараметра bb эмпирическая байесовская оценка оказывается в наименее, а при каких — в наиболее выгодном положении?

?
Задача 4.7.12

Рассмотрим иерархическую байесовскую оценку для пуассоновской модели (7.7.15) при функции потерь (7.7.16). Используя распределение (5.6.27) для гиперпараметра bb, покажите, что байесовская оценка равна

(pxˉ+α−kpxˉ+pa+α+β−k)(a+xi−k). \left(\frac{p \bar{x}+\alpha -k}{p \bar{x}+p a+\alpha +\beta -k}\right)\left(a+x_{i}-k\right).

[Указание: Покажите, что байесовская оценка равна E[λ1−k∣x]/E[λ−k∣x]\mathbb {E}\left[\lambda^{1-k} \mid \mathbf{x}\right] / \mathbb {E}\left[\lambda^{-k} \mid \mathbf{x}\right] и что

E[λr∣x]=Γ(pxˉ+pa+α+β)Γ(pxˉ+α+r)Γ(pxˉ+α)Γ(pxˉ+pa+α+β+r)Γ(a+xi+r)Γ(a+xi). \mathbb {E}\left[\lambda ^{r} \mid \mathbf{x}\right]=\frac{\Gamma (p \bar{x}+p a+\alpha +\beta ) \Gamma (p \bar{x}+\alpha +r)}{\Gamma (p \bar{x}+\alpha ) \Gamma (p \bar{x}+p a+\alpha +\beta +r)} \frac{\Gamma \left(a+x_{i}+r\right)}{\Gamma \left(a+x_{i}\right)}.
?
Задача 4.7.13

Докажите следующее: два матричных результата, полезных при вычислении оценок в многомерных иерархических моделях:

?
(a)

Для любого вектора aa вида a=(I−1sJ)b,1′a=Σai=0a=\left(I-\frac{1}{s} J\right) b, \mathbf{1}^{\prime } a=\Sigma a_{i}=0.

(b)

Если BB — идемпотентная матрица (то есть B2=IB^{2}=I), а aa — скаляр, то

(I+aB)−1=I−a1+aB. (I+a B)^{-1}=I-\frac{a}{1+a} B.
Задача 4.7.14

Для ситуации примера 7.7:

?
(a)

Покажите, как вывести эмпирическую байесовскую оценку δL\delta^{L} из (7.7.28).

(b)

Проверьте байесовский риск δL\delta^{L} из (7.7.29).

Для ситуации примера 7.8:

(c)

Покажите, как вывести эмпирическую байесовскую оценку δEB2\delta^{\mathrm{EB}_{2}} из (7.7.33).

(d)

Проверьте байесовский риск δEB2\delta^{\mathrm{EB}_{2}}, (7.7.34).

Задача 4.7.15

Эмпирическую байесовскую оценку (7.7.27) можно также вывести как иерархическую байесовскую оценку. Рассмотрим иерархическую модель

Xij∣ξi∼N(ξi,σ2),j=1,…,n,i=1,…,s,ξi∣μ∼N(μ,τ2),i=1,…,s,μ∼ Uniform (−∞,∞) \begin{align} X_{i j} \mid \xi _{i} & \sim N\left(\xi _{i}, \sigma ^{2}\right), \quad j=1, \ldots , n, \quad i=1, \ldots , s, \\ \xi _{i} \mid \mu & \sim N\left(\mu , \tau ^{2}\right), \quad i=1, \ldots , s, \\ \mu & \sim \text{ Uniform }(-\infty , \infty ) \end{align}

где σ2\sigma^{2} и τ2\tau^{2} известны.

?
(a)

Покажите, что байесовская оценка при квадратичной функции потерь равна

E[ξi∣x]=σ2σ2+nτ2E[μ∣x]+nτ2σ2+nτ2xˉi \mathbb {E}\left[\xi _{i} \mid \mathbf{x}\right]=\frac{\sigma ^{2}}{\sigma ^{2}+n \tau ^{2}} \mathbb {E}\left[\mu \mid \mathbf{x}\right]+\frac{n \tau ^{2}}{\sigma ^{2}+n \tau ^{2}} \bar{x}_{i}

где E[μ∣x]\mathbb {E}\left[\mu \mid \mathbf{x}\right] — апостериорное среднее μ\mu.

(b)

Установите, что E[μ∣x]=xˉ=Σxij/ns\mathbb {E}\left[\mu \mid \mathbf{x}\right]=\bar{x}=\Sigma x_{i j} / n s. [Это можно сделать, вычислив математическое ожидание напрямую, либо показав, что апостериорное распределение ξi∣x\xi_{i} \mid \mathbf{x} есть

ξi∣ x∼N[σ2σ2+nτ2xˉ+nτ2σ2+nτ2xˉi,σ2σ2+nτ2(nτ2+σ2s)]. \xi _{i} \left\lvert \, \mathbf{x} \sim N\left[\frac{\sigma ^{2}}{\sigma ^{2}+n \tau ^{2}} \bar{x}+\frac{n \tau ^{2}}{\sigma ^{2}+n \tau ^{2}} \bar{x}_{i}, \frac{\sigma ^{2}}{\sigma ^{2}+n \tau ^{2}}\left(n \tau ^{2}+\frac{\sigma ^{2}}{s}\right)\right].\right.

Заметим, что величины ξi\xi_{i} не являются независимыми апостериори. В самом деле,

ξ∣ x∼Ns(nτ2σ2+nτ2M,nσ2τ2σ2+nτ2M), \boldsymbol {\xi } \left\lvert \, \mathbf{x} \sim N_{s}\left(\frac{n \tau ^{2}}{\sigma ^{2}+n \tau ^{2}} M, \frac{n \sigma ^{2} \tau ^{2}}{\sigma ^{2}+n \tau ^{2}} M\right)\right.,

где M=I+(σ2/nτ2)J]\left.M=I+\left(\sigma^{2} / n \tau^{2}\right) J\right].

(c)

Покажите, что эмпирическую байесовскую оценку (7.7.32) также можно вывести как иерархическую байесовскую оценку, добавив к иерархии (7.7.30) спецификацию (α,β)∼(\alpha , \beta ) \sim равномерное (ℜ2)\left(\Re^{2}\right) [то есть π(α,β)=dαdβ,−∞<α,β<∞\pi (\alpha , \beta )=d \alpha d \beta ,-\infty <\alpha , \beta <\infty ].

Задача 4.7.16

Обобщение модели (7.7.23) на случай неравных nin_{i}, возможно, не так просто, как можно было бы ожидать. Рассмотрим обобщение

Xij∣ξi∼N(ξi,σ2),j=1,…,ni,i=1,…,s,ξi∣μ∼N(μ,τi2),i=1,…,s. \begin{align} X_{i j} \mid \xi _{i} & \sim N\left(\xi _{i}, \sigma ^{2}\right), \quad j=1, \ldots , n_{i}, \quad i=1, \ldots , s, \\ \xi _{i} \mid \mu & \sim N\left(\mu , \tau _{i}^{2}\right), \quad i=1, \ldots , s. \end{align}

Предположим также, что τi2=τ2/ni\tau_{i}^{2}=\tau^{2} / n_{i}. Покажите, что:

?
(a)

Приведённая выше модель эквивалентна

Y∼Ns(λ,σ2I),λ∼Ns(Zμ,τ2I) \begin{align} & \mathbf{Y} \sim N_{s}\left(\lambda , \sigma ^{2} I\right), \\ & \lambda \sim N_{s}\left(\mathbf{Z} \mu , \tau ^{2} I\right) \end{align}

где Yi=niXˉi,λi=niξiY_{i}=\sqrt{n_{i}} \bar{X}_{i}, \lambda_{i}=\sqrt{n_{i}} \xi_{i} и z=(n1,…,ns)′\mathbf{z}=\left(\sqrt{n_{1}}, \ldots , \sqrt{n_{s}}\right)^{\prime }.

(b)

Байесовская оценка ξi\xi_{i} при квадратичной функции потерь равна

σ2σ2+τ2μ+τ2σ2+τ2xˉi. \frac{\sigma ^{2}}{\sigma ^{2}+\tau ^{2}} \mu +\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} \bar{x}_{i}.
(c)

Маргинальное распределение YiY_{i} есть Yi∼Ns(Zμ,(σ2+τ2)I)Y_{i} \sim N_{s}\left(\mathbf{Z} \mu ,\left(\sigma^{2}+\tau^{2}\right) I\right), и эмпирическая байесовская оценка ξ\xi равна

δiEB=xˉ+(1−(s−3)σ2Σni(xˉi−xˉ)2)(xˉi−xˉ) \delta _{i}^{E B}=\bar{x}+\left(1-\frac{(s-3) \sigma ^{2}}{\Sigma n_{i}\left(\bar{x}_{i}-\bar{x}\right)^{2}}\right)\left(\bar{x}_{i}-\bar{x}\right)

где xˉi=Σjxij/ni\bar{x}_{i}=\Sigma_{j} x_{i j} / n_{i} и xˉ=Σinixˉi/Σini\bar{x}=\Sigma_{i} n_{i} \bar{x}_{i} / \Sigma_{i} n_{i}. [Без предположения τi2=τ2/ni\tau_{i}^{2}=\tau^{2} / n_{i} получить простую эмпирическую байесовскую оценку не удаётся. Если τi2=τ2\tau_{i}^{2}=\tau^{2}, для получения оценки τ2\tau^{2}, используемой в эмпирической байесовской оценке, можно применить оценивание по методу правдоподобия. Это обсуждается у Morris (1983a).]

Задача 4.7.17

(Эмпирическое байесовское оценивание в общем случае). Общий вид иерархических моделей из примеров 7.7 и 7.8:

X∣ξ∼Ns(ξ,σ2I),ξ∣β∼Ns(Zβ,τ2I) \begin{align} & \mathbf{X} \mid \xi \sim N_{s}\left(\xi , \sigma ^{2} I\right), \\ & \xi \mid \boldsymbol {\beta } \sim N_{s}\left(\mathbf{Z} \boldsymbol {\beta }, \tau ^{2} I\right) \end{align}

где σ2\sigma^{2} и Zs×r\mathbf{Z}_{s \times r} ранга rr известны, а τ2\tau^{2} и βr×1\boldsymbol {\beta }_{r \times 1} неизвестны. Для этой модели покажите, что:

?
(a)

Байесовская оценка ξ\xi при квадратичной функции потерь равна

E[ξ∣x,β]=σ2σ2+τ2zβ+τ2σ2+τ2x. \mathbb {E}\left[\boldsymbol {\xi } \mid \mathbf{x}, \boldsymbol {\beta }\right]=\frac{\sigma ^{2}}{\sigma ^{2}+\tau ^{2}} z \boldsymbol {\beta }+\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} \mathbf{x}.
(b)

Маргинально распределение X∣β\mathbf{X} \mid \boldsymbol {\beta } есть X∣β∼Ns(Zβ,(σ2+τ2)I)\mathbf{X} \mid \boldsymbol {\beta } \sim N_{s}\left(\mathbf{Z} \boldsymbol {\beta },\left(\sigma^{2}+\tau^{2}\right) I\right).

(c)

При маргинальном распределении из пункта (b)

E[(Z′Z)−1Z′x]=E[β^]=β,E[s−r−2∣X−Zβ^∣2]=1σ2+τ2, \begin{align} \mathbb {E}\left[\left(\mathbf{Z}^{\prime } \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } \mathbf{x}\right] & =\mathbb {E}\left[\hat{\boldsymbol {\beta }}\right]=\boldsymbol {\beta }, \\ \mathbb {E}\left[\frac{s-r-2}{|\mathbf{X}-\mathbf{Z} \hat{\boldsymbol {\beta }}|^{2}}\right] & =\frac{1}{\sigma ^{2}+\tau ^{2}}, \end{align}

и, следовательно, эмпирическая байесовская оценка ξ\xi равна

δEB=Zβ^+(1−(s−r−2)σ2∣x−Zβ^∣2)(x−Zβ^). \delta ^{E B}=\mathbf{Z} \hat{\boldsymbol {\beta }}+\left(1-\frac{(s-r-2) \sigma ^{2}}{|\mathbf{x}-\mathbf{Z} \hat{\boldsymbol {\beta }}|^{2}}\right)(\mathbf{x}-\mathbf{Z} \hat{\boldsymbol {\beta }}).
(d)

Байесовский риск δEB\delta^{E B} равен r(τ,δτ)+(r+2)σ4/(σ2+τ2)r\left(\tau , \delta^{\tau }\right)+(r+2) \sigma^{4} /\left(\sigma^{2}+\tau^{2}\right), где r(τ,δτ)r\left(\tau , \delta^{\tau }\right) — риск байесовской оценки.

Задача 4.7.18

Аналогично предыдущей задаче, можно вывести иерархические байесовские оценки для модели

X∣ξ∼Ns(ξ,σ2I),ξ∣β∼Ns(Zβ,τ2I),β∼Uniform⁡(ℜr) \begin{align} \mathbf{X} \mid \boldsymbol {\xi } & \sim N_{s}\left(\boldsymbol {\xi }, \sigma ^{2} I\right), \\ \boldsymbol {\xi } \mid \boldsymbol {\beta } & \sim N_{s}\left(\mathbf{Z} \boldsymbol {\beta }, \tau ^{2} I\right), \\ \boldsymbol {\beta } & \sim \operatorname {Uniform}\left(\Re ^{r}\right) \end{align}

где σ2\sigma^{2} и Zs×r\mathbf{Z}_{s \times r} ранга rr известны, а τ2\tau^{2} неизвестно.

?
(a)

Априорное распределение ξ\boldsymbol {\xi }, безусловное относительно β\beta, пропорционально

π(ξ)=∫ℜrπ(ξ∣β)dβ∝e−12ξ′(I−H)ξτ2, \pi (\xi )=\int _{\Re ^{r}} \pi (\xi \mid \beta ) d \beta \propto e^{-\frac{1}{2} \frac{\xi ^{\prime }(I-H) \xi }{\tau ^{2}}},

где H=Z(Z′Z)−1Z′H=\mathbf{Z}\left(\mathbf{Z}^{\prime } \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } проектирует из ℜs\Re^{s} в ℜr\Re^{r}. [Указание: Установите, что

(ξ−Zβ)′(ξ−Zβ)=ξ′(I−H)ξ+[β−(Z′Z)−1Z′ξ]′Z′Z[β−(Z′Z)−1Z′ξ] \begin{align} (\xi -\mathbf{Z} \boldsymbol {\beta })^{\prime }(\boldsymbol {\xi }-\mathbf{Z} \boldsymbol {\beta })=\xi ^{\prime }(I-H) \boldsymbol {\xi } & \\ & +\left[\boldsymbol {\beta }-\left(\mathbf{Z}^{\prime } \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } \boldsymbol {\xi }\right]^{\prime } \mathbf{Z}^{\prime } \mathbf{Z}\left[\boldsymbol {\beta }-\left(\mathbf{Z}^{\prime } \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } \boldsymbol {\xi }\right] \end{align}

чтобы выполнить интегрирование по β\boldsymbol {\beta }.]

(b)

Покажите, что

ξ∣ x∼Ns(τ2σ2+τ2M,σ2τ2σ2+τ2M) \boldsymbol {\xi } \left\lvert \, \mathbf{x} \sim N_{s}\left(\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} M, \frac{\sigma ^{2} \tau ^{2}}{\sigma ^{2}+\tau ^{2}} M\right)\right.

где M=I+(σ2/τ2)HM=I+\left(\sigma^{2} / \tau^{2}\right) H, и, следовательно, байесовская оценка задаётся формулой

σ2σ2+τ2Hx+τ2σ2+τ2x \frac{\sigma ^{2}}{\sigma ^{2}+\tau ^{2}} H \mathbf{x}+\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} \mathbf{x}

где Zβ^=Hx\mathbf{Z} \hat{\boldsymbol {\beta }}=H \mathbf{x}. [Указание: Установите, что

1τ2ξ′(I−H)ξ+1σ2(x−ξ)′(x−ξ)=σ2+τ2σ2τ2[(ξ−τ2σ2+τ2Mx)′M−1(ξ−τ2σ2+τ2Mx)]+1σ2+τ2x′(I−H)x \begin{align} & \frac{1}{\tau ^{2}} \xi ^{\prime }(I-H) \xi +\frac{1}{\sigma ^{2}}(\mathbf{x}-\xi )^{\prime }(\mathbf{x}-\xi ) \\ & = \frac{\sigma ^{2}+\tau ^{2}}{\sigma ^{2} \tau ^{2}}\left[\left(\xi -\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} M \mathbf{x}\right)^{\prime } M^{-1}\left(\xi -\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} M \mathbf{x}\right)\right] \\ & +\frac{1}{\sigma ^{2}+\tau ^{2}} \mathbf{x}^{\prime }(I-H) \mathbf{x} \end{align}

где M−1=I−σ2σ2+τ2HM^{-1}=I-\frac{\sigma^{2}}{\sigma^{2}+\tau^{2}} H.]

(c)

Маргинально, X′(I−H)X∼(σ2+τ2)χs−r2\mathbf{X}^{\prime }(I-H) \mathbf{X} \sim \left(\sigma^{2}+\tau^{2}\right) \chi_{s-r}^{2}. Это приводит нас к эмпирической байесовской оценке

Hx+(1−(s−r−2)σ2x′(I−H)x)(x−Hx) H \mathbf{x}+\left(1-\frac{(s-r-2) \sigma ^{2}}{\mathbf{x}^{\prime }(I-H) \mathbf{x}}\right)(\mathbf{x}-H \mathbf{x})

которая равна эмпирической байесовской оценке из задачи 7.17(c).

[Модель в этой и предыдущей задаче можно существенно обобщить. Например, обе матрицы σ2I\sigma^{2} I и τ2I\tau^{2} I можно заменить полными положительно определёнными матрицами. Ценой увеличения сложности матричных вычислений и потери простых ответов иерархические и эмпирические байесовские оценки всё же можно вычислить. Ковариации, скалярные или матричные, также могут быть неизвестны, и в этом случае можно использовать обратное гамма-распределение (или обратное распределение Уишарта) в качестве априорного. Вычисления можно реализовать с помощью сэмплера Гиббса. Заметим, что эти обобщения охватывают случай «неравных nin_{i}» (см. задачу 7.16), однако для этого случая простых решений не существует. Многие из этих оценок также обладают свойством минимаксности, которое будет обсуждаться в главе 5.]

Задача 4.7.19

Как отмечено Morris (1983a), иерархическая модель типа дисперсионного анализа с неравными nin_{i} даёт эмпирические байесовские оценки в замкнутой форме, если априорные дисперсии пропорциональны выборочным дисперсиям. Покажите, что для модели

Xij∣ξi∼N(ξi,σ2),j=1,…,ni,i=1,…,sξ∣β∼Ns(Zβ,τ2D−1) \begin{align} X_{i j} \mid \xi _{i} & \sim N\left(\xi _{i}, \sigma ^{2}\right), \quad j=1, \ldots , n_{i}, \quad i=1, \ldots , s \\ \boldsymbol {\xi } \mid \boldsymbol {\beta } & \sim N_{s}\left(\mathbf{Z} \boldsymbol {\beta }, \tau ^{2} D^{-1}\right) \end{align}

где σ2\sigma^{2} и Zs×r\mathbf{Z}_{s \times r} полного ранга rr известны, τ2\tau^{2} неизвестно, а D=diag⁡(n1,…,ns)D=\operatorname {diag}\left(n_{1}, \ldots , n_{s}\right), эмпирическая байесовская оценка задаётся формулой

δEB=Zβ^+(1−(s−r−2)σ2(x‾−Zβ^)′D(x‾−Zβ^))(x‾−Zβ^) \delta ^{\mathrm{EB}}=\mathbf{Z} \hat{\boldsymbol {\beta }}+\left(1-\frac{(s-r-2) \sigma ^{2}}{(\overline{\mathbf{x}}-\mathbf{Z} \hat{\boldsymbol {\beta }})^{\prime } D(\overline{\mathbf{x}}-\mathbf{Z} \hat{\boldsymbol {\beta }})}\right)(\overline{\mathbf{x}}-\mathbf{Z} \hat{\boldsymbol {\beta }})

с x‾i=Σjxij/ni,x‾={xˉi}\overline{\mathbf{x}}_{i}=\Sigma_{j} x_{i j} / n_{i}, \overline{\mathbf{x}}=\left\{ \bar{x}_{i}\right\}, и β^=(Z′DZ)−1Z′Dx‾\hat{\boldsymbol {\beta }}=\left(\mathbf{Z}^{\prime } D \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } D \overline{\mathbf{x}}.

?
Задача 4.7.20

Занимательный (и необоснованный) результат, злоупотребляющий иерархическим байесовским вычислением, приводит к следующему выводу оценки Джеймса—Стейна. Пусть X∼Np(θ,I)X \sim N_{p}(\boldsymbol {\theta }, I) и θ∣τ2∼Np(0,τ2I)\boldsymbol {\theta } \mid \tau^{2} \sim N_{p}\left(0, \tau^{2} I\right).

?
(a)

Проверьте, что при условии τ2\tau^{2} апостериорное и маргинальное распределения задаются формулами

π(θ∣x,τ2)=Np(τ2τ2+1x,τ2τ2+1I)m(x∣τ2)=Np[0,(τ2+1)I] \begin{align} \pi \left(\boldsymbol {\theta } \mid \mathbf{x}, \tau ^{2}\right) & =N_{p}\left(\frac{\tau ^{2}}{\tau ^{2}+1} \mathbf{x}, \frac{\tau ^{2}}{\tau ^{2}+1} I\right) \\ m\left(\mathbf{x} \mid \tau ^{2}\right) & =N_{p}\left[0,\left(\tau ^{2}+1\right) I\right] \end{align}
(b)

Покажите, что, если положить π(τ2)=1,−1<τ2<∞\pi \left(\tau^{2}\right)=1,-1<\tau^{2}<\infty, то

∬ℜpθπ(θ∣x,τ2)m(x∣τ2)dθdτ2=x(2π)p/2(∣x∣2)p/2−1[Γ(p−22)2(p−2)/2−Γ(p/2)2p/2∣x∣2] \begin{align} & \iint _{\Re p} \boldsymbol {\theta } \pi \left(\boldsymbol {\theta } \mid \mathbf{x}, \tau ^{2}\right) m\left(\mathbf{x} \mid \tau ^{2}\right) d \boldsymbol {\theta } d \tau ^{2} \\ & =\frac{\mathbf{x}}{(2 \pi )^{p / 2}\left(|\mathbf{x}|^{2}\right)^{p / 2-1}}\left[\Gamma \left(\frac{p-2}{2}\right) 2^{(p-2) / 2}-\frac{\Gamma (p / 2) 2^{p / 2}}{|\mathbf{x}|^{2}}\right] \end{align}

и

∬ℜpπ(θ∣x,τ2)m(x∣τ2)dθdτ2=1(2π)p/2(∣x∣2)p/2−1Γ(p−22)2(p−2)/2 \begin{align} & \iint _{\Re p} \pi \left(\boldsymbol {\theta } \mid \mathbf{x}, \tau ^{2}\right) m\left(\mathbf{x} \mid \tau ^{2}\right) d \boldsymbol {\theta } d \tau ^{2} \\ & =\frac{1}{(2 \pi )^{p / 2}\left(|\mathbf{x}|^{2}\right)^{p / 2-1}} \Gamma \left(\frac{p-2}{2}\right) 2^{(p-2) / 2} \end{align}

и, следовательно,

E[θ∣x]=(1−p−2∣x∣2)x. \mathbb {E}\left[\boldsymbol {\theta } \mid \mathbf{x}\right]=\left(1-\frac{p-2}{|\mathbf{x}|^{2}}\right) \mathbf{x}.
(c)

Объясните некоторые следствия результата из пункта (b) и то, почему он не может быть верным. [Попробуйте согласовать его с (3.3.12).]

(d)

Почему вычисления в пункте (b) необоснованны?