Глава 4

Оптимальность по среднему риску

[116/0%]
Показать
LaTeX
§
Задача 4.1.1

Проверьте выражения для π(λ∣xˉ)\pi (\lambda \mid \bar{x}) и δk(xˉ)\delta^{k}(\bar{x}) в Примере 1.3.

?
Задача 4.1.2

Приведите примеры пар значений (a,b)(a, b), для которых бета-плотность B(a,b)B(a, b) является

?
(a)

убывающей,

(b)

возрастающей,

(c)

возрастающей при p<p0p<p_{0} и убывающей при p>p0p>p_{0}, и

(d)

убывающей при p<p0p<p_{0} и возрастающей при p>p0p>p_{0}.

Задача 4.1.3

В Примере 1.5, если pp имеет несобственную априорную плотность 1p(1−p)\frac{1}{p(1-p)}, покажите, что апостериорная плотность pp при заданном xx является собственной, при условии 0<x<n0<x<n.

?
Задача 4.1.4

В Примере 1.5 найдите априорное распределение Джеффриса для pp и соответствующую байесовскую оценку δΛ\delta_{\Lambda }.

?
Задача 4.1.5

Для оценки δΛ\delta_{\Lambda } из Задачи 1.4,

?
(a)

вычислите смещение и максимальное смещение;

(b)

вычислите ожидаемую квадратичную ошибку и сравните её с ожидаемой квадратичной ошибкой UMVU-оценки.

Задача 4.1.6

В Примере 1.5 найдите байесовскую оценку δ\delta параметра p(1−p)p(1-p), когда pp имеет априорное распределение B(a,b)B(a, b).

?
Задача 4.1.7

Для ситуации Примера 1.5 UMVU-оценка p(1−p)p(1-p) равна δ′=[x(x−1)]/[n(n−1)]\delta^{\prime }=[x(x- 1)] /[n(n-1)] (см. Пример 2.3.1 и Задачу 2.3.1).

?
(a)

Сравните оценку δ\delta из Задачи 1.6 с UMVU-оценкой δ′\delta^{\prime }.

(b)

Сравните ожидаемую квадратичную ошибку оценки p(1−p)p(1-p) для априорного распределения Джеффриса в Примере 1.5 с ожидаемой квадратичной ошибкой δ′\delta^{\prime }.

Задача 4.1.8

По аналогии с Задачей 1.2 определите возможные формы гамма-плотности Γ(g,1/α),α,g>0\Gamma (g, 1 / \alpha ), \alpha , g>0.

?
Задача 4.1.9

Пусть X1,…,XnX_{1}, \ldots , X_{n} — независимые одинаково распределённые согласно распределению Пуассона P(λ)P(\lambda ), и пусть λ\lambda имеет гамма-распределение Γ(g,α)\Gamma (g, \alpha ).

?
(a)

Для квадратичной функции потерь покажите, что байесовская оценка δα,g\delta_{\alpha , g} параметра λ\lambda имеет представление, аналогичное (1.1.13).

(b)

Что происходит с δα,g\delta_{\alpha , g}, если (i) n→∞n \rightarrow \infty, (ii) α→∞,g→0\alpha \rightarrow \infty , g \rightarrow 0, или оба одновременно?

Задача 4.1.10

Для ситуации предыдущей задачи решите два пункта, соответствующие пунктам (a) и (b) Задачи 1.5.

?
Задача 4.1.11

В Задаче 1.9, если λ\lambda имеет несобственную априорную плотность dλ/λd \lambda / \lambda (соответствующую α=g=\alpha =g= 0), при каких условиях апостериорное распределение является собственным?

?
Задача 4.1.12

Решите задачи, аналогичные Задачам 1.9 и 1.10, когда наблюдения состоят из одной случайной величины XX, имеющей отрицательное биномиальное распределение Nb(p,m)N b(p, m), pp имеет бета-априорное распределение B(a,b)B(a, b), а оцениваемым параметром является

?
(a)

pp, и

(b)

1/p1 / p.

§
Задача 4.2.1

Обращаясь к Примеру 1.5, предположим, что XX имеет биномиальное распределение b(p,n)b(p, n), а семейство априорных распределений для pp является семейством бета-распределений B(a,b)B(a, b).

?
(a)

Покажите, что маргинальное распределение XX является бета-биномиальным распределением с функцией вероятности

(nx)Γ(a+b)Γ(a)Γ(b)Γ(x+a)Γ(n−x+b)Γ(n+a+b). \binom {n}{x} \frac{\Gamma (a+b)}{\Gamma (a) \Gamma (b)} \frac{\Gamma (x+a) \Gamma (n-x+b)}{\Gamma (n+a+b)}.
(b)

Покажите, что среднее и дисперсия бета-биномиального распределения задаются формулами

E[X]=naa+b и  var X=n(aa+b)(ba+b)(a+b+na+b+1). \mathbb {E}\left[X\right]=\frac{n a}{a+b} \quad \text{ и } \quad \text{ var } X=n\left(\frac{a}{a+b}\right)\left(\frac{b}{a+b}\right)\left(\frac{a+b+n}{a+b+1}\right).

[Указание: Для пункта (b) полезны тождества E[X]=E[E[X∣p]]\mathbb {E}\left[X\right]=E[\mathbb {E}\left[X \mid p\right]] и var⁡X=var⁡[E[X∣p]]+E[var⁡(X∣p)]\operatorname {var} X=\operatorname {var}[\mathbb {E}\left[X \mid p\right]]+ E[\operatorname {var}(X \mid p)].]

Задача 4.2.2

Для ситуации Примера 2.1, Lindley и Phillips (1976) приводят подробное описание влияния правил остановки, которое мы можем проиллюстрировать следующим образом. Пусть XX — число успехов в nn испытаниях Бернулли с вероятностью успеха pp.

?
(a)

Предположим, что число проведённых испытаний Бернулли является заранее заданным числом nn, так что мы имеем биномиальную модель выборки, P(X=x)=(nx)px(1−p)n−x\mathbb {P}\left(X=x\right)=\binom {n}{x} p^{x}(1-p)^{n-x}, x=0,1,…,nx=0,1, \ldots , n. Вычислите байесовский риск байесовской оценки (1.1.12) и UMVU-оценки pp.

(b)

Предположим, что число проведённых испытаний Бернулли является случайной величиной NN. Значение N=nN=n было получено, когда было замечено заранее заданное число xx успехов, так что мы имеем модель отрицательной биномиальной выборки, P(N=n)=(n−1x−1)px(1−p)n−x\mathbb {P}\left(N=n\right)=\binom {n-1}{x-1} p^{x}(1- p)^{n-x}, n=xn=x. Вычислите байесовский риск байесовской оценки и UMVU-оценки pp.

(c)

Вычислите среднеквадратичные ошибки всех трёх оценок для каждой модели. Если неизвестно, какой механизм выборки породил данные, какую оценку вы предпочтёте в целом?

Задача 4.2.3

Покажите, что оценка (2.2.4) сходится по вероятности

?
(a)

к θ\theta при n→∞n \rightarrow \infty,

(b)

к μ\mu при b→0b \rightarrow 0, и

(c)

к θ\theta при b→∞b \rightarrow \infty.

Задача 4.2.4

Bickel и Mallows (1988) более подробно исследуют связь между несмещённостью и байесовским подходом, указывая условия, при которых эти свойства не могут выполняться одновременно. Кроме того, они показывают, что если априорное распределение несобственно, то апостериорное среднее может быть несмещённым. Пусть X∼1θf(x/θ),x>0X \sim \frac{1}{\theta } f(x / \theta ), x>0, где ∫0∞tf(t)dt=1\int_{0}^{\infty } t f(t) d t=1, и пусть π(θ)=1θ2dθ\pi (\theta )=\frac{1}{\theta^{2}} d \theta, θ>0\theta >0.

?
(a)

Покажите, что E[X∣θ]=θ\mathbb {E}\left[X \mid \theta \right]=\theta, так что XX несмещена.

(b)

Покажите, что π(θ∣x)=x2θ3f(x/θ)\pi (\theta \mid x)=\frac{x^{2}}{\theta^{3}} f(x / \theta ) является собственной плотностью.

(c)

Покажите, что E[θ∣x]=x\mathbb {E}\left[\theta \mid x\right]=x, и, следовательно, апостериорное среднее несмещено.

Задача 4.2.5

DasGupta (1994) приводит тождество, связывающее байесовский риск со смещением, которое иллюстрирует, что небольшое смещение может помочь достичь малого байесовского риска. Пусть X∼f(x∣θ)X \sim f(x \mid \theta ) и θ∼π(θ)\theta \sim \pi (\theta ). Байесовская оценка при квадратичной функции потерь равна δπ=E[θ∣x]\delta^{\pi }=\mathbb {E}\left[\theta \mid x\right]. Покажите, что байесовский риск δπ\delta^{\pi } может быть записан как

r(π,δπ)=∫Θ∫X[θ−δπ(x)]2f(x∣θ)π(θ)dxdθ=∫Θθb(θ)π(θ)dθ r\left(\pi , \delta ^{\pi }\right)=\int _{\Theta } \int _{\mathcal{X}}\left[\theta -\delta ^{\pi }(x)\right]^{2} f(x \mid \theta ) \pi (\theta ) d x d \theta =\int _{\Theta } \theta b(\theta ) \pi (\theta ) d \theta

где b(θ)=E[δπ(X)∣θ]−θb(\theta )=\mathbb {E}\left[\delta^{\pi }(X) \mid \theta \right]-\theta — смещение δπ\delta^{\pi }.

?
Задача 4.2.6

Проверьте оценку (2.2.10).

?
Задача 4.2.7

В Примере 2.6 проверьте, что апостериорное распределение τ\tau есть Γ(r+g−1/2,1/(α+z))\Gamma (r+g-1 / 2,1 /(\alpha +z)).

?
Задача 4.2.8

В Примере 2.6 при α=g=0\alpha =g=0 покажите, что апостериорное распределение n(θ−Xˉ)/Z/(n−1)\sqrt{n}(\theta -\bar{X}) / \sqrt{Z /(n-1)} при заданных XX является tt-распределением Стьюдента с n−1n-1 степенями свободы.

?
Задача 4.2.9

В Примере 2.6 покажите, что апостериорное распределение θ\theta симметрично относительно xˉ\bar{x}, когда совместное априорное распределение θ\theta и σ\sigma имеет вид h(σ)dσdθh(\sigma ) d \sigma d \theta, где hh — произвольная плотность вероятности на (0,∞)(0, \infty ).

?
Задача 4.2.10

Rukhin (1978) исследует ситуацию, когда байесовская оценка одна и та же для каждой функции потерь из некоторого множества функций потерь, называя такие оценки универсальными байесовскими оценками. Для случая Примера 2.6, используя априорное распределение вида, указанного в Задаче 2.9, покажите, что Xˉ\bar{X} является байесовской оценкой при любой чётной функции потерь.

?
Задача 4.2.11

Пусть XX и YY независимо распределены согласно распределениям PξP_{\xi } и QηQ_{\eta } соответственно. Предположим, что ξ\xi и η\eta являются вещественнозначными и независимы согласно некоторым априорным распределениям Λ\Lambda и Λ′\Lambda^{\prime }. Если при квадратичной функции потерь δΛ\delta_{\Lambda } — байесовская оценка ξ\xi на основе XX, а δΛ′′\delta_{\Lambda^{\prime }}^{\prime } — байесовская оценка η\eta на основе YY,

?
(a)

покажите, что δΛ′′−δΛ\delta_{\Lambda^{\prime }}^{\prime }-\delta_{\Lambda } является байесовской оценкой η−ξ\eta -\xi на основе (X,Y)(X, Y);

(b)

если η>0\eta >0 и δΛ′∗\delta_{\Lambda^{\prime }}^{*} — байесовская оценка 1/η1 / \eta на основе YY, покажите, что δΛ⋅δΛ′∗\delta_{\Lambda } \cdot \delta_{\Lambda^{\prime }}^{*} является байесовской оценкой ξ/η\xi / \eta на основе (X,Y)(X, Y).

Задача 4.2.12

Для плотности (2.2.13) и несобственного априорного распределения (dσ/σ)⋅(dσA/σA)(d \sigma / \sigma ) \cdot \left(d \sigma_{A} / \sigma_{A}\right) покажите, что апостериорное распределение (σ,σA)\left(\sigma , \sigma_{A}\right) остаётся несобственным.

?
Задача 4.2.13
?
(a)

В Примере 2.7 получите априорное распределение Джеффриса для (σ,τ)(\sigma , \tau ).

(b)

Покажите, что для априорного распределения из пункта (a) апостериорное распределение (σ,τ)(\sigma , \tau ) является собственным.

Задача 4.2.14

Проверьте байесовскую оценку (2.2.14).

?
Задача 4.2.15

Пусть X∼N(θ,1)X \sim N(\theta , 1) и L(θ,δ)=(θ−δ)2L(\theta , \delta )=(\theta -\delta )^{2}.

?
(a)

Покажите, что XX является пределом байесовских оценок δπn\delta^{\pi_{n}}, где πn\pi_{n} есть N(0,1)N(0,1). Следовательно, XX является одновременно обобщённой байесовской оценкой и пределом байесовских оценок.

(b)

Для априорной меры π(θ)=eaθ,a>0\pi (\theta )=e^{a \theta }, a>0, покажите, что обобщённая байесовская оценка равна X+aX+a.

(c)

Для a>0a>0 покажите, что не существует последовательности собственных априорных распределений, для которой δπn→X+a\delta^{\pi_{n}} \rightarrow X+a.

Этот пример принадлежит Farrell; см. Kiefer 1966. Heath и Sudderth (1989), опираясь на работу Stone (1976), показали, что выводы из этой модели некогерентны, и установили, когда обобщённые байесовские оценки приводят к когерентным (то есть непротиворечивым) выводам. Их работа связана с теорией «аппроксимируемости собственными априорными распределениями», развитой Stein (1965) и Stone (1965, 1970, 1976), которая показывает, когда обобщённые байесовские оценки можно рассматривать как байесовские оценки.

Задача 4.2.16
?
(a)

Для ситуации Примера 2.8 проверьте, что δ(x)=x/n\delta (x)=x / n является обобщённой байесовской оценкой.

(b)

Если X∼N(0,1)X \sim N(0,1) и L(θ,δ)=(θ−δ)2L(\theta , \delta )=(\theta -\delta )^{2}, покажите, что XX является обобщённой байесовской оценкой при несобственном априорном распределении π(θ)=1\pi (\theta )=1.

§
Задача 4.3.1

Для ситуации Примера 3.1:

?
(a)

Проверьте, что байесовская оценка зависит от данных только через Y=max⁡iXiY=\max_{i} X_{i}.

(b)

Покажите, что E[Θ∣y,a,b]\mathbb {E}\left[\Theta \mid y, a, b\right] можно выразить как

E[Θ∣y,a,b]=1b(n+a−1)P(χ2(n+a−1)2<2/by)P(χ2(n+a)2<2/by) \mathbb {E}\left[\Theta \mid y, a, b\right]=\frac{1}{b(n+a-1)} \frac{P\left(\chi _{2(n+a-1)}^{2}<2 / b y\right)}{P\left(\chi _{2(n+a)}^{2}<2 / b y\right)}

где χv2\chi_{v}^{2} — случайная величина, имеющая распределение хи-квадрат с vv степенями свободы. (В таком виде оценку особенно легко вычислить, поскольку многие компьютерные пакеты имеют встроенное распределение хи-квадрат.)

Задача 4.3.2

Пусть X1,…,XnX_{1}, \ldots , X_{n} — независимые одинаково распределённые из Gamma⁡(a,b)\operatorname {Gamma}(a, b), где aa известно.

?
(a)

Проверьте, что сопряжённое априорное распределение для естественного параметра η=−1/b\eta =-1 / b эквивалентно обратному гамма-распределению для bb.

(b)

Используя априорное распределение из пункта (a), найдите байесовскую оценку при функциях потерь (i) L(b,δ)=(b−δ)2L(b, \delta )= (b-\delta )^{2} и (ii) L(b,δ)=(1−δ/b)2L(b, \delta )=(1-\delta / b)^{2}.

(c)

Выразите оценку из пункта (b)(i) в виде (3.3.9). Можно ли сделать то же самое для оценки из пункта (b)(ii)?

Задача 4.3.3

Следствие 3.3 утверждает: если X=(X1,…,Xp)X=(X_{1}, \ldots , X_{p}) имеет плотность pη(x)=e∑i=1pηixi−A(η)h(x)p_{\eta }(x)=e^{\sum_{i=1}^{p} \eta_{i} x_{i}-A(\eta )} h(x), а η\eta имеет априорную плотность π(η)\pi (\eta ), то байесовская оценка η\eta при функции потерь L(η,δ)=∑(ηi−δi)2L(\eta , \delta )=\sum (\eta_{i}-\delta_{i})^{2} задаётся формулой

E[ηi∣x]=∂∂xilog⁡m(x)−∂∂xilog⁡h(x). \mathbb {E}\left[\eta _{i} \mid x\right]=\frac{\partial }{\partial x_{i}} \log m(x)-\frac{\partial }{\partial x_{i}} \log h(x).
?
(a)

Докажите Следствие 3.3.

(b)

Проверьте вычисление байесовской оценки в Примере 3.4.

Задача 4.3.4

Используя тождество Стейна (Лемма 1.5.15), покажите, что если Xi∼pηi(x)X_{i} \sim p_{\eta_{i}}(x) из (3.3.7), то

Eη[−∇log⁡h(X)]=η,R(η,−∇log⁡h(X))=∑i=1pEη[−∂2∂Xi2log⁡h(X)]. \begin{align} \mathbb {E}_{\eta }\left[-\nabla \log h(\mathbf{X})\right] & =\boldsymbol {\eta }, \\ R(\boldsymbol {\eta },-\nabla \log h(\mathbf{X})) & =\sum _{i=1}^{p} \mathbb {E}_{\eta }\left[-\frac{\partial ^{2}}{\partial X_{i}^{2}} \log h(\mathbf{X})\right]. \end{align}
?
Задача 4.3.5
?
(a)

Если Xi∼Gamma⁡(a,b),i=1,…,pX_{i} \sim \operatorname {Gamma}(a, b), i=1, \ldots , p, независимы, с известным aa, вычислите −∇log⁡h(x)-\nabla \log h(\mathbf{x}) и его математическое ожидание.

(b)

Примените результаты пункта (a) к ситуации, когда Xi∼N(0,σi2),i=1,…,pX_{i} \sim N\left(0, \sigma_{i}^{2}\right), i=1, \ldots , p, независимы. Приводит ли это к несмещённой оценке σi2\sigma_{i}^{2}? [Замечание: Для пункта (b) квадратичная функция потерь для естественного параметра 1/σ21 / \sigma^{2} приводит к функции потерь L(σ2,δ)=(σ2δ−1)2/σ4L\left(\sigma^{2}, \delta \right)=\left(\sigma^{2} \delta -1\right)^{2} / \sigma^{4} для оценивания σ2\sigma^{2}.]

(c)

Если

Xi∼tan⁡(aiπ)πxai(1−x)−1,0<x<1,i=1,…,p, независимы,  X_{i} \sim \frac{\tan \left(a_{i} \pi \right)}{\pi } x^{a_{i}}(1-x)^{-1}, 0<x<1, \quad i=1, \ldots , p, \text{ независимы, }

вычислите −∇log⁡h(X)-\nabla \log h(\mathbf{X}) и покажите, что это несмещённая оценка a=(a1,…,ap)\mathbf{a}=\left(a_{1}, \ldots , a_{p}\right).

Задача 4.3.6

Для ситуации Примера 3.6:

?
(a)

Покажите, что если δ\delta — байесовская оценка θ\theta, то δ′=δ/σ2\delta^{\prime }=\delta / \sigma^{2} является байесовской оценкой η\eta, и, следовательно, R(θ,δ)=σ4R(η,δ′)R(\theta , \delta )=\sigma^{4} R\left(\eta , \delta^{\prime }\right).

(b)

Покажите, что риск байесовской оценки η\eta задаётся формулой

pτ4σ2(σ2+τ2)2+(σ2σ2+τ2)2∑ai2 \frac{p \tau ^{4}}{\sigma ^{2}\left(\sigma ^{2}+\tau ^{2}\right)^{2}}+\left(\frac{\sigma ^{2}}{\sigma ^{2}+\tau ^{2}}\right)^{2} \sum a_{i}^{2}

где ai=ηi−μ/σ2a_{i}=\eta_{i}-\mu / \sigma^{2}.

(c)

Если Σai2=k\Sigma a_{i}^{2}=k — фиксированная константа, то минимальный риск достигается при ηi=μ/σ2+k/p\eta_{i}=\mu / \sigma^{2}+\sqrt{k / p}.

Задача 4.3.7

Если X\mathbf{X} имеет распределение pθ(x)p_{\theta }(\mathbf{x}) из (1.5.1), покажите, что, аналогично Теореме 3.2, E[Tη(θ)]=∇log⁡mπ(x)−∇log⁡h(x)\mathbb {E}\left[\mathcal{T} \boldsymbol {\eta }(\theta )\right]= \nabla \log m_{\pi }(\mathbf{x})-\nabla \log h(\mathbf{x}).

?
Задача 4.3.8
?
(a)

Используя тождество Стейна (Лемма 1.5.15), покажите, что если Xi∼pηi(x)X_{i} \sim p_{\eta_{i}}(x) из (3.3.18), то

Eη[−∇log⁡h(X)]=∑iηiEη[∂∂XjTi(X)]. \mathbb {E}_{\eta }\left[-\nabla \log h(\mathbf{X})\right]=\sum _{i} \eta _{i} \mathbb {E}_{\eta }\left[\frac{\partial }{\partial X_{j}} T_{i}(\mathbf{X})\right].
(b)

Если XiX_{i} — независимые одинаково распределённые из гамма-распределения Gamma⁡(a,b)\operatorname {Gamma}(a, b), где параметр формы aa известен, используя пункт (a), найдите несмещённую оценку 1/b1 / b.

(c)

Если XiX_{i} — независимые одинаково распределённые из бета-распределения (a,b)(a, b), можно ли использовать тождество из пункта (a) для получения несмещённой оценки aa, когда bb известно, или несмещённой оценки bb, когда aa известно?

Задача 4.3.9

Для естественного экспоненциального семейства pη(x)p_{\eta }(x) из (3.3.7) и сопряжённого априорного распределения π(η∣k,μ)\pi (\eta \mid k, \mu ) из (3.3.19) докажите, что:

?
(a)

E[X]=A′(η)\mathbb {E}\left[X\right]=A^{\prime }(\eta ) и var X=A′′(η)X=A^{\prime \prime }(\eta ), где математическое ожидание берётся относительно выборочной плотности pη(x)p_{\eta }(x).

(b)

E[A′(η)]=μ\mathbb {E}\left[A^{\prime }(\eta )\right]=\mu и var⁡[A(η)]=(1/k)E[A′′(η)]\operatorname {var}[A(\eta )]=(1 / k) \mathbb {E}\left[A^{\prime \prime }(\eta )\right], где математическое ожидание берётся относительно априорного распределения.

[Результаты пункта (b) позволяют рассматривать μ\mu как априорное среднее, а kk — как объём априорной выборки.]

Задача 4.3.10

Для каждой из следующих ситуаций запишите плотность в виде (3.7) и укажите естественный параметр. Найдите байесовскую оценку A′(η)A^{\prime }(\eta ) при квадратичной функции потерь и сопряжённом априорном распределении. Выразите ответ через исходные параметры.

?
(a)

X∼X \sim биномиальное (p,n)(p, n),

(b)

X∼X \sim Пуассона(λ)(\lambda ), и

(c)

X∼Gamma⁡(a,b)X \sim \operatorname {Gamma}(a, b), aa известно.

Задача 4.3.11

Для ситуации задачи 3.9, если X1,…,XnX_{1}, \ldots , X_{n} — независимые одинаково распределённые как pη(x)p_{\eta }(x), а априорное распределение — сопряжённое π(η∣k,μ)\pi (\eta \mid k, \mu ), то апостериорное распределение равно π(η∣k+n,kμ+nxˉk+n)\pi \left(\eta \mid k+n, \frac{k \mu +n \bar{x}}{k+n}\right).

?
Задача 4.3.12

Если X1,…,XnX_{1}, \ldots , X_{n} — независимые одинаково распределённые из однопараметрического экспоненциального семейства, то байесовская оценка среднего при квадратичной функции потерь с использованием сопряжённого априорного распределения имеет вид aXˉ+ba \bar{X}+b для некоторых констант aa и bb.

?
(a)

Если E[Xi]=μ\mathbb {E}\left[X_{i}\right]=\mu и var Xi=σ2X_{i}=\sigma^{2}, то независимо от распределения XiX_{i} среднеквадратичная ошибка равна

E[(aXˉ+b)−μ]2=a2 var Xˉ+[(a−1)μ+b]2. E[(a \bar{X}+b)-\mu ]^{2}=a^{2} \text{ var } \bar{X}+[(a-1) \mu +b]^{2}.
(b)

Если μ\mu не ограничено, то никакая оценка вида aXˉ+ba \bar{X}+b не может иметь конечную среднеквадратичную ошибку при a≠1a \neq 1.

(c)

Может ли байесовская оценка с сопряжённым априорным распределением в экспоненциальном семействе иметь конечную среднеквадратичную ошибку?

Примечание.
?

Эта задача показывает, почему байесовские оценки с сопряжённым априорным распределением считаются «неробастными».

§
Задача 4.4.1

Для ситуации примера 4.2:

?
(a)

Покажите, что байесовское правило при априорном распределении бета(α,α)(\alpha , \alpha ) эквивариантно.

(b)

Покажите, что байесовское правило при любом априорном распределении, симметричном относительно 1/21 / 2, эквивариантно.

Задача 4.4.2

Байесовская оценка η\eta в примере 4.7 задаётся формулой (4.22).

?
Задача 4.4.3

Байесовская оценка τ\tau в примере 4.5 задаётся формулой (4.22).

?
Задача 4.4.4

Байесовские оценки η\eta и τ\tau в примере 4.9 задаются формулами (4.31) и (4.32). (Вспомните следствие 1.2.)

?
Задача 4.4.5

Для каждой из следующих ситуаций найдите группу GG, оставляющую модель инвариантной, и определите лево- и право-инвариантные меры на GG. Совместная плотность X=(X1,…,Xn)\mathbf{X}= \left(X_{1}, \ldots , X_{n}\right) и Y=(Y1,…,Yn)\mathbf{Y}=\left(Y_{1}, \ldots , Y_{n}\right) и оцениваемый параметр таковы:

?
(a)

f(x−η,y−ζ)f(\mathbf{x}-\eta , \mathbf{y}-\zeta ), оцениваемый параметр η−ζ\eta -\zeta;

(b)

f(x−ησ,y−ζτ)f\left(\frac{\mathbf{x}-\eta }{\sigma }, \frac{\mathbf{y}-\zeta }{\tau }\right), оцениваемый параметр τ/σ\tau / \sigma;

(c)

f(x−ητ,/,y−ζτ),τf\left(\frac{\mathbf{x}-\eta }{\tau }, /, \frac{\mathbf{y}-\zeta }{\tau }\right), \tau неизвестно; оцениваемый параметр η−ζ\eta -\zeta.

Задача 4.4.6

Для каждой из ситуаций задачи 4.5 найдите MRE-оценку, если функция потерь — квадратичная ошибка с масштабированием, обеспечивающим её инвариантность.

?
Задача 4.4.7

Для каждой из ситуаций задачи 4.5:

?
(a)

Найдите меру на Ω\Omega, индуцированную право-инвариантной мерой Хаара на Gˉ\bar{G};

(b)

Найдите байесовскую оценку относительно меры, найденной в пункте (a), и покажите, что она совпадает с MRE-оценкой.

Задача 4.4.8

В примере 4.9 покажите, что оценка

τ^(x)=∬1vrf(x1−uv,…,xn−uv)dvdu∬1vr+1f(x1−uv,…,xn−uv)dvdu \hat{\tau }(\mathbf{x})=\frac{\iint \frac{1}{v^{r}} f\left(\frac{x_{1}-u}{v}, \ldots , \frac{x_{n}-u}{v}\right) d v d u}{\iint \frac{1}{v^{r+1}} f\left(\frac{x_{1}-u}{v}, \ldots , \frac{x_{n}-u}{v}\right) d v d u}

эквивариантна относительно изменений масштаба, то есть удовлетворяет τˉ(cx)=cτ^(x)\bar{\tau }(c \mathbf{x})=c \hat{\tau }(\mathbf{x}) для всех значений rr, при которых интегралы в τ^(x)\hat{\tau }(\mathbf{x}) существуют.

?
Задача 4.4.9

Если Λ\Lambda — лево-инвариантная мера на GG, покажите, что Λ∗\Lambda^{*}, определённая как Λ∗(B)=Λ(B−1)\Lambda^{*}(B)=\Lambda \left(B^{-1}\right), право-инвариантна, где B−1={g−1:g∈B}B^{-1}=\left\{ g^{-1}: g \in B\right\}.

?
Задача 4.4.10

Между мерами Хаара и априорными распределениями Джеффриса в случаях сдвига и масштаба существует соответствие.

?
(a)

Покажите, что в случае параметра сдвига априорное распределение Джеффриса совпадает с инвариантной мерой Хаара.

(b)

Покажите, что в случае параметра масштаба априорное распределение Джеффриса совпадает с инвариантной мерой Хаара.

(c)

Покажите, что в случае сдвига-масштаба априорное распределение Джеффриса совпадает с лево-инвариантной мерой Хаара.

[Пункт c) вызывает определённое беспокойство, поскольку, как отмечено в разделе 4.4 (см. обсуждение после примера 4.9), наилучшее эквивариантное правило является байесовским относительно право-инвариантной меры Хаара (если она существует).]

Задача 4.4.11

Для модели (3.3.23) найдите меру ν\nu на плоскости (ξ,τ)(\xi , \tau ), остающуюся инвариантной относительно преобразований (3.3.24). Следующие три задачи содержат более формальное изложение лево- и право-инвариантных мер Хаара.

?
Задача 4.4.12

Мера Λ\Lambda на группе GG называется право-инвариантной, если она удовлетворяет Λ(Bg)=Λ(B)\Lambda (B g)=\Lambda (B), и лево-инвариантной, если она удовлетворяет Λ(gB)=Λ(B)\Lambda (g B)=\Lambda (B). Заметим, что если GG коммутативна, оба определения совпадают.

?
(a)

Если элементы g∈Gg \in G — вещественные числа (−∞<g<∞)(-\infty <g<\infty ), а групповая операция задаётся как g2⋅g1=g1+g2g_{2} \cdot g_{1}=g_{1}+g_{2}, то мера ν\nu, определённая как ν(B)=∫Bdx\nu (B)=\int_{B} d x (т.е. мера Лебега), является как лево-, так и право-инвариантной.

(b)

Если элементы g∈Gg \in G — положительные вещественные числа, а композиция g2g_{2} и g1g_{1} — это произведение этих двух чисел, то мера ν\nu, определённая как ν(B)=∫B(1/y)dy\nu (B)=\int_{B}(1 / y) d y, является как лево-, так и право-инвариантной.

Задача 4.4.13

Если элементы g∈Gg \in G — пары вещественных чисел (a,b)(a, b), b>0b>0, соответствующие преобразованиям gx=a+bxg x=a+b x, то групповая операция по (1.4.8) имеет вид

(a2,b2)⋅(a1,b1)=(a2+a1b2,b1b2). \left(a_{2}, b_{2}\right) \cdot \left(a_{1}, b_{1}\right)=\left(a_{2}+a_{1} b_{2}, b_{1} b_{2}\right).

Из мер, определённых как

ν(B)=∬B1ydxdy и ν(B)=∬B1y2dxdy \nu (B)=\iint _{B} \frac{1}{y} d x d y \quad \text{ и } \quad \nu (B)=\iint _{B} \frac{1}{y^{2}} d x d y

первая право-, но не лево-инвариантна, а вторая лево-, но не право-инвариантна.

?
Задача 4.4.14

Четыре плотности, определяющие меры vv в задачах 4.12 и 4.13(dx,(1/y)dy4.13(d x,(1 / y) d y, (1/y)dxdy,(1/y2)dxdy(1 / y) d x d y,\left(1 / y^{2}\right) d x d y ), являются единственными плотностями (с точностью до мультипликативных констант), для которых vv обладает указанными свойствами инвариантности в ситуациях этих задач.

?
§
Задача 4.5.1

Для модели (3.3.1) пусть π(θ∣x,λ)\pi (\theta \mid x, \lambda ) — байесовское апостериорное распределение при фиксированном априорном распределении, а π(θ∣x)\pi (\theta \mid x) — иерархическое байесовское апостериорное распределение. Покажите, что π(θ∣x)=∫π(θ∣x,λ)⋅π(λ∣x)dλ\pi (\theta \mid x)=\int \pi (\theta \mid x, \lambda ) \cdot \pi (\lambda \mid x) d \lambda, где π(λ∣x)=∫f(x∣θ)π(θ∣λ)γ(λ)dθ/∬f(x∣θ)π(θ∣λ)γ(λ)dθdλ\pi (\lambda \mid x)=\int f(x \mid \theta ) \pi (\theta \mid \lambda ) \gamma (\lambda ) d \theta / \iint f(x \mid \theta ) \pi (\theta \mid \lambda ) \gamma (\lambda ) d \theta d \lambda.

?
Задача 4.5.2

Для ситуации задачи 5.1 покажите, что:

?
(a)

E[θ∣x]=E[E[θ∣x,λ]]\mathbb {E}\left[\theta \mid x\right]=E[\mathbb {E}\left[\theta \mid x, \lambda \right]];

(b)

var⁡(θ∣x)=E[var⁡(θ∣x,λ)]+var⁡[E[θ∣x,λ]]\operatorname {var}(\theta \mid x)=E[\operatorname {var}(\theta \mid x, \lambda )]+\operatorname {var}[\mathbb {E}\left[\theta \mid x, \lambda \right]];

и, следовательно, что π(θ∣x)\pi (\theta \mid x) будет, как правило, иметь бо́льшую дисперсию, чем π(θ∣x,λ0)\pi \left(\theta \mid x, \lambda_{0}\right).

Задача 4.5.3

Для модели (3.3.3) покажите, что:

?
(a)

Маргинальное априорное распределение θ\theta, безусловное относительно τ2\tau^{2}, задаётся формулой

π(θ)=Γ(a+12)2πΓ(a)ba1(1b+θ22)a+1/2, \pi (\theta )=\frac{\Gamma \left(a+\frac{1}{2}\right)}{\sqrt{2 \pi } \Gamma (a) b^{a}} \frac{1}{\left(\frac{1}{b}+\frac{\theta ^{2}}{2}\right)^{a+1 / 2}},

которое при a=v/2a=v / 2 и b=2/vb=2 / v является tt-распределением Стьюдента с vv степенями свободы.

(b)

Маргинальное апостериорное распределение τ2\tau^{2} задаётся формулой

π(τ2∣xˉ)=[σ2τ2σ2+τ2]1/2e−12xˉ2σ2+τ21(τ2)a+3/2e−1/bτ2∫0∞[σ2τ2σ2+τ2]1/2e−12xˉ2σ2+τ21(τ2)a+3/2e−1/bτ2dτ2 \pi \left(\tau ^{2} \mid \bar{x}\right)=\frac{\left[\frac{\sigma ^{2} \tau ^{2}}{\sigma ^{2}+\tau ^{2}}\right]^{1 / 2} e^{-\frac{1}{2} \frac{\bar{x}^{2}}{\sigma ^{2}+\tau ^{2}}} \frac{1}{\left(\tau ^{2}\right)^{a+3 / 2}} e^{-1 / b \tau ^{2}}}{\int _{0}^{\infty }\left[\frac{\sigma ^{2} \tau ^{2}}{\sigma ^{2}+\tau ^{2}}\right]^{1 / 2} e^{-\frac{1}{2} \frac{\bar{x}^{2}}{\sigma ^{2}+\tau ^{2}}} \frac{1}{\left(\tau ^{2}\right)^{a+3 / 2}} e^{-1 / b \tau ^{2}} d \tau ^{2}}
Задача 4.5.4

Albert and Gupta (1985) исследуют теорию и приложения иерархической модели

Xi∣θi∼b(θi,n),i=1,…,p, независимы, θi∣η∼beta⁡[kη,k(1−η)],k известно, η∼Uniform⁡(0,1). \begin{align} X_{i} \mid \theta _{i} & \sim b\left(\theta _{i}, n\right), \quad i=1, \ldots , p, \text{ независимы, } \\ \theta _{i} \mid \eta & \sim \operatorname {beta}[k \eta , k(1-\eta )], k \text{ известно, } \\ \eta & \sim \operatorname {Uniform}(0,1). \end{align}
?
(a)

Покажите, что

E[θi∣x]=(nn+k)(xin)+(kn+k)E[η∣x],var⁡(θi∣x)=k2(n+k)(n+k+1)var⁡(η∣x). \begin{align} \mathbb {E}\left[\theta _{i} \mid \mathbf{x}\right] & =\left(\frac{n}{n+k}\right)\left(\frac{x_{i}}{n}\right)+\left(\frac{k}{n+k}\right) \mathbb {E}\left[\eta \mid \mathbf{x}\right], \\ \operatorname {var}\left(\theta _{i} \mid \mathbf{x}\right) & =\frac{k^{2}}{(n+k)(n+k+1)} \operatorname {var}(\eta \mid \mathbf{x}). \end{align}

[Заметим, что E[η∣x]\mathbb {E}\left[\eta \mid \mathbf{x}\right] и var⁡(η∣x)\operatorname {var}(\eta \mid \mathbf{x}) не выражаются в простом виде.]

(b)

Безусловно по η\eta, величины θi\theta_{i} имеют условную ковариацию

cov⁡(θi,θj∣x)=(kn+k)2var⁡(η∣x),i≠j. \operatorname {cov}\left(\theta _{i}, \theta _{j} \mid \mathbf{x}\right)=\left(\frac{k}{n+k}\right)^{2} \operatorname {var}(\eta \mid \mathbf{x}), \quad i \neq j.
(c)

Игнорируя априорное распределение η\eta, покажите, как построить эмпирическую байесовскую оценку θi\theta_{i}. (Опять же, она не выражается в простом виде.)

[Albert and Gupta (1985) на самом деле рассматривают более общую модель, чем приведённая здесь, и показывают, как приближённо получить байесовское решение. Они применяют свою модель к задаче об отсутствии ответов при почтовых опросах.]

Задача 4.5.5
?
(a)

По аналогии с задачей 1.7.9 докажите, что для любых случайных величин X,YX, Y и ZZ,

cov⁡(X,Y)=E[cov⁡(X,Y)∣Z]+cov⁡[E[X∣Z],E[Y∣Z]]. \operatorname {cov}(X, Y)=E[\operatorname {cov}(X, Y) \mid Z]+\operatorname {cov}[\mathbb {E}\left[X \mid Z\right], \mathbb {E}\left[Y \mid Z\right]].
(b)

Для иерархии

Xi∣θi∼f(x∣θi),i=1,…,p, независимы ,Θi∣λ∼π(θi∣λ),i=1,…,p, независимы ,Λ∼γ(λ), \begin{align} X_{i} \mid \theta _{i} & \sim f\left(x \mid \theta _{i}\right), \quad i=1, \ldots , p, \text{ независимы }, \\ \Theta _{i} \mid \lambda & \sim \pi \left(\theta _{i} \mid \lambda \right), \quad i=1, \ldots , p, \text{ независимы }, \\ \Lambda & \sim \gamma (\lambda ), \end{align}

покажите, что cov⁡(Θi,Θj∣x)=cov⁡[E[Θi∣x,λ],E[Θj∣x,λ]]\operatorname {cov}\left(\Theta_{i}, \Theta_{j} \mid \mathbf{x}\right)=\operatorname {cov}\left[\mathbb {E}\left[\Theta_{i} \mid \mathbf{x}, \lambda \right], \mathbb {E}\left[\Theta_{j} \mid \mathbf{x}, \lambda \right]\right].

(c)

Если E[Θi∣x,λ]=g(xi)+h(λ),i=1,…,p\mathbb {E}\left[\Theta_{i} \mid \mathbf{x}, \lambda \right]=g\left(x_{i}\right)+h(\lambda ), i=1, \ldots , p, где g(⋅)g(\cdot ) и h(⋅)h(\cdot ) известны, то

cov⁡(Θi,Θj∣x)=var⁡[E[Θi∣x,λ]]. \operatorname {cov}\left(\Theta _{i}, \Theta _{j} \mid \mathbf{x}\right)=\operatorname {var}\left[\mathbb {E}\left[\Theta _{i} \mid \mathbf{x}, \lambda \right]\right].

[Пункт (c) указывает на определённое ограничение применимости некоторых иерархических моделей, а именно на то, что они влекут положительную корреляционную структуру в апостериорном распределении.]

Задача 4.5.6

Модель однофакторных случайных эффектов из примера 2.7 (см. также примеры 3.5.1 и 3.5.5) можно записать в виде иерархической модели

Xij∣μ,αi∼N(μ+αi,σ2),j=1,…,n,i=1,…,s,αi∼N(0,σA2),i=1,…,s. \begin{align} X_{i j} \mid \mu , \alpha _{i} & \sim N\left(\mu +\alpha _{i}, \sigma ^{2}\right), \quad j=1, \ldots , n, \quad i=1, \ldots , s, \\ \alpha _{i} & \sim N\left(0, \sigma _{A}^{2}\right), \quad i=1, \ldots , s. \end{align}

Если, кроме того, положить μ∼\mu \sim равномерное (−∞,∞)(-\infty , \infty ), покажите, что байесовская оценка μ+αi\mu +\alpha_{i} при квадратичной функции потерь задаётся формулой (3.5.13) — UMVU-предиктором μ+αi\mu +\alpha_{i}.

?
Задача 4.5.7

Обращаясь к примеру 6.6:

?
(a)

Используя априорное распределение для γ(b)\gamma (b), заданное в (5.6.27), покажите, что мода апостериорного распределения π(b∣x)\pi (b \mid \mathbf{x}) равна b^=(pxˉ+α−1)/(pa+β−1)\hat{b}=(p \bar{x}+\alpha -1) /(p a+\beta -1), и, следовательно, эмпирическая байесовская оценка, основанная на этом b^\hat{b}, не совпадает с иерархической байесовской оценкой (5.6.29).

(b)

Покажите, что если оценивать b/(b+1)b /(b+1) с помощью его апостериорного математического ожидания E[b/(b+1)∣x]E[b /(b+1) \mid \mathbf{x}], то получаемая эмпирическая байесовская оценка совпадает с иерархической байесовской оценкой.

Задача 4.5.8

Метод интегрирования Монте-Карло позволяет вычислять (возможно, сложные) интегралы с помощью (возможно, простой) генерации случайных величин.

?
(a)

Чтобы вычислить ∫h(x)fX(x)dx\int h(x) f_{X}(x) d x, сгенерируйте выборку X1,…,XmX_{1}, \ldots , X_{m}, независимую одинаково распределённую, из fX(x)f_{X}(x). Тогда 1/m∑i=1mh(xi)→∫h(x)fX(x)dx1 / m \sum_{i=1}^{m} h\left(x_{i}\right) \rightarrow \int h(x) f_{X}(x) d x при m→∞m \rightarrow \infty.

(b)

Если трудно сгенерировать случайную величину из fX(x)f_{X}(x), то сгенерируйте пары случайных величин

Yi∼fY(y),Xi∼fX∣Y(x∣yi). \begin{align} Y_{i} & \sim f_{Y}(y), \\ X_{i} & \sim f_{X \mid Y}\left(x \mid y_{i}\right). \end{align}

Тогда 1/m∑i=1mh(xi)→∫h(x)fX(x)dx1 / m \sum_{i=1}^{m} h\left(x_{i}\right) \rightarrow \int h(x) f_{X}(x) d x при m→∞m \rightarrow \infty. [Покажите, что если XX генерируется согласно Y∼fY(y)Y \sim f_{Y}(y) и X∼fX∣Y(x∣Y)X \sim f_{X \mid Y}(x \mid Y), то P(X≤a)=∫−∞afx(x)dx\mathbb {P}\left(X \leq a\right)=\int_{-\infty }^{a} f_{x}(x) d x.]

(c)

Если сгенерировать, как в пункте (b), затруднительно, то сгенерируйте

Xmi∼fX∣Y(x∣Ymi−1),Ymi∼fY∣X(y∣Xmi). \begin{align} X_{m_{i}} & \sim f_{X \mid Y}\left(x \mid Y_{m_{i-1}}\right), \\ Y_{m_{i}} & \sim f_{Y \mid X}\left(y \mid X_{m_{i}}\right). \end{align}

для i=1,…,Ki=1, \ldots , K и m=1,…,Mm=1, \ldots , M.

(d)

Покажите, что:

  1. для каждого mm последовательность {Xmi}\left\{ X_{m_{i}}\right\} является цепью Маркова. Если это к тому же эргодическая цепь Маркова, то Xmi→LXX_{m_{i}} \xrightarrow {\mathcal{L}} X при i→∞i \rightarrow \infty, где XX имеет стационарное распределение цепи.

  2. Если стационарное распределение цепи равно fX(x)f_{X}(x), то

    1M∑m=1Mh(xmk)→∫h(x)fX(x)dx \frac{1}{M} \sum _{m=1}^{M} h\left(x_{m_{k}}\right) \rightarrow \int h(x) f_{X}(x) d x

    при K,M→∞K, M \rightarrow \infty.

Примечание.
?

Это основная теория, лежащая в основе сэмплера Гиббса. Для каждого kk мы сгенерировали независимые случайные величины Xmk,m=1,…,MX_{m_{k}}, m=1, \ldots , M, где XmkX_{m_{k}} распределена согласно fX∣Y(x∣ymk−)f_{X \mid Y}\left(x \mid y_{m_{k-}}\right). Также верно, что для каждого mm и большого kk величина XmkX_{m_{k}} распределена приближённо согласно fX(x)f_{X}(x), хотя эти величины уже не являются независимыми. Преимущества и недостатки этих вычислительных схем (одна длинная цепь против многих коротких цепей) обсуждаются в Gelman and Rubin 1992; см. также Geyer and Thompson 1992 и Smith and Roberts 1992. Преобладающее мнение склоняется в пользу одной длинной цепи.

Задача 4.5.9

Чтобы понять сходимость сэмплера Гиббса, пусть (X,Y)∼f(x,y)(X, Y) \sim f(x, y), и определим

k(x,x′)=∫fX∣Y(x∣y)fY∣X(y∣x′)dy k\left(x, x^{\prime }\right)=\int f_{X \mid Y}(x \mid y) f_{Y \mid X}\left(y \mid x^{\prime }\right) d y
?
(a)

Покажите, что функция h∗(⋅)h^{*}(\cdot ), решающая уравнение h∗(x)=∫k(x,x′)h∗(x′)dx′h^{*}(x)=\int k\left(x, x^{\prime }\right) h^{*}\left(x^{\prime }\right) d x^{\prime }, есть h∗(x)=fX(x)h^{*}(x)= f_{X}(x) — маргинальное распределение XX.

(b)

Запишите аналогичное интегральное уравнение, которому удовлетворяет fY(y)f_{Y}(y).

(c)

Определите последовательность функций рекуррентно как hi+1(x)=∫k(x,x′)hi(x′)dxI′h_{i+1}(x)=\int k\left(x, x^{\prime }\right) h_{i}\left(x^{\prime }\right) d x_{I}^{\prime }, где h0(x)h_{0}(x) произвольна, но удовлетворяет sup⁡x∣h0(x)h∗(x)∣<∞\sup_{x}\left|\frac{h_{0}(x)}{h^{*}(x)}\right|<\infty. Покажите, что

∫∣hi+1(x)−h∗(x)∣dx<∫∣hi(x)−h∗(x)∣dx \int \left|h_{i+1}(x)-h^{*}(x)\right| d x<\int \left|h_{i}(x)-h^{*}(x)\right| d x

и, следовательно, hi(x)h_{i}(x) сходится к h∗(x)h^{*}(x).

[Метод пункта (c) называется методом последовательных подстановок. Когда в сэмплере Гиббса участвуют две переменные, он эквивалентен аугментации данных (Tanner and Wong 1987). Даже если переменные векторнозначны, приведённые выше результаты устанавливают сходимость. Если исходный вектор переменных содержит более двух переменных, то требуется более общая версия этого рассуждения (Gelfand and Smith 1990).]

Задача 4.5.10

Прямая реализация подстановочной выборки методом Монте-Карло обеспечивается алгоритмом аугментации данных (Tanner and Wong 1987). Если определить

hi+1(x)=∫[∫fX∣Y(x∣y)fY∣X(y∣x′)dy]hi(x′)dx′ h_{i+1}(x)=\int \left[\int f_{X \mid Y}(x \mid y) f_{Y \mid X}\left(y \mid x^{\prime }\right) d y\right] h_{i}\left(x^{\prime }\right) d x^{\prime }

то по задаче 5.9 hi(x)→fx(x)h_{i}(x) \rightarrow f_{x}(x) при i→∞i \rightarrow \infty.

?
(a)

Чтобы вычислить hi+1h_{i+1} методом интегрирования Монте-Карло:

  1. Сгенерируйте Xj′∼hi(x′),j=1,…,JX_{j}^{\prime } \sim h_{i}\left(x^{\prime }\right), \quad j=1, \ldots , J.

  2. Для каждого xj′x_{j}^{\prime } сгенерируйте Yjk∼fY∣X(y∣xj′),k=1,…,KY_{j k} \sim f_{Y \mid X}\left(y \mid x_{j}^{\prime }\right), k=1, \ldots , K.

  3. Вычислите h^i+1(x)=1J∑j=1J1K∑k=1KfX∣Y(x∣yjk)\hat{h}_{i+1}(x)=\frac{1}{J} \sum_{j=1}^{J} \frac{1}{K} \sum_{k=1}^{K} f_{X \mid Y}\left(x \mid y_{j k}\right). Тогда h^i+1(x)→hi+1(x)\hat{h}_{i+1}(x) \rightarrow h_{i+1}(x) при J,K→∞J, K \rightarrow \infty, и, следовательно, алгоритм аугментации данных сходится.

(b)

Чтобы реализовать (a)(i), нужно уметь генерировать случайную величину из смеси распределений. Покажите, что если fY(y)=∑i=1naigi(y),Σai=1f_{Y}(y)=\sum_{i=1}^{n} a_{i} g_{i}(y), \Sigma a_{i}=1, то алгоритм

  1. Выбрать gig_{i} с вероятностью aia_{i}

  2. Сгенерировать Y∼giY \sim g_{i} порождает случайную величину с распределением fYf_{Y}.

Отсюда покажите, как реализовать шаг (a)(i), генерируя случайные величины из fX∣Yf_{X \mid Y}. Tanner and Wong (1987) отмечают, что этот алгоритм работает даже при J=1J=1, что даёт приближение

h^i+1(x)=1K∑k=1KfX∣Y(x∣yk), \hat{h}_{i+1}(x)=\frac{1}{K} \sum _{k=1}^{K} f_{X \mid Y}\left(x \mid y_{k}\right),

идентичное сэмплеру Гиббса. Алгоритм аугментации данных можно также рассматривать как применение процедуры множественной импутации (multiple imputation) (Rubin 1976, 1987, Little and Rubin 1987).

Задача 4.5.11

Выборку методом последовательных подстановок можно реализовать через сэмплер Гиббса следующим образом. Из задачи 5.8(c) требуется вычислить

hM=1M∑m=1Mk(x∣xmk)=1M∑m=1M∫fX∣Y(x∣y)fX∣Y(y∣xmk)dy. h_{M}=\frac{1}{M} \sum _{m=1}^{M} k\left(x \mid x_{m_{k}}\right)=\frac{1}{M} \sum _{m=1}^{M} \int f_{X \mid Y}(x \mid y) f_{X \mid Y}\left(y \mid x_{m_{k}}\right) d y.
?
(a)

Покажите, что hM(x)→fX(x)h_{M}(x) \rightarrow f_{X}(x) при M→∞M \rightarrow \infty.

(b)

При заданном xmkx_{m_{k}} приближение Монте-Карло к hM(x)h_{M}(x) имеет вид

h^M(x)=1M∑m=1M1J∑j=1JfX∣Y(x∣ykj) \hat{h}_{M}(x)=\frac{1}{M} \sum _{m=1}^{M} \frac{1}{J} \sum _{j=1}^{J} f_{X \mid Y}\left(x \mid y_{k_{j}}\right)

где Ykj∼fY∣X(y∣xmk)Y_{k_{j}} \sim f_{Y \mid X}\left(y \mid x_{m_{k}}\right) и h^M(x)→hM(x)\hat{h}_{M}(x) \rightarrow h_{M}(x) при J→∞J \rightarrow \infty.

(c)

Следовательно, при M,J→∞,h^M(x)→fX(x)M, J \rightarrow \infty , \hat{h}_{M}(x) \rightarrow f_{X}(x).

Примечание.
?

Это сэмплер Гиббса, который обычно реализуется при J=1J=1.

Задача 4.5.12

Для ситуации примера 5.6 покажите, что

?
(a)
E[1M∑i=1MΘi]=E[1M∑i=1ME[Θ∣x,τi]], \mathbb {E}\left[\frac{1}{M} \sum _{i=1}^{M} \Theta _{i}\right]=\mathbb {E}\left[\frac{1}{M} \sum _{i=1}^{M} \mathbb {E}\left[\Theta \mid \mathbf{x}, \tau _{i}\right]\right],
(b)
var⁡(1M∑i=1MΘi)≥var⁡(1M∑i=1ME[Θ∣x,τi]). \operatorname {var}\left(\frac{1}{M} \sum _{i=1}^{M} \Theta _{i}\right) \geq \operatorname {var}\left(\frac{1}{M} \sum _{i=1}^{M} \mathbb {E}\left[\Theta \mid \mathbf{x}, \tau _{i}\right]\right).
(c)

Обсудите, когда в (b) может достигаться равенство. Можете ли вы привести пример?

Задача 4.5.13

Покажите, что для иерархии (5.5.1) апостериорные распределения π(θ∣x)\pi (\theta \mid \mathbf{x}) и π(λ∣x)\pi (\lambda \mid \mathbf{x}) удовлетворяют

π(θ∣x)=∫[∫π(θ∣x,λ)π(λ∣x,θ′)dλ]π(θ′∣x)dθ′π(λ∣x)=∫[∫π(λ∣x,θ)π(θ∣x,λ′)dθ]π(λ′∣x)dλ′ \begin{align} & \pi (\theta \mid \mathbf{x})=\int \left[\int \pi (\theta \mid \mathbf{x}, \lambda ) \pi \left(\lambda \mid \mathbf{x}, \theta ^{\prime }\right) d \lambda \right] \pi \left(\theta ^{\prime } \mid \mathbf{x}\right) d \theta ^{\prime } \\ & \pi (\lambda \mid \mathbf{x})=\int \left[\int \pi (\lambda \mid \mathbf{x}, \theta ) \pi \left(\theta \mid \mathbf{x}, \lambda ^{\prime }\right) d \theta \right] \pi \left(\lambda ^{\prime } \mid \mathbf{x}\right) d \lambda ^{\prime } \end{align}

и, следовательно, являются стационарными точками цепей Маркова в (5.5.13).

?
Задача 4.5.14

Исходя из равномерной случайной величины U∼Uniform⁡(0,1)U \sim \operatorname {Uniform}(0,1), с помощью преобразований можно построить многие случайные величины.

?
(a)

Покажите, что −log⁡U∼exp⁡(1)-\log U \sim \exp (1).

(b)

Покажите, что −∑i=1nlog⁡Ui∼Gamma⁡(n,1)-\sum_{i=1}^{n} \log U_{i} \sim \operatorname {Gamma}(n, 1), где U1,…,UnU_{1}, \ldots , U_{n} — независимые одинаково распределённые как U(0,1)U(0,1).

(c)

Пусть X∼Exp⁡(a,b)X \sim \operatorname {Exp}(a, b). Запишите XX как функцию от UU.

(d)

Пусть X∼Gamma⁡(n,β)X \sim \operatorname {Gamma}(n, \beta ), nn — целое число. Запишите XX как функцию от U1,…,UnU_{1}, \ldots , U_{n}, независимых одинаково распределённых как U(0,1)U(0,1).

Задача 4.5.15

Начиная со случайной величины U(0,1)U(0,1), преобразования из задачи 5.14 не позволяют получить нормальные случайные величины или гамма-случайные величины с нецелым параметром формы. Один из способов сделать это — использовать алгоритм принятия-отклонения (Accept-Reject Algorithm) (Ripley 1987, раздел 3.2), алгоритм для моделирования X∼f(x)X \sim f(x) :

  1. Сгенерировать Y∼g(y),U∼U(0,1)Y \sim g(y), U \sim U(0,1), независимо.

  2. Вычислить ρ(Y)=1Mf(Y)g(Y)\rho (Y)=\frac{1}{M} \frac{f(Y)}{g(Y)} где M=sup⁡tf(t)/g(t)M=\sup_{t} f(t) / g(t).

  3. Если U<ρ(Y)U<\rho (Y), положить X=YX=Y, иначе вернуться к i).

?
(a)

Покажите, что этот алгоритм генерирует X∼f(x)X \sim f(x).

(b)

Начиная с Y∼exp⁡(1)Y \sim \exp (1), покажите, как сгенерировать X∼N(0,1)X \sim N(0,1).

(c)

Покажите, как сгенерировать гамма-случайную величину с нецелым параметром формы.

Задача 4.5.16

Рассмотрим нормальную иерархическую модель

X∣θ1∼n(θ1,σ12),θ1∣θ2∼n(θ2∣σ22),⋮θk−1∣θk∼n(θk,σk2) \begin{align} X \mid \theta _{1} & \sim n\left(\theta _{1}, \sigma _{1}^{2}\right), \\ \theta _{1} \mid \theta _{2} & \sim n\left(\theta _{2} \mid \sigma _{2}^{2}\right), \\ \vdots & \\ \theta _{k-1} \mid \theta _{k} & \sim n\left(\theta _{k}, \sigma _{k}^{2}\right) \end{align}

где σ12,i=1,…,k\sigma_{1}^{2}, i=1, \ldots , k, известны.

?
(a)

Покажите, что апостериорное распределение θi(1≤i≤k−1)\theta_{i}(1 \leq i \leq k-1) равно

π(θi∣x,θk)=N(αix+(1−αi)θk,τi2) \pi \left(\theta _{i} \mid x, \theta _{k}\right)=N\left(\alpha _{i} x+\left(1-\alpha _{i}\right) \theta _{k}, \tau _{i}^{2}\right)

где τi2=(Σ1iσj2)(Σi+1kσj2)/Σikσj2\tau_{i}^{2}=\left(\Sigma_{1}^{i} \sigma_{j}^{2}\right)\left(\Sigma_{i+1}^{k} \sigma_{j}^{2}\right) / \Sigma_{i}^{k} \sigma_{j}^{2} и αi=τi2/Σ1iσj2\alpha_{i}=\tau_{i}^{2} / \Sigma_{1}^{i} \sigma_{j}^{2}.

(b)

Найдите выражение для информации Кульбака—Лейблера K[π(θi∣x,θk),π(θi∣θk)]K\left[\pi \left(\theta_{i} \mid x, \theta_{k}\right), \pi \left(\theta_{i} \mid \theta_{k}\right)\right] и покажите, что она является убывающей функцией ii.

Задача 4.5.17

В первоначальном доказательстве теоремы 5.7 (Goel and DeGroot 1981) использовалась энтропийная функция Реньи (Rényi 1961)

Rα(f,g)=1α−1log⁡∫fα(x)g1−α(x)dμ(x), R_{\alpha }(f, g)=\frac{1}{\alpha -1} \log \int f^{\alpha }(x) g^{1-\alpha }(x) d \mu (x),

где ff и gg — плотности, μ\mu — доминирующая мера, а α\alpha — постоянная, α≠1\alpha \neq 1.

?
(a)

Покажите, что Rα(f,g)R_{\alpha }(f, g) удовлетворяет Rα(f,g)>0R_{\alpha }(f, g)>0 и Rα(f,f)=0R_{\alpha }(f, f)=0.

(b)

Покажите, что теорема 5.7 остаётся верной, если вместо K[f,g]K[f, g] использовать Rα(f,g)R_{\alpha }(f, g).

(c)

Покажите, что lim⁡α→1Rα(f,g)=K[f,g]\lim_{\alpha \rightarrow 1} R_{\alpha }(f, g)=K[f, g], и приведите другое доказательство теоремы 5.7.

Задача 4.5.18

Информация Кульбака—Лейблера K[f,g]K[f, g] (5.5.25) не симметрична по ff и gg, и модификация, называемая дивергенцией, устраняет эту асимметрию. Определим J[f,g]J[f, g] — дивергенцию между ff и gg — как J[f,g]=K[f,g]+K[g,f]J[f, g]=K[f, g]+K[g, f]. Покажите, что, аналогично теореме 5.7, J[π(λ∣x),γ(λ)]<J[π(θ∣x),π(θ)]J[\pi (\lambda \mid x), \gamma (\lambda )]<J[\pi (\theta \mid x), \pi (\theta )].

?
Задача 4.5.19

Goel and DeGroot (1981) определяют байесовский аналог информации Фишера [см. (2.5.10)] как

I[π(θ∣x)]=∫Ω[∂∂xπ(θ∣x)π(θ∣x)]2dθ \mathcal{I}[\pi (\theta \mid x)]=\int _{\Omega }\left[\frac{\frac{\partial }{\partial x} \pi (\theta \mid x)}{\pi (\theta \mid x)}\right]^{2} d \theta

— информацию, которую xx несёт об апостериорном распределении. Как и в теореме 5.7, покажите, что I[π(λ∣x)]<I[π(θ∣x)]\mathcal{I}[\pi (\lambda \mid x)]<\mathcal{I}[\pi (\theta \mid x)], что снова показывает, что влияние λ\lambda меньше влияния θ\theta.

?
Задача 4.5.20

Каждая из mm спор имеет вероятность τ\tau прорастания. Из rr проросших спор каждая имеет вероятность ω\omega изогнуться в определённом направлении. Если ss изгибается в этом определённом направлении, то вероятностная модель, описывающая этот процесс, — двумерное биномиальное распределение с функцией вероятности

f(r,s∣τ,ω,m)=(mr)τr(1−τ)m−r(rs)ωs(1−ω)r−s. f(r, s \mid \tau , \omega , m)=\binom {m}{r} \tau ^{r}(1-\tau )^{m-r}\binom {r}{s} \omega ^{s}(1-\omega )^{r-s}.
?
(a)

Покажите, что априорное распределение Джеффриса равно πJ(τ,ω)=(1−τ)−1/2ω−1/2(1−ω)−1/2\pi_{J}(\tau , \omega )=(1-\tau )^{-1 / 2} \omega^{-1 / 2}(1-\omega )^{-1 / 2}.

(b)

Если τ\tau рассматривается как мешающий параметр, то референсное априорное распределение равно

πR(τ,ω)=τ−1/2(1−τ)−1/2ω−1/2(1−ω)−1/2. \pi _{R}(\tau , \omega )=\tau ^{-1 / 2}(1-\tau )^{-1 / 2} \omega ^{-1 / 2}(1-\omega )^{-1 / 2}.

Сравните апостериорные средние E[ω∣r,s,m]\mathbb {E}\left[\omega \mid r, s, m\right] при априорном распределении Джеффриса и при референсном априорном распределении. Является ли одно из них более подходящим?

(c)

Как разные априорные распределения влияют на апостериорную дисперсию?

[Априорные распределения для двумерного биномиального распределения рассматривались в работах Crowder and Sweeting (1989), Polson and Wasserman (1990) и Clark and Wasserman (1993), которые предлагают компромиссное референсное/джеффрисовское априорное распределение.]

Задача 4.5.21

Пусть F={f(x∣θ);θ∈Ω}\mathcal{F}=\left\{ f(x \mid \theta ) ; \theta \in \Omega \right\} — семейство плотностей вероятности. Информацию Кульбака—Лейблера для различения двух плотностей из F\mathcal{F} можно записать как

ψ(θ1,θ2)=∫f(x∣θ1)log⁡[f(x∣θ1)f(x∣θ2)]dx. \psi \left(\theta _{1}, \theta _{2}\right)=\int f\left(x \mid \theta _{1}\right) \log \left[\frac{f\left(x \mid \theta _{1}\right)}{f\left(x \mid \theta _{2}\right)}\right] d x.

Напомним, что градиент ψ\psi есть ∇ψ={(∂/∂θi)ψ}\nabla \psi =\left\{ \left(\partial / \partial \theta_{i}\right) \psi \right\}, а гессиан — ∇∇ψ={(∂2/∂θi∂θj)ψ}\nabla \nabla \psi = \left\{ \left(\partial^{2} / \partial \theta_{i} \partial \theta_{j}\right) \psi \right\}.

?
(a)

Если интегрирование и дифференцирование можно менять местами, покажите, что

∇ψ(θ,θ)=0 и det⁡[∇∇ψ(θ,θ)]=I(θ), \nabla \psi (\theta , \theta )=0 \quad \text{ и } \quad \operatorname {det}[\nabla \nabla \psi (\theta , \theta )]=I(\theta ),

где I(θ)I(\theta ) — информация Фишера для f(x∣θ)f(x \mid \theta ).

(b)

George and McCulloch (1993) утверждают, что выбор π(θ)=(det⁡[∇∇ψ(θ,θ)])1/2\pi (\theta )=(\operatorname {det}[\nabla \nabla \psi (\theta , \theta )])^{1 / 2} представляет собой привлекательный наименее информативный выбор априорного распределения. Какое обоснование вы можете этому дать?

§
Задача 4.6.1

Для модели (3.3.1) покажите, что δλ(x)∣λ=λ^=δλ^(x)\left.\delta^{\lambda }(x)\right|_{\lambda =\hat{\lambda }}=\delta^{\hat{\lambda }(x)}, где байесовская оценка δλ(x)\delta^{\lambda }(x) минимизирует ∫L[θ,d(x)]π(θ∣x,λ)dθ\int L[\theta , d(x)] \pi (\theta \mid x, \lambda ) d \theta, а эмпирическая байесовская оценка δλ^(x)\delta^{\hat{\lambda }(x)} минимизирует ∫L[θ,d(x)]π(θ∣x,λ^)dθ\int L[\theta , d(x)] \pi (\theta \mid x, \hat{\lambda }) d \theta.

?
Задача 4.6.2

В этой задаче исследуются условия, при которых эмпирическая байесовская оценка является байесовской оценкой. Выражение (6.6.3) представляет собой истинные апостериорные ожидаемые потери, если π(θ∣x,λ^(x))\pi (\theta \mid \mathbf{x}, \hat{\lambda }(\mathbf{x})) является истинным апостериорным распределением.

Исходя из иерархии

X∣θ∼f(x∣θ),Θ∣λ∼π(θ∣λ), \begin{align} & X \mid \theta \sim f(x \mid \theta ), \\ & \Theta \mid \lambda \sim \pi (\theta \mid \lambda ), \end{align}

определим совместное распределение X\mathbf{X} и Θ\Theta как (X,θ)∼g(x,θ)=f(x∣θ)π(θ∣λ^(x))(\mathbf{X}, \theta ) \sim g(\mathbf{x}, \theta )=f(\mathbf{x} \mid \theta ) \pi (\theta \mid \hat{\lambda }(\mathbf{x})), где π(θ∣λ^(x))\pi (\theta \mid \hat{\lambda }(\mathbf{x})) получается подстановкой λ^(x)\hat{\lambda }(\mathbf{x}) вместо λ\lambda в π(θ∣λ)\pi (\theta \mid \lambda ).

?
(a)

Покажите, что для этой совместной плотности формальная байесовская оценка эквивалентна эмпирической байесовской оценке из иерархической модели.

(b)

Если f(⋅∣θ)f(\cdot \mid \theta ) и π(⋅∣λ)\pi (\cdot \mid \lambda ) — собственные плотности, то ∫g(x,θ)dθ<∞\int g(\mathbf{x}, \theta ) d \theta <\infty. Однако ∬g(x,θ)dxdθ\iint g(\mathbf{x}, \theta ) d \mathbf{x} d \theta не обязано быть конечным.

Задача 4.6.3

Для модели (6.3.1) байесовская оценка δλ(x)\delta^{\lambda }(x) минимизирует ∫L(θ,d(x))×π(θ∣x,λ)dθ\int L(\theta , d(x)) \times \pi (\theta \mid x, \lambda ) d \theta, а эмпирическая байесовская оценка δλ^(x)\delta^{\hat{\lambda }}(x) минимизирует ∫L(θ,d(x))π(θ∣x,λ^(x))dθ\int L(\theta , d(x)) \pi (\theta \mid x, \hat{\lambda }(x)) d \theta. Покажите, что δλ(x)∣λ=λ^(x)=δλ^(x)\left.\delta^{\lambda }(x)\right|_{\lambda =\hat{\lambda }(x)}=\delta^{\hat{\lambda }}(x).

?
Задача 4.6.4

Для ситуации примера 6.1:

?
(a)

Покажите, что

∫−∞∞e−n/2σ2(xˉ−θ)2e(−1/2)θ2/τ2dθ=2π(σ2τ2σ2+τ2)1/2e(−n/2)xˉ2/σ2+nτ2 \int _{-\infty }^{\infty } e^{-n / 2 \sigma ^{2}(\bar{x}-\theta )^{2}} e^{(-1 / 2) \theta ^{2} / \tau ^{2}} d \theta =\sqrt{2 \pi }\left(\frac{\sigma ^{2} \tau ^{2}}{\sigma ^{2}+\tau ^{2}}\right)^{1 / 2} e^{(-n / 2) \bar{x}^{2} / \sigma ^{2}+n \tau ^{2}}

и, тем самым, установите (6.6.4).

(b)

Проверьте, что маргинальная MLE-оценка σ2+nτ2\sigma^{2}+n \tau^{2} равна nxˉ2n \bar{x}^{2} и что эмпирическая байесовская оценка задаётся формулой (6.6.5).

Задача 4.6.5

Обращаясь к примеру 6.2:

?
(a)

Покажите, что байесовский риск r(π,δπ)r\left(\pi , \delta^{\pi }\right) байесовской оценки (6.6.7) задаётся формулой

r(π,δπ)=kE[var⁡(pk∣xk)]=kab(a+b)(a+b+1)(a+b+n). r\left(\pi , \delta ^{\pi }\right)=k \mathbb {E}\left[\operatorname {var}\left(p_{k} \mid x_{k}\right)\right]=\frac{k a b}{(a+b)(a+b+1)(a+b+n)}.
(b)

Покажите, что байесовский риск несмещённой оценки X/n=(X1/n,…,Xk/n)\mathbf{X} / n=\left(X_{1} / n, \ldots , X_{k} / n\right) задаётся формулой

r(π,X/n)=kabn(a+b+1)(a+b). r(\pi , \mathbf{X} / n)=\frac{k a b}{n(a+b+1)(a+b)}.
Задача 4.6.6

Теорема 6.3 утверждает: для ситуации следствия 3.3 (если X=(X1,…,Xp)X=(X_{1}, \ldots , X_{p}) имеет плотность pη(x)=e∑iηixi−A(η)h(x)p_{\eta }(x)=e^{\sum_{i} \eta_{i} x_{i}-A(\eta )} h(x), а η\eta имеет априорную плотность π(η)\pi (\eta ), то байесовская оценка η\eta при квадратичной функции потерь равна E[ηi∣x]=∂∂xilog⁡m(x)−∂∂xilog⁡h(x)\mathbb {E}\left[\eta_{i} \mid x\right]=\frac{\partial }{\partial x_{i}} \log m(x)-\frac{\partial }{\partial x_{i}} \log h(x)), с априорным распределением π(η∣λ)\pi (\eta \mid \lambda ); пусть λ^(x)\hat{\lambda }(x) — MLE-оценка λ\lambda, основанная на m(x∣λ)m(x \mid \lambda ). Тогда эмпирическая байесовская оценка равна

E[ηi∣x,λ^]=∂∂xilog⁡m(x∣λ^(x))−∂∂xilog⁡h(x). \mathbb {E}\left[\eta _{i} \mid x, \hat{\lambda }\right]=\frac{\partial }{\partial x_{i}} \log m(x \mid \hat{\lambda }(x))-\frac{\partial }{\partial x_{i}} \log h(x).

Обобщите теорему 6.3 на случай теоремы 3.2; то есть, если X\mathbf{X} имеет плотность (3.3.7), а η\boldsymbol {\eta } имеет априорную плотность π(η∣γ)\pi (\boldsymbol {\eta } \mid \gamma ), то эмпирическая байесовская оценка равна

E[∑ηi∂Ti(x)∂xj∣ x,γ^(x)]=∂∂xjlog⁡m(x∣γ^(x))−∂∂xjlog⁡h(x), \mathbb {E}\left[\left.\sum \eta _{i} \frac{\partial T_{i}(\mathbf{x})}{\partial x_{j}} \right\rvert \, \mathbf{x}, \hat{\gamma }(\mathbf{x})\right]=\frac{\partial }{\partial x_{j}} \log m(\mathbf{x} \mid \hat{\gamma }(\mathbf{x}))-\frac{\partial }{\partial x_{j}} \log h(\mathbf{x}),

где m(x∣γ)m(\mathbf{x} \mid \gamma ) — маргинальное распределение X, а γ^(x)\hat{\gamma }(\mathbf{x}) — маргинальная MLE-оценка γ\gamma.

?
Задача 4.6.7
?
(a)

Для pη(x)p_{\eta }(\mathbf{x}) из (1.5.2) покажите, что для любого априорного распределения π(η∣λ)\pi (\eta \mid \lambda ), зависящего от гиперпараметра λ\lambda, эмпирическая байесовская оценка задаётся формулой

E[∑i=1sηi∂∂xjTi(x)∣ x,λ^]=∂∂xjlog⁡mπ(x∣λ^(x))−∂∂xjlog⁡h(x). \mathbb {E}\left[\left.\sum _{i=1}^{s} \eta _{i} \frac{\partial }{\partial x_{j}} T_{i}(\mathbf{x}) \right\rvert \, \mathbf{x}, \hat{\lambda }\right]=\frac{\partial }{\partial x_{j}} \log m_{\pi }(\mathbf{x} \mid \hat{\lambda }(\mathbf{x}))-\frac{\partial }{\partial x_{j}} \log h(\mathbf{x}).

где mπ(x)=∫pθ(x)π(θ)dθm_{\pi }(\mathbf{x})=\int p_{\theta }(\mathbf{x}) \pi (\theta ) d \theta.

(b)

Если X имеет распределение pθ(x)p_{\theta }(\mathbf{x}) из (1.5.1), покажите, что справедлива аналогичная формула, а именно

E[Tη(θ)∣λ^]=∇log⁡mπ(x∣λ^)−∇log⁡h(x), \mathbb {E}\left[\mathcal{T} \eta (\theta ) \mid \hat{\lambda }\right]=\nabla \log m_{\pi }(\mathbf{x} \mid \hat{\lambda })-\nabla \log h(\mathbf{x}),

где T={∂Ti/∂xj}\mathcal{T}=\left\{ \partial T_{i} / \partial x_{j}\right\} — якобиан T\mathcal{T}, а ∇a\nabla a — вектор градиента aa, то есть ∇a={∂a/∂xi}\nabla a=\left\{ \partial a / \partial x_{i}\right\}.

Задача 4.6.8

Для каждой из следующих ситуаций запишите эмпирическую байесовскую оценку естественного параметра (при квадратичной функции потерь) в виде (6.6.12), используя оценку максимального маргинального правдоподобия гиперпараметра λ\lambda. Вычислите выражения настолько, насколько это возможно.

?
(a)

Xi∼N(0,σi2),i=1,…,pX_{i} \sim N\left(0, \sigma_{i}^{2}\right), i=1, \ldots , p, независимы; 1/σi2∼Exponential⁡(λ)1 / \sigma_{i}^{2} \sim \operatorname {Exponential}(\lambda ).

(b)

Xi∼N(θi,1),i=1,…,pX_{i} \sim N\left(\theta_{i}, 1\right), \quad i=1, \ldots , p, независимы, θi∼DE(0,λ)\theta_{i} \sim D E(0, \lambda ).

Задача 4.6.9

Strawderman (1992) показывает, что оценку Джеймса—Стейна можно рассматривать как эмпирическую байесовскую оценку в произвольном семействе сдвига. Пусть Xp×1∼f(x−θ)\mathbf{X}_{p \times 1} \sim f(x-\theta ), где E[X]=θ\mathbb {E}\left[\mathbf{X}\right]=\theta и var X=σ2I\mathbf{X}=\sigma^{2} I. Пусть априорное распределение есть θ∼f∗n\theta \sim f^{* n} — nn-кратная свёртка ff с самой собой. [Свёртка ff с самой собой — это f∗2(x)=∫f(x−y)f(y)dyf^{* 2}(x)=\int f(x-y) f(y) d y. nn-кратная свёртка — это f∗n(x)=∫f∗(n−1)(x)(x−y)f(y)dyf^{* n}(x)=\int f *(n-1)(x)(x-y) f(y) d y.] Эквивалентно, пусть Ui∼f,i=0,⋯ ,nU_{i} \sim f, i=0, \cdots , n, независимые одинаково распределённые, θ=∑1nUi\theta =\sum_{1}^{n} U_{i}, и X=U0+θ\mathbf{X}=U_{0}+\theta.

?
(a)

Покажите, что байесовское правило при квадратичной функции потерь равно nn+1x\frac{n}{n+1} \mathbf{x}. Заметим, что nn является априорным параметром.

(b)

Покажите, что ∣X∣2/(pσ2)|\mathbf{X}|^{2} /\left(p \sigma^{2}\right) является несмещённой оценкой n+1n+1, и, следовательно, эмпирическая байесовская оценка θ\theta задаётся формулой δEB=[1−(pσ2/∣x∣2)]x\delta^{E B}=\left[1-\left(p \sigma^{2} /|\mathbf{x}|^{2}\right)\right] \mathbf{x}.

Задача 4.6.10

Покажите для иерархии из примера 3.4, где σ2\sigma^{2} и τ2\tau^{2} известны, а μ\mu неизвестно, что:

?
(a)

Эмпирическая байесовская оценка θi\theta_{i}, основанная на маргинальной MLE-оценке θi\theta_{i}, равна τ2σ2+τ2Xi+σ2σ2+τ2Xˉ\frac{\tau^{2}}{\sigma^{2}+\tau^{2}} X_{i}+ \frac{\sigma^{2}}{\sigma^{2}+\tau^{2}} \bar{X}.

(b)

Байесовский риск, при функции потерь в виде суммы квадратов ошибок, эмпирической байесовской оценки из пункта (a) равен

pσ2−2(p−1)2σ4p(σ2+τ2)+(p−1)(σ2σ2+τ2)2∑i=1pE[(Xi−Xˉ)2]. p \sigma ^{2}-\frac{2(p-1)^{2} \sigma ^{4}}{p\left(\sigma ^{2}+\tau ^{2}\right)}+(p-1)\left(\frac{\sigma ^{2}}{\sigma ^{2}+\tau ^{2}}\right)^{2} \sum _{i=1}^{p} \mathbb {E}\left[(X_{i}-\bar{X})^{2}\right].
(c)

Минимальный риск эмпирической байесовской оценки достигается, когда все θi\theta_{i} равны. [Указание: Покажите, что ∑i=1pE[(Xi−Xˉ)2]=∑i=1p(θi−θˉ)2+(p−1)σ2\sum_{i=1}^{p} \mathbb {E}\left[\left(X_{i}-\bar{X}\right)^{2}\right]=\sum_{i=1}^{p}\left(\theta_{i}-\bar{\theta }\right)^{2}+(p-1) \sigma^{2}.]

Задача 4.6.11

Для E[Θ∣x]\mathbb {E}\left[\Theta \mid \mathbf{x}\right] из (5.5.8) покажите, что при v→∞,E[Θ∣x]→[p/(p+σ2)]xˉv \rightarrow \infty , \mathbb {E}\left[\Theta \mid x\right] \rightarrow \left[p /\left(p+\sigma^{2}\right)\right] \bar{x} — байесовской оценке при априорном распределении N(0,1)N(0,1).

?
Задача 4.6.12
?
(a)

Покажите, что эмпирическая байесовская оценка δEB(xˉ)=(1−σ2/max⁡{σ2,pxˉ2})xˉ\delta^{E B}(\bar{x})=\left(1-\sigma^{2} / \max \left\{ \sigma^{2}, p \bar{x}^{2}\right\} \right) \bar{x} из (6.6.5) имеет ограниченную среднеквадратичную ошибку.

(b)

Покажите, что вариант δEB(xˉ)\delta^{E B}(\bar{x}) из пункта (a), δv(xˉ)=[1−σ2/(v+pxˉ2)]xˉ\delta^{v}(\bar{x})=\left[1-\sigma^{2} /\left(v+p \bar{x}^{2}\right)\right] \bar{x}, также имеет ограниченную среднеквадратичную ошибку.

(c)

При σ2=τ2=1\sigma^{2}=\tau^{2}=1 постройте графики функций риска оценок из пунктов (a) и (b).

[Thompson (1968a, 1968b) исследовал свойства среднеквадратичной ошибки оценок, подобных приведённым в пункте (b). Хотя такие оценки имеют меньшую среднеквадратичную ошибку, чем xˉ\bar{x}, при малых значениях θ\theta, они всегда имеют бо́льшую среднеквадратичную ошибку при бо́льших значениях θ\theta.]

Задача 4.6.13
?
(a)

Для иерархии (5.5.7), при σ2=1\sigma^{2}=1 и p=10p=10, вычислите байесовский риск r(π,δπ)r\left(\pi , \delta^{\pi }\right) байесовской оценки (5.5.8) при v=2,5v=2,5 и 10.

(b)

Вычислите байесовский риск оценки δv\delta^{v} из задачи 6.12(b). Найдите значение vv, дающее хорошее приближение к риску иерархической байесовской оценки. Сравните его с байесовским риском эмпирической байесовской оценки из задачи 6.12(a).

Задача 4.6.14

Обращаясь к примеру 6.6, покажите, что эмпирическая байесовская оценка также является иерархической байесовской оценкой при использовании априорного распределения γ(b)=1/b\gamma (b)=1 / b.

?
Задача 4.6.15

Аппроксимация оценки (5.5.8) рядом Тейлора выполняется в несколько шагов. Покажите, что:

?
(a)

Используя разложение Тейлора первого порядка в окрестности точки xˉ\bar{x}, имеем

1(1+θ2/v)(v+1)/2=1(1+xˉ2/v)(v+1)/2−v+1vxˉ(1+xˉ2/v)(v+3)/2(θ−xˉ)+R(θ−xˉ) \begin{align} \frac{1}{\left(1+\theta ^{2} / v\right)^{(v+1) / 2}}= & \frac{1}{\left(1+\bar{x}^{2} / v\right)^{(v+1) / 2}} \\ & -\frac{v+1}{v} \frac{\bar{x}}{\left(1+\bar{x}^{2} / v\right)^{(v+3) / 2}}(\theta -\bar{x})+R(\theta -\bar{x}) \end{align}

где остаточный член R(θ−xˉ)R(\theta -\bar{x}) удовлетворяет R(θ−xˉ)/(θ−xˉ)2→0R(\theta -\bar{x}) /(\theta -\bar{x})^{2} \rightarrow 0 при θ→xˉ\theta \rightarrow \bar{x}.

(b)

Остаточный член из пункта (a) также удовлетворяет

∫−∞∞R(θ−xˉ)e−p2σ2(θ−xˉ)2dθ=O(1/p3/2) \int _{-\infty }^{\infty } R(\theta -\bar{x}) e^{-\frac{p}{2 \sigma ^{2}}(\theta -\bar{x})^{2}} d \theta =O\left(1 / p^{3 / 2}\right)
(c)

Числитель и знаменатель (5.5.8) можно записать как

∫−∞∞1(1+θ2/ν)(ν+1)/2e−p2σ2(θ−xˉ)2dθ=2πσ2/p(1+xˉ2/ν)(ν+1)/2+O(1p3/2) \int _{-\infty }^{\infty } \frac{1}{\left(1+\theta ^{2} / \nu \right)^{(\nu +1) / 2}} e^{-\frac{p}{2 \sigma ^{2}}(\theta -\bar{x})^{2}} d \theta =\frac{\sqrt{2 \pi \sigma ^{2} / p}}{\left(1+\bar{x}^{2} / \nu \right)^{(\nu +1) / 2}}+O\left(\frac{1}{p^{3 / 2}}\right)

и

∫−∞∞θ(1+θ2/v)(v+1)/2e−p2σ2(θ−xˉ)2dθ=2πσ2/p(1+xˉ2/v)(v+1)/2[1−(v+1)/v(1+xˉ2/v)]xˉ+O(1p3/2) \begin{align} \int _{-\infty }^{\infty } & \frac{\theta }{\left(1+\theta ^{2} / v\right)^{(v+1) / 2}} e^{-\frac{p}{2 \sigma ^{2}}(\theta -\bar{x})^{2}} d \theta \\ & =\frac{\sqrt{2 \pi \sigma ^{2} / p}}{\left(1+\bar{x}^{2} / v\right)^{(v+1) / 2}}\left[1-\frac{(v+1) / v}{\left(1+\bar{x}^{2} / v\right)}\right] \bar{x}+O\left(\frac{1}{p^{3 / 2}}\right) \end{align}

что даёт (5.6.32).

Задача 4.6.16

Для ситуации примера 6.7:

?
(a)

Вычислите значения приближения (5.6.32) для значений из таблицы 6.2. Существуют ли ситуации, в которых оценка (5.6.32) явно предпочтительнее эмпирической байесовской оценки (5.6.5) как приближение к иерархической байесовской оценке (5.5.8)?

(b)

Расширьте рассуждение из задачи 6.15, чтобы вычислить следующий член разложения, и тем самым получите более точное приближение к иерархической байесовской оценке (5.5.8). Для значений из таблицы 6.2, предпочтительнее ли это новое приближение к (5.5.8), чем (5.6.5) и (5.6.32)?

Задача 4.6.17
?
(a)

Покажите, что если b(⋅)b(\cdot ) имеет ограниченную вторую производную, то

∫b(λ)e−nh(λ)dλ=b(λ^)2πnh′′(λ^)e−nh(λ^)+O(1n3/2) \int b(\lambda ) e^{-n h(\lambda )} d \lambda =b(\hat{\lambda }) \sqrt{\frac{2 \pi }{n h^{\prime \prime }(\hat{\lambda })}} e^{-n h(\hat{\lambda })}+O\left(\frac{1}{n^{3 / 2}}\right)

где h(λ^)h(\hat{\lambda }) — единственный минимум h(λ),h′′(λ)≠0h(\lambda ), h^{\prime \prime }(\lambda ) \neq 0, и nh(λ^)→n h(\hat{\lambda }) \rightarrow константа при n→∞n \rightarrow \infty. [Указание: Разложите b(⋅)b(\cdot ) и h(⋅)h(\cdot ) в ряд Тейлора в окрестности λ^\hat{\lambda } до членов второго порядка. Затем проведите почленное интегрирование.] Это приближение Лапласа для интеграла. Об уточнениях и других разработках этого приближения в байесовском выводе см. Tierney and Kadane 1986, Tierney, Kass, and Kadane 1989, и Robert 1994a (раздел 9.2.3).

(b)

Для иерархической модели (5.5.1) апостериорное среднее можно приблизить как

E[Θ∣x]=e−nh(λ^)[2πnh′′(λ^)]1/2E[Θ∣x,λ^]+O(1n3/2) \mathbb {E}\left[\Theta \mid x\right]=e^{-n h(\hat{\lambda })}\left[\frac{2 \pi }{n h^{\prime \prime }(\hat{\lambda })}\right]^{1 / 2} \mathbb {E}\left[\Theta \mid x, \hat{\lambda }\right]+O\left(\frac{1}{n^{3 / 2}}\right)

где h=1nlog⁡π(λ∣x)h=\frac{1}{n} \log \pi (\lambda \mid x), а λ^\hat{\lambda } — мода π(λ∣x)\pi (\lambda \mid x), апостериорного распределения λ\lambda.

(c)

Если π(λ∣x)\pi (\lambda \mid x) — нормальное распределение со средним λ^\hat{\lambda } и дисперсией σ2=[−(∂2/∂λ2)×log⁡π(λ∣x)∣λ=λ^]−1\sigma^{2}=\left[-\left(\partial^{2} / \partial \lambda^{2}\right) \times \left.\log \pi (\lambda \mid x)\right|_{\lambda =\hat{\lambda }}\right]^{-1}, то E[Θ∣x]=E[Θ∣x,λ^]+O(1/n3/2)\mathbb {E}\left[\Theta \mid x\right]=\mathbb {E}\left[\Theta \mid x, \hat{\lambda }\right]+O\left(1 / n^{3 / 2}\right).

(d)

Покажите, что ситуация из пункта (c) возникает из иерархии

Xi∣θi∼N(θi,σ2),θi∣λ∼N(λ,τ2),λ∼ Uniform (−∞,∞). \begin{align} X_{i} \mid \theta _{i} & \sim N\left(\theta _{i}, \sigma ^{2}\right), \\ \theta _{i} \mid \lambda & \sim N\left(\lambda , \tau ^{2}\right), \\ \lambda & \sim \text{ Uniform }(-\infty , \infty ). \end{align}
Задача 4.6.18
?
(a)

Примените приближение Лапласа (5.6.33), чтобы получить приближение к иерархической байесовской оценке из примера 6.6.

(b)

Сравните приближение из пункта (a) с эмпирической байесовской оценкой (5.6.24). Какое из них лучше приближает иерархическую байесовскую оценку?

Задача 4.6.19

Примените приближение Лапласа (5.6.33) к иерархии из примера 6.7 и покажите, что получаемое приближение к иерархической байесовской оценке задаётся формулой (5.6.32).

?
Задача 4.6.20
?
(a)

Проверьте (6.6.37) — что при квадратичной функции потерь

r(π,δ)=r(π,δπ)+E[(δ−δπ)2]. r(\pi , \delta )=r\left(\pi , \delta ^{\pi }\right)+\mathbb {E}\left[(\delta -\delta ^{\pi })^{2}\right].
(b)

Для X∼binomial⁡(p,n),L(p,δ)=(p−δ)2X \sim \operatorname {binomial}(p, n), L(p, \delta )=(p-\delta )^{2} и π={π:π=beta⁡(a,b),a>0, b>0}\pi =\left\{ \pi : \pi =\operatorname {beta}(a, b), a>0\text{, }b>0\right\}, определите, какая оценка более робастна согласно (6.6.37) — p^=x/n\hat{p}=x / n или δ0=(a0+x)/(a0+b0+n)\delta^{0}=\left(a_{0}+x\right) /\left(a_{0}+b_{0}+n\right).

(c)

Существует ли оценка вида (c+x)/(c+d+n)(c+x) /(c+d+n), которую вы считали бы более робастной, в смысле (6.6.37), чем каждая из оценок пункта (b)?

[В пункте (b), при фиксированных nn и (a0,b0)\left(a_{0}, b_{0}\right), вычислите байесовский риск p^\hat{p} и δ0\delta^{0} для нескольких пар (a,b)(a, b).]

Задача 4.6.21
?
(a)

Установите (6.6.39) и (6.6.40) для класса априорных распределений, заданного в (6.6.38).

(b)

Покажите, что байесовская оценка, основанная на π(θ)∈π\pi (\theta ) \in \pi в (6.6.38), при квадратичной функции потерь задаётся формулой (6.6.41).

§
Задача 4.7.1

Для ситуации примера 7.1:

?
(a)

Эмпирическая байесовская оценка θ\boldsymbol {\theta }, использующая несмещённую оценку τ2/(σ2+τ2)\tau^{2} /\left(\sigma^{2}+\tau^{2}\right), равна

δEB=(1−(p−2)σ2∣x∣2)x, \delta ^{\mathrm{EB}}=\left(1-\frac{(p-2) \sigma ^{2}}{|\mathbf{x}|^{2}}\right) \mathbf{x},

— оценке Джеймса—Стейна.

(b)

Эмпирическая байесовская оценка θ\boldsymbol {\theta }, использующая маргинальную MLE-оценку τ2/(σ2+τ2)\tau^{2} /\left(\sigma^{2}+\tau^{2}\right), равна

δEB=(1−pσ2∣x∣2)+x, \delta ^{\mathrm{EB}}=\left(1-\frac{p \sigma ^{2}}{|\mathbf{x}|^{2}}\right)^{+} \mathbf{x},

что напоминает положительную часть оценки Стейна.

Задача 4.7.2

Следствие 7.2 утверждает: пусть X∼Np(θ,σ2I)X \sim N_{p}(\theta , \sigma^{2} I), и пусть оценка δ\delta имеет вид δ(x)=x−g(x)\delta (\mathbf{x})=\mathbf{x}-g(\mathbf{x}), где g(x)={gi(x)}g(\mathbf{x})=\left\{ g_{i}(\mathbf{x})\right\} дифференцируема. Если Eθ[∣(∂/∂xi)gi(X)∣]<∞\mathbb {E}_{\theta }\left[\left|(\partial / \partial x_{i}) g_{i}(X)\right|\right]<\infty для i=1,…,pi=1, \ldots , p, то

R(θ,δ)=Eθ[∣θ−δ(X)∣2]=pσ2+Eθ[∣g(X)∣2]−2σ2∑i=1pEθ[∂∂xigi(X)]. R(\theta , \delta )=\mathbb {E}_{\theta }\left[\left|\theta -\delta (X)\right|^{2}\right]=p \sigma ^{2}+\mathbb {E}_{\theta }\left[\left|g(X)\right|^{2}\right]-2 \sigma ^{2} \sum _{i=1}^{p} \mathbb {E}_{\theta }\left[\frac{\partial }{\partial x_{i}} g_{i}(X)\right].

Докажите следствие 7.2. Обязательно проверьте, что условия на g(x)g(\mathbf{x}) достаточны, чтобы допустить рассуждение с интегрированием по частям. [Stein (1973,1981)(1973,1981) развивает эти представления в нормальном случае.]

?
Задача 4.7.3

Вывод несмещённой оценки риска (следствие 7.2) можно распространить на более общую модель в экспоненциальном семействе — модель следствия 3.3, где X=X1,…,Xp\mathbf{X}=X_{1}, \ldots , X_{p} имеет плотность

pη(x)=e∑i=1pηixi−A(η)h(x). p_{\boldsymbol {\eta }}(\mathbf{x})=e^{\sum _{i=1}^{p} \eta _{i} x_{i}-A(\boldsymbol {\eta })} h(\mathbf{x}).
?
(a)

Байесовская оценка η\boldsymbol {\eta } при квадратичной функции потерь равна

E[ηi∣x]=∂∂xilog⁡m(x)−∂∂xilog⁡h(x). \mathbb {E}\left[\eta _{i} \mid \mathbf{x}\right]=\frac{\partial }{\partial x_{i}} \log m(\mathbf{x})-\frac{\partial }{\partial x_{i}} \log h(\mathbf{x}).

Покажите, что риск E[η∣X]]\mathbb {E}\left[\eta \mid \mathbf{X}\right]] имеет несмещённую оценку

∑i=1p[∂2∂xi2(log⁡h(x)−2log⁡m(x))+(∂∂xilog⁡m(x))2]. \sum _{i=1}^{p}\left[\frac{\partial ^{2}}{\partial x_{i}^{2}}(\log h(\mathbf{x})-2 \log m(\mathbf{x}))+\left(\frac{\partial }{\partial x_{i}} \log m(\mathbf{x})\right)^{2}\right].

[Указание: теорема 3.5 и задача 3.4.]

(b)

Покажите, что риск эмпирической байесовской оценки

E[ηi∣x,λ^]=∂∂xilog⁡m(x∣λ^(x))−∂∂xilog⁡h(x). \mathbb {E}\left[\eta _{i} \mid \mathbf{x}, \hat{\lambda }\right]=\frac{\partial }{\partial x_{i}} \log m(\mathbf{x} \mid \hat{\lambda }(\mathbf{x}))-\frac{\partial }{\partial x_{i}} \log h(\mathbf{x}).

из теоремы 6.3 имеет несмещённую оценку

∑i=1p[∂2∂xi2(log⁡h(x)−2log⁡m(x∣λ^(x)))+(∂∂xilog⁡m(x∣λ^(x)))2] \sum _{i=1}^{p}\left[\frac{\partial ^{2}}{\partial x_{i}^{2}}(\log h(\mathbf{x})-2 \log m(\mathbf{x} \mid \hat{\lambda }(\mathbf{x})))+\left(\frac{\partial }{\partial x_{i}} \log m(\mathbf{x} \mid \hat{\lambda }(\mathbf{x}))\right)^{2}\right]
(c)

Используя результаты пункта (b), выведите несмещённую оценку риска положительной части оценки Стейна из (7.7.10).

Задача 4.7.4

Проверьте (7.7.9) — выражение для байесовского риска δτ0\delta^{\tau_{0}}. (Задача 3.12 может оказаться полезной.)

?
Задача 4.7.5

Общий вид эмпирической байесовской оценки (7.7.3) задаётся как

δc(x)=(1−cσ2∣x∣2)x, \delta ^{c}(\mathbf{x})=\left(1-\frac{c \sigma ^{2}}{|\mathbf{x}|^{2}}\right) \mathbf{x},

где cc — положительная константа.

?
(a)

Используя следствие 7.2, проверьте, что

Eθ[∣θ−δc(X)∣2]=pσ2+cσ4[c−2(p−2)]Eθ[1∣X∣2]. \mathbb {E}_{\theta }\left[\left|\boldsymbol {\theta }-\delta ^{c}(\mathbf{X})\right|^{2}\right]=p \sigma ^{2}+c \sigma ^{4}[c-2(p-2)] \mathbb {E}_{\theta }\left[\frac{1}{|\mathbf{X}|^{2}}\right].
(b)

Покажите, что байесовский риск при Θ∼Np(0,τ2I)\Theta \sim N_{p}\left(0, \tau^{2} I\right) задаётся формулой

r(π,δc)=σ2[p+cσ2σ2+τ2(cp−2−2)] r\left(\pi , \delta ^{c}\right)=\sigma ^{2}\left[p+\frac{c \sigma ^{2}}{\sigma ^{2}+\tau ^{2}}\left(\frac{c}{p-2}-2\right)\right]

и минимизируется при выборе c=p−2c=p-2.

Задача 4.7.6

Для модели

X∣θ∼Np(θ,σ2I),θ∣τ2∼Np(μ,τ2I): \begin{align} \mathbf{X} \mid \boldsymbol {\theta } & \sim N_{p}\left(\boldsymbol {\theta }, \sigma ^{2} I\right), \\ \boldsymbol {\theta } \mid \tau ^{2} & \sim N_{p}\left(\mu , \tau ^{2} I\right): \end{align}

Покажите, что:

?
(a)

Эмпирическая байесовская оценка, использующая несмещённую оценку τ2/(σ2+τ2)\tau^{2} /\left(\sigma^{2}+\tau^{2}\right), является оценкой Стейна

δiJS(x)=μi+(1−(p−2)σ2Σ(xi−μi)2)(xi−μi). \delta _{i}^{\mathrm{JS}}(\mathbf{x})=\mu _{i}+\left(1-\frac{(p-2) \sigma ^{2}}{\Sigma \left(x_{i}-\mu _{i}\right)^{2}}\right)\left(x_{i}-\mu _{i}\right).
(b)

Если p≥3p \geq 3, байесовский риск при квадратичной функции потерь оценки δJS\delta^{\mathrm{JS}} равен r(τ,δJS)=r(τ,δτ)+2σ4/(σ2+τ2)r\left(\tau , \delta^{\mathrm{JS}}\right)=r\left(\tau , \delta^{\tau }\right)+ 2 \sigma^{4} /\left(\sigma^{2}+\tau^{2}\right), где r(τ,δτ)r\left(\tau , \delta^{\tau }\right) — байесовский риск байесовской оценки.

(c)

Если p<3p<3, байесовский риск δJS\delta^{\mathrm{JS}} бесконечен. [Указание: Покажите, что если Y∼χm2Y \sim \chi_{m}^{2}, то E[1/Y]<∞⟺m<3]\mathbb {E}\left[1 / Y\right]< \infty \Longleftrightarrow m<3].

Задача 4.7.7

Для модели

X∣θ∼Np(θ,σ2I),θ∣τ2∼N(μ,τ2I) \begin{align} \mathbf{X} \mid \boldsymbol {\theta } & \sim N_{p}\left(\boldsymbol {\theta }, \sigma ^{2} I\right), \\ \boldsymbol {\theta } \mid \tau ^{2} & \sim N\left(\mu , \tau ^{2} I\right) \end{align}

байесовский риск обычной оценки Стейна

δi(x)=μi+(1−(p−2)σ2Σ(xi−μi)2)(xi−μi) \delta _{i}(\mathbf{x})=\mu _{i}+\left(1-\frac{(p-2) \sigma ^{2}}{\Sigma \left(x_{i}-\mu _{i}\right)^{2}}\right)\left(x_{i}-\mu _{i}\right)

равномерно больше, чем у её положительной части

δi+(x)=μi+(1−(p−2)σ2Σ(xi−μi)2)+(xi−μi). \delta _{i}^{+}(\mathbf{x})=\mu _{i}+\left(1-\frac{(p-2) \sigma ^{2}}{\Sigma \left(x_{i}-\mu _{i}\right)^{2}}\right)^{+}\left(x_{i}-\mu _{i}\right).
?
Задача 4.7.8

Теорема 7.5 верна в большей общности, чем только для нормального распределения. Предположим, что X\mathbf{X} распределена согласно многомерной версии экспоненциального семейства pη(x)p_{\eta }(x) из (33.7),

pη(x)=eη′x−A(η)h(x),−∞<xi<∞, p_{\eta }(\mathbf{x})=e^{\eta ^{\prime } \mathbf{x}-A(\eta )} h(\mathbf{x}), \quad -\infty <x_{i}<\infty ,

и используется многомерное сопряжённое априорное распределение [обобщающее (3.19)].

?
(a)

Покажите, что E[X∣η]=∇A(η)\mathbb {E}\left[\mathbf{X} \mid \eta \right]=\nabla A(\eta ).

(b)

Если μ=0\mu =0 в априорном распределении (см. 3.19), покажите, что r(τ,δ)≥r(τ,δ+)r(\tau , \delta ) \geq r\left(\tau , \delta^{+}\right), где δ(x)=[1−B(x)]x\delta (\mathbf{x})=[1-B(\mathbf{x})] \mathbf{x} и δ+(x)=[1−B(x)]+x\delta^{+}(\mathbf{x})=[1-B(\mathbf{x})]^{+} \mathbf{x}.

(c)

Если μ≠0\mu \neq 0, оценка δ(x)\delta (\mathbf{x}) изменяется на μ+δ(x−μ)\mu +\delta (\mathbf{x}-\mu ). Установите результат, аналогичный пункту (b), для этой оценки.

Задача 4.7.9
?
(a)

Для модели (7.7.15) покажите, что маргинальное распределение XiX_{i} — отрицательное биномиальное (a,1/b+1)(a, 1 / b+1); то есть

P(Xi=x)=(a+x−1x)(bb+1)x(1b+1)a \mathbb {P}\left(X_{i}=x\right)=\binom {a+x-1}{x}\left(\frac{b}{b+1}\right)^{x}\left(\frac{1}{b+1}\right)^{a}

с E[Xi]=ab\mathbb {E}\left[X_{i}\right]=a b и var Xi=ab(b+1)X_{i}=a b(b+1).

(b)

Если X1,…,XmX_{1}, \ldots , X_{m} независимые одинаково распределённые согласно отрицательному биномиальному распределению из пункта (a), покажите, что условное распределение Xj∣∑1mXiX_{j} \mid \sum_{1}^{m} X_{i} — отрицательное гипергеометрическое распределение, задаваемое как

P(Xj=x∣∑1mXi=t)=(a+x−1x)((m−1)a+t−x−1t−x)(ma+t−1t) \mathbb {P}\left(X_{j}=x \mid \sum _{1}^{m} X_{i}=t\right)=\frac{\binom {a+x-1}{x}\binom {(m-1) a+t-x-1}{t-x}}{\binom {m a+t-1}{t}}

с E[Xj]=t/m\mathbb {E}\left[X_{j}\right]=t / m и var Xj=(m−1)t(ma+t)/m2(ma+1)X_{j}=(m-1) t(m a+t) / m^{2}(m a+1).

Задача 4.7.10

Для ситуации примера 7.6:

?
(a)

Покажите, что байесовская оценка при функции потерь Lk(λ,δ)L_{k}(\lambda , \delta ) из (7.7.16) задаётся формулой (7.7.17).

(b)

Проверьте (7.7.19) и (7.7.20).

(c)

Вычислите байесовские риски r(0,δ1)r\left(0, \delta^{1}\right) и r(1,δ0)r\left(1, \delta^{0}\right). Какая оценка, δ0\delta^{0} или δ1\delta^{1}, более робастна?

Задача 4.7.11

Для ситуации примера 7.6 вычислите байесовский риск эмпирической байесовской оценки (7.7.20) при k=0k=0 и 1. При каких значениях неизвестного гиперпараметра bb эмпирическая байесовская оценка оказывается в наименее, а при каких — в наиболее выгодном положении?

?
Задача 4.7.12

Рассмотрим иерархическую байесовскую оценку для пуассоновской модели (7.7.15) при функции потерь (7.7.16). Используя распределение (5.6.27) для гиперпараметра bb, покажите, что байесовская оценка равна

(pxˉ+α−kpxˉ+pa+α+β−k)(a+xi−k). \left(\frac{p \bar{x}+\alpha -k}{p \bar{x}+p a+\alpha +\beta -k}\right)\left(a+x_{i}-k\right).

[Указание: Покажите, что байесовская оценка равна E[λ1−k∣x]/E[λ−k∣x]\mathbb {E}\left[\lambda^{1-k} \mid \mathbf{x}\right] / \mathbb {E}\left[\lambda^{-k} \mid \mathbf{x}\right] и что

E[λr∣x]=Γ(pxˉ+pa+α+β)Γ(pxˉ+α+r)Γ(pxˉ+α)Γ(pxˉ+pa+α+β+r)Γ(a+xi+r)Γ(a+xi). \mathbb {E}\left[\lambda ^{r} \mid \mathbf{x}\right]=\frac{\Gamma (p \bar{x}+p a+\alpha +\beta ) \Gamma (p \bar{x}+\alpha +r)}{\Gamma (p \bar{x}+\alpha ) \Gamma (p \bar{x}+p a+\alpha +\beta +r)} \frac{\Gamma \left(a+x_{i}+r\right)}{\Gamma \left(a+x_{i}\right)}.
?
Задача 4.7.13

Докажите следующее: два матричных результата, полезных при вычислении оценок в многомерных иерархических моделях:

?
(a)

Для любого вектора aa вида a=(I−1sJ)b,1′a=Σai=0a=\left(I-\frac{1}{s} J\right) b, \mathbf{1}^{\prime } a=\Sigma a_{i}=0.

(b)

Если BB — идемпотентная матрица (то есть B2=IB^{2}=I), а aa — скаляр, то

(I+aB)−1=I−a1+aB. (I+a B)^{-1}=I-\frac{a}{1+a} B.
Задача 4.7.14

Для ситуации примера 7.7:

?
(a)

Покажите, как вывести эмпирическую байесовскую оценку δL\delta^{L} из (7.7.28).

(b)

Проверьте байесовский риск δL\delta^{L} из (7.7.29).

Для ситуации примера 7.8:

(c)

Покажите, как вывести эмпирическую байесовскую оценку δEB2\delta^{\mathrm{EB}_{2}} из (7.7.33).

(d)

Проверьте байесовский риск δEB2\delta^{\mathrm{EB}_{2}}, (7.7.34).

Задача 4.7.15

Эмпирическую байесовскую оценку (7.7.27) можно также вывести как иерархическую байесовскую оценку. Рассмотрим иерархическую модель

Xij∣ξi∼N(ξi,σ2),j=1,…,n,i=1,…,s,ξi∣μ∼N(μ,τ2),i=1,…,s,μ∼ Uniform (−∞,∞) \begin{align} X_{i j} \mid \xi _{i} & \sim N\left(\xi _{i}, \sigma ^{2}\right), \quad j=1, \ldots , n, \quad i=1, \ldots , s, \\ \xi _{i} \mid \mu & \sim N\left(\mu , \tau ^{2}\right), \quad i=1, \ldots , s, \\ \mu & \sim \text{ Uniform }(-\infty , \infty ) \end{align}

где σ2\sigma^{2} и τ2\tau^{2} известны.

?
(a)

Покажите, что байесовская оценка при квадратичной функции потерь равна

E[ξi∣x]=σ2σ2+nτ2E[μ∣x]+nτ2σ2+nτ2xˉi \mathbb {E}\left[\xi _{i} \mid \mathbf{x}\right]=\frac{\sigma ^{2}}{\sigma ^{2}+n \tau ^{2}} \mathbb {E}\left[\mu \mid \mathbf{x}\right]+\frac{n \tau ^{2}}{\sigma ^{2}+n \tau ^{2}} \bar{x}_{i}

где E[μ∣x]\mathbb {E}\left[\mu \mid \mathbf{x}\right] — апостериорное среднее μ\mu.

(b)

Установите, что E[μ∣x]=xˉ=Σxij/ns\mathbb {E}\left[\mu \mid \mathbf{x}\right]=\bar{x}=\Sigma x_{i j} / n s. [Это можно сделать, вычислив математическое ожидание напрямую, либо показав, что апостериорное распределение ξi∣x\xi_{i} \mid \mathbf{x} есть

ξi∣ x∼N[σ2σ2+nτ2xˉ+nτ2σ2+nτ2xˉi,σ2σ2+nτ2(nτ2+σ2s)]. \xi _{i} \left\lvert \, \mathbf{x} \sim N\left[\frac{\sigma ^{2}}{\sigma ^{2}+n \tau ^{2}} \bar{x}+\frac{n \tau ^{2}}{\sigma ^{2}+n \tau ^{2}} \bar{x}_{i}, \frac{\sigma ^{2}}{\sigma ^{2}+n \tau ^{2}}\left(n \tau ^{2}+\frac{\sigma ^{2}}{s}\right)\right].\right.

Заметим, что величины ξi\xi_{i} не являются независимыми апостериори. В самом деле,

ξ∣ x∼Ns(nτ2σ2+nτ2M,nσ2τ2σ2+nτ2M), \boldsymbol {\xi } \left\lvert \, \mathbf{x} \sim N_{s}\left(\frac{n \tau ^{2}}{\sigma ^{2}+n \tau ^{2}} M, \frac{n \sigma ^{2} \tau ^{2}}{\sigma ^{2}+n \tau ^{2}} M\right)\right.,

где M=I+(σ2/nτ2)J]\left.M=I+\left(\sigma^{2} / n \tau^{2}\right) J\right].

(c)

Покажите, что эмпирическую байесовскую оценку (7.7.32) также можно вывести как иерархическую байесовскую оценку, добавив к иерархии (7.7.30) спецификацию (α,β)∼(\alpha , \beta ) \sim равномерное (ℜ2)\left(\Re^{2}\right) [то есть π(α,β)=dαdβ,−∞<α,β<∞\pi (\alpha , \beta )=d \alpha d \beta ,-\infty <\alpha , \beta <\infty ].

Задача 4.7.16

Обобщение модели (7.7.23) на случай неравных nin_{i}, возможно, не так просто, как можно было бы ожидать. Рассмотрим обобщение

Xij∣ξi∼N(ξi,σ2),j=1,…,ni,i=1,…,s,ξi∣μ∼N(μ,τi2),i=1,…,s. \begin{align} X_{i j} \mid \xi _{i} & \sim N\left(\xi _{i}, \sigma ^{2}\right), \quad j=1, \ldots , n_{i}, \quad i=1, \ldots , s, \\ \xi _{i} \mid \mu & \sim N\left(\mu , \tau _{i}^{2}\right), \quad i=1, \ldots , s. \end{align}

Предположим также, что τi2=τ2/ni\tau_{i}^{2}=\tau^{2} / n_{i}. Покажите, что:

?
(a)

Приведённая выше модель эквивалентна

Y∼Ns(λ,σ2I),λ∼Ns(Zμ,τ2I) \begin{align} & \mathbf{Y} \sim N_{s}\left(\lambda , \sigma ^{2} I\right), \\ & \lambda \sim N_{s}\left(\mathbf{Z} \mu , \tau ^{2} I\right) \end{align}

где Yi=niXˉi,λi=niξiY_{i}=\sqrt{n_{i}} \bar{X}_{i}, \lambda_{i}=\sqrt{n_{i}} \xi_{i} и z=(n1,…,ns)′\mathbf{z}=\left(\sqrt{n_{1}}, \ldots , \sqrt{n_{s}}\right)^{\prime }.

(b)

Байесовская оценка ξi\xi_{i} при квадратичной функции потерь равна

σ2σ2+τ2μ+τ2σ2+τ2xˉi. \frac{\sigma ^{2}}{\sigma ^{2}+\tau ^{2}} \mu +\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} \bar{x}_{i}.
(c)

Маргинальное распределение YiY_{i} есть Yi∼Ns(Zμ,(σ2+τ2)I)Y_{i} \sim N_{s}\left(\mathbf{Z} \mu ,\left(\sigma^{2}+\tau^{2}\right) I\right), и эмпирическая байесовская оценка ξ\xi равна

δiEB=xˉ+(1−(s−3)σ2Σni(xˉi−xˉ)2)(xˉi−xˉ) \delta _{i}^{E B}=\bar{x}+\left(1-\frac{(s-3) \sigma ^{2}}{\Sigma n_{i}\left(\bar{x}_{i}-\bar{x}\right)^{2}}\right)\left(\bar{x}_{i}-\bar{x}\right)

где xˉi=Σjxij/ni\bar{x}_{i}=\Sigma_{j} x_{i j} / n_{i} и xˉ=Σinixˉi/Σini\bar{x}=\Sigma_{i} n_{i} \bar{x}_{i} / \Sigma_{i} n_{i}. [Без предположения τi2=τ2/ni\tau_{i}^{2}=\tau^{2} / n_{i} получить простую эмпирическую байесовскую оценку не удаётся. Если τi2=τ2\tau_{i}^{2}=\tau^{2}, для получения оценки τ2\tau^{2}, используемой в эмпирической байесовской оценке, можно применить оценивание по методу правдоподобия. Это обсуждается у Morris (1983a).]

Задача 4.7.17

(Эмпирическое байесовское оценивание в общем случае). Общий вид иерархических моделей из примеров 7.7 и 7.8:

X∣ξ∼Ns(ξ,σ2I),ξ∣β∼Ns(Zβ,τ2I) \begin{align} & \mathbf{X} \mid \xi \sim N_{s}\left(\xi , \sigma ^{2} I\right), \\ & \xi \mid \boldsymbol {\beta } \sim N_{s}\left(\mathbf{Z} \boldsymbol {\beta }, \tau ^{2} I\right) \end{align}

где σ2\sigma^{2} и Zs×r\mathbf{Z}_{s \times r} ранга rr известны, а τ2\tau^{2} и βr×1\boldsymbol {\beta }_{r \times 1} неизвестны. Для этой модели покажите, что:

?
(a)

Байесовская оценка ξ\xi при квадратичной функции потерь равна

E[ξ∣x,β]=σ2σ2+τ2zβ+τ2σ2+τ2x. \mathbb {E}\left[\boldsymbol {\xi } \mid \mathbf{x}, \boldsymbol {\beta }\right]=\frac{\sigma ^{2}}{\sigma ^{2}+\tau ^{2}} z \boldsymbol {\beta }+\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} \mathbf{x}.
(b)

Маргинально распределение X∣β\mathbf{X} \mid \boldsymbol {\beta } есть X∣β∼Ns(Zβ,(σ2+τ2)I)\mathbf{X} \mid \boldsymbol {\beta } \sim N_{s}\left(\mathbf{Z} \boldsymbol {\beta },\left(\sigma^{2}+\tau^{2}\right) I\right).

(c)

При маргинальном распределении из пункта (b)

E[(Z′Z)−1Z′x]=E[β^]=β,E[s−r−2∣X−Zβ^∣2]=1σ2+τ2, \begin{align} \mathbb {E}\left[\left(\mathbf{Z}^{\prime } \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } \mathbf{x}\right] & =\mathbb {E}\left[\hat{\boldsymbol {\beta }}\right]=\boldsymbol {\beta }, \\ \mathbb {E}\left[\frac{s-r-2}{|\mathbf{X}-\mathbf{Z} \hat{\boldsymbol {\beta }}|^{2}}\right] & =\frac{1}{\sigma ^{2}+\tau ^{2}}, \end{align}

и, следовательно, эмпирическая байесовская оценка ξ\xi равна

δEB=Zβ^+(1−(s−r−2)σ2∣x−Zβ^∣2)(x−Zβ^). \delta ^{E B}=\mathbf{Z} \hat{\boldsymbol {\beta }}+\left(1-\frac{(s-r-2) \sigma ^{2}}{|\mathbf{x}-\mathbf{Z} \hat{\boldsymbol {\beta }}|^{2}}\right)(\mathbf{x}-\mathbf{Z} \hat{\boldsymbol {\beta }}).
(d)

Байесовский риск δEB\delta^{E B} равен r(τ,δτ)+(r+2)σ4/(σ2+τ2)r\left(\tau , \delta^{\tau }\right)+(r+2) \sigma^{4} /\left(\sigma^{2}+\tau^{2}\right), где r(τ,δτ)r\left(\tau , \delta^{\tau }\right) — риск байесовской оценки.

Задача 4.7.18

Аналогично предыдущей задаче, можно вывести иерархические байесовские оценки для модели

X∣ξ∼Ns(ξ,σ2I),ξ∣β∼Ns(Zβ,τ2I),β∼Uniform⁡(ℜr) \begin{align} \mathbf{X} \mid \boldsymbol {\xi } & \sim N_{s}\left(\boldsymbol {\xi }, \sigma ^{2} I\right), \\ \boldsymbol {\xi } \mid \boldsymbol {\beta } & \sim N_{s}\left(\mathbf{Z} \boldsymbol {\beta }, \tau ^{2} I\right), \\ \boldsymbol {\beta } & \sim \operatorname {Uniform}\left(\Re ^{r}\right) \end{align}

где σ2\sigma^{2} и Zs×r\mathbf{Z}_{s \times r} ранга rr известны, а τ2\tau^{2} неизвестно.

?
(a)

Априорное распределение ξ\boldsymbol {\xi }, безусловное относительно β\beta, пропорционально

π(ξ)=∫ℜrπ(ξ∣β)dβ∝e−12ξ′(I−H)ξτ2, \pi (\xi )=\int _{\Re ^{r}} \pi (\xi \mid \beta ) d \beta \propto e^{-\frac{1}{2} \frac{\xi ^{\prime }(I-H) \xi }{\tau ^{2}}},

где H=Z(Z′Z)−1Z′H=\mathbf{Z}\left(\mathbf{Z}^{\prime } \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } проектирует из ℜs\Re^{s} в ℜr\Re^{r}. [Указание: Установите, что

(ξ−Zβ)′(ξ−Zβ)=ξ′(I−H)ξ+[β−(Z′Z)−1Z′ξ]′Z′Z[β−(Z′Z)−1Z′ξ] \begin{align} (\xi -\mathbf{Z} \boldsymbol {\beta })^{\prime }(\boldsymbol {\xi }-\mathbf{Z} \boldsymbol {\beta })=\xi ^{\prime }(I-H) \boldsymbol {\xi } & \\ & +\left[\boldsymbol {\beta }-\left(\mathbf{Z}^{\prime } \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } \boldsymbol {\xi }\right]^{\prime } \mathbf{Z}^{\prime } \mathbf{Z}\left[\boldsymbol {\beta }-\left(\mathbf{Z}^{\prime } \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } \boldsymbol {\xi }\right] \end{align}

чтобы выполнить интегрирование по β\boldsymbol {\beta }.]

(b)

Покажите, что

ξ∣ x∼Ns(τ2σ2+τ2M,σ2τ2σ2+τ2M) \boldsymbol {\xi } \left\lvert \, \mathbf{x} \sim N_{s}\left(\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} M, \frac{\sigma ^{2} \tau ^{2}}{\sigma ^{2}+\tau ^{2}} M\right)\right.

где M=I+(σ2/τ2)HM=I+\left(\sigma^{2} / \tau^{2}\right) H, и, следовательно, байесовская оценка задаётся формулой

σ2σ2+τ2Hx+τ2σ2+τ2x \frac{\sigma ^{2}}{\sigma ^{2}+\tau ^{2}} H \mathbf{x}+\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} \mathbf{x}

где Zβ^=Hx\mathbf{Z} \hat{\boldsymbol {\beta }}=H \mathbf{x}. [Указание: Установите, что

1τ2ξ′(I−H)ξ+1σ2(x−ξ)′(x−ξ)=σ2+τ2σ2τ2[(ξ−τ2σ2+τ2Mx)′M−1(ξ−τ2σ2+τ2Mx)]+1σ2+τ2x′(I−H)x \begin{align} & \frac{1}{\tau ^{2}} \xi ^{\prime }(I-H) \xi +\frac{1}{\sigma ^{2}}(\mathbf{x}-\xi )^{\prime }(\mathbf{x}-\xi ) \\ & = \frac{\sigma ^{2}+\tau ^{2}}{\sigma ^{2} \tau ^{2}}\left[\left(\xi -\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} M \mathbf{x}\right)^{\prime } M^{-1}\left(\xi -\frac{\tau ^{2}}{\sigma ^{2}+\tau ^{2}} M \mathbf{x}\right)\right] \\ & +\frac{1}{\sigma ^{2}+\tau ^{2}} \mathbf{x}^{\prime }(I-H) \mathbf{x} \end{align}

где M−1=I−σ2σ2+τ2HM^{-1}=I-\frac{\sigma^{2}}{\sigma^{2}+\tau^{2}} H.]

(c)

Маргинально, X′(I−H)X∼(σ2+τ2)χs−r2\mathbf{X}^{\prime }(I-H) \mathbf{X} \sim \left(\sigma^{2}+\tau^{2}\right) \chi_{s-r}^{2}. Это приводит нас к эмпирической байесовской оценке

Hx+(1−(s−r−2)σ2x′(I−H)x)(x−Hx) H \mathbf{x}+\left(1-\frac{(s-r-2) \sigma ^{2}}{\mathbf{x}^{\prime }(I-H) \mathbf{x}}\right)(\mathbf{x}-H \mathbf{x})

которая равна эмпирической байесовской оценке из задачи 7.17(c).

[Модель в этой и предыдущей задаче можно существенно обобщить. Например, обе матрицы σ2I\sigma^{2} I и τ2I\tau^{2} I можно заменить полными положительно определёнными матрицами. Ценой увеличения сложности матричных вычислений и потери простых ответов иерархические и эмпирические байесовские оценки всё же можно вычислить. Ковариации, скалярные или матричные, также могут быть неизвестны, и в этом случае можно использовать обратное гамма-распределение (или обратное распределение Уишарта) в качестве априорного. Вычисления можно реализовать с помощью сэмплера Гиббса. Заметим, что эти обобщения охватывают случай «неравных nin_{i}» (см. задачу 7.16), однако для этого случая простых решений не существует. Многие из этих оценок также обладают свойством минимаксности, которое будет обсуждаться в главе 5.]

Задача 4.7.19

Как отмечено Morris (1983a), иерархическая модель типа дисперсионного анализа с неравными nin_{i} даёт эмпирические байесовские оценки в замкнутой форме, если априорные дисперсии пропорциональны выборочным дисперсиям. Покажите, что для модели

Xij∣ξi∼N(ξi,σ2),j=1,…,ni,i=1,…,sξ∣β∼Ns(Zβ,τ2D−1) \begin{align} X_{i j} \mid \xi _{i} & \sim N\left(\xi _{i}, \sigma ^{2}\right), \quad j=1, \ldots , n_{i}, \quad i=1, \ldots , s \\ \boldsymbol {\xi } \mid \boldsymbol {\beta } & \sim N_{s}\left(\mathbf{Z} \boldsymbol {\beta }, \tau ^{2} D^{-1}\right) \end{align}

где σ2\sigma^{2} и Zs×r\mathbf{Z}_{s \times r} полного ранга rr известны, τ2\tau^{2} неизвестно, а D=diag⁡(n1,…,ns)D=\operatorname {diag}\left(n_{1}, \ldots , n_{s}\right), эмпирическая байесовская оценка задаётся формулой

δEB=Zβ^+(1−(s−r−2)σ2(x‾−Zβ^)′D(x‾−Zβ^))(x‾−Zβ^) \delta ^{\mathrm{EB}}=\mathbf{Z} \hat{\boldsymbol {\beta }}+\left(1-\frac{(s-r-2) \sigma ^{2}}{(\overline{\mathbf{x}}-\mathbf{Z} \hat{\boldsymbol {\beta }})^{\prime } D(\overline{\mathbf{x}}-\mathbf{Z} \hat{\boldsymbol {\beta }})}\right)(\overline{\mathbf{x}}-\mathbf{Z} \hat{\boldsymbol {\beta }})

с x‾i=Σjxij/ni,x‾={xˉi}\overline{\mathbf{x}}_{i}=\Sigma_{j} x_{i j} / n_{i}, \overline{\mathbf{x}}=\left\{ \bar{x}_{i}\right\}, и β^=(Z′DZ)−1Z′Dx‾\hat{\boldsymbol {\beta }}=\left(\mathbf{Z}^{\prime } D \mathbf{Z}\right)^{-1} \mathbf{Z}^{\prime } D \overline{\mathbf{x}}.

?
Задача 4.7.20

Занимательный (и необоснованный) результат, злоупотребляющий иерархическим байесовским вычислением, приводит к следующему выводу оценки Джеймса—Стейна. Пусть X∼Np(θ,I)X \sim N_{p}(\boldsymbol {\theta }, I) и θ∣τ2∼Np(0,τ2I)\boldsymbol {\theta } \mid \tau^{2} \sim N_{p}\left(0, \tau^{2} I\right).

?
(a)

Проверьте, что при условии τ2\tau^{2} апостериорное и маргинальное распределения задаются формулами

π(θ∣x,τ2)=Np(τ2τ2+1x,τ2τ2+1I)m(x∣τ2)=Np[0,(τ2+1)I] \begin{align} \pi \left(\boldsymbol {\theta } \mid \mathbf{x}, \tau ^{2}\right) & =N_{p}\left(\frac{\tau ^{2}}{\tau ^{2}+1} \mathbf{x}, \frac{\tau ^{2}}{\tau ^{2}+1} I\right) \\ m\left(\mathbf{x} \mid \tau ^{2}\right) & =N_{p}\left[0,\left(\tau ^{2}+1\right) I\right] \end{align}
(b)

Покажите, что, если положить π(τ2)=1,−1<τ2<∞\pi \left(\tau^{2}\right)=1,-1<\tau^{2}<\infty, то

∬ℜpθπ(θ∣x,τ2)m(x∣τ2)dθdτ2=x(2π)p/2(∣x∣2)p/2−1[Γ(p−22)2(p−2)/2−Γ(p/2)2p/2∣x∣2] \begin{align} & \iint _{\Re p} \boldsymbol {\theta } \pi \left(\boldsymbol {\theta } \mid \mathbf{x}, \tau ^{2}\right) m\left(\mathbf{x} \mid \tau ^{2}\right) d \boldsymbol {\theta } d \tau ^{2} \\ & =\frac{\mathbf{x}}{(2 \pi )^{p / 2}\left(|\mathbf{x}|^{2}\right)^{p / 2-1}}\left[\Gamma \left(\frac{p-2}{2}\right) 2^{(p-2) / 2}-\frac{\Gamma (p / 2) 2^{p / 2}}{|\mathbf{x}|^{2}}\right] \end{align}

и

∬ℜpπ(θ∣x,τ2)m(x∣τ2)dθdτ2=1(2π)p/2(∣x∣2)p/2−1Γ(p−22)2(p−2)/2 \begin{align} & \iint _{\Re p} \pi \left(\boldsymbol {\theta } \mid \mathbf{x}, \tau ^{2}\right) m\left(\mathbf{x} \mid \tau ^{2}\right) d \boldsymbol {\theta } d \tau ^{2} \\ & =\frac{1}{(2 \pi )^{p / 2}\left(|\mathbf{x}|^{2}\right)^{p / 2-1}} \Gamma \left(\frac{p-2}{2}\right) 2^{(p-2) / 2} \end{align}

и, следовательно,

E[θ∣x]=(1−p−2∣x∣2)x. \mathbb {E}\left[\boldsymbol {\theta } \mid \mathbf{x}\right]=\left(1-\frac{p-2}{|\mathbf{x}|^{2}}\right) \mathbf{x}.
(c)

Объясните некоторые следствия результата из пункта (b) и то, почему он не может быть верным. [Попробуйте согласовать его с (3.3.12).]

(d)

Почему вычисления в пункте (b) необоснованны?