Глава 5

Минимаксность и допустимость

[164/0%]
Показать
LaTeX
§
Задача 5.1.1

Для ситуации примера 1.2:

?
(a)

Постройте графики функций риска δ1/4,δ1/2\delta^{1 / 4}, \delta^{1 / 2} и δ3/4\delta^{3 / 4} при n=5,10,25n=5,10,25.

(b)

Для каждого значения nn из пункта (a) найдите диапазон априорных значений pp, при которых предпочтительна каждая из оценок.

(c)

Если у экспериментатора нет априорных сведений о pp, какую из оценок δ1/4,δ1/2\delta^{1 / 4}, \delta^{1 / 2} и δ3/4\delta^{3 / 4} вы бы рекомендовали? Обоснуйте свой выбор.

Задача 5.1.2

Принцип гамма-минимаксности [впервые использованный Hodges and Lehmann (1952); см. также Robbins 1964 и Solomon 1972a, 1972b)] представляет собой синтез байесовского и частотного подходов. Оценка δ∗\delta^{*} называется гамма-минимаксной, если

inf⁡δ∈Dsup⁡π∈Γr(π,δ)=sup⁡π∈Γr(π,δ∗) \inf _{\delta \in \mathcal{D}} \sup _{\pi \in \Gamma } r(\pi , \delta )=\sup _{\pi \in \Gamma } r\left(\pi , \delta ^{*}\right)

где Γ\Gamma — заданный класс априорных распределений. Таким образом, оценка δ∗\delta^{*} минимизирует максимальный байесовский риск среди априорных распределений класса Γ\Gamma. (Если Γ=\Gamma = все априорные распределения, то δ∗\delta^{*} была бы минимаксной.)

?
(a)

Покажите, что если Γ={π0}\Gamma =\left\{ \pi_{0}\right\}, то есть Γ\Gamma состоит из одного априорного распределения, то байесовская оценка является Γ\Gamma-минимаксной.

(b)

Покажите, что если Γ={ все априорные распределения }\Gamma =\left\{ \text{ все априорные распределения }\right\}, то минимаксная оценка является Γ\Gamma-минимаксной.

(c)

Найдите Γ\Gamma-минимаксную оценку среди трёх оценок примера 1.2.

Задача 5.1.3

Классы априорных распределений для Γ\Gamma-минимаксного оценивания часто задаются с помощью ограничений на моменты.

?
(a)

Для X∼b(p,n)X \sim b(p, n) найдите Γ\Gamma-минимаксную оценку pp при квадратичной функции потерь, с

Γμ={π(p):π(p)=beta⁡(a,b),μ=aa+b} \Gamma _{\mu }=\left\{ \pi (p): \pi (p)=\operatorname {beta}(a, b), \mu =\frac{a}{a+b}\right\}

где μ\mu считается фиксированным и известным.

(b)

Для X∼N(θ,1)X \sim N(\theta , 1) найдите Γ\Gamma-минимаксную оценку θ\theta при квадратичной функции потерь, с

Γμ,τ={π(θ):E[θ]=μ,var⁡θ=τ2} \Gamma _{\mu , \tau }=\left\{ \pi (\theta ): \mathbb {E}\left[\theta \right]=\mu , \operatorname {var} \theta =\tau ^{2}\right\}

где μ\mu и τ\tau фиксированы и известны.

Задача 5.1.4
?
(a)

Для модели случайных эффектов из примера 4.2.7 (см. также пример 3.5.1) покажите, что правдоподобие ограниченного максимального правдоподобия (REML) для σA2\sigma_{A}^{2} и σ2\sigma^{2} задаётся формулой (4.2.13), которую можно получить, интегрируя исходное правдоподобие по равномерному (−∞,∞)(-\infty , \infty ) априорному распределению для μ\mu.

(b)

При ni=nn_{i}=n в

Xij=μ+Ai+uij(j=1,…,ni,i=1,…,s) X_{i j}=\mu +A_{i}+u_{i j} \quad \left(j=1, \ldots , n_{i}, \quad i=1, \ldots , s\right)

вычислите математическое ожидание REML-оценки σA2\sigma_{A}^{2} и покажите, что она смещена. Сравните REML-оценку с несмещённой оценкой σA2\sigma_{A}^{2}. Какую из них вы предпочитаете?

(Построение маргинальных правдоподобий REML-типа, в которых некоторые эффекты интегрируются по априорным распределениям, оказывается особенно полезным в нелинейных и обобщённых линейных моделях. См., например, Searle et al. 1992, раздел 9.4 и глава 10.)

Задача 5.1.5

Установление того факта, что (9.1) выполняется, а значит, S2S^{2} условно смещена, опирается на ряд шагов, некоторые из которых могут быть довольно громоздкими. Определим ϕ(a,μ,σ2)=(1/σ2)Eμ,σ2[S2∣∣xˉ∣/s<a]\phi \left(a, \mu , \sigma^{2}\right)=\left(1 / \sigma^{2}\right) E_{\mu , \sigma^{2}}\left[S^{2} \mid \left|\bar{x}\right| / s<a\right].

?
(a)

Покажите, что ϕ(a,μ,σ2)\phi \left(a, \mu , \sigma^{2}\right) зависит от μ\mu и σ2\sigma^{2} только через μ/σ\mu / \sigma. Следовательно, без потери общности можно считать σ=1\sigma =1.

(b)

Используя тот факт, что плотность f(s∣∣xˉ∣/s<a,μ)f(s||\bar{x}| / s<a, \mu ) обладает монотонным отношением правдоподобия, установите ϕ(a,μ,1)≥ϕ(a,0,1)\phi (a, \mu , 1) \geq \phi (a, 0,1).

(c)

Покажите, что

lim⁡a→∞ϕ(a,0,1)=1 и lim⁡a→0ϕ(a,0,1)=E0,1S3E0,1S=nn−1. \lim _{a \rightarrow \infty } \phi (a, 0,1)=1 \quad \text{ и } \quad \lim _{a \rightarrow 0} \phi (a, 0,1)=\frac{E_{0,1} S^{3}}{E_{0,1} S}=\frac{n}{n-1}.
(d)

Объедините пункты (a), (b) и (c), чтобы установить (19.1).

Следующие три задачи исследуют условные свойства оценок. Подробное изложение этой теории можно найти у Robinson (1979a, 1979b), который также исследовал связь между допустимостью и условными свойствами.

Задача 5.1.6

Пусть X∼f(x∣θ)X \sim f(x \mid \theta ), и T(x)T(x) используется для оценивания τ(θ)\tau (\theta ). Ценность T(x)T(x) можно поставить под сомнение, если существует такое множество A∈XA \in \mathcal{X}, что T(x)>τ(θ)T(x)>\tau (\theta ) для x∈Ax \in A (или выполняется обратное неравенство). Это приводит к условному принципу, согласно которому оценку никогда не следует использовать, если существует множество A∈XA \in \mathcal{X}, для которого Eθ[[T(X)−τ(θ)]I(X∈A)]≥0∀θ\mathbb {E}_{\theta }\left[[T(X)-\tau (\theta )] I(X \in A)\right] \geq 0 \quad \forall \theta, причём для некоторого θ\theta неравенство строгое (или если выполняется аналогичное утверждение с обратным неравенством). Покажите, что если T(x)T(x) — апостериорное среднее τ(θ)\tau (\theta ) относительно собственного априорного распределения, причём и априорное распределение, и f(x∣θ)f(x \mid \theta ) непрерывны по θ\theta, то такого множества AA существовать не может. (Если такое AA существует, оно называется полурелевантным множеством. Устранение полурелевантных множеств — чрезвычайно сильное требование. Более слабое требование — устранение релевантных множеств — представляется более уместным.)

?
Задача 5.1.7

Покажите, что если существует множество A∈XA \in \mathcal{X} и ε>0\varepsilon >0, для которых Eθ[[T(X)−τ(θ)]I(X∈A)]>ε\mathbb {E}_{\theta }\left[[T(X)-\tau (\theta )] I(X \in A)\right]>\varepsilon, то T(x)T(x) недопустима для оценивания τ(θ)\tau (\theta ) при квадратичной функции потерь. (Множество AA, удовлетворяющее этому неравенству, является примером релевантного множества.)

?
Задача 5.1.8

Чтобы понять, почему устранение полурелевантных множеств является слишком сильным требованием, рассмотрим оценивание θ\theta по наблюдению X∼f(x−θ)X \sim f(x-\theta ). Покажите, что для любой константы aa оценка Питмена XX удовлетворяет

Eθ[(X−θ)I(X<a)]≤0∀θ или Eθ[(X−θ)I(X>a)]≥0∀θ, E_{\theta }[(X-\theta ) I(X<a)] \leq 0 \quad \forall \theta \quad \text{ или } \quad E_{\theta }[(X-\theta ) I(X>a)] \geq 0 \quad \forall \theta ,

причём для некоторого θ\theta неравенство строгое. Таким образом, для оценки Питмена, которая по общему мнению является хорошей оценкой, существуют полурелевантные множества.

?
Задача 5.1.9

В примере 1.7 пусть δ∗(X)=X/n\delta^{*}(X)=X / n с вероятностью 1−ε1-\varepsilon и =1/2=1 / 2 с вероятностью ε\varepsilon. Найдите функцию риска δ∗\delta^{*} и покажите, что при ε=1/(n+1)\varepsilon =1 /(n+1) её риск постоянен и меньше sup⁡R(p,X/n)\sup R(p, X / n).

?
Задача 5.1.10

Найдите смещение минимаксной оценки (1.11) и обсудите его направление.

?
Задача 5.1.11

В примере 1.7,

?
(a)

найдите cnc_{n} и покажите, что cn→0c_{n} \rightarrow 0 при n→∞n \rightarrow \infty,

(b)

покажите, что Rn(1/2)/rn→1R_{n}(1 / 2) / r_{n} \rightarrow 1 при n→∞n \rightarrow \infty.

Задача 5.1.12

В примере 1.7 постройте графики функций риска X/nX / n и минимаксной оценки (1.11) при n=1,4,9,16n=1,4,9,16, и укажите взаимное расположение этих двух графиков при больших значениях nn.

?
Задача 5.1.13
?
(a)

Найдите две точки 0<p0<p1<10<p_{0}<p_{1}<1, такие что оценка (1.11) при n=1n=1 является байесовской относительно распределения Λ\Lambda, для которого PΛ(p=p0)+PΛ(p=p1)=1\mathbb {P}_{\Lambda }\left(p=p_{0}\right)+\mathbb {P}_{\Lambda }\left(p=p_{1}\right)=1.

(b)

Покажите, что при n=1n=1 оценка (1.11) является минимаксной оценкой pp, даже если известно, что po≤p≤p1p_{o} \leq p \leq p_{1}.

(c)

В условиях пункта (b) найдите значения p0p_{0} и p1p_{1}, при которых p1−p0p_{1}-p_{0} как можно меньше.

Задача 5.1.14

Вычислите (1.16) и покажите, что его максимум равен 1−α1-\alpha.

?
Задача 5.1.15

Пусть X=1X=1 или 0 с вероятностями pp и qq соответственно, и рассмотрим оценивание pp с функцией потерь, равной 1 при ∣d−p∣≥1/4\left|d-p\right| \geq 1 / 4, и 0 в противном случае. Наиболее общая рандомизированная оценка имеет вид δ=U\delta =U при X=0X=0 и δ=V\delta =V при X=1X=1, где UU и VV — две случайные величины с известными распределениями.

?
(a)

Вычислите функцию риска и максимальный риск оценки δ\delta, когда UU и VV равномерно распределены на (0, 1/2) и (1/2, 1) соответственно.

(b)

Покажите, что оценка δ\delta из пункта (a) является минимаксной, рассмотрев три значения p=0p=0, 1/2, 1.

Задача 5.1.16

Покажите, что задача из Примера 1.8 остаётся инвариантной относительно преобразований

X′=n−X,p′=1−p,d′=1−d. X^{\prime }=n-X, \quad p^{\prime }=1-p, \quad d^{\prime }=1-d.

Это показывает, что рандомизированные эквивариантные оценки, возможно, придётся рассматривать, когда Gˉ\bar{G} не транзитивна.

?
Задача 5.1.17

Пусть rΛr_{\Lambda } задаётся формулой (1.3). Если rΛ=∞r_{\Lambda }=\infty для некоторого Λ\Lambda, покажите, что любая оценка δ\delta имеет неограниченный риск.

?
Задача 5.1.18

В Примере 1.9 покажите, что ни одна линейная оценка не имеет постоянного риска.

?
Задача 5.1.19

Покажите, что функция риска из (1.22) зависит от p1p_{1} и p2p_{2} только через p1+p2p_{1}+p_{2} и достигает максимума при p1+p2=1p_{1}+p_{2}=1.

?
Задача 5.1.20
?
(a)

В Примере 1.9 определите область в единичном квадрате (p1,p2)\left(p_{1}, p_{2}\right), в которой (1.22) лучше, чем UMVU-оценка p2−p1p_{2}-p_{1}, для m=n=2,8,18m=n=2,8,18 и 32.

(b)

Распространите Задачи 1.11 и 1.12 на Пример 1.9.

Задача 5.1.21

В Примере 1.14 покажите, что Xˉ\bar{X} является минимаксной для функции потерь (d−θ)2/σ2(d-\theta )^{2} / \sigma^{2} без каких-либо ограничений на σ\sigma.

?
Задача 5.1.22
?
(a)

Проверьте (1.37).

(b)

Покажите, что равенство в (1.39) достигается тогда и только тогда, когда P(Xi=0)+P(Xi=1)=1\mathbb {P}\left(X_{i}=0\right)+\mathbb {P}\left(X_{i}=1\right)=1.

Задача 5.1.23

В Примере 1.16(b) покажите, что для любого k>0k>0 оценка

δ=n1+n1n∑i=1nXik+12(1+n) \delta =\frac{\sqrt{n}}{1+\sqrt{n}} \frac{1}{n} \sum _{i=1}^{n} X_{i}^{k}+\frac{1}{2(1+\sqrt{n})}

является байесовской оценкой для априорного распределения Λ\Lambda на F0\mathcal{F}_{0}, для которого было показано, что (1.36) является байесовской.

?
Задача 5.1.24

Пусть Xi(i=1,…,n)X_{i}(i=1, \ldots , n) и Yj(j=1,…,n)Y_{j}(j=1, \ldots , n) независимы с распределениями FF и GG соответственно. Если F(1)−F(0)=G(1)−G(0)=1F(1)-F(0)=G(1)-G(0)=1, но FF и GG в остальном неизвестны, найдите минимаксную оценку для E[Yj]−E[Xi]\mathbb {E}\left[Y_{j}\right]-\mathbb {E}\left[X_{i}\right] при квадратичной функции потерь.

?
Задача 5.1.25

Пусть Xi(i=1,…,n)X_{i}(i=1, \ldots , n) — независимые одинаково распределённые случайные величины с неизвестным распределением FF. Покажите, что

δ= Число Xi≤0n⋅11+n+12(1+n) \delta =\frac{\text{ Число } X_{i} \leq 0}{\sqrt{n}} \cdot \frac{1}{1+\sqrt{n}}+\frac{1}{2(1+\sqrt{n})}

является минимаксной оценкой для F(0)=P(Xi≤0)F(0)=\mathbb {P}\left(X_{i} \leq 0\right) при квадратичной функции потерь.

?
Задача 5.1.26

Пусть X1,…,XmX_{1}, \ldots , X_{m} и Y1,…,YnY_{1}, \ldots , Y_{n} независимо распределены как N(ξ,σ2)N\left(\xi , \sigma^{2}\right) и N(η,τ2)N\left(\eta , \tau^{2}\right) соответственно, и рассмотрим задачу оценивания Δ=η−ξ\Delta =\eta -\xi при квадратичной функции потерь.

?
(a)

Если σ\sigma и τ\tau известны, Yˉ−Xˉ\bar{Y}-\bar{X} является минимаксной оценкой.

(b)

Если σ\sigma и τ\tau ограничены условиями σ2≤A\sigma^{2} \leq A и τ2≤B\tau^{2} \leq B соответственно (A,BA, B известны и конечны), Yˉ−Xˉ\bar{Y}-\bar{X} остаётся минимаксной оценкой.

Задача 5.1.27

В линейной модели (3.4.4) покажите, что Σaiξ^i\Sigma a_{i} \hat{\xi }_{i} (в обозначениях Теоремы 3.4.4) является минимаксной оценкой для θ=Σaiξi\theta =\Sigma a_{i} \xi_{i} при квадратичной функции потерь, при ограничении σ2≤M\sigma^{2} \leq M.

?
Задача 5.1.28

Для случайной величины XX, распределение которой задаётся формулой (1.42), покажите, что xx должно удовлетворять неравенствам, указанным после (1.42).

?
Задача 5.1.29

Покажите, что оценка, определённая формулой (1.43),

?
(a)

имеет постоянный риск,

(b)

является байесовской относительно априорного распределения, заданного формулами (1.44) и (1.45).

Задача 5.1.30

Покажите, что при фиксированных XX и nn (1.43) →\rightarrow (1.11) при N→∞N \rightarrow \infty.

?
Задача 5.1.31

Покажите, что var⁡(Yˉ)\operatorname {var}(\bar{Y}), задаваемая формулой (3.7.6), достигает максимального значения при ограничении (1.41), когда все aa равны 0 или 1.

?
Задача 5.1.32
?
(a)

Если R(p,δ)R(p, \delta ) задаётся формулой (1.49), покажите, что sup⁡R(p,δ)⋅4(1+n)2→1\sup R(p, \delta ) \cdot 4(1+\sqrt{n})^{2} \rightarrow 1 при n→∞n \rightarrow \infty.

(b)

Определите наименьшее значение nn, при котором байесовская оценка из Примера 1.18 удовлетворяет (1.48) для r=1r=1 и b=5,10b=5,10 и 20.

Задача 5.1.33

(Efron and Morris 1971)

?
(a)

Покажите, что оценка δ\delta из (1.50) является оценкой, минимизирующей ∣δ−cxˉ∣\left|\delta -c \bar{x}\right| при ограничении ∣δ−xˉ∣≤M\left|\delta -\bar{x}\right| \leq M. В этом смысле она является оценкой, наиболее близкой к байесовской оценке cxˉc \bar{x}, но не слишком удаляющейся от минимаксной оценки xˉ\bar{x}.

(b)

Покажите, что для ситуации из Примера 1.19 R(θ,δ)R(\theta , \delta ) ограничена для δ\delta из (1.50).

(c)

Для ситуации из Примера 1.19 оценка δ\delta из (1.50) удовлетворяет sup⁡θR(θ,δ)=(1/n)+M2\sup_{\theta } R(\theta , \delta )=(1 / n)+M^{2}.

§
Задача 5.2.1

Лемма 2.1 была расширена Berger (1990a) для случая, когда оцениваемая функция не обязана быть ограничена конечным интервалом, а вместо этого достигает максимума или минимума в конечной точке параметра.

Лемма 8.1. Пусть оцениваемая функция g(θ)g(\theta ) непостоянна и достигает глобального максимума или минимума в точке θ∗∈Ω\theta^{*} \in \Omega, для которой f(x∣θ∗)>0f\left(x \mid \theta^{*}\right)>0 п.в. (относительно доминирующей меры μ\mu), и пусть функция потерь L(θ,d)L(\theta , d) удовлетворяет предположениям Леммы 2.1. Тогда любая оценка δ\delta, принимающая значения выше максимума g(θ)g(\theta ) или ниже минимума, недопустима.

?
(a)

Покажите, что если θ∗\theta^{*} минимизирует g(θ)g(\theta ) и g^(x)\hat{g}(x) является несмещённой оценкой g(θ)g(\theta ), то существует ϵ>0\epsilon >0 такое, что множество Aϵ={x∈X:g^(x)<g(θ)−ϵ}A_{\epsilon }=\left\{ x \in \mathcal{X}: \hat{g}(x)<g(\theta )-\epsilon \right\} удовлетворяет P(Aϵ)>0\mathbb {P}\left(A_{\epsilon }\right)>0. Аналогичный вывод верен, если g(θ∗)g\left(\theta^{*}\right) является максимумом.

(b)

Предположим, что g(θ∗)g\left(\theta^{*}\right) является минимумом. (Случай максимума рассматривается аналогично.) Покажите, что оценка

δ(x)={g^(x) если g^(x)≥g(θ∗)g(θ∗) если g^(x)<g(θ∗) \delta (x)= \begin{cases} \hat{g}(x) & \text{ если } \hat{g}(x) \geq g\left(\theta ^{*}\right) \\ g\left(\theta ^{*}\right) & \text{ если } \hat{g}(x)<g\left(\theta ^{*}\right)\end{cases}

удовлетворяет R(δ,θ)−R(g^(x),θ)<0R(\delta , \theta )-R(\hat{g}(x), \theta )<0.

(c)

Для ситуации из Примера 2.3 примените Лемму 8.1, чтобы установить недопустимость UMVU-оценки σA2\sigma_{A}^{2}. Также объясните, почему предположения Леммы 8.1 не выполняются для оценивания σ2\sigma^{2}.

Задача 5.2.2

Определите байесовский риск оценки (2.4), когда θ\theta имеет априорное распределение N(μ,τ2)N\left(\mu , \tau^{2}\right).

?
Задача 5.2.3

Докажите утверждение (d) во втором доказательстве Примера 2.8: что существует последовательность значений θi→−∞\theta_{i} \rightarrow -\infty, для которой b′(θi)→0b^{\prime }\left(\theta_{i}\right) \rightarrow 0.

?
Задача 5.2.4

Покажите, что оценка aX+b(0≤a≤1)a X+b(0 \leq a \leq 1) величины Eθ[X]\mathbb {E}_{\theta }\left[X\right] недопустима (при квадратичной функции потерь) при каждом из следующих условий:

?
(a)

если Eθ[X]≥0\mathbb {E}_{\theta }\left[X\right] \geq 0 для всех θ\theta и b<0b<0;

(b)

если Eθ[X]≤k\mathbb {E}_{\theta }\left[X\right] \leq k для всех θ\theta и ak+b>ka k+b>k.

Задача 5.2.5

Покажите, что оценка [1/(1+λ)+ε]X[1 /(1+\lambda )+\varepsilon ] X величины Eθ[X]\mathbb {E}_{\theta }\left[X\right] недопустима (при квадратичной функции потерь) при каждом из следующих условий:

?
(a)

если var⁡θ(X)/Eθ2(X)>λ>0\operatorname {var}_{\theta }(X) / E_{\theta }^{2}(X)>\lambda >0 и ε>0\varepsilon >0,

(b)

если var⁡θ(X)/Eθ2(X)<λ\operatorname {var}_{\theta }(X) / E_{\theta }^{2}(X)<\lambda и ε<0\varepsilon <0.

Задача 5.2.6

Покажите, что если var⁡θ(X)/Eθ2(X)>λ>0\operatorname {var}_{\theta }(X) / E_{\theta }^{2}(X)>\lambda >0, то оценка [1/(1+λ)+ε]X+b[1 /(1+\lambda )+\varepsilon ] X+b недопустима (при квадратичной функции потерь) при каждом из следующих условий:

?
(a)

если Eθ[X]>0\mathbb {E}_{\theta }\left[X\right]>0 для всех θ,b>0\theta , b>0 и ε>0\varepsilon >0;

(b)

если Eθ[X]<0\mathbb {E}_{\theta }\left[X\right]<0 для всех θ,b<0\theta , b<0 и ε>0\varepsilon >0 (Gupta 1966).

Задача 5.2.7

Brown (1986a) указывает на связь между информационным неравенством и несмещённой оценкой риска оценок стейновского типа.

?
(a)

Покажите, что из (2.7) следует

R(θ,δ)≥[1+b′(θ)]2n+b2(θ)≥1n+2b′(θ)n+b2(θ) R(\theta , \delta ) \geq \frac{\left[1+b^{\prime }(\theta )\right]^{2}}{n}+b^{2}(\theta ) \geq \frac{1}{n}+\frac{2 b^{\prime }(\theta )}{n}+b^{2}(\theta )

и, следовательно, если R(θ,δ)≤R(θ,Xˉ)R(\theta , \delta ) \leq R(\theta , \bar{X}), то 2b′(θ)n+b2≤0\frac{2 b^{\prime }(\theta )}{n}+b^{2} \leq 0.

(b)

Покажите, что нетривиальное решение b(θ)b(\theta ) привело бы к улучшенной оценке x−g(x)x-g(x) при p=1p=1 в Следствии 4.7.2.

Задача 5.2.8

Функция плотности f(x∣θ)f(x \mid \theta ) называется понижающей вариацию порядка n+1(VRn+1)n+1\left(V R_{n+1}\right), если для любой функции g(x)g(x) с k(k≤n)k(k \leq n) переменами знака (без учёта нулей) математическое ожидание Eθ[g(X)]=∫g(x)f(x∣θ)dx\mathbb {E}_{\theta }\left[g(X)\right]= \int g(x) f(x \mid \theta ) d x имеет не более kk перемен знака. Если Eθ[g(X)]\mathbb {E}_{\theta }\left[g(X)\right] имеет ровно kk перемен знака, они происходят в том же порядке. Покажите, что f(x∣θ)f(x \mid \theta ) обладает свойством VR2V R_{2} тогда и только тогда, когда она имеет монотонное отношение правдоподобия. (См. TSH2, Лемма 2, Раздел 3.3, для доказательства импликации «если».) Brown и др. (1981) дают подробное введение в эту тему, включая характеризации VRV R для многих семейств распределений (экспоненциальное семейство обладает свойством VR∞V R_{\infty }, как и χv2\chi_{v}^{2} с параметром ν\nu, и нецентральное χν2(λ)\chi_{\nu }^{2}(\lambda ) по параметру λ\lambda). Существует эквивалентность между VRnV R_{n} и TPnT P_{n} — полной положительностью порядка nn по Karlin (1968), а именно VRn=TPnV R_{n}=T P_{n}.

?
Задача 5.2.9

Для ситуации из Примера 2.9 покажите, что:

?
(a)

без потери общности ограничение θ∈[a,b]\theta \in [a, b] можно свести к θ∈[−m,m]\theta \in [-m, m], m>0m>0.

(b)

Если Λ\Lambda — априорное распределение, помещающее массу 1/2 в каждую из точек ±m\pm m, то байесовская оценка при квадратичной функции потерь есть

δΛ(xˉ)=memnxˉ−e−mnxˉemnxˉ+e−mnxˉ=mtanh⁡(mnxˉ). \delta ^{\Lambda }(\bar{x})=m \frac{e^{m n \bar{x}}-e^{-m n \bar{x}}}{e^{m n \bar{x}}+e^{-m n \bar{x}}}=m \tanh (m n \bar{x}).
(c)

Для m<1/nm<1 / \sqrt{n}

max⁡θ∈[−m,m]R(θ,δ(Xˉ))=max⁡{R(−m,δΛ(Xˉ)),R(m,δΛ(Xˉ))} \max _{\theta \in [-m, m]} R(\theta , \delta (\bar{X}))=\max \left\{ R\left(-m, \delta ^{\Lambda }(\bar{X})\right), R\left(m, \delta ^{\Lambda }(\bar{X})\right)\right\}

и, следовательно, по Следствию 1.6, δΛ\delta^{\Lambda } является минимаксной.

(d)

Для m>1.05/nm>1.05 / \sqrt{n} оценка δΛ\delta^{\Lambda } из пункта (b) больше не является минимаксной. Объясните, почему это так, и предложите альтернативную оценку в этом случае.

Задача 5.2.10

Для ситуации из Примера 2.10 покажите, что:

?
(a)

max⁡θ∈[−m,m]R(θ,aXˉ+b)=max⁡{R(−m,aXˉ+b),R(m,aXˉ+b)}\max_{\theta \in [-m, m]} R(\theta , a \bar{X}+b)=\max \left\{ R(-m, a \bar{X}+b), R(m, a \bar{X}+b)\right\}.

(b)

Оценка a∗Xˉa^{*} \bar{X} с a∗=m2/(1n+m2)a^{*}=m^{2} /\left(\frac{1}{n}+m^{2}\right) является линейной минимаксной оценкой для всех mm с минимаксным риском a∗/na^{*} / n.

(c)

Xˉ\bar{X} является линейной минимаксной оценкой для m=∞m=\infty.

Задача 5.2.11

Предположим, что XX имеет распределение FξF_{\xi }, а YY имеет распределение GηG_{\eta }, где ξ\xi и η\eta изменяются независимо. Если известно, что η=η0\eta =\eta_{0}, то любая оценка δ(X,Y)\delta (X, Y) может быть улучшена с помощью

δ∗(x)=EY[δ(x,Y)]=∫δ(x,y)dGη0(y) \delta ^{*}(x)=\mathbb {E}_{Y}\left[\delta (x, Y)\right]=\int \delta (x, y) d G_{\eta _{0}}(y)
?
Задача 5.2.12

В Примере 2.13 докажите, что оценка aY+ba Y+b недопустима при a>1/(r+1)a>1 /(r+1).

?
Задача 5.2.13

Пусть X1,…,XnX_{1}, \ldots , X_{n} независимые одинаково распределённые случайные величины с плотностью N(0,σ2)N\left(0, \sigma^{2}\right), и пусть S2=∑Xi2S^{2}=\sum X_{i}^{2}. Нас интересует оценивание σ2\sigma^{2} при квадратичной функции потерь с помощью линейных оценок cS2+dc S^{2}+d, где cc и dd — константы. Покажите, что:

?
(a)

допустимость оценки aY+ba Y+b в Примере 2.13 эквивалентна допустимости cS2+dc S^{2}+d при подходящем выборе cc и dd.

(b)

риск cS2+dc S^{2}+d задаётся формулой R(cS2+d,σ2)=2nc2σ2+[(nc−1)σ2+d]2R\left(c S^{2}+d, \sigma^{2}\right)=2 n c^{2} \sigma^{2}+\left[(n c-1) \sigma^{2}+d\right]^{2}

(c)

при d=0,R(cS2,σ2)<R(0,σ2)d=0, R\left(c S^{2}, \sigma^{2}\right)<R\left(0, \sigma^{2}\right), когда c<2/(n+2)c<2 /(n+2), и, следовательно, оценка aY+ba Y+b в Примере 2.13 недопустима при a=b=0a=b=0.

Примечание.
?

Это упражнение иллюстрирует тот факт, что константы не обязательно являются допустимыми оценками.

Задача 5.2.14

Для ситуации из Примера 2.15 пусть Z=Xˉ/SZ=\bar{X} / S.

?
(a)

Покажите, что риск оценки δ=φ(z)s2\delta =\varphi (z) s^{2} при квадратичной функции потерь минимизируется при выборе

φ(z)=φμ,σ∗(z)=E[S2/σ2∣z]/E[(S2/σ2)2∣z]. \varphi (z)=\varphi _{\mu , \sigma }^{*}(z)=\mathbb {E}\left[S^{2} / \sigma ^{2} \mid z\right] / \mathbb {E}\left[\left(S^{2} / \sigma ^{2}\right)^{2} \mid z\right].
(b)

Stein (1964) показал, что φμ,σ∗(z)≤φ0,1∗(z)\varphi_{\mu , \sigma }^{*}(z) \leq \varphi_{0,1}^{*}(z) для всех μ,σ\mu , \sigma. Предполагая это, выведите, что φs(Z)S2\varphi_{s}(Z) S^{2} доминирует над [1/(n+1)]S2[1 /(n+1)] S^{2} при квадратичной функции потерь, где

φs(z)=min⁡{φ0,1∗(z),1n+1}. \varphi _{s}(z)=\min \left\{ \varphi _{0,1}^{*}(z), \frac{1}{n+1}\right\} .
(c)

Покажите, что φ0,1∗(z)=(1+z2)/(n+2)\varphi_{0,1}^{*}(z)=\left(1+z^{2}\right) /(n+2), и, следовательно, φs(Z)S2\varphi_{s}(Z) S^{2} задаётся формулой (2.31).

(d)

Наилучшая эквивариантная оценка вида φ(Z)S2\varphi (Z) S^{2} была получена Brewster и Zidek (1974) и задаётся формулой

φBZ(z)=E[S2∣Z≤z]E[S4∣Z≤z], \varphi _{B Z}(z)=\frac{\mathbb {E}\left[S^{2} \mid Z \leq z\right]}{\mathbb {E}\left[S^{4} \mid Z \leq z\right]},

где математическое ожидание вычисляется в предположении μ=0\mu =0 и σ=1\sigma =1. Покажите, что φBZ(Z)S2\varphi_{B Z}(Z) S^{2} является обобщённой байесовской оценкой относительно априорного распределения

π(μ,σ)=1σ∫0∞u−1/2(1+u)−1e−unμ2/σ2dudμdσ \pi (\mu , \sigma )=\frac{1}{\sigma } \int _{0}^{\infty } u^{-1 / 2}(1+u)^{-1} e^{-u n \mu ^{2} / \sigma ^{2}} d u d \mu d \sigma
Примечание.
?

Brewster и Zidek первоначально получили свою оценку не как байесовскую, а, напротив, сначала нашли оценку, а затем нашли априорное распределение. Brown (1968) рассмотрел семейство оценок, аналогичных оценкам Stein (1964), которые принимали различные значения в зависимости от порогового значения для z2z^{2}. Brewster и Zidek (1974) показали, что число пороговых значений может быть сколь угодно большим. Они построили последовательность оценок с убывающими рисками и всё более плотными пороговыми значениями, предел которой являлся наилучшей эквивалентной оценкой.

Задача 5.2.15

Покажите эквивалентность следующих соотношений:

?
(a)

(2.26) и (2.27),

(b)

(2.34) и (2.35) при c=(n−1)/(n+1)c=\sqrt{(n-1) /(n+1)}, и

(c)

(2.38) и (2.39).

Задача 5.2.16

В Примере 2.17 покажите, что оценка aX/n+ba X / n+b недопустима для всех (a,b)(a, b) вне треугольника (2.39).

?
Задача 5.2.17

Докажите допустимость оценок, соответствующих внутренности треугольника (2.39), применив Теорему 2.4 и используя результаты Примера 4.1.5.

?
Задача 5.2.18

Используя Теорему 2.14, приведите альтернативное доказательство допустимости оценки aXˉ+ba \bar{X}+b, удовлетворяющей (2.6), в Примере 2.5.

?
Задача 5.2.19

Определите, какие оценки aX+ba X+b допустимы для оценивания E[X]\mathbb {E}\left[X\right] при квадратичной функции потерь в следующих ситуациях:

?
(a)

XX имеет распределение Пуассона.

(b)

XX имеет отрицательное биномиальное распределение (Gupta 1966).

Задача 5.2.20

Пусть XX имеет распределение Poisson⁡(λ)\operatorname {Poisson}(\lambda ), и рассмотрим оценивание λ\lambda при функции потерь (d−λ)2/λ(d-\lambda )^{2} / \lambda с ограничением 0≤λ≤m0 \leq \lambda \leq m, где mm известно.

?
(a)

Используя рассуждение, аналогичное рассуждению из Примера 2.9, покажите, что XX не является минимаксной оценкой и что наименее благоприятное априорное распределение должно иметь множество w∧w_{\wedge } [из (1.5)], состоящее из конечного числа точек.

(b)

Пусть Λa\Lambda_{a} — априорное распределение, помещающее массу ai,i=1,…,ka_{i}, i=1, \ldots , k, в точки параметра bi,i=1,…,kb_{i}, i=1, \ldots , k. Покажите, что байесовская оценка, соответствующая этому априорному распределению, есть

δΛa(x)=1E[λ−1∣x]=∑i=1kaibixe−bi∑i=1kaibix−1e−bi. \delta ^{\Lambda a}(x)=\frac{1}{\mathbb {E}\left[\lambda ^{-1} \mid x\right]}=\frac{\sum _{i=1}^{k} a_{i} b_{i}^{x} e^{-b_{i}}}{\sum _{i=1}^{k} a_{i} b_{i}^{x-1} e^{-b_{i}}}.
(c)

Пусть m0m_{0} — решение уравнения m=e−m(m0≈.57)m=e^{-m}\left(m_{0} \approx .57\right). Покажите, что при 0≤λ≤m0 \leq \lambda \leq m, m≤m0m \leq m_{0}, одноточечное априорное распределение (ai=1,b1=m)(a_{i}=1, b_{1}=m) даёт минимаксную оценку. Вычислите минимаксный риск и сравните его с риском XX.

(d)

Пусть m1m_{1} — первый положительный нуль уравнения (1+δΛ(m))2=2+m2/2\left(1+\delta^{\Lambda }(m)\right)^{2}=2+m^{2} / 2, где Λ\Lambda — двухточечное априорное распределение (a1=a,b1=0;a2=1−a,b2=m)(a_{1}=a, b_{1}=0 ; a_{2}=1-a, b_{2}=m). Покажите, что при 0≤λ≤m0 \leq \lambda \leq m, m0<m≤m1m_{0}<m \leq m_{1}, двухточечное априорное распределение даёт минимаксную оценку (используйте Следствие 1.6). Вычислите минимаксный риск и сравните его с риском XX.

Примечание.
?

С ростом mm ситуация усложняется, и точные минимаксные решения становятся труднодостижимыми. В этих случаях линейные приближения могут быть вполне удовлетворительными. См. Johnstone и MacGibbon 1992, 1993.

Задача 5.2.21

Покажите, что условия (2.41) и (2.42) из Примера 2.22 являются не только достаточными, но и необходимыми для допустимости (2.40).

?
Задача 5.2.22

Пусть XX и YY независимо распределены по закону Пуассона с E[X]=ξ\mathbb {E}\left[X\right]=\xi и E[Y]=η\mathbb {E}\left[Y\right]=\eta соответственно. Покажите, что aX+bY+ca X+b Y+c допустима для оценивания ξ\xi при квадратичной функции потерь тогда и только тогда, когда либо 0≤a<1,b≥0,c≥00 \leq a<1, b \geq 0, c \geq 0, либо a=1,b=c=0a=1, b=c=0 (Makani 1972).

?
Задача 5.2.23

Пусть XX имеет плотность 12β(θ)eθxe−∣x∣,∣θ∣<1\frac{1}{2} \beta (\theta ) e^{\theta x} e^{-\left|x\right|},\left|\theta \right|<1.

?
(a)

Покажите, что β(θ)=1−θ2\beta (\theta )=1-\theta^{2}.

(b)

Покажите, что aX+ba X+b допустима для оценивания Eθ[X]\mathbb {E}_{\theta }\left[X\right] при квадратичной функции потерь тогда и только тогда, когда 0≤a≤1/20 \leq a \leq 1 / 2.

Задача 5.2.24

Пусть XX распределена как N(θ,1)N(\theta , 1), и пусть θ\theta имеет несобственную априорную плотность π(θ)=eθ\pi (\theta )=e^{\theta } (−∞<θ<∞)(-\infty <\theta <\infty ). При квадратичной функции потерь формальная байесовская оценка θ\theta равна X+1X+1, и она не является ни минимаксной, ни допустимой. (См. также Задачу 2.15.) Условия, при которых формальная байесовская оценка, соответствующая несобственному априорному распределению для θ\theta в Примере 3.4, является допустимой, даны в Zidek (1970).

?
Задача 5.2.25

Покажите, что естественное параметрическое пространство семейства (2.16) есть (−∞,∞)(-\infty , \infty ) для нормального (с известной дисперсией), биномиального распределений и распределения Пуассона, но не в случае гамма-распределения или отрицательного биномиального распределения.

?
§
Задача 5.3.1

Покажите, что Теорема 3.2.7 остаётся верной для почти эквивариантных оценок.

?
Задача 5.3.2

Проверьте плотность (3.1).

?
Задача 5.3.3

В Примере 3.3 покажите, что функция потерь остаётся инвариантной относительно GG тогда и только тогда, когда она является функцией от (d−θ)∗(d-\theta )^{*}.

?
Задача 5.3.4

В Примере 3.3 покажите, что ни одна из функций потерь [(d−θ)∗∗]2\left[(d-\theta )^{* *}\right]^{2} и ∣(d−θ)∗∗∣\left|(d-\theta )^{* *}\right| не является выпуклой.

?
Задача 5.3.5

Пусть YY распределена как G(y−η)G(y-\eta ). Если T=[Y]T=[Y] и X=Y−TX=Y-T, найдите распределение XX и покажите, что оно зависит от η\eta только через η−[η]\eta -[\eta ].

?
Задача 5.3.6
?
(a)

Если X1,…,XnX_{1}, \ldots , X_{n} — независимые одинаково распределённые случайные величины с плотностью f(x−θ)f(x-\theta ), покажите, что MRE-оценка при квадратичной функции потерь [оценка Питмена из (3.1.28)] является байесовской оценкой относительно правоинвариантной меры Хаара.

(b)

Если X1,…,XnX_{1}, \ldots , X_{n} — независимые одинаково распределённые случайные величины с плотностью 1/τf[(x−μ)/τ]1 / \tau f[(x-\mu ) / \tau ], покажите, что:

  1. При квадратичной функции потерь оценка Питмена из (3.1.28) является байесовской оценкой относительно правоинвариантной меры Хаара.

  2. При функции потерь (3.3.17) оценка Питмена из (3.3.19) является байесовской оценкой относительно правоинвариантной меры Хаара.

Задача 5.3.7

Докажите формулу (3.9).

?
Задача 5.3.8

Докажите (3.11).

?
Задача 5.3.9

В Примере 3.8 пусть h(θ)h(\theta ) — длина пути θ\theta после сокращения. Покажите, что hh не удовлетворяет условиям (3.2.11).

?
Задача 5.3.10

Обсудите Пример 3.8 для случая, когда случайное блуждание происходит не на плоскости, а

?
(a)

на прямой и

(b)

в трёхмерном пространстве.

Задача 5.3.11
?
(a)

Покажите, что вероятности (3.17) в сумме дают 1.

(b)

При pkp_{k}, заданных формулой (3.17), покажите, что риск (3.16) бесконечен.

Задача 5.3.12

Покажите, что риск R(θ,δ)R(\theta , \delta ) из (3.18) конечен.

?
Задача 5.3.13

Покажите, что обе оценки δ∗\delta^{*} и δ∗∗\delta^{* *}, определённые формулами (3.20) и (3.21) соответственно, являются эквивариантными.

?
Задача 5.3.14

Докажите соотношения (3.22) и (3.23).

?
Задача 5.3.15

Пусть распределение XX зависит от параметров θ\theta и ϑ\vartheta, пусть функция риска оценки δ=δ(x)\delta =\delta (x) параметра θ\theta равна R(θ,ϑ;δ)R(\theta , \vartheta ; \delta ), и пусть r(θ,δ)=∫R(θ,ϑ;δ)dP(ϑ)r(\theta , \delta )=\int R(\theta , \vartheta ; \delta ) d P(\vartheta ) для некоторого распределения PP. Если δ0\delta_{0} минимизирует sup⁡θr(θ,δ)\sup_{\theta } r(\theta , \delta ) и удовлетворяет sup⁡θr(θ,δ0)=sup⁡θ,ϑR(θ,ϑ;δ0)\sup_{\theta } r\left(\theta , \delta_{0}\right)=\sup_{\theta , \vartheta } R\left(\theta , \vartheta ; \delta_{0}\right), покажите, что δ0\delta_{0} минимизирует sup⁡θ,ϑR(θ,ϑ;δ)\sup_{\theta , \vartheta } R(\theta , \vartheta ; \delta ).

?
§
Задача 5.4.1

В Примере 4.2 покажите, что оценка δ\delta эквивариантна тогда и только тогда, когда она удовлетворяет (4.11) и (4.12).

?
Задача 5.4.2

Покажите, что функция μ\mu удовлетворяет (4.12) тогда и только тогда, когда она зависит только от ΣXi2\Sigma X_{i}^{2}.

?
Задача 5.4.3

Проверьте байесовскую оценку (4.15).

?
Задача 5.4.4

Пусть XiX_{i} независимы с биномиальным распределением b(pi,ni),i=1,…,rb\left(p_{i}, n_{i}\right), i=1, \ldots , r. Для оценивания p=(p1,…,pr)p=\left(p_{1}, \ldots , p_{r}\right) при усреднённой квадратичной функции потерь (4.17) найдите минимаксную оценку pp и определите, является ли она допустимой.

?
Задача 5.4.5

Установление допустимости нормального среднего в двумерном случае представляет собой довольно сложную задачу, что обусловлено тем, что сопряжённые априорные распределения не работают в предельном байесовском методе. Пусть

X∼N2(θ,I) и L(θ,δ)=∣θ−δ∣2. X \sim N_{2}(\boldsymbol {\theta }, I) \quad \text{ и } \quad L(\boldsymbol {\theta }, \delta )=|\boldsymbol {\theta }-\delta |^{2}.

Сопряжённые априорные распределения — это θ∼N2(0,τ2I),τ2>0\boldsymbol {\theta } \sim N_{2}\left(0, \tau^{2} I\right), \tau^{2}>0.

?
(a)

Для этой последовательности априорных распределений проверьте, что предельное байесовское рассуждение, как в Примере 2.8, приводит к неравенству (4.18), которое не устанавливает допустимости.

(b)

Stein (в работе James and Stein 1961) предложил последовательность априорных распределений, позволяющую доказать допустимость XX предельным байесовским методом. Вариант этих априорных распределений, приведённый в Brown and Hwang (1982), таков:

gn(θ)={1 если ∣θ∣≤11−log⁡∣θ∣log⁡n если 1≤∣θ∣≤n0 если ∣θ∣≥n g_{n}(\boldsymbol {\theta })= \begin{cases} 1 & \text{ если }|\boldsymbol {\theta }| \leq 1 \\ 1-\frac{\log |\boldsymbol {\theta }|}{\log n} & \text{ если } 1 \leq |\boldsymbol {\theta }| \leq n \\ 0 & \text{ если }|\boldsymbol {\theta }| \geq n\end{cases}

для n=2,3,…n=2,3, \ldots. Покажите, что δgn(x)→x\delta^{g_{n}}(x) \rightarrow x п.в. при n→∞n \rightarrow \infty.

(c)

Частный случай весьма общих результатов Brown and Hwang (1982) утверждает, что для априорного распределения πn(θ)2g(θ)\pi_{n}(\boldsymbol {\theta })^{2} g(\boldsymbol {\theta }) предельный байесовский метод (метод Blyth) устанавливает допустимость оценки δg(x)\delta^{g}(x) [обобщённой байесовской оценки относительно g(θ)g(\boldsymbol {\theta })], если

∫{θ:∣θ∣>1}g(θ)dθ∣θ∣2[max⁡{log⁡∣θ∣,log⁡2}]2<∞. \int _{\left\{ \boldsymbol {\theta }:\left|\boldsymbol {\theta }\right|>1\right\} } \frac{g(\boldsymbol {\theta }) d \boldsymbol {\theta }}{|\boldsymbol {\theta }|^{2}[\max \left\{ \log \left|\boldsymbol {\theta }\right|, \log 2\right\} ]^{2}}<\infty .

Покажите, что это выполняется для g(θ)=1g(\theta )=1 и что δg(x)=x\delta^{g}(x)=x, так что xx является допустимой.

Примечание.
?

Stein (1956b) первоначально установил допустимость XX в двумерном случае, используя рассуждение, основанное на информационном неравенстве. Его доказательство было усложнено тем, что ему потребовались дополнительные рассуждения, связанные с инвариантностью, чтобы установить результат. См. Теорему 7.19 и Задачу 7.19 для более общих формулировок результата Brown/Hwang.

Задача 5.4.6

Пусть X1,X2,…,XrX_{1}, X_{2}, \ldots , X_{r} независимы, причём Xi∼N(θi,1)X_{i} \sim N\left(\theta_{i}, 1\right). Следующее эвристическое рассуждение, принадлежащее Stein (1956b), показывает, что должно быть возможно, по крайней мере при большом rr и, следовательно, большом ∣θ∣\left|\theta \right|, улучшить оценку X=(X1,X2,…,Xr)\mathbf{X}=\left(X_{1}, X_{2}, \ldots , X_{r}\right).

?
(a)

Используя разложение в ряд Тейлора, покажите, что

∣x∣2=r+∣θ∣2+Op[(r+∣θ∣2)1/2], |\mathbf{x}|^{2}=r+|\boldsymbol {\theta }|^{2}+O_{p}\left[\left(r+|\boldsymbol {\theta }|^{2}\right)^{1 / 2}\right],

так что с высокой вероятностью истинное θ\boldsymbol {\theta } лежит в шаре {θ:∣θ∣2≤∣x∣2−r}\left\{ \boldsymbol {\theta }:|\boldsymbol {\theta }|^{2} \leq |\mathbf{x}|^{2}-r\right\}. Обычная оценка X\mathbf{X} имеет приблизительно тот же размер, что и θ\boldsymbol {\theta }, и почти наверняка окажется вне этого шара.

(b)

Пункт (a) подсказал Stein оценку вида δ(x)=[1−h(∣x∣2)]x\delta (\mathbf{x})=\left[1-h\left(|\mathbf{x}|^{2}\right)\right] \mathbf{x}. Покажите, что

∣θ−δ(x)∣2=(1−h)2∣x−θ∣2−2h(1−h)θ′(x−θ)+h2∣θ∣2. |\boldsymbol {\theta }-\delta (\mathbf{x})|^{2}=(1-h)^{2}|\mathbf{x}-\boldsymbol {\theta }|^{2}-2 h(1-h) \boldsymbol {\theta }^{\prime }(\mathbf{x}-\boldsymbol {\theta })+h^{2}|\boldsymbol {\theta }|^{2}.
(c)

Установите, что θ′(x−θ)/∣θ∣=Z∼N(0,1)\boldsymbol {\theta }^{\prime }(\mathbf{x}-\boldsymbol {\theta }) /\left|\boldsymbol {\theta }\right|=Z \sim N(0,1) и ∣x−θ∣2≈r|\mathbf{x}-\boldsymbol {\theta }|^{2} \approx r, и, следовательно,

∣θ−δ(x)∣2≈(1−h)2r+h2∣θ∣2+Op[(r+∣θ∣2)1/2]. |\boldsymbol {\theta }-\delta (\mathbf{x})|^{2} \approx (1-h)^{2} r+h^{2}|\boldsymbol {\theta }|^{2}+O_{p}\left[\left(r+|\boldsymbol {\theta }|^{2}\right)^{1 / 2}\right].
(d)

Покажите, что главный член в пункте (c) минимизируется при h=r/(r+∣θ∣2)h=r /\left(r+|\boldsymbol {\theta }|^{2}\right), и, поскольку ∣x∣2≈r+∣θ∣2|\mathbf{x}|^{2} \approx r+|\boldsymbol {\theta }|^{2}, это приводит к оценке δ(x)=(1−r∣x∣2)x\delta (\mathbf{x})=\left(1-\frac{r}{|\mathbf{x}|^{2}}\right) \mathbf{x} из (4.20).

Задача 5.4.7

Если S2S^{2} распределена как χr2\chi_{r}^{2}, используя (2.2.5), покажите, что E[S−2]=1/(r−2)\mathbb {E}\left[S^{-2}\right]=1 /(r-2).

?
Задача 5.4.8

В Примере 4.7 покажите, что R\mathcal{R} невырождена для ρ1\rho_{1} и ρ2\rho_{2} и вырождена для ρ3\rho_{3} и ρ4\rho_{4}.

?
Задача 5.4.9

Покажите, что функция ρ2\rho_{2} из Примера 4.7 выпукла.

?
Задача 5.4.10

В Примере 4.7 покажите, что XX допустима для

?
(a)

ρ3\rho_{3} и

(b)

ρ4\rho_{4}.

Задача 5.4.11

В Примере 4.8 покажите, что X\mathbf{X} допустима при предположениях (ii)(a).

?
Задача 5.4.12

Пусть L\mathcal{L} — семейство функций потерь, и предположим, что существуют L0∈LL_{0} \in \mathcal{L} и минимаксная оценка δ0\delta_{0} относительно L0L_{0} такие, что в обозначениях (4.29)

sup⁡L,θRL(θ,δ0)=sup⁡θRL0(θ,δ0). \sup _{L, \theta } R_{L}\left(\theta , \delta _{0}\right)=\sup _{\theta } R_{L_{0}}\left(\theta , \delta _{0}\right).

Тогда δ0\delta_{0} является минимаксной относительно L\mathcal{L}, то есть минимизирует sup⁡L,θRL(θ,δ)\sup_{L, \theta } R_{L}(\theta , \delta ).

?
Задача 5.4.13

Предполагая (4.25), покажите, что E=1−[(r−2)2/r∣X−μ∣2]E=1-\left[(r-2)^{2} / r|\mathbf{X}-\mu |^{2}\right] является единственной несмещённой оценкой риска (5..4.25) и что EE недопустима.

?
Примечание.
?

Оценка EE также несмещена для оценивания функции потерь L(θ,δ)L(\boldsymbol {\theta }, \delta ). См. Замечание 9.5.

Задача 5.4.14

Естественным расширением доминирования по риску при заданной функции потерь является доминирование по риску при целом классе функций потерь. Hwang (1985) определяет универсальное доминирование δ\delta оценкой δ′\delta^{\prime }, если неравенство

Eθ[L(∣θ−δ′(X)∣)]≤Eθ[L(∣θ−δ(X)∣)] для всех θ \mathbb {E}_{\theta }\left[L\left(\left|\boldsymbol {\theta }-\delta ^{\prime }(\mathbf{X})\right|\right)\right] \leq \mathbb {E}_{\theta }\left[L(\left|\boldsymbol {\theta }-\delta (\mathbf{X})\right|)\right] \text{ для всех } \boldsymbol {\theta }

выполняется для всех неубывающих функций потерь L(⋅)L(\cdot ), причём хотя бы для одной функции потерь риски не совпадают.

?
(a)

Покажите, что δ′\delta^{\prime } универсально доминирует δ\delta тогда и только тогда, когда она стохастически доминирует δ\delta, то есть тогда и только тогда, когда

Pθ(∣θ−δ′(X)∣>k)≤Pθ(∣θ−δ(X)∣>k) \mathbb {P}_{\theta }\left(\left|\boldsymbol {\theta }-\delta ^{\prime }(\mathbf{X})\right|>k\right) \leq \mathbb {P}_{\theta }\left(\left|\boldsymbol {\theta }-\delta (\mathbf{X})\right|>k\right)

для всех kk и θ\boldsymbol {\theta }, причём для некоторого θ\boldsymbol {\theta } неравенство строгое.

(b)

Для X∼Nr(θ,I)X \sim N_{r}(\boldsymbol {\theta }, I) покажите, что оценка Джеймса-Стейна δc(x)=(1−c/∣x∣2)x\delta^{c}(\mathbf{x})=\left(1-c /|\mathbf{x}|^{2}\right) \mathbf{x} не доминирует над x универсально.

Hwang (1985) и Brown and Hwang (1989) исследуют многие аспекты универсального доминирования. Hwang (1985) показывает, что даже δ+\delta^{+}не доминирует над XX универсально, если класс функций потерь не ограничен. Отметим также, что, хотя неравенство в пункте (a) может показаться напоминающим критерий «близости по Питмену», на самом деле никакой связи здесь нет. Критерий близости по Питмену страдает рядом недостатков, не свойственных стохастическому доминированию (см. Robert и др. 1993).

§
Задача 5.5.1

Покажите, что оценка δc\delta_{c}, определённая формулой (5.2) с 0<c=1−Δ<10<c=1-\Delta <1, доминируется любой оценкой δd\delta_{d} с ∣d−1∣<Δ\left|d-1\right|<\Delta.

?
Задача 5.5.2

В контексте Теоремы 5.1 покажите, что

Eθ[1∣X∣2]≤E0[1∣X∣2]<∞. \mathbb {E}_{\theta }\left[\frac{1}{|\mathbf{X}|^{2}}\right] \leq \mathbb {E}_{0}\left[\frac{1}{|\mathbf{X}|^{2}}\right]<\infty .
?
Задача 5.5.3

Stigler (1990) даёт интересное объяснение феномена Стейна с точки зрения регрессии, а также приводит тождество, которое можно использовать для доказательства минимаксности оценки Джеймса-Стейна. Для X∼(Nrθ,I)\mathbf{X} \sim \left(N_{r} \boldsymbol {\theta }, I\right) и δc(x)=(1−c∣x∣2)x\delta^{c}(\mathbf{x})=\left(1-\frac{c}{|\mathbf{x}|^{2}}\right) \mathbf{x}:

?
(a)

Покажите, что

Eθ∣θ−δc(X)∣2=r−2cEθ[X′θ+(c/2)∣X∣2−1]. E_{\boldsymbol {\theta }}\left|\boldsymbol {\theta }-\delta ^{c}(\mathbf{X})\right|^{2}=r-2 c E_{\boldsymbol {\theta }}\left[\frac{\mathbf{X}^{\prime } \boldsymbol {\theta }+(c / 2)}{|\mathbf{X}|^{2}}-1\right].
(b)

Выражение в квадратных скобках возрастает по cc. Докажите минимаксность δc\delta^{c} при 0≤c≤2(r−2)0 \leq c \leq 2(r-2), установив тождество Stigler

Eθ[X′θ+r−2∣X∣2]=1. E_{\boldsymbol {\theta }}\left[\frac{\mathbf{X}^{\prime } \boldsymbol {\theta }+r-2}{|\mathbf{X}|^{2}}\right]=1.
Задача 5.5.4

Теорема 5.5 утверждает: для X∼Nr(θ,I)X \sim N_{r}(\theta , I), r≥3r \geq 3, и функции потерь L(θ,d)=1r∑(di−θi)2L(\theta , d)=\frac{1}{r} \sum (d_{i}-\theta_{i})^{2} оценка вида

δi=[1−c(∣x∣)r−2∣x∣2]xi \delta _{i}=\left[1-c(\left|x\right|) \frac{r-2}{|x|^{2}}\right] x_{i}

является минимаксной, если (i) 0≤c(⋅)≤20 \leq c(\cdot ) \leq 2 и (ii) функция cc не убывает.

?
(a)

Докажите Теорему 5.5.

(b)

Примените Теорему 5.5, чтобы установить условия минимаксности собственной байесовской оценки Strawderman (1971), заданной формулами (5.10) и (5.12).

Задача 5.5.5

Для иерархической модели (5.11) Strawderman (1971):

?
(a)

Покажите, что байесовская оценка при квадратичной функции потерь задаётся формулой E[θ∣x]=[1−E[λ∣x]]x\mathbb {E}\left[\boldsymbol {\theta } \mid \mathbf{x}\right]= [1-\mathbb {E}\left[\lambda \mid \mathbf{x}\right]] \mathbf{x}, где

E[λ∣x]=∫01λr/2−a+1e−1/2λ∣x∣2dλ∫01λr/2−ae−1/2λ∣x∣2dλ \mathbb {E}\left[\lambda \mid \mathbf{x}\right]=\frac{\int _{0}^{1} \lambda ^{r / 2-a+1} e^{-1 / 2 \lambda |\mathbf{x}|^{2}} d \lambda }{\int _{0}^{1} \lambda ^{r / 2-a} e^{-1 / 2 \lambda |\mathbf{x}|^{2}} d \lambda }
(b)

Покажите, что E[λ∣x]\mathbb {E}\left[\lambda \mid \mathbf{x}\right] допускает альтернативные представления

E[λ∣x]=r−2a+2∣x∣2P(χr−2a+42≤∣x∣2)P(χr−2a+22≤∣x∣2),E[λ∣x]=r−2a+2∣x∣2−2e−1/2∣x∣2∣x∣2∫01λr/2−ae−1/2λ∣x∣2dλ, \begin{align} & \mathbb {E}\left[\lambda \mid \mathbf{x}\right]=\frac{r-2 a+2}{|\mathbf{x}|^{2}} \frac{\mathbb {P}\left(\chi _{r-2 a+4}^{2} \leq |\mathbf{x}|^{2}\right)}{\mathbb {P}\left(\chi _{r-2 a+2}^{2} \leq |\mathbf{x}|^{2}\right)}, \\ & \mathbb {E}\left[\lambda \mid \mathbf{x}\right]=\frac{r-2 a+2}{|\mathbf{x}|^{2}}-\frac{2 e^{-1 / 2|\mathbf{x}|^{2}}}{|\mathbf{x}|^{2} \int _{0}^{1} \lambda ^{r / 2-a} e^{-1 / 2 \lambda |\mathbf{x}|^{2}} d \lambda }, \end{align}

и, следовательно, что a=0a=0 даёт оценку из (5.12).

(c)

Покажите, что ∣x∣2E[λ∣x]|\mathbf{x}|^{2} \mathbb {E}\left[\lambda \mid \mathbf{x}\right] возрастает по ∣x∣2|\mathbf{x}|^{2} с максимумом r−2a+2r-2 a+2. Следовательно, байесовская оценка минимаксна, если r−2a+2≤2(r−2)r-2 a+2 \leq 2(r-2), то есть r≥2(3−a)r \geq 2(3-a). Для 0≤a≤10 \leq a \leq 1 это требует r≥5r \geq 5.

Примечание.
?

Berger (1976b) рассматривает матричные обобщения этой иерархической модели и выводит допустимые минимаксные оценки. Собственные байесовские минимаксные оценки существуют только при r≥5r \geq 5 (Strawderman 1971); однако формальные байесовские минимаксные оценки существуют при r=3r=3 и 4.

Задача 5.5.6

Рассмотрим обобщение иерархической модели Strawderman (1971) из Задачи 5.5:

X∣θ∼N(θ,I),θ∣λ∼N(0,λ−1(1−λ)I),λ∼π(λ). \begin{align} \mathbf{X} \mid \boldsymbol {\theta } & \sim N(\boldsymbol {\theta }, I), \\ \boldsymbol {\theta } \mid \lambda & \sim N\left(0, \lambda ^{-1}(1-\lambda ) I\right), \\ \lambda & \sim \pi (\lambda ). \end{align}
?
(a)

Покажите, что байесовская оценка при квадратичной функции потерь равна [1−E[λ∣x]]x[1-\mathbb {E}\left[\lambda \mid \mathbf{x}\right]] \mathbf{x}, где

E[λ∣x]=∫01λr/2+1e−1/2λ∣x∣2π(λ)dλ∫01λr/2e−1/2λ∣x∣2π(λ)dλ. \mathbb {E}\left[\lambda \mid \mathbf{x}\right]=\frac{\int _{0}^{1} \lambda ^{r / 2+1} e^{-1 / 2 \lambda |\mathbf{x}|^{2}} \pi (\lambda ) d \lambda }{\int _{0}^{1} \lambda ^{r / 2} e^{-1 / 2 \lambda |\mathbf{x}|^{2}} \pi (\lambda ) d \lambda }.
(b)

Предположим, что λ∼beta⁡(α,β)\lambda \sim \operatorname {beta}(\alpha , \beta ) с плотностью

π(λ)=Γ(α+β)Γ(α)Γ(β)λα−1(1−λ)β−1. \pi (\lambda )=\frac{\Gamma (\alpha +\beta )}{\Gamma (\alpha ) \Gamma (\beta )} \lambda ^{\alpha -1}(1-\lambda )^{\beta -1}.

Покажите, что байесовская оценка минимаксна, если β≥1\beta \geq 1 и 0≤a≤(r−4)/20 \leq a \leq (r-4) / 2.

(c)

Пусть t=λ−1(1−λ)t=\lambda^{-1}(1-\lambda ) — априорная точность θ\boldsymbol {\theta }. Если λ∼beta⁡(α,β)\lambda \sim \operatorname {beta}(\alpha , \beta ), покажите, что плотность tt пропорциональна tα−1/(1+t)α+βt^{\alpha -1} /(1+t)^{\alpha +\beta }, то есть t∼F2α,2βt \sim F_{2 \alpha , 2 \beta } — FF-распределению с 2α2 \alpha и 2β2 \beta степенями свободы.

(d)

Два интересных предельных случая — это α=1,β=0\alpha =1, \beta =0 и α=0,β=1\alpha =0, \beta =1. Для каждого случая покажите, что получающееся априорное распределение для tt является собственным, и прокомментируйте минимаксность получающихся оценок.

Примечание.
?
(c)

Априорное распределение Strawderman из Задачи 5.5 соответствует β=1\beta =1 и 0<α<10<\alpha <1. Если взять α=1/2\alpha =1 / 2 и β=1\beta =1, то t∼F1,2t \sim F_{1,2}.

Задача 5.5.7

Faith (1978) рассмотрел иерархическую модель

X∣θ∼N(θ,I),θ∣t∼N(0,1tI),t∼Gamma⁡(a,b), \begin{align} \mathbf{X} \mid \boldsymbol {\theta } & \sim N(\boldsymbol {\theta }, I), \\ \boldsymbol {\theta } \mid t & \sim N\left(0, \frac{1}{t} I\right), \\ t & \sim \operatorname {Gamma}(a, b), \end{align}

то есть

π(t)=1Γ(a)bata−1e−t/b. \pi (t)=\frac{1}{\Gamma (a) b^{a}} t^{a-1} e^{-t / b}.
?
(a)

Покажите, что маргинальное априорное распределение для θ\boldsymbol {\theta }, безусловное по tt, есть

π(θ)∝(2/b+∣θ∣2)−(a+r/2), \pi (\boldsymbol {\theta }) \propto \left(2 / b+|\boldsymbol {\theta }|^{2}\right)^{-(a+r / 2)},

то есть многомерное распределение Стьюдента.

(b)

Покажите, что a≤−1a \leq -1 является достаточным условием для ∑i∂2π(θ)∂θi2≥0\sum_{i} \frac{\partial^{2} \pi (\boldsymbol {\theta })}{\partial \theta_{i}^{2}} \geq 0 и, следовательно, достаточным условием минимаксности байесовской оценки при квадратичной функции потерь.

(c)

Покажите, в более общем случае, что байесовская оценка при квадратичной функции потерь минимаксна, если a≤(r−4)/2a \leq (r-4) / 2 и a≤1/b+3a \leq 1 / b+3.

(d)

При каком выборе aa и bb получится многомерное априорное распределение Коши для π(θ)\pi (\boldsymbol {\theta })? Является ли получающаяся байесовская оценка минимаксной?

Задача 5.5.8

Пусть X∼N(θ,Σ)X \sim N(\boldsymbol {\theta }, \Sigma ), и рассмотрим оценивание θ\boldsymbol {\theta } при функции потерь L(θ,δ)=(θ−δ)′(θ−δ)L(\boldsymbol {\theta }, \delta )= (\boldsymbol {\theta }-\delta )^{\prime }(\boldsymbol {\theta }-\delta ).

?
(a)

Покажите, что R(θ,X)=tr⁡ΣR(\boldsymbol {\theta }, \mathbf{X})=\operatorname {tr} \Sigma — минимаксный риск. Следовательно, X является минимаксной оценкой.

(b)

Пусть X∼N(θ,I)X \sim N(\boldsymbol {\theta }, I), и рассмотрим оценивание θ\boldsymbol {\theta } при функции потерь L(θ,δ)=(θ−δ)′Q(θ−δ)L(\boldsymbol {\theta }, \delta )=(\boldsymbol {\theta }- \delta )^{\prime } Q(\boldsymbol {\theta }-\delta ), где QQ — известная положительно определённая матрица. Покажите, что R(θ,X)=tr⁡QR(\boldsymbol {\theta }, \mathbf{X})=\operatorname {tr} Q — минимаксный риск. Следовательно, X\mathbf{X} является минимаксной оценкой.

(c)

Покажите, что вычисления в пунктах (a) и (b) эквивалентны.

Задача 5.5.9

В Теореме 5.7 проверьте

Eθ[c(∣X∣2)∣X∣2X′(θ−X)]=Eθ[c(∣X∣2)∣X∣2tr⁡(Σ)−2c(∣X∣2)∣X∣4X′ΣX+2c′(∣X∣2)∣X∣2X′ΣX]. \mathbb {E}_{\theta }\left[\frac{c\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{2}} \mathbf{X}^{\prime }(\boldsymbol {\theta }-\mathbf{X})\right]=\mathbb {E}_{\theta }\left[\frac{c\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{2}} \operatorname {tr}(\Sigma )-2 \frac{c\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{4}} \mathbf{X}^{\prime } \Sigma \mathbf{X}+2 \frac{c^{\prime }\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{2}} \mathbf{X}^{\prime } \Sigma \mathbf{X}\right].
?
Задача 5.5.10

В Теореме 5.7 покажите, что условие (i) допускает наибольшее сжатие, когда Σ=σ2I\Sigma =\sigma^{2} I при некотором значении σ2\sigma^{2}. То есть покажите, что для всех положительно определённых Σ\Sigma размера r×rr \times r

max⁡Σtr⁡Σλmax⁡(Σ)=tr⁡σ2Iλmax⁡(σ2I)=r. \max _{\Sigma } \frac{\operatorname {tr} \Sigma }{\lambda _{\max }(\Sigma )}=\frac{\operatorname {tr} \sigma ^{2} I}{\lambda _{\max }\left(\sigma ^{2} I\right)}=r.
?
Задача 5.5.11

Задача оценивания (5.18),

X∼N(θ,Σ)L(θ,δ)=(θ−δ)′Q(θ−δ), \begin{align} \mathbf{X} & \sim N(\boldsymbol {\theta }, \Sigma ) \\ L(\boldsymbol {\theta }, \delta ) & =(\boldsymbol {\theta }-\delta )^{\prime } Q(\boldsymbol {\theta }-\delta ), \end{align}

где обе матрицы Σ\Sigma и QQ положительно определены, всегда может быть сведена без потери общности к более простому случаю

Y∼N(η,I)L(η,δ∗)=(η−δ∗)′Dq∗(η−δ∗), \begin{align} \mathbf{Y} & \sim N(\boldsymbol {\eta }, I) \\ L\left(\boldsymbol {\eta }, \delta ^{*}\right) & =\left(\boldsymbol {\eta }-\delta ^{*}\right)^{\prime } D_{q^{*}}\left(\boldsymbol {\eta }-\delta ^{*}\right), \end{align}

где Dq∗D_{q^{*}} — диагональная матрица с элементами (q1∗,…,qr∗)(q_{1}^{*}, \ldots , q_{r}^{*}), с помощью следующего рассуждения. Определим R=Σ1/2BR=\Sigma^{1 / 2} B, где Σ1/2\Sigma^{1 / 2} — симметричный квадратный корень из Σ\Sigma (то есть Σ1/2Σ1/2=Σ\Sigma^{1 / 2} \Sigma^{1 / 2}=\Sigma), а BB — матрица собственных векторов Σ1/2QΣ1/2\Sigma^{1 / 2} Q \Sigma^{1 / 2} (то есть B′Σ1/2QΣ1/2B=Dq∗B^{\prime } \Sigma^{1 / 2} Q \Sigma^{1 / 2} B=D_{q^{*}}).

?
(a)

Покажите, что RR удовлетворяет

R′Σ−1R=I,R′QR=Dq∗ R^{\prime } \Sigma ^{-1} R=I, \quad R^{\prime } Q R=D_{q^{*}}
(b)

Определим Y=R−1X\mathbf{Y}=R^{-1} \mathbf{X}. Покажите, что Y∼N(η,I)\mathbf{Y} \sim N(\boldsymbol {\eta }, I), где η=R−1θ\boldsymbol {\eta }=R^{-1} \boldsymbol {\theta }.

(c)

Покажите, что задачи оценивания эквивалентны, если определить δ∗(Y)=R−1δ(RY)\delta^{*}(\mathbf{Y})= R^{-1} \delta (R \mathbf{Y}).

Примечание.
?

Замечание: Если Σ\Sigma имеет спектральное разложение P′ΣP=D=P^{\prime } \Sigma P=D= diagonal (d1,⋯ ,dr)\left(d_{1}, \cdots , d_{r}\right), то можно определить Σ1/2=PD1/2P′\Sigma^{1 / 2}=P D^{1 / 2} P^{\prime }, где D1/2D^{1 / 2} — диагональная матрица с элементами di\sqrt{d_{i}}. Поскольку Σ\Sigma положительно определена, did_{i} положительны.

Задача 5.5.12

Завершите доказательство Теоремы 5.9.

?
(a)

Покажите, что риск δ(x)\delta (\mathbf{x}) равен

R(θ,δ)=Eθ[(θ−X)′Q(θ−X)]−2Eθ[c(∣X∣2)∣X∣2X′Q(θ−X)]+Eθ[c2(∣X∣2)∣X∣4X′QX] \begin{align} R(\boldsymbol {\theta }, \delta )= & \mathbb {E}_{\theta }\left[(\boldsymbol {\theta }-\mathbf{X})^{\prime } Q(\boldsymbol {\theta }-\mathbf{X})\right] \\ & -2 \mathbb {E}_{\theta }\left[\frac{c\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{2}} \mathbf{X}^{\prime } Q(\boldsymbol {\theta }-\mathbf{X})\right] \\ & +\mathbb {E}_{\theta }\left[\frac{c^{2}\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{4}} \mathbf{X}^{\prime } Q \mathbf{X}\right] \end{align}

где Eθ[(θ−X)′Q(θ−X)]=tr⁡(Q)\mathbb {E}_{\theta }\left[(\boldsymbol {\theta }-\mathbf{X})^{\prime } Q(\boldsymbol {\theta }-\mathbf{X})\right]=\operatorname {tr}(Q).

(b)

Используя лемму Стейна, проверьте

Eθ[c(∣X∣2)∣X∣2X′Q(θ−X)]=Eθ[c(∣X∣2)∣X∣2tr⁡(Q)−2c(∣X∣2)∣X∣4X′QX+2c′(∣X∣2)∣X∣2X′QX]. \begin{align} & \mathbb {E}_{\theta }\left[\frac{c\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{2}} \mathbf{X}^{\prime } Q(\boldsymbol {\theta }-\mathbf{X})\right] \\ & =\mathbb {E}_{\theta }\left[\frac{c\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{2}} \operatorname {tr}(Q)-2 \frac{c\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{4}} \mathbf{X}^{\prime } Q \mathbf{X}+2 \frac{c^{\prime }\left(|\mathbf{X}|^{2}\right)}{|\mathbf{X}|^{2}} \mathbf{X}^{\prime } Q \mathbf{X}\right]. \end{align}

Используйте рассуждение, аналогичное рассуждению в Теореме 5.7.

Задача 5.5.13

Докажите следующее «обобщение» Теоремы 5.9.

Теорема 8.2. Пусть X∼N(θ,Σ)\mathbf{X} \sim N(\boldsymbol {\theta }, \Sigma ). Оценка вида (5.13) минимаксна относительно функции потерь L(θ,δ)=(θ−δ)′Q(θ−δ)L(\boldsymbol {\theta }, \delta )=(\boldsymbol {\theta }-\delta )^{\prime } Q(\boldsymbol {\theta }-\delta ), если

  1. 0≤c(∣x∣2)≤2[tr⁡(Q∗)/λmax⁡(Q∗)]−40 \leq c\left(|\mathbf{x}|^{2}\right) \leq 2\left[\operatorname {tr}\left(Q^{*}\right) / \lambda_{\max }\left(Q^{*}\right)\right]-4,

  2. функция c(⋅)c(\cdot ) не убывает, где Q∗=Σ1/2QΣ1/2Q^{*}=\Sigma^{1 / 2} Q \Sigma^{1 / 2}.

?
Задача 5.5.14

Brown (1975) исследовал поведение оценки относительно класса функций потерь

L(C)={L:L(θ,δ)=∑i=1rci(θi−δi)2;(c1,…,cr)∈C} \mathcal{L}(C)=\left\{ L: L(\boldsymbol {\theta }, \delta )=\sum _{i=1}^{r} c_{i}\left(\theta _{i}-\delta _{i}\right)^{2} ; \quad \left(c_{1}, \ldots , c_{r}\right) \in C\right\}

для заданного множества CC, и доказал следующую теорему. Теорема 8.3. Для X∼Nr(θ,I)\mathbf{X} \sim N_{r}(\boldsymbol {\theta }, I) существует сферически симметричная оценка δ\delta, то есть δ(x)=[1−h(∣x∣2)]x\delta (\mathbf{x})=\left[1-h\left(|\mathbf{x}|^{2}\right)\right] \mathbf{x}, где h(∣x∣2)≠0h\left(|\mathbf{x}|^{2}\right) \neq 0, такая что R(θ,δ)≤R(θ,X)R(\boldsymbol {\theta }, \delta ) \leq R(\boldsymbol {\theta }, \mathbf{X}) для всех L∈L(C)L \in \mathcal{L}(C), если для всех (c1,…,cr)∈C\left(c_{1}, \ldots , c_{r}\right) \in C неравенство ∑j=1rci>2ck\sum_{j=1}^{r} c_{i}>2 c_{k} выполняется при k=1,…,rk=1, \ldots , r.

Покажите, что эта теорема эквивалентна Теореме 5.9 в том смысле, что указанное выше неравенство эквивалентно пункту (i) Теоремы 5.9, и оценка (5.13) минимаксна. Bock (1975) также устанавливает эту теорему; см. также Shinozaki (1980).

?
Задача 5.5.15

Теорема 5.5 утверждает: для X∼Nr(θ,I)X \sim N_{r}(\theta , I), r≥3r \geq 3, и функции потерь L(θ,d)=1r∑(di−θi)2L(\theta , d)=\frac{1}{r} \sum (d_{i}-\theta_{i})^{2} оценка вида δi=[1−c(∣x∣)r−2∣x∣2]xi\delta_{i}=\left[1-c(\left|x\right|) \frac{r-2}{|x|^{2}}\right] x_{i} минимаксна, если (i) 0≤c(⋅)≤20 \leq c(\cdot ) \leq 2 и (ii) функция cc не убывает.

Теорема 5.9 утверждает: пусть X∼N(θ,I)X \sim N(\theta , I). Оценка вида (5.13) [δi=(1−c(∣x∣2)/∣x∣2)xi\delta_{i}=(1-c(|x|^{2})/|x|^{2})x_{i}] минимаксна относительно функции потерь L(θ,δ)=(θ−δ)′Q(θ−δ)L(\theta , \delta )=(\theta -\delta )' Q(\theta -\delta ), если (i) 0≤c(∣x∣2)≤2[tr⁡(Q)/λmax⁡(Q)]−40 \leq c(|x|^{2}) \leq 2[\operatorname {tr}(Q)/\lambda_{\max }(Q)]-4, (ii) функция c(⋅)c(\cdot ) не убывает.

Существуют различные способы, по-видимому, обобщить Теоремы 5.5 и 5.9. Однако, если и оценке, и функции потерь разрешить зависеть от ковариационной матрицы и матрицы потерь, то линейные преобразования обычно позволяют свести задачу к более простому виду. Пусть X∼Nr(θ,Σ)X \sim N_{r}(\boldsymbol {\theta }, \Sigma ), и пусть функция потерь равна L(θ,δ)=(θ−δ)′Q(θ−δ)L(\boldsymbol {\theta }, \delta )=(\boldsymbol {\theta }-\delta )^{\prime } Q(\boldsymbol {\theta }-\delta ), и рассмотрим следующие «обобщения» Теорем 5.5 и 5.9.

?
(a)
δ(x)=(1−c(x′Σ−1x)x′Σ−1x)x,Q=Σ−1 \delta (\mathbf{x})=\left(1-\frac{c\left(\mathbf{x}^{\prime } \Sigma ^{-1} \mathbf{x}\right)}{\mathbf{x}^{\prime } \Sigma ^{-1} \mathbf{x}}\right) \mathbf{x}, \quad Q=\Sigma ^{-1}
(b)
δ(x)=(1−c(x′Qx)x′Qx)x,Σ=I или Σ=Q, \delta (\mathbf{x})=\left(1-\frac{c\left(\mathbf{x}^{\prime } Q \mathbf{x}\right)}{\mathbf{x}^{\prime } Q \mathbf{x}}\right) \mathbf{x}, \quad \Sigma =I \text{ или } \Sigma =Q,
(c)
δ(x)=(1−c(x′Σ−1/2QΣ−1/2x)x′Σ−1/2QΣ−1/2x)x. \delta (\mathbf{x})=\left(1-\frac{c\left(\mathbf{x}^{\prime } \Sigma ^{-1 / 2} Q \Sigma ^{-1 / 2} \mathbf{x}\right)}{\mathbf{x}^{\prime } \Sigma ^{-1 / 2} Q \Sigma ^{-1 / 2} \mathbf{x}}\right) \mathbf{x}.

В каждом случае используйте преобразования, чтобы свести задачу к задаче Теоремы 5.5 или 5.9, и выведите условие минимаксности δ\delta.

Задача 5.5.16

Естественным расширением оценки (5.10) является оценка, сжимающая к произвольной известной точке μ=(μ1,…,μr)\mu =\left(\mu_{1}, \ldots , \mu_{r}\right),

δμ(x)=μ+[1−c(S)r−2∣x−μ∣2](x−μ) \delta _{\mu }(\mathbf{x})=\mu +\left[1-c(S) \frac{r-2}{|\mathbf{x}-\mu |^{2}}\right](\mathbf{x}-\mu )

где ∣x−μ∣2=Σ(xi−μi)2|\mathbf{x}-\mu |^{2}=\Sigma \left(x_{i}-\mu_{i}\right)^{2}.

?
(a)

Покажите, что при условиях Теоремы 5.5 оценка δμ\delta_{\mu } минимаксна.

(b)

Покажите, что её положительная часть является лучшей оценкой.

Задача 5.5.17

Пусть X∼Nr(θ,I)\mathbf{X} \sim N_{r}(\boldsymbol {\theta }, I). Покажите, что байесовская оценка θ\boldsymbol {\theta } при квадратичной функции потерь задаётся формулой δ(x)=x+∇log⁡m(x)\delta (\mathbf{x})=\mathbf{x}+\nabla \log m(\mathbf{x}), где m(x)m(\mathbf{x}) — маргинальная плотность, а ∇f={∂/∂xif}\nabla f=\left\{ \partial / \partial x_{i} f\right\}.

?
Задача 5.5.18

Проверьте (5.27).

?
Задача 5.5.19

Свойство супергармоничности и его связь с минимаксностью не ограничивается байесовскими оценками. Для X∼Nr(θ,I)X \sim N_{r}(\boldsymbol {\theta }, I) псевдобайесовская оценка (так названная и исследованная Bock, 1988) — это оценка вида

x+∇log⁡m(x) \mathbf{x}+\nabla \log m(\mathbf{x})

где m(x)m(\mathbf{x}) не обязательно является маргинальной плотностью.

?
(a)

Покажите, что оценка Стейна с положительной частью

δa+=μ+(1−a∣x−μ∣2)+(x−μ) \delta _{a}^{+}=\mu +\left(1-\frac{a}{|\mathbf{x}-\mu |^{2}}\right)^{+}(\mathbf{x}-\mu )

является псевдобайесовской оценкой с

m(x)={e−(1/2)∣x−μ∣2 если ∣x−μ∣2<a(∣x−μ∣2)−a/2 если ∣x−μ∣2≥a. m(\mathbf{x})= \begin{cases} e^{-(1 / 2)|\mathbf{x}-\mu |^{2}} & \text{ если }|\mathbf{x}-\mu |^{2}<a \\ \left(|\mathbf{x}-\mu |^{2}\right)^{-a / 2} & \text{ если }|\mathbf{x}-\mu |^{2} \geq a.\end{cases}
(b)

Покажите, что, за исключением точки разрыва, если a≤r−2a \leq r-2, то ∑i=1r∂2∂xi2m(x)≤0\sum_{i=1}^{r} \frac{\partial^{2}}{\partial x_{i}^{2}} m(\mathbf{x}) \leq 0, так что m(x)m(\mathbf{x}) супергармонична.

(c)

Покажите, как модифицировать доказательство Следствия 5.11, чтобы учесть супергармонические функции m(x)m(\mathbf{x}) с конечным числом разрывов меры нуль.

Этот результат адаптирован из George (1986a, 1986b), который использует как псевдобайесовость, так и супергармоничность, чтобы установить минимаксность интересного класса оценок, которые далее исследуются в следующей задаче.

Задача 5.5.20

Для X∣θ∼Nr(θ,I)X \mid \boldsymbol {\theta } \sim N_{r}(\boldsymbol {\theta }, I) George (1986a, 1986b) рассмотрел оценки с множественным сжатием — оценки, которые могут сжиматься к нескольким различным целевым точкам. Предположим, что θ∼π(θ)=∑j=1kωiπi(θ)\boldsymbol {\theta } \sim \pi (\boldsymbol {\theta })= \sum_{j=1}^{k} \omega_{i} \pi_{i}(\boldsymbol {\theta }), где ωi\omega_{i} — известные положительные веса, ∑ωi=1\sum \omega_{i}=1.

?
(a)

Покажите, что байесовская оценка относительно π(θ)\pi (\boldsymbol {\theta }) при квадратичной функции потерь задаётся формулой δ∗(x)=x+∇log⁡m∗(x)\delta^{*}(\mathbf{x})=\mathbf{x}+\nabla \log m^{*}(\mathbf{x}), где m∗(x)=∑j=1kωjmj(x)m^{*}(\mathbf{x})=\sum_{j=1}^{k} \omega_{j} m_{j}(\mathbf{x}) и

mi(x)=∫Ω1(2π)p/2e−(1/2)∣x−θ∣2πi(θ)dθ m_{i}(\mathbf{x})=\int _{\Omega } \frac{1}{(2 \pi )^{p / 2}} e^{-(1 / 2)|\mathbf{x}-\boldsymbol {\theta }|^{2}} \pi _{i}(\boldsymbol {\theta }) d \boldsymbol {\theta }
(b)

Очевидно, δ∗\delta^{*} минимаксна, если m∗(x)m^{*}(\mathbf{x}) супергармонична. Покажите, что δ∗(x)\delta^{*}(\mathbf{x}) минимаксна, если либо (i) mi(x)m_{i}(\mathbf{x}) супергармонична, i=1,…,k\quad i=1, \ldots , k, либо (ii) πi(θ)\pi_{i}(\boldsymbol {\theta }) супергармонична, i=1,…,ki=1, \ldots , k.

(c)

Настоящее преимущество δ∗\delta^{*} проявляется, когда компоненты задают различные целевые точки. Для ρj=ωjmj(x)/m∗(x)\rho_{j}=\omega_{j} m_{j}(x) / m^{*}(x) пусть δ∗(x)=∑j=1kρjδj+(x)\delta^{*}(\mathbf{x})=\sum_{j=1}^{k} \rho_{j} \delta_{j}^{+}(\mathbf{x}), где

δj+(x)=μj+(1−r−2∣x−μj∣2)+(x−μj) \delta _{j}^{+}(\mathbf{x})=\mu _{j}+\left(1-\frac{r-2}{\left|\mathbf{x}-\mu _{j}\right|^{2}}\right)^{+}\left(\mathbf{x}-\mu _{j}\right)

а μj\mu_{j} — целевые векторы. Покажите, что δ∗(x)\delta^{*}(\mathbf{x}) минимаксна.

Примечание.
?

George (1986a, 1986b) исследовал многие типы множественных целей, включая множественные точки, подпространства, а также кластеры и подвекторы. Задача о подвекторах также рассматривалась в Berger and Dey (1983a, 1983b). Оценки с множественным сжатием также исследовались в Ki and Tsui (1990) и Withers (1991).

Задача 5.5.21

Пусть Xi,YjX_{i}, Y_{j} независимы и распределены как N(ξi,1)N\left(\xi_{i}, 1\right) и N(ηj,1)N\left(\eta_{j}, 1\right) соответственно (i=1,…,r;j=1,…,si=1, \ldots , r ; j= 1, \ldots , s).

?
(a)

Найдите оценку (ξ1,…,ξr;η1,…,ηs)\left(\xi_{1}, \ldots , \xi_{r} ; \eta_{1}, \ldots , \eta_{s}\right), которая была бы хороша вблизи ξi=…=ξr=ξ,η1=…=ηs=η\xi_{i}=\ldots = \xi_{r}=\xi , \eta_{1}=\ldots =\eta_{s}=\eta, где ξ\xi и η\eta неизвестны, если изменчивость ξ\xi и η\eta примерно одинакова.

(b)

Когда функция потерь имеет вид (4.17), определите функцию риска вашей оценки.

Задача 5.5.22

Первые доказательства минимаксности оценок Стейна (James and Stein 1961, Baranchik 1970) опирались на представление нецентрального χ2\chi^{2}-распределения в виде пуассоновской суммы центральных χ2\chi^{2}-распределений (TSH2, Задача 6.7). В частности, если χr2(λ)\chi_{r}^{2}(\lambda ) — нецентральная χ2\chi^{2}-случайная величина с параметром нецентральности λ\lambda, то

Eλ[h(χr2(λ))]=E[E[h(χr+2K2)∣K]] \mathbb {E}_{\lambda }\left[h\left(\chi _{r}^{2}(\lambda )\right)\right]=\mathbb {E}\left[\mathbb {E}\left[ h\left(\chi _{r+2 K}^{2}\right) \mid K \right]\right]

где K∼Poisson⁡(λ)K \sim \operatorname {Poisson}(\lambda ), а χr+2k2\chi_{r+2 k}^{2} — центральная χ2\chi^{2}-случайная величина с r+2kr+2 k степенями свободы. Используя это представление и свойства центрального χ2\chi^{2}-распределения, установите следующие тождества для X∼Nr(θ,I)X \sim N_{r}(\boldsymbol {\theta }, I) и λ=∣θ∣2\lambda =|\boldsymbol {\theta }|^{2}.

?
(a)

Eθ[x′θ∣X∣2]=∣θ∣2E[1χr+22(λ)]\mathbb {E}_{\theta }\left[\frac{\mathbf{x}^{\prime } \boldsymbol {\theta }}{|\mathbf{X}|^{2}}\right]=|\boldsymbol {\theta }|^{2} \mathbb {E}\left[\frac{1}{\chi_{r+2}^{2}(\lambda )}\right].

(b)

(r−2)E[1χr2(λ)]+∣θ∣2E[1χr+22(λ)]=1(r-2) \mathbb {E}\left[\frac{1}{\chi_{r}^{2}(\lambda )}\right]+|\boldsymbol {\theta }|^{2} \mathbb {E}\left[\frac{1}{\chi_{r+2}^{2}(\lambda )}\right]=1.

(c)

Для δ(x)=(1−c/∣x∣2)x\delta (\mathbf{x})=\left(1-c /|\mathbf{x}|^{2}\right) \mathbf{x}, используя тождества (a) и (b), покажите, что для L(θ,δ)=∣θ−δ∣2L(\boldsymbol {\theta }, \delta )= |\boldsymbol {\theta }-\delta |^{2}

R(θ,δ)=r+2c∣θ∣2E[1χr+22(λ)]−2c+c2E[1χr2(λ)]=r+2c[1−(r−2)E[1χr2(λ)]]−2c+c2E[1χr2(λ)] \begin{align} R(\boldsymbol {\theta }, \delta ) & =r+2 c|\boldsymbol {\theta }|^{2} \mathbb {E}\left[\frac{1}{\chi _{r+2}^{2}(\lambda )}\right]-2 c+c^{2} \mathbb {E}\left[\frac{1}{\chi _{r}^{2}(\lambda )}\right] \\ & =r+2 c\left[1-(r-2) \mathbb {E}\left[\frac{1}{\chi _{r}^{2}(\lambda )}\right]\right]-2 c+c^{2} \mathbb {E}\left[\frac{1}{\chi _{r}^{2}(\lambda )}\right] \end{align}

и, следовательно, что δ(x)\delta (\mathbf{x}) минимаксна, если 0≤c≤2(r−2)0 \leq c \leq 2(r-2).

Примечание.
?

См. Bock 1975 или Casella 1980 для дополнительных тождеств, включающих математические ожидания нецентрального χ2\chi^{2}.

Задача 5.5.23

Пусть χr2(λ)\chi_{r}^{2}(\lambda ) — χ2\chi^{2}-случайная величина с rr степенями свободы и параметром нецентральности λ\lambda.

?
(a)

Покажите, что E[1χr2(λ)]=E[E[1χr+2K2∣K]]=E[1r−2+2K]\mathbb {E}\left[\frac{1}{\chi_{r}^{2}(\lambda )}\right]=\mathbb {E}\left[\mathbb {E}\left[ \frac{1}{\chi_{r+2 K}^{2}} \mid K \right]\right]=\mathbb {E}\left[\frac{1}{r-2+2 K}\right], где K∼Poisson⁡(λ/2)K \sim \operatorname {Poisson}(\lambda / 2).

(b)

Установите (5.32).

Задача 5.5.24

По большей части функция риска оценки Стейна возрастает по мере удаления ∣θ∣\left|\boldsymbol {\theta }\right| от нуля (если ноль является целью сжатия). Чтобы гарантировать, что функция риска монотонно возрастает по ∣θ∣\left|\boldsymbol {\theta }\right| (то есть что в риске нет «провалов», как в минимаксных хвостовых оценках Berger (1976a)), требуется несколько более сильное предположение об оценке (Casella 1990). Пусть X∼Nr(θ,I)X \sim N_{r}(\boldsymbol {\theta }, I) и L(θ,δ)=∣θ−δ∣2L(\boldsymbol {\theta }, \delta )=|\boldsymbol {\theta }-\delta |^{2}, и рассмотрим оценку Стейна

δ(x)=(1−c(∣x∣2)(r−2)∣x∣2)x. \delta (\mathbf{x})=\left(1-c\left(|\mathbf{x}|^{2}\right) \frac{(r-2)}{|\mathbf{x}|^{2}}\right) \mathbf{x}.
?
(a)

Покажите, что если 0≤c(⋅)≤20 \leq c(\cdot ) \leq 2 и c(⋅)c(\cdot ) вогнута и дважды дифференцируема, то δ(x)\delta (\mathbf{x}) минимаксна.

(b)

При условиях пункта (a) функция риска δ(x)\delta (\mathbf{x}) не убывает по ∣θ∣\left|\boldsymbol {\theta }\right|.

Задача 5.5.25

В духе рассуждения Стейна о «больших rr и ∣θ∣\left|\boldsymbol {\theta }\right|», Casella and Hwang (1982) исследовали предельное отношение риска δJS(x)=(1−(r−2)/∣x∣2)x\delta^{J S}(\mathbf{x})=\left(1-(r-2) /|\mathbf{x}|^{2}\right) \mathbf{x} к риску x\mathbf{x}. Если X∼Nr(θ,I)X \sim N_{r}(\boldsymbol {\theta }, I) и L(θ,δ)=∣θ−δ∣2L(\boldsymbol {\theta }, \delta )=|\boldsymbol {\theta }-\delta |^{2}, они показали, что

lim⁡r→∞∣θ∣2r→cR(θ,δJS)R(θ,X)=cc+1. \lim _{\substack {r \rightarrow \infty \\ \frac{|\boldsymbol {\theta }|^{2}}{r} \rightarrow c}} \frac{R\left(\boldsymbol {\theta }, \delta ^{J S}\right)}{R(\boldsymbol {\theta }, \mathbf{X})}=\frac{c}{c+1}.

Чтобы установить этот предел, можно использовать следующие шаги.

?
(a)

Покажите, что R(θ,δJS)R(θ,x)=1−(r−2)2rEθ[1∣X∣2]\frac{R\left(\boldsymbol {\theta }, \delta^{J S}\right)}{R(\boldsymbol {\theta }, x)}=1-\frac{(r-2)^{2}}{r} \mathbb {E}_{\theta }\left[\frac{1}{|\mathbf{X}|^{2}}\right].

(b)

Покажите, что 1p−2+∣θ∣2≤Eθ[1∣X∣2]≤1p−2(pp+∣θ∣2)\frac{1}{p-2+|\boldsymbol {\theta }|^{2}} \leq \mathbb {E}_{\theta }\left[\frac{1}{|\mathbf{X}|^{2}}\right] \leq \frac{1}{p-2}\left(\frac{p}{p+|\boldsymbol {\theta }|^{2}}\right).

(c)

Покажите, что верхняя и нижняя границы отношения рисков имеют один и тот же предел.

§
Задача 5.6.1

Обращаясь к Примеру 6.1, эта задача устанавливает справедливость выражения (6.2) для риска оценки δL\delta^{L} из (6.1), используя рассуждение, аналогичное рассуждению в доказательстве Теоремы 5.7.

?
(a)

Покажите, что

\begin{align} R\left(\boldsymbol {\theta }, \delta ^{L}\right)= & \sum _{i} \mathbb {E}_{\theta }\left[(\theta _{i}-\delta _{i}^{L}(\mathbf{X}))^{2}\right] \\ = & \sum _{i} \mathbb {E}_{\theta }\left[\left\{ \left(\theta _{i}-X_{i}\right)^{2}+\frac{2 c(r-3)}{S}\left(\theta _{i}-X_{i}\right)\left(X_{i}-\overline{\mathbf{X}}\right)\right. \\ & \left.+\frac{[c(r-3)]^{2}}{S^{2}}\left(X_{i}-\overline{\mathbf{X}}\right)^{2}\right\} \right] \end{align}

где S=∑j(Xj−X‾)2S=\sum_{j}\left(X_{j}-\overline{\mathbf{X}}\right)^{2}.

(b)

Используя интегрирование по частям, покажите, что

Eθ[(θi−Xi)(Xi−X‾)S]=−Eθ[r−1rS+2(Xi−X‾)2S2]. \mathbb {E}_{\theta }\left[\frac{\left(\theta _{i}-X_{i}\right)\left(X_{i}-\overline{\mathbf{X}}\right)}{S}\right]=-\mathbb {E}_{\theta }\left[\frac{\frac{r-1}{r} S+2\left(X_{i}-\overline{\mathbf{X}}\right)^{2}}{S^{2}}\right].
(c)

Используйте результаты пунктов (a) и (b), чтобы установить (6.2).

Задача 5.6.2

В Примере 6.1 покажите, что:

?
(a)

Оценка δL\delta^{L} минимаксна, если r≥4r \geq 4 и c≤2c \leq 2.

(b)

Риск δL\delta^{L} бесконечен, если r≤3r \leq 3.

(c)

Минимальный риск равен 3/r3 / r и достигается при θ1=θ2=⋯=θ\theta_{1}=\theta_{2}=\cdots =\theta.

(d)

Оценка δL\delta^{L} доминируется по риску своей версией с положительной частью

δL+=xˉ1+(1−c(r−3)∣x−xˉ1∣2)+(x−xˉ1). \delta ^{L^{+}}=\bar{x} \mathbf{1}+\left(1-\frac{c(r-3)}{|\mathbf{x}-\bar{x} \mathbf{1}|^{2}}\right)^{+}(\mathbf{x}-\bar{x} \mathbf{1}).
Задача 5.6.3

В Примере 6.2:

?
(a)

Покажите, что kxk \mathbf{x} является MLE, если θ∈Lk\boldsymbol {\theta } \in \mathcal{L}_{k}.

(b)

Покажите, что δk(x)\delta^{k}(\mathbf{x}) из (6.8) минимаксна при квадратичной функции потерь.

(c)

Проверьте, что θi\theta_{i} вида (6.4) удовлетворяют T(T′T)−1T′θ=θT\left(T^{\prime } T\right)^{-1} T^{\prime } \boldsymbol {\theta }=\boldsymbol {\theta } для TT из (6.5), и постройте минимаксную оценку, сжимающуюся к этому подпространству.

Задача 5.6.4

Рассмотрим задачу оценивания среднего на основе X∼Nr(θ,I)X \sim N_{r}(\boldsymbol {\theta }, I), где предполагается, что θi=∑j=1sβjtij\theta_{i}=\sum_{j=1}^{s} \beta_{j} t_{i}^{j}, где (ti,…,tr)(t_{i}, \ldots , t_{r}) известны, (β1,…,βs)(\beta_{1}, \ldots , \beta_{s}) неизвестны, и r−s>2r-s>2.

?
(a)

Найдите MLE θ\boldsymbol {\theta }, скажем θ^R\hat{\boldsymbol {\theta }}_{R}, если предполагается, что θ\boldsymbol {\theta } лежит в линейном подпространстве

L={θ:∑j=1sβjtij=θi,i=1,…,r}. \mathcal{L}=\left\{ \boldsymbol {\theta }: \sum _{j=1}^{s} \beta _{j} t_{i}^{j}=\theta _{i}, \quad i=1, \ldots , r\right\} .
(b)

Покажите, что L\mathcal{L} можно записать в виде (6.7), и найдите KK.

(c)

Постройте оценку Стейна, сжимающуюся к MLE из пункта (a), и докажите, что она минимаксна.

Задача 5.6.5

Для ситуации из Примера 6.3:

?
(a)

Покажите, что δc(x,y)\delta^{c}(\mathbf{x}, \mathbf{y}) минимаксна, если 0≤c≤20 \leq c \leq 2.

(b)

Покажите, что если ξ=0\boldsymbol {\xi }=0, то R(θ,δ1)=1−σ2σ2+τ2r−2rR\left(\boldsymbol {\theta }, \delta^{1}\right)=1-\frac{\sigma^{2}}{\sigma^{2}+\tau^{2}} \frac{r-2}{r}, R(θ,δcomb )=1−σ2σ2+τ2R\left(\boldsymbol {\theta }, \delta^{\text{comb }}\right)=1-\frac{\sigma^{2}}{\sigma^{2}+\tau^{2}}, и, следовательно, R(θ,δ1)>R(θ,δcomb )R\left(\boldsymbol {\theta }, \delta^{1}\right)>R\left(\boldsymbol {\theta }, \delta^{\text{comb }}\right).

(c)

Для ξ≠0\boldsymbol {\xi } \neq 0 покажите, что R(θ,δcomb )=1−σ2σ2+τ2+∣ξ∣2σ2r(σ2+τ2)R\left(\boldsymbol {\theta }, \delta^{\text{comb }}\right)=1-\frac{\sigma^{2}}{\sigma^{2}+\tau^{2}}+\frac{|\boldsymbol {\xi }|^{2} \sigma^{2}}{r\left(\sigma^{2}+\tau^{2}\right)}, и, следовательно, риск неограничен при ∣ξ∣→∞\left|\boldsymbol {\xi }\right| \rightarrow \infty.

Задача 5.6.6

Оценку Green and Strawderman (1991) δc(x,y)\delta^{c}(\mathbf{x}, \mathbf{y}) можно получить как эмпирическую байесовскую оценку.

?
(a)

Для X∣θ∼Nr(θ,σ2I),Y∣θ,ξ∼Nr(θ+ξ,τ2I),ξ∼N(0,γ2I)X\left|\boldsymbol {\theta } \sim N_{r}\left(\boldsymbol {\theta }, \sigma^{2} I\right), Y\right| \boldsymbol {\theta }, \boldsymbol {\xi } \sim N_{r}\left(\boldsymbol {\theta }+\boldsymbol {\xi }, \tau^{2} I\right), \boldsymbol {\xi } \sim N\left(0, \gamma^{2} I\right), и θi∼\theta_{i} \sim Uniform (−∞,∞)(-\infty , \infty ), при известных σ2\sigma^{2} и τ2\tau^{2}, покажите, как получить δr−2(x,y)\delta^{r-2}(\mathbf{x}, \mathbf{y}) как эмпирическую байесовскую оценку.

(b)

Вычислите байесовскую оценку δπ\delta^{\pi } при квадратичной функции потерь.

(c)

Сравните r(π,δπ)r\left(\pi , \delta^{\pi }\right) и r(π,δr−2)r\left(\pi , \delta^{r-2}\right).

Задача 5.6.7

В Примере 6.4:

?
(a)

Проверьте функцию риска (6.13).

(b)

Проверьте, что при неизвестной σ2\sigma^{2} функция риска оценки (6.14) задаётся формулой (6.15).

(c)

Покажите, что минимальный риск оценки (6.14) равен 1−vv+2r−2r1-\frac{v}{v+2} \frac{r-2}{r}.

Задача 5.6.8

Для ситуации из Примера 6.4 аналогичная модификация оценки Lindley (6.1) имеет вид

δL=xˉ1+(1−r−3Σ(xi−xˉ)2/σ^2)(x−xˉ1), \delta ^{L}=\bar{x} \mathbf{1}+\left(1-\frac{r-3}{\Sigma \left(x_{i}-\bar{x}\right)^{2} / \hat{\sigma }^{2}}\right)(\mathbf{x}-\bar{x} \mathbf{1}),

где σ^2=S2/(v+2)\hat{\sigma }^{2}=S^{2} /(v+2) и S2/σ2∼χv2S^{2} / \sigma^{2} \sim \chi_{v}^{2}, независимо от X\mathbf{X}.

?
(a)

Покажите, что R(θ,δL)=1−vv+2(r−3)2rEθ[σ2Σ(xi−xˉ)2]R\left(\boldsymbol {\theta }, \delta^{L}\right)=1-\frac{v}{v+2} \frac{(r-3)^{2}}{r} \mathbb {E}_{\theta }\left[\frac{\sigma^{2}}{\Sigma \left(x_{i}-\bar{x}\right)^{2}}\right].

(b)

Покажите, что и δL\delta^{L}, и δ\delta из (6.14) можно улучшить, используя их версии с положительной частью.

Задача 5.6.9

Основное применение Примера 6.4 относится к ситуации

Yij∼N(θi,σ2),i=1,…,s,j=1,…,n, независимы  Y_{i j} \sim N\left(\theta _{i}, \sigma ^{2}\right), i=1, \ldots , s, j=1, \ldots , n, \text{ независимы }

с Yˉi=(1/n)ΣjYij\bar{Y}_{i}=(1 / n) \Sigma_{j} Y_{i j} и σ^2=Σij(Yij−Yˉi)2/s(n−1)\hat{\sigma }^{2}=\Sigma_{i j}\left(Y_{i j}-\bar{Y}_{i}\right)^{2} / s(n-1). Покажите, что оценка

δi=yˉ‾+(1−c(s−3)σ^2Σ(yˉi−yˉ‾)2)+(yˉi−yˉ‾) \delta _{i}=\overline{\bar{y}}+\left(1-c \frac{(s-3) \hat{\sigma }^{2}}{\Sigma \left(\bar{y}_{i}-\overline{\bar{y}}\right)^{2}}\right)^{+}\left(\bar{y}_{i}-\overline{\bar{y}}\right)

является минимаксной, где yˉ=Σijyij/sn\bar{y}=\Sigma_{i j} y_{i j} / s n, при условии 0≤c≤20 \leq c \leq 2.

?
Примечание.
?

Случай неравных объёмов выборок nin_{i} не охвачен тем, что было сделано до сих пор. См. Efron and Morris 1973b, Berger and Bock 1976 и Morris 1983 для подходов к этой задаче. Случай полностью неизвестной ковариационной матрицы рассматривается в Berger и др. (1977) и Gleser (1979,1986)(1979,1986).

Задача 5.6.10

Оценка Lindley с положительной частью из Задачи 6.9 имеет интересную интерпретацию в однофакторном дисперсионном анализе, в частности, применительно к обычно используемому критерию для проверки H0:θ1=θ2=⋯=θsH_{0}: \theta_{1}=\theta_{2}=\cdots =\theta_{s}. Эта гипотеза проверяется с помощью статистики

F=Σ(yˉi−yˉ‾)2/(s−1)Σ(yij−yˉi)2/s(n−1), F=\frac{\Sigma \left(\bar{y}_{i}-\overline{\bar{y}}\right)^{2} /(s-1)}{\Sigma \left(y_{i j}-\bar{y}_{i}\right)^{2} / s(n-1)},

которая при H0H_{0} имеет FF-распределение с s−1s-1 и s(n−1)s(n-1) степенями свободы.

?
(a)

Покажите, что оценку Lindley с положительной частью можно записать в виде

δi=yˉ‾+(1−cs−3s−11F)+(yˉi−yˉ‾). \delta _{i}=\overline{\bar{y}}+\left(1-c \frac{s-3}{s-1} \frac{1}{F}\right)^{+}\left(\bar{y}_{i}-\overline{\bar{y}}\right).
(b)

Нулевая гипотеза отвергается, если FF велико. Покажите, что это соответствует использованию MLE при H0H_{0}, если FF мало, и оценки Стейна, если FF велико.

(c)

Нулевая гипотеза отвергается на уровне α\alpha, если F>Fs−1,s(n−1),αF>F_{s-1, s(n-1), \alpha }. Для s=8s=8 и n=6n=6: каков уровень критерия, соответствующий выбору c=1c=1 — оптимальному по риску выбору?

(d)

Для тех же s=8s=8 и n=6n=6: каким значениям cc соответствует выбор α=.05\alpha =.05 или α=.01\alpha =.01 — типичных уровней α\alpha? Являются ли получающиеся оценки минимаксными?

Задача 5.6.11

Докажите следующее расширение Теоремы 5.5 на случай неизвестной дисперсии, принадлежащее Strawderman (1973).

Теорема 8.4. Пусть X∼Nr(θ,σ2I)X \sim N_{r}\left(\boldsymbol {\theta }, \sigma^{2} I\right) и S2/σ2∼χν2S^{2} / \sigma^{2} \sim \chi_{\nu }^{2}, независимо от XX. Оценка

δc(x)=(1−c(F,S2)S2r−2v+2)x, \delta ^{c}(\mathbf{x})=\left(1-\frac{c\left(F, S^{2}\right)}{S^{2}} \frac{r-2}{v+2}\right) \mathbf{x},

где F=Σxi2/S2F=\Sigma x_{i}^{2} / S^{2}, является минимаксной оценкой θ\boldsymbol {\theta }, если

  1. при каждом фиксированном S2S^{2} функция c(⋅,S2)c\left(\cdot , S^{2}\right) не убывает,

  2. при каждом фиксированном FF функция c(F,⋅)c(F, \cdot ) не возрастает,

  3. 0≤c(⋅,⋅)≤20 \leq c(\cdot , \cdot ) \leq 2.

?
Примечание.
?

Заметьте, что здесь функция потерь берётся масштабированной на σ2\sigma^{2}, L(θ,δ)=∣θ−δ∣2/σ2L(\boldsymbol {\theta }, \delta )=|\boldsymbol {\theta }-\delta |^{2} / \sigma^{2}, иначе минимаксный риск не был бы конечен. Strawderman (1973) далее вывел собственные байесовские минимаксные оценки в этом случае.

Задача 5.6.12

Для ситуации из Примера 6.5:

?
(a)

Покажите, что Eσ[1σ2]=E0[r−2∣x∣2]\mathbb {E}_{\sigma }\left[\frac{1}{\sigma^{2}}\right]=\mathbb {E}_{0}\left[\frac{r-2}{|\mathrm{x}|^{2}}\right].

(b)

Если 1/σ2∼χv2/v1 / \sigma^{2} \sim \chi_{v}^{2} / v, то f(∣x−θ∣)f(\left|\mathbf{x}-\boldsymbol {\theta }\right|) из (6.19) есть многомерное tt-распределение с vv степенями свободы, и E0[∣X∣−2]=(r−2)−1\mathbb {E}_{0}\left[|\mathbf{X}|^{-2}\right]=(r-2)^{-1}.

(c)

Если 1/σ2∼Y1 / \sigma^{2} \sim Y, где χv2/v\chi_{v}^{2} / v стохастически больше YY, то δ(x)\delta (\mathbf{x}) из (6.20) минимаксна для этой смеси при условии 0≤c≤2(r−2)0 \leq c \leq 2(r-2).

Задача 5.6.13

Докажите Лемму 6.2.

?
Задача 5.6.14

Для ситуации из Примера 6.7:

?
(a)

Проверьте, что оценка (6.25) минимаксна, если 0≤c≤20 \leq c \leq 2. (Применима Теорема 5.5.)

(b)

Обращаясь к (6.27), покажите, что

E[∣δπ(X)−δc(X)∣2I[∣X∣2≥c(r−2)(σ2+τ2)]]=σ4σ2+τ2E[1Y[Y−c(r−2)]2I[Y≥c(r−2)]] \begin{align} & \mathbb {E}\left[\left|\delta ^{\pi }(\mathbf{X})-\delta ^{c}(\mathbf{X})\right|^{2} I\left[|\mathbf{X}|^{2} \geq c(r-2)\left(\sigma ^{2}+\tau ^{2}\right)\right]\right] \\ & =\frac{\sigma ^{4}}{\sigma ^{2}+\tau ^{2}} \mathbb {E}\left[\frac{1}{Y}[Y-c(r-2)]^{2} I[Y \geq c(r-2)]\right] \end{align}

где Y∼χr2Y \sim \chi_{r}^{2}.

(c)

Если χv2\chi_{v}^{2} обозначает случайную величину хи-квадрат с vv степенями свободы, установите тождество

E[h(χv2)]=vE[h(χv+22)χv+22] \mathbb {E}\left[h\left(\chi _{v}^{2}\right)\right]=v \mathbb {E}\left[\frac{h\left(\chi _{v+2}^{2}\right)}{\chi _{v+2}^{2}}\right]

чтобы показать, что

r(π,δR)=r(π,δπ)+1r−2σ4σ2+τ2E[[Y−c(r−2)]2I[Y≥c(r−2)]] r\left(\pi , \delta ^{R}\right)=r\left(\pi , \delta ^{\pi }\right)+\frac{1}{r-2} \frac{\sigma ^{4}}{\sigma ^{2}+\tau ^{2}} \mathbb {E}\left[\left[Y-c(r-2)\right]^{2} I[Y \geq c(r-2)]\right]

где теперь Y∼χr−22Y \sim \chi_{r-2}^{2}.

(d)

Проверьте (6.29), тем самым показав, что r(π,δR)≤r(π,δc)r\left(\pi , \delta^{R}\right) \leq r\left(\pi , \delta^{c}\right).

(e)

Покажите, что E[(Y−a)2I(Y>a)]\mathbb {E}\left[(Y-a)^{2} I(Y>a)\right] является убывающей функцией от aa, и, следовательно, максимальное улучшение байесовского риска при сохранении минимаксности достигается при c=2c=2.

Задача 5.6.15

Для Xi∼Poisson⁡(λi)X_{i} \sim \operatorname {Poisson}\left(\lambda_{i}\right), i=1,…,ri=1, \ldots , r, независимых, и функции потерь L(λ,δ)=Σ(λi−δi)2/λiL(\lambda , \delta )= \Sigma \left(\lambda_{i}-\delta_{i}\right)^{2} / \lambda_{i}:

?
(a)

При каких значениях a,αa, \alpha и β\beta оценки из (4.6.29) минимаксны? Являются ли они также собственными байесовскими при этих значениях?

(b)

Пусть Λ=Σλi\Lambda =\Sigma \lambda_{i}, и определим θi=λi/Λ,i=1,…,r\theta_{i}=\lambda_{i} / \Lambda , i=1, \ldots , r. Для априорного распределения π(θ,Λ)=m(Λ)dΛ∏i=1rdθi\pi (\boldsymbol {\theta }, \Lambda )= m(\Lambda ) d \Lambda \prod_{i=1}^{r} d \theta_{i} покажите, что байесовская оценка равна

δπ(x)=ψπ(z)z+r−1x, \delta ^{\pi }(\mathbf{x})=\frac{\psi _{\pi }(z)}{z+r-1} \mathbf{x},

где z=Σxiz=\Sigma x_{i} и

ψπ(z)=∫Λze−Λm(Λ)dΛ∫Λz−1e−Λm(Λ)dΛ. \psi _{\pi }(z)=\frac{\int \Lambda ^{z} e^{-\Lambda } m(\Lambda ) d \Lambda }{\int \Lambda ^{z-1} e^{-\Lambda } m(\Lambda ) d \Lambda }.
(c)

Покажите, что выбор m(Λ)=1m(\Lambda )=1 даёт оценку δ(x)=[1−(r−1)/(z+r−1)]x\delta (\mathbf{x})=[1-(r-1) /(z+r-1)] \mathbf{x}, которая минимаксна.

(d)

Покажите, что выбор m(Λ)=(1+Λ)−β,1≤β≤r−1m(\Lambda )=(1+\Lambda )^{-\beta }, 1 \leq \beta \leq r-1, даёт оценку, которая является собственной байесовской минимаксной при r>2r>2.

(e)

Оценку из пункта (d) трудно вычислить. Однако для выбора априорного распределения

m(Λ)=∫0∞t−re−1/t(1+Λt)βdt,1≤β≤r−1, m(\Lambda )=\int _{0}^{\infty } \frac{t^{-r} e^{-1 / t}}{(1+\Lambda t)^{\beta }} d t, \quad 1 \leq \beta \leq r-1,

покажите, что обобщённая байесовская оценка равна

δπ(x)=zz+β+r−1x, \delta ^{\pi }(\mathbf{x})=\frac{z}{z+\beta +r-1} \mathbf{x},

и определите условия её минимаксности. Покажите, что она является собственной байесовской, если β>1\beta >1.

Задача 5.6.16

Пусть Xi∼binomial⁡(p,ni),i=1,…,rX_{i} \sim \operatorname {binomial}\left(p, n_{i}\right), i=1, \ldots , r, где nin_{i} неизвестны, а pp известно. Оцениваемый параметр — n=(n1,…,nr)\mathbf{n}=\left(n_{1}, \ldots , n_{r}\right) с функцией потерь

L(n,δ)=∑i=1r1ni(ni−δi)2. L(\mathbf{n}, \delta )=\sum _{i=1}^{r} \frac{1}{n_{i}}\left(n_{i}-\delta _{i}\right)^{2}.
?
(a)

Покажите, что обычная оценка x/p\mathbf{x} / p имеет постоянный риск r(1−p)/pr(1-p) / p.

(b)

Для r≥2r \geq 2 покажите, что оценка

δ(x)=(1−az+r−1)xp \delta (\mathbf{x})=\left(1-\frac{a}{z+r-1}\right) \frac{\mathbf{x}}{p}

доминирует над x/p\mathbf{x} / p по риску, где z=Σxiz=\Sigma x_{i} и 0<a<2(r−1)(1−p)0<a<2(r-1)(1-p).

(c)

Обобщите рассуждение из пункта (b) и найдите условия на функцию c(⋅)c(\cdot ) и константу bb, при которых

δ(x)=(1−c(z)z+b)xp \delta (\mathbf{x})=\left(1-\frac{c(z)}{z+b}\right) \frac{\mathbf{x}}{p}

доминирует над x/p\mathbf{x} / p по риску.

Доминирование над обычной оценкой n рассматривалось в работах Feldman and Fox (1968), Johnson (1987), а также Casella and Strawderman (1994). Задача оценивания n для биномиального распределения имеет ряд интересных практических приложений; см. Olkin и др. 1981, Carroll and Lombard 1985, Casella 1986. Хотя мы сделали нереалистичное предположение о том, что pp известно, эти результаты можно адаптировать к более практичному случаю неизвестного pp (подробности см. в Casella and Strawderman 1994).

Задача 5.6.17

Лемма 6.9 утверждает: пусть Xi,i=1,…,rX_{i}, i=1, \ldots , r, независимы с вероятностями pi(x∣θi)=ci(θi)hi(x)θixp_{i}(x \mid \theta_{i})=c_{i}(\theta_{i}) h_{i}(x) \theta_{i}^{x}, x=0,1,…x=0,1, \ldots, (6.36), то есть pi(x∣θi)p_{i}(x \mid \theta_{i}) принадлежит экспоненциальному семейству. Тогда для любой вещественнозначной функции g(x)g(x) с Eθ[∣g(X)∣]<∞\mathbb {E}_{\theta }\left[\left|g(X)\right|\right]<\infty и любого числа mm, для которого g(x)=0g(x)=0 при xi<mx_{i}<m, Eθ[θimg(X)]=Eθ[g(X−mei)hi(Xi−m)hi(Xi)]\mathbb {E}_{\theta }\left[\theta_{i}^{m} g(X)\right]=\mathbb {E}_{\theta }\left[g(X-m e_{i}) \dfrac {h_{i}(X_{i}-m)}{h_{i}(X_{i})}\right], где eie_{i} — единичный вектор, у которого ii-я координата равна 11, а остальные равны 00.

Теорема 6.10 утверждает: пусть X1,…,XrX_{1}, \ldots , X_{r} независимо распределены согласно (6.36), и пусть δ0(x)={hi(xi−1)/hi(xi)}\delta^{0}(x)=\left\{ h_{i}(x_{i}-1) / h_{i}(x_{i})\right\} (оценка, ii-я координата которой равна hi(xi−1)/hi(xi)h_{i}(x_{i}-1)/h_{i}(x_{i})) — UMVU-оценка θ\theta. Для функции потерь Lm(θ,δ)=∑i=1rθimi(θi−δi)2L_{m}(\theta , \delta )=\sum_{i=1}^{r} \theta_{i}^{m_{i}}(\theta_{i}-\delta_{i})^{2}, где m=(m1,…,mr)m=(m_{1}, \ldots , m_{r}) — известные числа, риск оценки δ(x)=δ0(x)+g(x)\delta (x)=\delta^{0}(x)+g(x) задаётся формулой R(θ,δ)=R(θ,δ0)+Eθ[D(x)]R(\theta , \delta )=R(\theta , \delta^{0})+\mathbb {E}_{\theta }\left[D(x)\right], где

D(x)=∑i=1r{2hi(xi−mi−1)hi(xi)[gi(x−miei−ei)−gi(x−miei)]+hi(xi−mi)hi(xi)gi2(x−miei)}. D(x)=\sum _{i=1}^{r}\left\{ \frac{2 h_{i}(x_{i}-m_{i}-1)}{h_{i}(x_{i})}\left[g_{i}(x-m_{i} e_{i}-e_{i})-g_{i}(x-m_{i} e_{i})\right]+\frac{h_{i}(x_{i}-m_{i})}{h_{i}(x_{i})} g_{i}^{2}(x-m_{i} e_{i})\right\} .
?
(a)

Докажите Лемму 6.9.

(b)

Докажите, что для X∼pi(x∣θ)X \sim p_{i}(x \mid \theta ), где pi(x∣θ)p_{i}(x \mid \theta ) задаётся формулой (6.36), δ0(x)=hi(x−1)/hi(x)\delta^{0}(x)=h_{i}(x- 1) / h_{i}(x) является UMVU-оценкой θ\theta (Roy and Mitra 1957).

(c)

Докажите Теорему 6.10.

Задача 5.6.18

Для ситуации Примера 6.11:

?
(a)

Установите, что x+g(x)\mathbf{x}+g(\mathbf{x}), где g(x)g(\mathbf{x}) задаётся формулой (6.42), удовлетворяет D(x)≤0\mathcal{D}(\mathbf{x}) \leq 0 для функции потерь L0(θ,δ)L_{0}(\boldsymbol {\theta }, \delta ) из (6.38), и, следовательно, доминирует над x\mathbf{x} по риску.

(b)

Выведите D(x)\mathcal{D}(\mathbf{x}) для независимых Xi∼Poisson⁡(λi)X_{i} \sim \operatorname {Poisson}\left(\lambda_{i}\right) и функции потерь L−1(λ,δ)L_{-1}(\lambda , \delta ) из (6.38). Покажите, что x+g(x)\mathbf{x}+g(\mathbf{x}) для g(x)g(\mathbf{x}), заданной формулой (6.43), удовлетворяет D(x)≤0\mathcal{D}(\mathbf{x}) \leq 0 и, следовательно, является минимаксной оценкой λ\lambda.

Задача 5.6.19

Для ситуации Примера 6.12:

?
(a)

Покажите, что оценка δ0(x)+g(x)\delta_{0}(\mathbf{x})+g(\mathbf{x}), для g(x)g(\mathbf{x}) из (6.45), доминирует над δ0\delta^{0} по риску при функции потерь L−1(θ,δ)L_{-1}(\boldsymbol {\theta }, \delta ) из (6.38), установив, что D(x)≤0\mathcal{D}(\mathbf{x}) \leq 0.

(b)

Для функции потерь L0(θ,δ)L_{0}(\boldsymbol {\theta }, \delta ) из (6.38) покажите, что оценка δ0(x)+g(x)\delta^{0}(\mathbf{x})+g(\mathbf{x}), где

gi(x)=c(x)ki(xi)∑j=1r[kj2(xj)+(1+tj2)kj(xj)], g_{i}(\mathbf{x})=\frac{c(\mathbf{x}) k_{i}\left(x_{i}\right)}{\sum _{j=1}^{r}\left[k_{j}^{2}\left(x_{j}\right)+\left(\frac{1+t_{j}}{2}\right) k_{j}\left(x_{j}\right)\right]},

с ki(x)=Σℓ=1x(ti−1+ℓ)/ℓk_{i}(x)=\Sigma_{\ell =1}^{x}\left(t_{i}-1+\ell \right) / \ell и неубывающей c(⋅)c(\cdot ), где 0≤c(⋅)≤2[(#xis>1)−2]0 \leq c(\cdot ) \leq 2\left[\left(\# x_{i} s>1\right)-2\right], обладает свойством D(x)≤0\mathcal{D}(\mathbf{x}) \leq 0 и, следовательно, доминирует над δ0(x)\delta^{0}(\mathbf{x}) по риску.

Задача 5.6.20

В Примере 6.12 мы видели улучшенные оценки вероятности успеха для отрицательных биномиальных распределений. Аналогичные результаты справедливы для оценивания средних отрицательных биномиальных распределений, с некоторыми дополнительными интересными особенностями. Пусть X1,…,XrX_{1}, \ldots , X_{r} — независимые отрицательные биномиальные случайные величины с функцией вероятности (6.44), и предположим, что мы хотим оценить μ={μi}\mu =\left\{ \mu_{i}\right\}, где μi=tiθi/(1−θi)\mu_{i}=t_{i} \theta_{i} /\left(1-\theta_{i}\right) — среднее ii-го распределения, используя функцию потерь L(μ,δ)=Σ(μi−δi)2/μiL(\mu , \delta )=\Sigma \left(\mu_{i}-\delta_{i}\right)^{2} / \mu_{i}.

?
(a)

Покажите, что MLE для μ\mu есть XX, и что риск оценки δ(x)=x+g(x)\delta (\mathbf{x})=\mathbf{x}+g(\mathbf{x}) можно записать в виде

R(μ,δ)=R(μ,X)+Eμ[D1(X)+D2(X)] R(\mu , \delta )=R(\mu , \mathbf{X})+\mathbb {E}_{\mu }\left[\mathcal{D}_{1}(\mathbf{X})+\mathcal{D}_{2}(\mathbf{X})\right]

где

D1(x)=∑i=1r{2[gi(x+ei)−gi(x)]+gi2(x+ei)xi+1} \mathcal{D}_{1}(\mathbf{x})=\sum _{i=1}^{r}\left\{ 2\left[g_{i}\left(\mathbf{x}+e_{i}\right)-g_{i}(\mathbf{x})\right]+\frac{g_{i}^{2}\left(\mathbf{x}+e_{i}\right)}{x_{i}+1}\right\}

и

D2(x)=∑i=1r{2xiti[gi(x+ei)−gi(x)]+gi2(x+ei)ti[xixi+1−1]} \begin{align} \mathcal{D}_{2}(\mathbf{x})= & \sum _{i=1}^{r}\left\{ 2 \frac{x_{i}}{t_{i}}\left[g_{i}\left(\mathbf{x}+e_{i}\right)-g_{i}(\mathbf{x})\right]\right. \\ & \left.+\frac{g_{i}^{2}\left(\mathbf{x}+e_{i}\right)}{t_{i}}\left[\frac{x_{i}}{x_{i+1}}-1\right]\right\} \end{align}

так что достаточным условием доминирования над MLE является D1(x)+D2(x)≤0\mathcal{D}_{1}(\mathbf{x})+\mathcal{D}_{2}(\mathbf{x}) \leq 0 для всех x\mathbf{x}.

(b)

Покажите, что если XiX_{i} имеют распределение Poisson⁡(θi)\operatorname {Poisson}\left(\theta_{i}\right) (вместо отрицательного биномиального), то D2(x)=0\mathcal{D}_{2}(\mathbf{x})=0. Таким образом, любая оценка, доминирующая над MLE в отрицательном биномиальном случае, также доминирует над MLE в пуассоновском случае.

(c)

Покажите, что оценка Клевенсона—Зидека

δcz(x)=(1−c(r−1)Σxi+r−1)x \delta _{c z}(\mathbf{x})=\left(1-\frac{c(r-1)}{\Sigma x_{i}+r-1}\right) \mathbf{x}

удовлетворяет D1(x)≤0\mathcal{D}_{1}(\mathbf{x}) \leq 0 и D2(x)≤0\mathcal{D}_{2}(\mathbf{x}) \leq 0 и, следовательно, доминирует над MLE как в пуассоновской, так и в отрицательной биномиальной модели.

Это свойство робастности оценок Клевенсона—Зидека было открыто Tsui (1984) и справедливо для более общих форм оценки. Tsui (1984,1986)(1984,1986) также исследует другие оценки средних пуассоновского и отрицательного биномиального распределений и их свойства робастности.

§
Задача 5.7.1

Установите утверждение, сделанное в Примере 7.2. Пусть X1X_{1} и X2X_{2} — независимые случайные величины, Xi∼N(θi,1)X_{i} \sim N\left(\theta_{i}, 1\right), и пусть L((θ1,θ2),δ)=(θ1−δ)2L\left(\left(\theta_{1}, \theta_{2}\right), \delta \right)=\left(\theta_{1}-\delta \right)^{2}. Покажите, что δ=sign⁡(X2)\delta =\operatorname {sign}\left(X_{2}\right) является допустимой оценкой θ1\theta_{1}, несмотря на то что её распределение не зависит от θ1\theta_{1}.

?
Задача 5.7.2

Efron and Morris (1973a) приводят следующий вывод положительной части оценки Стейна как усечённой байесовской оценки. Для X∼Nr(θ,σ2I),r≥3X \sim N_{r}\left(\boldsymbol {\theta }, \sigma^{2} I\right), r \geq 3, и θ∼N(0,τ2I)\boldsymbol {\theta } \sim N\left(0, \tau^{2} I\right), где σ2\sigma^{2} известно, а τ2\tau^{2} неизвестно, определим t=σ2/(σ2+τ2)t=\sigma^{2} /\left(\sigma^{2}+\tau^{2}\right) и зададим на tt априорное распределение h(t),0<t<1h(t), 0<t<1.

?
(a)

Покажите, что байесовская оценка относительно квадратичной функции потерь задаётся формулой E[θ∣x]=[1−E[t∣x]]x\mathbb {E}\left[\boldsymbol {\theta } \mid \mathbf{x}\right]= [1-\mathbb {E}\left[t \mid \mathbf{x}\right]] \mathbf{x}, где

π(t∣x)=tr/2e−t∣x∣2/2h(t)∫01tr/2e−t∣x∣2/2h(t)dt \pi (t \mid \mathbf{x})=\frac{t^{r / 2} e^{-t|\mathbf{x}|^{2} / 2} h(t)}{\int _{0}^{1} t^{r / 2} e^{-t|\mathbf{x}|^{2} / 2} h(t) d t}
(b)

Среди оценок вида δτ(x)=(1−τ(∣x∣2)r−2∣x∣2)x\delta^{\tau }(\mathbf{x})=\left(1-\tau \left(|\mathbf{x}|^{2}\right) \frac{r-2}{|\mathbf{x}|^{2}}\right) \mathbf{x} оценка, удовлетворяющая условиям

  1. τ(⋅)\tau (\cdot ) не убывает,

  2. τ(⋅)≤c\tau (\cdot ) \leq c,

  3. δτ\delta^{\tau } минимизирует байесовский риск относительно h(t)h(t) имеет вид τ(∣x∣2)=τ∗(∣x∣2)=min⁡{c,∣x∣2r−2E[t∣x]}\tau \left(|\mathbf{x}|^{2}\right)=\tau^{*}\left(|\mathbf{x}|^{2}\right)=\min \left\{ c, \frac{|\mathbf{x}|^{2}}{r-2} \mathbb {E}\left[t \mid \mathbf{x}\right]\right\}. (Это усечённая байесовская оценка, и она минимаксна, если c≤2c \leq 2.)

(c)

Покажите, что если h(t)h(t) сосредоточивает всю массу в точке t=1t=1, то

τ∗(∣x∣2)=min⁡{c,∣x∣2r−2} \tau ^{*}\left(|\mathbf{x}|^{2}\right)=\min \left\{ c, \frac{|\mathbf{x}|^{2}}{r-2}\right\}

и результирующая усечённая байесовская оценка является оценкой положительной части.

Задача 5.7.3

Лемма 7.5 утверждает: (i) если CC — класс всех (включая рандомизированные) оценок, основанных на достаточной статистике, то CC существенно полон; (ii) если функция потерь L(θ,d)L(\theta , d) выпукла по dd, то класс нерандомизированных оценок полон. Эти результаты являются непосредственными следствиями Теоремы 1.6.1 и Следствия 1.7.9.

Заполните детали доказательства Леммы 7.5.

?
Задача 5.7.4

Для ситуации Примера 7.8 покажите, что если δ0\delta_{0} — произвольная оценка θ\theta, то класс всех оценок с δ(x)<δ0(x)\delta (x)<\delta_{0}(x) при некотором xx полон.

?
Задача 5.7.5

Задача принятия решений называется монотонной (по определению Karlin and Rubin 1956; см. также Brown, Cohen and Strawderman 1976 и Berger 1985, Раздел 8.4), если функция потерь L(θ,δ)L(\theta , \delta ) при каждом θ\theta минимизируется при δ=θ\delta =\theta и является возрастающей функцией от ∣δ−θ∣\left|\delta -\theta \right|. Оценка δ\delta называется монотонной, если она является неубывающей функцией от xx.

?
(a)

Покажите, что если L(θ,δ)L(\theta , \delta ) выпукла, то монотонные оценки образуют полный класс.

(b)

Если δ(x)\delta (x) не монотонна, покажите, что монотонная оценка δ′\delta^{\prime }, неявно определённая соотношением

Pt(δ′(X)≤t)=Pt(δ(X)≤t) для каждого t \mathbb {P}_{t}\left(\delta ^{\prime }(X) \leq t\right)=\mathbb {P}_{t}\left(\delta (X) \leq t\right) \quad \text{ для каждого } t

удовлетворяет R(θ,δ′)≤R(θ,δ)R\left(\theta , \delta^{\prime }\right) \leq R(\theta , \delta ) для всех θ\theta.

(c)

Если X∼N(θ,1)X \sim N(\theta , 1) и L(θ,δ)=(θ−δ)2L(\theta , \delta )=(\theta -\delta )^{2}, постройте монотонную оценку, которая доминирует над

δa(x)={−2a−x если x<−ax если ∣x∣≤a2a−x если x>a. \delta ^{a}(x)= \begin{cases} -2 a-x & \text{ если } x<-a \\ x & \text{ если }\left|x\right| \leq a \\ 2 a-x & \text{ если } x>a.\end{cases}
Задача 5.7.6

Покажите, что в следующих задачах оценивания все функции риска непрерывны.

?
(a)

Оцените θ\theta с L(θ,δ(x))=[θ−δ(x)]2,X∼N(θ,1)L(\theta , \delta (x))=[\theta -\delta (x)]^{2}, X \sim N(\theta , 1).

(b)

Оцените θ\theta с L(θ,δ(x))=∣θ−δ(x)∣2,X∼Nr(θ,I)L(\theta , \delta (\mathbf{x}))=|\theta -\delta (\mathbf{x})|^{2}, X \sim N_{r}(\theta , I).

(c)

Оцените λ\lambda с L(λ,δ(x))=∑i=1rλi−m(λi−δi(x))2,Xi∼Poisson⁡(λi)L(\lambda , \delta (\mathbf{x}))=\sum_{i=1}^{r} \lambda_{i}^{-m}\left(\lambda_{i}-\delta_{i}(\mathbf{x})\right)^{2}, X_{i} \sim \operatorname {Poisson}\left(\lambda_{i}\right), независимые.

(d)

Оцените β\beta с L(β,δ(x))=∑i=1rβi−m(βi−δi(x))2,Xi∼Gamma⁡(αi,βi)L(\beta , \delta (\mathbf{x}))=\sum_{i=1}^{r} \beta_{i}^{-m}\left(\beta_{i}-\delta_{i}(\mathbf{x})\right)^{2}, X_{i} \sim \operatorname {Gamma}\left(\alpha_{i}, \beta_{i}\right), независимые, αi\alpha_{i} известны.

Задача 5.7.7

Докажите следующую теорему, которая даёт достаточные условия непрерывности функций риска оценок.

Теорема 8.5 (Ferguson 1967, Теорема 3.7.1) Рассмотрим оценивание θ\theta с функцией потерь L(θ,δ)L(\theta , \delta ), где X∼f(x∣θ)X \sim f(x \mid \theta ). Предположим, что

  1. функция потерь L(θ,δ)L(\theta , \delta ) ограничена и непрерывна по θ\theta равномерно по δ\delta (так что lim⁡θ→θ0sup⁡δ∣L(θ,δ)−L(θ0,δ)∣=0)\left.\lim_{\theta \rightarrow \theta_{0}} \sup_{\delta }\left|L(\theta , \delta )-L\left(\theta_{0}, \delta \right)\right|=0\right);

  2. для любой ограниченной функции φ,∫φ(x)f(x∣θ)dμ(x)\varphi , \int \varphi (x) f(x \mid \theta ) d \mu (x) непрерывен по θ\theta.

Тогда функция риска R(θ,δ)=Eθ[L(θ,δ)]R(\theta , \delta )=\mathbb {E}_{\theta }\left[L(\theta , \delta )\right] непрерывна по θ\theta.

?
Задача 5.7.8

Ссылаясь на Теорему 8.5, покажите, что условие (iii) выполнено для

?
(a)

экспоненциального семейства,

(b)

непрерывных плотностей, в которых θ\theta — одномерный параметр сдвига или масштаба.

Задача 5.7.9

Семейство функций F\mathcal{F} называется равностепенно непрерывным в точке x0x_{0}, если для любого ε>0\varepsilon >0 найдётся δ\delta такое, что ∣f(x)−f(x0)∣<ε\left|f(x)-f\left(x_{0}\right)\right|<\varepsilon для всех ∣x−x0∣<δ\left|x-x_{0}\right|<\delta и всех f∈Ff \in \mathcal{F}. (Одно и то же δ\delta подходит для всех ff.) Семейство равностепенно непрерывно, если оно равностепенно непрерывно в каждой точке x0x_{0}.

Теорема 8.6 (сообщено LL. Gajek) Рассмотрим оценивание θ\theta с функцией потерь L(θ,δ)L(\theta , \delta ), где X∼f(x∣θ)X \sim f(x \mid \theta ) непрерывна по θ\theta при каждом xx. Если

  1. Семейство L(θ,δ(x))L(\theta , \delta (x)) равностепенно непрерывно по θ\theta при каждом δ\delta.

  2. Для всех θ,θ′∈Ω\theta , \theta^{\prime } \in \Omega,

    sup⁡xf(x∣θ′)f(x∣θ)<∞. \sup _{x} \frac{f\left(x \mid \theta ^{\prime }\right)}{f(x \mid \theta )}<\infty .

Тогда любая конечнозначная функция риска R(θ,δ)=Eθ[L(θ,δ)]R(\theta , \delta )=\mathbb {E}_{\theta }\left[L(\theta , \delta )\right] непрерывна по θ\theta и, следовательно, оценки с конечным, непрерывным риском образуют полный класс.

?
(a)

Докажите Теорему 8.6.

(b)

Приведите пример равностепенно непрерывного семейства функций потерь.

Задача 5.7.10

Ссылаясь на Теорему 7.11, эта задача показывает, что предположение о непрерывности f(x∣θ)f(x \mid \theta ) по θ\theta нельзя ослабить. Рассмотрим плотность f(x∣θ)f(x \mid \theta ), равную N(θ,1)N(\theta , 1) при θ≤0\theta \leq 0 и N(θ+1,1)N(\theta +1,1) при θ>0\theta >0.

?
(a)

Покажите, что эта плотность обладает монотонным отношением правдоподобия, но не является непрерывной по θ\theta.

(b)

Покажите, что существует ограниченная непрерывная функция потерь L(θ−δ)L(\theta -\delta ), для которой риск R(θ,X)R(\theta , X) разрывен.

Задача 5.7.11

Для X∼f(x∣θ)\mathbf{X} \sim f(\mathbf{x} \mid \theta ) и функции потерь L(θ,δ)=∑i=1rθim(θi−δi)2L(\theta , \delta )=\sum_{i=1}^{r} \theta_{i}^{m}\left(\theta_{i}-\delta_{i}\right)^{2} покажите, что условие (iii) Теоремы 7.11 выполнено.

?
Задача 5.7.12

Докажите следующую (эквивалентную) версию метода Блайта (Теорема 7.13).

Теорема 8.7 Предположим, что параметрическое пространство Ω∈ℜr\Omega \in \Re^{r} открыто, и оценки с непрерывным риском образуют полный класс. Пусть δ\delta — оценка с непрерывной функцией риска, и пусть {πn}\left\{ \pi_{n}\right\} — последовательность (возможно, несобственных) априорных мер, таких что

  1. r(πn,δ)<∞r\left(\pi_{n}, \delta \right)<\infty для всех nn,

  2. для любого непустого открытого множества Θ0∈Ω\Theta_{0} \in \Omega,

    r(πn,δ)−r(πn,δπn)∫Θ0πn(θ)dθ→0 при n→∞. \frac{r\left(\pi _{n}, \delta \right)-r\left(\pi _{n}, \delta ^{\pi _{n}}\right)}{\int _{\Theta _{0}} \pi _{n}(\theta ) d \theta } \rightarrow 0 \quad \text{ при } n \rightarrow \infty .

    Тогда δ\delta — допустимая оценка.

?
Задача 5.7.13

Заполните некоторые из пробелов в Примере 7.14:

  1. Проверьте выражения для апостериорных ожидаемых потерь δ0\delta^{0} и δπ\delta^{\pi } в (7.7).

  2. Покажите, что нормированные бета-априорные распределения не удовлетворяют условию (b) Теоремы 7.13, а затем проверьте (7.9).

  3. Покажите, что маргинальное распределение XX задаётся формулой (7.10).

  4. Покажите, что

    ∑x=1∞D(x)≤max⁡{a2,b2}∑x=1∞1x2→0 \sum _{x=1}^{\infty } D(x) \leq \max \left\{ a^{2}, b^{2}\right\} \sum _{x=1}^{\infty } \frac{1}{x^{2}} \rightarrow 0

    и, следовательно, δ0\delta^{0} допустима.

?
Задача 5.7.14

Пусть X∼Poisson⁡(λ)X \sim \operatorname {Poisson}(\lambda ). Используя метод Блайта, покажите, что δ0=X\delta^{0}=X является допустимой оценкой λ\lambda при функции потерь L(λ,δ)=(λ−δ)2L(\lambda , \delta )=(\lambda -\delta )^{2}, выполнив следующие шаги:

?
(a)

Покажите, что ненормированные гамма-априорные распределения πn(λ)=λa−1e−λ/n\pi_{n}(\lambda )=\lambda^{a-1} e^{-\lambda / n} удовлетворяют условию (b) Теоремы 7.13, проверив, что для любого cc

lim⁡n→∞∫0cπn(λ)dλ= постоянная.  \lim _{n \rightarrow \infty } \int _{0}^{c} \pi _{n}(\lambda ) d \lambda =\text{ постоянная. }

Также покажите, что нормированные гамма-априорные распределения не подходят.

(b)

Покажите, что при априорных распределениях πn(λ)\pi_{n}(\lambda ) байесовские риски δ0\delta^{0} и байесовской оценки δπn′\delta^{\pi_{n}^{\prime }} задаются формулами

r(πn′,δ0)=naΓ(a),r(πn′,δπn′)=nn+1naΓ(a). \begin{align} r\left(\pi _{n}^{\prime }, \delta ^{0}\right) & =n^{a} \Gamma (a), \\ r\left(\pi _{n}^{\prime }, \delta ^{\pi _{n}^{\prime }}\right) & =\frac{n}{n+1} n^{a} \Gamma (a). \end{align}
(c)

Разность рисков равна

r(πn′,δ0)−r(πn′,δπn′)=Γ(a)na(1−nn+1), r\left(\pi _{n}^{\prime }, \delta ^{0}\right)-r\left(\pi _{n}^{\prime }, \delta ^{\pi _{n}^{\prime }}\right)=\Gamma (a) n^{a}\left(1-\frac{n}{n+1}\right),

которая при фиксированном a>0a>0 стремится к бесконечности при n→∞n \rightarrow \infty (Увы!). Однако покажите, что если выбрать a=a(n)=1/na=a(n)=1 / \sqrt{n}, то Γ(a)na(1−nn+1)→0\Gamma (a) n^{a}\left(1-\frac{n}{n+1}\right) \rightarrow 0 при n→∞n \rightarrow \infty. Таким образом, разность рисков стремится к нулю.

(d)

К сожалению, нам придётся вернуться и проверить условие (b) Теоремы 7.13 для последовательности априорных распределений с a=1/na=1 / \sqrt{n}, поскольку пункт (a) более неприменим. Сделайте это и заключите, что δ0(x)=x\delta^{0}(x)=x является допустимой оценкой λ\lambda.

(Напомним, что мы уже рассматривали допустимость δ0=X\delta^{0}=X в Следствиях 2.18 и 2.20, где было показано, что δ0\delta^{0} допустима.)

Задача 5.7.15

Используя метод Блайта, установите допустимость в следующих ситуациях.

?
(a)

Если X∼Gamma⁡(α,β)X \sim \operatorname {Gamma}(\alpha , \beta ), α\alpha известно, то x/αx / \alpha является допустимой оценкой β\beta при функции потерь L(β,δ)=(β−δ)2/β2L(\beta , \delta )=(\beta -\delta )^{2} / \beta^{2}.

(b)

Если X∼X \sim Negative binomial⁡(k,p)\operatorname {binomial}(k, p), то XX является допустимой оценкой μ=k(1−p)/p\mu =k(1- p) / p при функции потерь L(μ,δ)=(μ−δ)2/(μ+1kμ2)L(\mu , \delta )=(\mu -\delta )^{2} /\left(\mu +\frac{1}{k} \mu^{2}\right).

Задача 5.7.16

Покажите, что в общем случае, если δπ\delta^{\pi } — байесовская оценка при квадратичной функции потерь, то

r(π,δπ)−r(π,δg)=E[∣δπ(X)−δg(X)∣2], r\left(\pi , \delta ^{\pi }\right)-r\left(\pi , \delta ^{g}\right)=\mathbb {E}\left[\left|\delta ^{\pi }(\mathbf{X})-\delta ^{g}(\mathbf{X})\right|^{2}\right],

тем самым устанавливая (7.13).

  1. Докажите (7.15).

  2. Используя (7.15), докажите допустимость XX в одномерном случае.

?
Задача 5.7.17

Тождество (7.14) можно установить другим способом. Для ситуации Примера 7.18 покажите, что

r(π,δg)=r−2∫[∇log⁡mπ(x)][∇log⁡mg(x)]mπ(x)dx+∫∣∇log⁡mg(x)∣2mπ(x)dx \begin{align} r\left(\pi , \delta ^{g}\right)= & r-2 \int \left[\nabla \log m_{\pi }(\mathbf{x})\right]\left[\nabla \log m_{g}(\mathbf{x})\right] m_{\pi }(\mathbf{x}) d \mathbf{x} \\ & +\int \left|\nabla \log m_{g}(\mathbf{x})\right|^{2} m_{\pi }(\mathbf{x}) d \mathbf{x} \end{align}

откуда следует

r(π,δπ)=r−∫∣∇log⁡mπ(x)∣2mπ(x)dx r\left(\pi , \delta ^{\pi }\right)=r-\int \left|\nabla \log m_{\pi }(\mathbf{x})\right|^{2} m_{\pi }(\mathbf{x}) d \mathbf{x}

и, следовательно, выведите (7.14).

?
Задача 5.7.18

Теорема 7.19 утверждает: пусть X∼Nr(θ,I)X \sim N_{r}(\theta , I) и L(θ,δ)=∣θ−δ∣2L(\theta , \delta )=|\theta -\delta |^{2}. Пусть δg(x)=x+∇log⁡mg(x)\delta^{g}(\mathbf{x})=\mathbf{x}+\nabla \log m_{g}(\mathbf{x}), где mg(x)=∫f(x∣θ)g(θ)dθm_{g}(\mathbf{x})=\int f(\mathbf{x} \mid \boldsymbol {\theta }) g(\boldsymbol {\theta }) d \boldsymbol {\theta }. Предположим, что g(⋅)g(\cdot ) удовлетворяет

(a) ∫{θ:∣θ∣>1}g(θ)∣θ∣2[max⁡{log⁡∣θ∣,log⁡2}]2dθ<∞\displaystyle \int_{\left\{ \boldsymbol {\theta }:\left|\boldsymbol {\theta }\right|>1\right\} } \frac{g(\boldsymbol {\theta })}{|\boldsymbol {\theta }|^{2}} \left[\max \left\{ \log \left|\boldsymbol {\theta }\right|, \log 2\right\} \right]^{2} d \boldsymbol {\theta }<\infty,

(b) ∫∣∇g(θ)∣2g(θ)dθ<∞\displaystyle \int \frac{|\nabla g(\boldsymbol {\theta })|^{2}}{g(\boldsymbol {\theta })} d \boldsymbol {\theta }<\infty,

(c) sup⁡{R(θ,δg):θ∈K}<∞\sup \left\{ R(\boldsymbol {\theta }, \delta^{g}): \boldsymbol {\theta } \in K\right\} <\infty для всех компактных множеств KK. Тогда δg(x)\delta^{g}(\mathbf{x}) допустима. Доказательство проводится с помощью последовательности априорных распределений gn(θ)→g(θ)g_{n}(\boldsymbol {\theta }) \rightarrow g(\boldsymbol {\theta }), где gn(θ)=hn2(θ)g(θ)g_{n}(\boldsymbol {\theta })=h_{n}^{2}(\boldsymbol {\theta }) g(\boldsymbol {\theta }) и

hn(θ)={1 если ∣θ∣≤11−log⁡(∣θ∣)log⁡(n) если 1<∣θ∣≤n0 если ∣θ∣>n h_{n}(\boldsymbol {\theta })= \begin{cases} 1 & \text{ если }|\boldsymbol {\theta }| \leq 1 \\ 1-\dfrac {\log (|\boldsymbol {\theta }|)}{\log (n)} & \text{ если } 1<|\boldsymbol {\theta }| \leq n \\ 0 & \text{ если }|\boldsymbol {\theta }|>n\end{cases}

для n=2,3,…n=2,3, \ldots.

Эта задача намечает рассуждение, необходимое для доказательства Теоремы 7.19:

?
(a)

Покажите, что ∇mg(x)=m∇g(x)\nabla m_{g}(\mathbf{x})=m_{\nabla g}(\mathbf{x}), то есть

∇∫g(θ)e−∣x−θ∣2dθ=∫[∇g(θ)]e−∣x−θ∣2dθ \nabla \int g(\boldsymbol {\theta }) e^{-|\mathbf{x}-\boldsymbol {\theta }|^{2}} d \boldsymbol {\theta }=\int [\nabla g(\boldsymbol {\theta })] e^{-|\mathbf{x}-\boldsymbol {\theta }|^{2}} d \boldsymbol {\theta }
(b)

Используя пункт (a), покажите, что

r(π,δg)−r(gn,δgn)=∫∣∇log⁡mg(x)−∇log⁡mgn(x)∣2mgn(x)dx=∫∣∇mg(x)mg(x)−∇mgn(x)mgn(x)∣2mgn(x)dx≤2∫∣∇mg(x)mg(x)−mhn2∇g(x)mgn(x)∣2mgn(x)dx+2∫∣mg∇hn2(x)mgn(x)∣2mgn(x)dx=Bn+An \begin{align} r\left(\pi , \delta ^{g}\right)-r\left(g_{n}, \delta ^{g_{n}}\right)= & \int \left|\nabla \log m_{g}(\mathbf{x})-\nabla \log m_{g_{n}}(\mathbf{x})\right|^{2} m_{g_{n}}(\mathbf{x}) d \mathbf{x} \\ = & \int \left|\frac{\nabla m_{g}(\mathbf{x})}{m_{g}(\mathbf{x})}-\frac{\nabla m_{g_{n}}(\mathbf{x})}{m_{g_{n}}(\mathbf{x})}\right|^{2} m_{g_{n}}(\mathbf{x}) d \mathbf{x} \\ \leq & 2 \int \left|\frac{\nabla m_{g}(\mathbf{x})}{m_{g}(\mathbf{x})}-\frac{m_{h_{n}^{2} \nabla _{g}}(\mathbf{x})}{m_{g_{n}}(\mathbf{x})}\right|^{2} m_{g_{n}}(\mathbf{x}) d \mathbf{x} \\ & \quad +2 \int \left|\frac{m_{g \nabla h_{n}^{2}}(\mathbf{x})}{m_{g_{n}}(\mathbf{x})}\right|^{2} m_{g_{n}}(\mathbf{x}) d \mathbf{x} \\ = & B_{n}+A_{n} \end{align}
(c)

Покажите, что

An=4∫∣mghn∇hn(x)mghn2(x)∣2mgn(x)dx≤4∫mg(∇hn)2(x)dx A_{n}=4 \int \left|\frac{m_{g h_{n} \nabla h_{n}}(\mathbf{x})}{m_{g h_{n}^{2}}(\mathbf{x})}\right|^{2} m_{g n}(\mathbf{x}) d \mathbf{x} \leq 4 \int m_{g\left(\nabla h_{n}\right)^{2}}(\mathbf{x}) d \mathbf{x}

и эта последняя оценка → 0 по условию (a).

(d)

Покажите, что подынтегральное выражение в Bn→0B_{n} \rightarrow 0 при n→∞n \rightarrow \infty, и, используя условие (b) вместе с теоремой о мажорируемой сходимости, покажите, что Bn→0B_{n} \rightarrow 0, чем и завершается доказательство теоремы.

Задача 5.7.19

Теорема 7.19 (нормальный случай) утверждает: пусть X∼Nr(θ,I)X \sim N_{r}(\theta , I) и L(θ,δ)=∣θ−δ∣2L(\theta , \delta )=|\theta -\delta |^{2}. Пусть δg(x)=x+∇log⁡mg(x)\delta^{g}(\mathbf{x})=\mathbf{x}+\nabla \log m_{g}(\mathbf{x}), где mg(x)=∫f(x∣θ)g(θ)dθm_{g}(\mathbf{x})=\int f(\mathbf{x} \mid \boldsymbol {\theta }) g(\boldsymbol {\theta }) d \boldsymbol {\theta }. Предположим, что g(⋅)g(\cdot ) удовлетворяет

?
(a)

∫{θ:∣θ∣>1}g(θ)∣θ∣2[max⁡{log⁡∣θ∣,log⁡2}]2dθ<∞\int_{\left\{ \boldsymbol {\theta }:\left|\boldsymbol {\theta }\right|>1\right\} } \frac{g(\boldsymbol {\theta })}{|\boldsymbol {\theta }|^{2}} \left[\max \left\{ \log \left|\boldsymbol {\theta }\right|, \log 2\right\} \right]^{2} d \boldsymbol {\theta }<\infty,

(b)

∫∣∇g(θ)∣2g(θ)dθ<∞\int \frac{|\nabla g(\boldsymbol {\theta })|^{2}}{g(\boldsymbol {\theta })} d \boldsymbol {\theta }<\infty,

(c)

sup⁡{R(θ,δg):θ∈K}<∞\sup \left\{ R(\boldsymbol {\theta }, \delta^{g}): \boldsymbol {\theta } \in K\right\} <\infty для всех компактных множеств KK.

Тогда δg(x)\delta^{g}(\mathbf{x}) допустима.

Brown and Hwang (1982) фактически доказывают Теорему 7.19 для случая f(x∣θ)=eθ′x−ψ(θ)f(\mathbf{x} \mid \boldsymbol {\theta })= e^{\boldsymbol {\theta }^{\prime } \mathbf{x}-\psi (\boldsymbol {\theta })}, где интерес представляет оценивание τ(θ)=Eθ[X]=∇ψ(θ)\tau (\boldsymbol {\theta })=\mathbb {E}_{\theta }\left[\mathbf{X}\right]=\nabla \psi (\boldsymbol {\theta }) при функции потерь L(θ,δ)=∣τ(θ)−δ∣2L(\boldsymbol {\theta }, \delta )=|\tau (\boldsymbol {\theta })-\delta |^{2}. Докажите Теорему 7.19 для этого случая.

Задача 5.7.20

Для ситуации Примера 7.20:

?
(a)

Используя интегрирование по частям, покажите, что

∂∂xi∫g(θ)e−∣x−θ∣2dθ=−∫(xi−θi)g(θ)e−∣x−θ∣2dθ=∫[∂∂θig(θ)]e−∣x−θ∣2dθ \begin{align} \frac{\partial }{\partial x_{i}} \int g(\boldsymbol {\theta }) e^{-|\mathbf{x}-\boldsymbol {\theta }|^{2}} d \boldsymbol {\theta } & =-\int \left(x_{i}-\theta _{i}\right) g(\boldsymbol {\theta }) e^{-|\mathbf{x}-\boldsymbol {\theta }|^{2}} d \boldsymbol {\theta } \\ & =\int \left[\frac{\partial }{\partial \theta _{i}} g(\boldsymbol {\theta })\right] e^{-|\mathbf{x}-\boldsymbol {\theta }|^{2}} d \boldsymbol {\theta } \end{align}

и, следовательно,

∇mg(x)mg(x)=∫[∇g(θ)]e−∣x−θ∣2dθ∫g(θ)e−∣x−θ∣2dθ. \frac{\nabla m_{g}(\mathbf{x})}{m_{g}(\mathbf{x})}=\frac{\int [\nabla g(\boldsymbol {\theta })] e^{-|\mathbf{x} \mathbf{-} \boldsymbol {\theta }|^{2}} d \boldsymbol {\theta }}{\int g(\boldsymbol {\theta }) e^{-|\mathbf{x}-\boldsymbol {\theta }|^{2}} d \boldsymbol {\theta }}.
(b)

Используя приближение Лапласа (4.6.33), покажите, что

∫[∇g(θ)]e−∣x−θ∣2dθ∫g(θ)e−∣x−θ∣2dθ≈∇g(x)g(x), \frac{\int [\nabla g(\boldsymbol {\theta })] e^{-|\mathbf{x}-\boldsymbol {\theta }|^{2}} d \boldsymbol {\theta }}{\int g(\boldsymbol {\theta }) e^{-|\mathbf{x}-\boldsymbol {\theta }|^{2}} d \boldsymbol {\theta }} \approx \frac{\nabla g(\mathbf{x})}{g(\mathbf{x})},

и что

δg(x)≈x+∇g(x)g(x) \delta ^{g}(\mathbf{x}) \approx \mathbf{x}+\frac{\nabla g(\mathbf{x})}{g(\mathbf{x})}
(c)

Если g(θ)=1/∣θ∣kg(\boldsymbol {\theta })=1 /|\boldsymbol {\theta }|^{k}, покажите, что

δg(x)≈(1−kx2)x. \delta ^{g}(\mathbf{x}) \approx \left(1-\frac{k}{\mathbf{x}^{2}}\right) \mathbf{x}.
Задача 5.7.21

В Примере 7.20, если g(θ)=1/∣θ∣kg(\boldsymbol {\theta })=1 /|\boldsymbol {\theta }|^{k} является собственным априорным распределением, то δg\delta^{g} допустима. При каких значениях kk это выполнено?

?
Задача 5.7.22

Проверьте, что условия Теоремы 7.19 выполнены для g(θ)=1/∣θ∣kg(\boldsymbol {\theta })=1 /|\boldsymbol {\theta }|^{k}, если

?
(a)

k>r−2k>r-2 и

(b)

k=r−2k=r-2.

Задача 5.7.23

Установите условия допустимости оценки Стродермана (Пример 5.6)

?
(a)

используя Теорему 7.19,

(b)

используя результаты Brown (1971), приведённые в Примере 7.21.

(c)

Приведите условия, при которых оценка Стродермана является допустимой минимаксной оценкой.

(Об обобщениях см. Berger 1975, 1976b).

Задача 5.7.24
?
(a)

Проверьте приближение Лапласа из (7.23).

(b)

Покажите, что при h(∣x∣)=k/∣x∣2αh(\left|\mathbf{x}\right|)=k /|x|^{2 \alpha } формулу (7.25) можно записать как (7.26), и что для допустимости и минимаксности оценки одновременно необходимо α=1\alpha =1.

Задача 5.7.25

Теорема 7.17 также применима к случаю Пуассона (λ)(\lambda ), для которого Johnstone (1984) получил следующую характеризацию допустимых оценок при функции потерь L(λ,δ)=∑i=1r(λi−δi)2/λiL(\lambda , \delta )=\sum_{i=1}^{r}\left(\lambda_{i}-\delta_{i}\right)^{2} / \lambda_{i}. Обобщённая байесовская оценка вида δ(x)=[1−h(Σxi)]x\delta (\mathbf{x})=\left[1-h\left(\Sigma x_{i}\right)\right] \mathbf{x} является

  1. недопустимой, если существуют ε>0\varepsilon >0 и M<∞M<\infty, такие что

    h(Σxi)<r−1−εΣxi для Σxi>M, h\left(\Sigma x_{i}\right)<\frac{r-1-\varepsilon }{\Sigma x_{i}} \quad \text{ для } \Sigma x_{i}>M,
  2. допустимой, если h(Σxi)(Σxi)1/2h\left(\Sigma x_{i}\right)\left(\Sigma x_{i}\right)^{1 / 2} ограничена и существует M<∞M<\infty, такое что

    h(Σxi)≥r−1Σxi для Σxi>M. h\left(\Sigma x_{i}\right) \geq \frac{r-1}{\Sigma x_{i}} \text{ для } \Sigma x_{i}>M.
?
(a)

Используя характеризацию Джонстона допустимых пуассоновских оценок (Пример 7.22), найдите допустимую оценку Клевенсона—Зидека (6.31).

(b)

Определите условия, при которых оценка одновременно допустима и минимаксна.

Задача 5.7.26

Для ситуации Примера 7.23:

?
(a)

Покажите, что X/nX / n и (n/n+1)(X/n)(1−X/n)(n / n+1)(X / n)(1-X / n) допустимы для оценивания pp и p(1−p)p(1-p) соответственно.

(b)

Покажите, что α(X/n)+(1−α)(a/(a+b))\alpha (X / n)+(1-\alpha )(a /(a+b)) является допустимой оценкой pp, где α=n/(n+a+b)\alpha =n /(n+a+b). Сравните полученные здесь результаты с результатом Теоремы 2.14 (теорема Карлина).

Примечание.
?
(b)

Заметьте, что результаты Diaconis and Ylvisaker (1979) означают, что единственное априорное распределение, дающее линейные байесовские оценки, — это π(⋅)=\pi (\cdot )= равномерное.

Задача 5.7.27

Заполните пробелы в доказательстве того, что оценки δπ\delta^{\pi } вида (7.27) образуют полный класс.

?
(a)

Покажите, что δπ\delta^{\pi } допустима при r=−1,s=n+1r=-1, s=n+1 и r+1=sr+1=s.

(b)

Для любой другой оценки δ′(x)\delta^{\prime }(x), для которой δ′(x)=h(0)\delta^{\prime }(x)=h(0) при x≤r′x \leq r^{\prime } и δ′(x)=h(1)\delta^{\prime }(x)=h(1) при x≥s′x \geq s^{\prime }, покажите, что должно выполняться r′≥rr^{\prime } \geq r и s′≤ss^{\prime } \leq s.

(c)

Покажите, что R(p,δ′)≤R(p,δπ)R\left(p, \delta^{\prime }\right) \leq R\left(p, \delta^{\pi }\right) для всех p∈[0,1]p \in [0,1] тогда и только тогда, когда Rr,s(p,δ′)≤Rr,s(p,δπ)R_{r, s}\left(p, \delta^{\prime }\right) \leq R_{r, s}\left(p, \delta^{\pi }\right) для всех p∈[0,1]p \in [0,1].

(d)

Покажите, что ∫01Rr,s(p,δ)k(p)dπ(p)\int_{0}^{1} R_{r, s}(p, \delta ) k(p) d \pi (p) однозначно минимизируется при [δπ(r+1),…,δπ(s−1)]\left[\delta^{\pi }(r+1), \ldots , \delta^{\pi }(s-1)\right], и, следовательно, выведите допустимость δπ\delta^{\pi }.

(e)

Используя Теорему 7.17, покажите, что любая допустимая оценка h(p)h(p) имеет вид (7.27), и, следовательно, что (7.27) — минимальный полный класс.

Задача 5.7.28

Для i=1,2,…,ki=1,2, \ldots , k пусть Xi∼fi(x∣θi)X_{i} \sim f_{i}\left(x \mid \theta_{i}\right) и предположим, что δi∗(xi)\delta_{i}^{*}\left(x_{i}\right) — единственная байесовская оценка θi\theta_{i} при функции потерь Li(θi,δ)L_{i}\left(\theta_{i}, \delta \right), где LiL_{i} удовлетворяет Li(a,a)=0L_{i}(a, a)=0 и Li(a,a′)>0,a≠a′L_{i}\left(a, a^{\prime }\right)> 0, \quad a \neq a^{\prime }. Предположим, что для некоторого j,1≤j≤kj, 1 \leq j \leq k, существует значение θ∗\theta^{*}, такое что если θj=θ∗\theta_{j}=\theta^{*}, то

  1. Xj=x∗X_{j}=x^{*} с вероятностью 1,

  2. δj∗(x∗)=θ∗\delta_{j}^{*}\left(x^{*}\right)=\theta^{*}.

Покажите, что (δ1∗(x1),δ2∗(x2),…,δk∗(xk))\left(\delta_{1}^{*}\left(x_{1}\right), \delta_{2}^{*}\left(x_{2}\right), \ldots , \delta_{k}^{*}\left(x_{k}\right)\right) допустима для (θ1,θ2,⋯ ,θk)\left(\theta_{1}, \theta_{2}, \cdots , \theta_{k}\right) при функции потерь ∑iLi(θi,δ)\sum_{i} L_{i}\left(\theta_{i}, \delta \right); то есть эффект Стейна отсутствует.

?
Задача 5.7.29

Предположим, что мы наблюдаем X1,X2,…X_{1}, X_{2}, \ldots последовательно, где Xi∼fi(x∣θi)X_{i} \sim f_{i}\left(x \mid \theta_{i}\right). Оценка θj=(θ1,θ2,…,θj)\boldsymbol {\theta }_{j}=\left(\theta_{1}, \theta_{2}, \ldots , \theta_{j}\right) называется неупреждающей (Gutmann 1982b), если она зависит только от (X1,X2,…,Xj)\left(X_{1}, X_{2}, \ldots , X_{j}\right). То есть мы не можем использовать информацию, поступающую позже, с индексами >j>j. Если δi∗(xi)\delta_{i}^{*}\left(x_{i}\right) — допустимая оценка θi\theta_{i}, покажите, что она не может быть доминирована неупреждающей оценкой. Таким образом, это снова ситуация, в которой эффект Стейна отсутствует.

?
Задача 5.7.30

Для X∼Nr(θ,I)X \sim N_{r}(\boldsymbol {\theta }, I) рассмотрим оценивание φ′θ\varphi^{\prime } \boldsymbol {\theta }, где φr×1\varphi_{r \times 1} известен, с помощью оценки a′Xa^{\prime } X при функции потерь L(φ′θ,δ)=(φ′θ−δ)2L\left(\varphi^{\prime } \boldsymbol {\theta }, \delta \right)=\left(\varphi^{\prime } \boldsymbol {\theta }-\delta \right)^{2}.

?
(a)

Покажите, что если aa лежит вне сферы (7.31), то a′Xa^{\prime } X недопустима.

(b)

Покажите, что байесовская оценка φ′θ\varphi^{\prime } \boldsymbol {\theta } относительно априорного распределения θ∼N(0,V)\boldsymbol {\theta } \sim N(0, V) задаётся формулой

E[φ′θ∣x]=(I+V)−1φx. \mathbb {E}\left[\varphi ^{\prime } \boldsymbol {\theta } \mid \mathbf{x}\right]=(I+V)^{-1} \varphi \mathbf{x}.
(c)

Найдите ковариационную матрицу VV, такую что E[φ′θ∣x]\mathbb {E}\left[\varphi^{\prime } \boldsymbol {\theta } \mid \mathbf{x}\right] лежит внутри сферы (7.31) [ VV будет иметь ранг один, то есть иметь вид vv′v v^{\prime } для некоторого вектора vv размера r×1r \times 1 ].

Пункты (a)-(c) показывают, что все линейные оценки внутри сферы (7.31) допустимы, а те, что вне неё, — недопустимы. Остаётся рассмотреть границу, что несколько сложнее. Подробности см. в Cohen 1966.

Задача 5.7.31

Парадокс вспомогательности Брауна. Пусть X∼Nr(μ,I),r>2\mathbf{X} \sim N_{r}(\mu , I), r>2, и рассмотрим оценивание w′μ=Σi=1rwiμi\mathbf{w}^{\prime } \mu =\Sigma_{i=1}^{r} w_{i} \mu_{i}, где w\mathbf{w} — известный вектор с Σwi2>0\Sigma w_{i}^{2}>0, при функции потерь L(μ,d)=(w′μ−w′d)2L(\mu , d)=\left(\mathbf{w}^{\prime } \mu -\mathbf{w}^{\prime } d\right)^{2}.

?
(a)

Покажите, что оценка w′X\mathbf{w}^{\prime } \mathbf{X} минимаксна и допустима.

(b)

Предположим теперь, что w\mathbf{w} — реализовавшееся значение случайной величины W\mathbf{W} с распределением, не зависящим от X\mathbf{X}, где V=E[W′W]\mathbf{V}=\mathbb {E}\left[\mathbf{W}^{\prime } \mathbf{W}\right] известно. Покажите, что оценка w′d∗\mathbf{w}^{\prime } d^{*}, где

d∗(x)=(I−cV−1xV−1x)x d^{*}(\mathbf{x})=\left(I-\frac{c \mathbf{V}^{-1}}{\mathbf{x} \mathbf{V}^{-1} \mathbf{x}}\right) \mathbf{x}

с 0<c<2(r−2)0<c<2(r-2), доминирует над w′X\mathbf{w}^{\prime } \mathbf{X} по риску.

Задача 5.7.32

Efron (1990), обсуждая парадокс вспомогательности Brown's (1990a), предложил альтернативную версию. Предположим, что X∼Nr(μ,I),r>2\mathbf{X} \sim N_{r}(\mu , I), r>2, и с вероятностью 1/r1 / r, независимо от X, наблюдается значение случайной величины J=jJ=j, j=1,2,…,rj=1,2, \ldots , r. Задача состоит в оценивании θj\theta_{j} при функции потерь L(θj,d)=(θj−d)2L\left(\theta_{j}, d\right)=\left(\theta_{j}-d\right)^{2}. Покажите, что при условии J=jJ=j, XjX_{j} является минимаксной и допустимой оценкой θj\theta_{j}. Однако безусловно XjX_{j} доминируется jj-й координатой оценки Джеймса—Стейна. Этот вариант парадокса может быть в некотором смысле более прозрачным. Он более наглядно показывает, как наличие вспомогательной случайной величины вынуждает рассматривать задачу как многомерную, открывая возможность для эффекта Стейна.

?