6.4

Оценивание максимального правдоподобия: множественные корни

[19/0%]
Показать
LaTeX
Задача 6.4.1

Пусть

u(t)={c∫0te−1/x(1−x)dx при 0<t<10 при t≤01 при t≥1 u(t)= \begin{cases} c \int _{0}^{t} e^{-1 / x(1-x)} d x & \text{ при } 0<t<1 \\ 0 & \text{ при } t \leq 0 \\ 1 & \text{ при } t \geq 1\end{cases}

Покажите, что при подходящем cc функция uu непрерывна и бесконечно дифференцируема при −∞<t<∞-\infty <t<\infty.

?
Задача 6.4.2

Покажите, что плотность (4.1) с Ω=(0,∞)\Omega =(0, \infty ) удовлетворяет всем условиям Теоремы 3.10, за исключением условия (d) Теоремы 2.6.

?
Задача 6.4.3

Покажите, что плотность (4.4) с Ω=(0,∞)\Omega =(0, \infty ) удовлетворяет всем условиям Теоремы 3.10.

?
Задача 6.4.4

В Примере 4.5 вычислите оценки (4.8) и (4.14) для случая Коши, используя в качестве θ~n\tilde{\theta }_{n} выборочную медиану.

?
Задача 6.4.5

В Примере 4.7 покажите, что l(θ)l(\theta ) вогнута.

?
Задача 6.4.6

В Примере 4.7, если η=ξ\eta =\xi, покажите, как получить n\sqrt{n}-состоятельную оценку, приравнивая выборочный и теоретический вторые моменты.

?
Задача 6.4.7

В Теореме 4.8 покажите, что σ11=σ12\sigma_{11}=\sigma_{12}.

?
Задача 6.4.8

Не используя Теорему 4.8, покажите в Примере 4.13, что EM-последовательность сходится к MLE.

?
Задача 6.4.9

Рассмотрим следующие 12 наблюдений из двумерного нормального распределения с параметрами μ1=μ2=0,σ12,σ22,ρ\mu_{1}=\mu_{2}=0, \sigma_{1}^{2}, \sigma_{2}^{2}, \rho:

x1x_{1}11-1-122-2-2****
x2x_{2}1-11-1****22-2-2

где «∗*» обозначает пропущенное значение.

?
(a)

Покажите, что функция правдоподобия имеет глобальные максимумы при ρ=±1/2,σ12=σ22=8/3\rho = \pm 1 / 2, \sigma_{1}^{2}=\sigma_{2}^{2}=8 / 3, и седловую точку при ρ=0,σ12=σ22=5/2\rho =0, \sigma_{1}^{2}=\sigma_{2}^{2}=5 / 2.

(b)

Покажите, что если EM-последовательность начинается с ρ=0\rho =0, то она остаётся при ρ=0\rho =0 на всех последующих итерациях.

(c)

Покажите, что если EM-последовательность начинается с ρ\rho, отделённого от нуля, то она сходится к максимуму.

Примечание.
?

Эта задача принадлежит Murray (1977) и обсуждается в Wu (1983).

Задача 6.4.10

Покажите, что если плотность полных данных EM f(y,z∣θ)f(\mathbf{y}, \mathbf{z} \mid \theta ) из (4.21) принадлежит искривлённому экспоненциальному семейству, то предположения Теоремы 4.12 выполнены.

?
Задача 6.4.11

В EM-алгоритме вычисление E-шага, то есть вычисление математического ожидания, может быть сложным. В таких случаях E-шаг иногда можно заменить методом Монте-Карло, что приводит к MCEM-алгоритму (Wei and Tanner 1990). Рассмотрим следующее MCEM-вычисление Q(θ∣θ^(j),y)Q\left(\theta \mid \hat{\theta }_{(j)}, \mathbf{y}\right): При заданном θ^(j)(k)\hat{\theta }_{(j)}^{(k)}

  1. Сгенерируйте Z1,⋯ ,ZkZ_{1}, \cdots , Z_{k} — независимые одинаково распределённые случайные величины из k(z∣θ^(j)(k),y)k\left(\mathbf{z} \mid \hat{\theta }_{(j)}^{(k)}, \mathbf{y}\right),

  2. Положите Q^(θ∣θ^(j)(k),y)=1k∑i=1klog⁡L(θ∣y,z)\hat{Q}\left(\theta \mid \hat{\theta }_{(j)}^{(k)}, \mathbf{y}\right)=\frac{1}{k} \sum_{i=1}^{k} \log L(\theta \mid \mathbf{y}, \mathbf{z})

а затем вычислите θ^(j+1)(k)\hat{\theta }_{(j+1)}^{(k)} как значение, максимизирующее Q^(θ∣θ^(j)(k),y)\hat{Q}\left(\theta \mid \hat{\theta }_{(j)}^{(k)}, \mathbf{y}\right).

?
(a)

Покажите, что Q^(θ∣θ^(j)(k),y)→Q^(θ∣θ^(j),y)\hat{Q}\left(\theta \mid \hat{\theta }_{(j)}^{(k)}, \mathbf{y}\right) \rightarrow \hat{Q}\left(\theta \mid \hat{\theta }_{(j)}, \mathbf{y}\right) при k→∞k \rightarrow \infty.

(b)

Какие условия обеспечат, что L(θ^(j+1)(k)∣y)≥L(θ^(j)(k)∣y)L\left(\hat{\theta }_{(j+1)}^{(k)} \mid \mathbf{y}\right) \geq L\left(\hat{\theta }_{(j)}^{(k)} \mid \mathbf{y}\right) при достаточно больших kk? Достаточны ли для этого предположения Теоремы 4.12?

Задача 6.4.12

Для смеси распределений из Примера 4.7, то есть

Xi∼θg(x)+(1−θ)h(x),i=1,…,n, независимые  X_{i} \sim \theta g(x)+(1-\theta ) h(x), \quad i=1, \ldots , n, \text{ независимые }

где g(⋅)g(\cdot ) и h(⋅)h(\cdot ) известны, для нахождения ML-оценки θ\theta можно использовать EM-алгоритм. Пусть Z1,⋯ ,ZnZ_{1}, \cdots , Z_{n}, где ZiZ_{i} указывает, из какого распределения получена XiX_{i}, так что

Xi∣Zi=1∼g(x)Xi∣Zi=0∼h(x). \begin{align} & X_{i} \mid Z_{i}=1 \sim g(x) \\ & X_{i} \mid Z_{i}=0 \sim h(x). \end{align}
?
(a)

Покажите, что функцию правдоподобия полных данных можно записать в виде

L(θ∣x,z)=∏i=1n[zig(xi)+(1−zi)h(xi)]θzi(1−θ)1−zi. L(\theta \mid \mathbf{x}, \mathbf{z})=\prod _{i=1}^{n}\left[z_{i} g\left(x_{i}\right)+\left(1-z_{i}\right) h\left(x_{i}\right)\right] \theta ^{z_{i}}(1-\theta )^{1-z_{i}}.
(b)

Покажите, что E[Zi∣θ,xi]=θg(xi)/[θg(xi)+(1−θ)h(xi)]\mathbb {E}\left[Z_{i} \mid \theta , x_{i}\right]=\theta g\left(x_{i}\right) /\left[\theta g\left(x_{i}\right)+(1-\theta ) h\left(x_{i}\right)\right], и, следовательно, EM-последовательность задаётся формулой

θ^(j+1)=1n∑i=1nθ^(j)g(xi)θ^(j)g(xi)+(1−θ^(j))h(xi). \hat{\theta }_{(j+1)}=\frac{1}{n} \sum _{i=1}^{n} \frac{\hat{\theta }_{(j)} g\left(x_{i}\right)}{\hat{\theta }_{(j)} g\left(x_{i}\right)+\left(1-\hat{\theta }_{(j)}\right) h\left(x_{i}\right)}.
(c)

Покажите, что θ^(j)→θ^\hat{\theta }_{(j)} \rightarrow \hat{\theta } — ML-оценка θ\theta.

Задача 6.4.13

Для ситуации Примера 4.10:

?
(a)

Покажите, что M-шаг EM-алгоритма задаётся формулами

μ^=(∑i=14∑j=1niyij+z1+z2)/12, \hat{\mu }=\left(\sum _{i=1}^{4} \sum _{j=1}^{n_{i}} y_{i j}+z_{1}+z_{2}\right) / 12, α^i=(∑j=12yij+zi)/3−μ^,i=1,3=(∑j=13yij)/3−μ^,i=2,4. \begin{align} \hat{\alpha }_{i} & =\left(\sum _{j=1}^{2} y_{i j}+z_{i}\right) / 3-\hat{\mu }, \quad i=1,3 \\ & =\left(\sum _{j=1}^{3} y_{i j}\right) / 3-\hat{\mu }, \quad i=2,4. \end{align}
(b)

Покажите, что E-шаг EM-алгоритма задаётся формулой

zi=E[Yi3∣μ=μ^,αi=α^i]=μ^+α^ii=1,3. z_{i}=\mathbb {E}\left[Y_{i 3} \mid \mu =\hat{\mu }, \alpha _{i}=\hat{\alpha }_{i}\right]=\hat{\mu }+\hat{\alpha }_{i} \quad i=1,3.
(c)

При ограничении ∑iαi=0\sum_{i} \alpha_{i}=0 покажите, что EM-последовательность сходится к α^i=yˉi.−μ^\hat{\alpha }_{i}= \bar{y}_{i.}-\hat{\mu }, где μ^=∑iyˉi./4\hat{\mu }=\sum_{i} \bar{y}_{i.} / 4.

(d)

При ограничении ∑iniαi=0\sum_{i} n_{i} \alpha_{i}=0 покажите, что EM-последовательность сходится к α^i=yˉi.−μ^\hat{\alpha }_{i}= \bar{y}_{i.}-\hat{\mu }, где μ^=∑ijyij/10\hat{\mu }=\sum_{i j} y_{i j} / 10.

(e)

Для общей однофакторной схемы с aa обработками и nijn_{i j} наблюдениями на обработку покажите, как использовать EM-алгоритм для дополнения данных так, чтобы каждая обработка имела nn наблюдений. Запишите EM-последовательность и покажите, к чему она сходится при ограничениях пунктов (c) и (d).

[Ограничения пунктов (c) и (d) встречались в Примере 3.4.9, где они привели, соответственно, к анализу невзвешенных средних и анализу взвешенных средних.]

Задача 6.4.14

В двухфакторной схеме (см. Пример 3.4.11) EM-алгоритм может быть очень полезен при вычислении ML-оценок в несбалансированном случае. Предположим, что мы наблюдаем

Yijk:N(ξij,σ2),i=1,…,I,j=1,…,J,k=1,…,nij, Y_{i j k}: N\left(\xi _{i j}, \sigma ^{2}\right), \quad i=1, \ldots , I, \quad j=1, \ldots , J, \quad k=1, \ldots , n_{i j},

где ξij=μ+αi+βj+γij\xi_{i j}=\mu +\alpha_{i}+\beta_{j}+\gamma_{i j}. Данные будут дополнены так, чтобы полные данные содержали nn наблюдений на ячейку.

?
(a)

Покажите, как вычислить и E-шаг, и M-шаг EM-алгоритма.

(b)

При ограничении ∑iαi=∑jβj=∑iγij=∑jγij=0\sum_{i} \alpha_{i}=\sum_{j} \beta_{j}=\sum_{i} \gamma_{i j}=\sum_{j} \gamma_{i j}=0 покажите, что EM-последовательность сходится к ML-оценкам, соответствующим анализу невзвешенных средних.

(c)

При ограничении ∑ini.αi=∑jn⋅jβj=∑ini⋅γij=∑j⋅jγij=0\sum_{i} n_{i}. \alpha_{i}=\sum_{j} n_{\cdot j} \beta_{j}=\sum_{i} n_{i \cdot } \gamma_{i j}=\sum_{j} \cdot j \gamma_{i j}=0 покажите, что EM-последовательность сходится к ML-оценкам, соответствующим анализу взвешенных средних.

Задача 6.4.15

Для однофакторной схемы со случайными эффектами (Пример 3.5.1) EM-алгоритм полезен для вычисления ML-оценок. (На самом деле, он весьма полезен во многих смешанных моделях; см. Searle и др. 1992, Глава 8.) Предположим, что имеет место модель

Xij=μ+Ai+Uij(j=1,…,ni,i=1,…,s) X_{i j}=\mu +A_{i}+U_{i j} \quad \left(j=1, \ldots , n_{i}, i=1, \ldots , s\right)

где AiA_{i} и UijU_{i j} — независимые нормальные случайные величины с нулевым средним и известной дисперсией. Для вычисления ML-оценок μ,σU2\mu , \sigma_{U}^{2} и σU2\sigma_{U}^{2} обычно применяют EM-алгоритм, используя ненаблюдаемые AiA_{i} в качестве дополненных данных. Выпишите E-шаг и M-шаг и покажите, что EM-последовательность сходится к ML-оценкам.

?
Задача 6.4.16

Оценивание максимального правдоподобия в пробит-модели из Раздела 3.6 можно реализовать с помощью EM-алгоритма. Мы наблюдаем независимые бернуллиевские величины X1,…,XnX_{1}, \ldots , X_{n}, которые зависят от ненаблюдаемых величин ZiZ_{i}, независимо распределённых как N(ζi,σ2)N\left(\zeta_{i}, \sigma^{2}\right), где

Xi={0 если Zi≤u1 если Zi>u. X_{i}= \begin{cases} 0 & \text{ если } Z_{i} \leq u \\ 1 & \text{ если } Z_{i}>u.\end{cases}

Предполагая, что uu известно, мы хотим получить ML-оценки ζ\zeta и σ2\sigma^{2}.

?
(a)

Покажите, что функция правдоподобия равна pΣxi(1−p)n−Σxip^{\Sigma x_{i}}(1-p)^{n-\Sigma x_{i}}, где

p=P(Zi>u)=Φ(ζ−uσ). p=\mathbb {P}\left(Z_{i}>u\right)=\Phi \left(\frac{\zeta -u}{\sigma }\right).
(b)

Если считать Z1,…,ZnZ_{1}, \ldots , Z_{n} полными данными, то правдоподобие полных данных равно

∏i=1n12πσe−12σ2(zi−ζ)2 \prod _{i=1}^{n} \frac{1}{\sqrt{2 \pi } \sigma } e^{-\frac{1}{2 \sigma ^{2}}\left(z_{i}-\zeta \right)^{2}}

а ожидаемый логарифм правдоподобия полных данных равен

−n2log⁡(2πσ2)−12σ2∑i=1n[E[Zi2∣Xi]−2ζE[Zi∣Xi]+ζ2]. -\frac{n}{2} \log \left(2 \pi \sigma ^{2}\right)-\frac{1}{2 \sigma ^{2}} \sum _{i=1}^{n}\left[\mathbb {E}\left[Z_{i}^{2} \mid X_{i}\right]-2 \zeta \mathbb {E}\left[Z_{i} \mid X_{i}\right]+\zeta ^{2}\right].
(c)

Покажите, что EM-последовательность задаётся формулами

ζ^(j+1)=1n∑i=1nti(ζ^(j),σ^(j)2)σ^(j+1)2=1n[∑i=1nvi(ζ^(j),σ^(j)2)−1n(∑i=1nti(ζ^(j),σ^(j)2))2] \begin{align} & \hat{\zeta }_{(j+1)}=\frac{1}{n} \sum _{i=1}^{n} t_{i}\left(\hat{\zeta }_{(j)}, \hat{\sigma }_{(j)}^{2}\right) \\ & \hat{\sigma }_{(j+1)}^{2}=\frac{1}{n}\left[\sum _{i=1}^{n} v_{i}\left(\hat{\zeta }_{(j)}, \hat{\sigma }_{(j)}^{2}\right)-\frac{1}{n}\left(\sum _{i=1}^{n} t_{i}\left(\hat{\zeta }_{(j)}, \hat{\sigma }_{(j)}^{2}\right)\right)^{2}\right] \end{align}

где

ti(ζ,σ2)=E[Zi∣Xi,ζ,σ2] и vi(ζ,σ2)=E[Zi2∣Xi,ζ,σ2]. t_{i}\left(\zeta , \sigma ^{2}\right)=\mathbb {E}\left[Z_{i} \mid X_{i}, \zeta , \sigma ^{2}\right] \quad \text{ и } \quad v_{i}\left(\zeta , \sigma ^{2}\right)=\mathbb {E}\left[Z_{i}^{2} \mid X_{i}, \zeta , \sigma ^{2}\right].
(d)

Покажите, что

E[Zi∣Xi,ζ,σ2]=ζ+σHi(u−ζσ)E[Zi2∣Xi,ζ,σ2]=ζ2+σ2+σ(u+ζ)Hi(u−ζσ) \begin{align} & \mathbb {E}\left[Z_{i} \mid X_{i}, \zeta , \sigma ^{2}\right]=\zeta +\sigma H_{i}\left(\frac{u-\zeta }{\sigma }\right) \\ & \mathbb {E}\left[Z_{i}^{2} \mid X_{i}, \zeta , \sigma ^{2}\right]=\zeta ^{2}+\sigma ^{2}+\sigma (u+\zeta ) H_{i}\left(\frac{u-\zeta }{\sigma }\right) \end{align}

где

Hi(t)={φ(t)1−Φ(t) если Xi=1−φ(t)Φ(t) если Xi=0 H_{i}(t)= \begin{cases} \frac{\varphi (t)}{1-\Phi (t)} & \text{ если } X_{i}=1 \\ -\frac{\varphi (t)}{\Phi (t)} & \text{ если } X_{i}=0\end{cases}
(e)

Покажите, что ζ^(j)→ζ^\hat{\zeta }_{(j)} \rightarrow \hat{\zeta } и σ^(j)2→σ^2\hat{\sigma }_{(j)}^{2} \rightarrow \hat{\sigma }^{2} — ML-оценки ζ\zeta и σ2\sigma^{2}.

Задача 6.4.17

Проверьте (4.30).

?
Задача 6.4.18

EM-алгоритм также можно применить в байесовской иерархической модели для нахождения моды апостериорного распределения. Вспомним модель (4.5.5.1),

X∣θ∼f(x∣θ),Θ∣λ∼π(θ∣λ),Λ∼γ(λ), \begin{align} & X \mid \theta \sim f(x \mid \theta ), \\ & \Theta \mid \lambda \sim \pi (\theta \mid \lambda ), \\ & \Lambda \sim \gamma (\lambda ), \end{align}

где интерес представляет оценивание величин, связанных с π(θ∣x)\pi (\theta \mid x). Поскольку

π(θ∣x)=∫π(θ,λ∣x)dλ, \pi (\theta \mid x)=\int \pi (\theta , \lambda \mid x) d \lambda ,

где π(θ,λ∣x)=π(θ∣λ,x)π(λ∣x)\pi (\theta , \lambda \mid x)=\pi (\theta \mid \lambda , x) \pi (\lambda \mid x), EM-алгоритм является одним из возможных методов нахождения моды π(θ∣x)\pi (\theta \mid x), где λ\lambda используется в качестве дополненных данных.

?
(a)

Определите k(λ∣θ,x)=π(θ,λ∣x)/π(θ∣x)k(\lambda \mid \theta , x)=\pi (\theta , \lambda \mid x) / \pi (\theta \mid x) и покажите, что

log⁡π(θ∣x)=∫log⁡π(θ,λ∣x)k(λ∣θ∗,x)dλ−∫log⁡k(λ∣θ,x)k(λ∣θ∗,x)dλ. \log \pi (\theta \mid x)=\int \log \pi (\theta , \lambda \mid x) k\left(\lambda \mid \theta ^{*}, x\right) d \lambda -\int \log k(\lambda \mid \theta , x) k\left(\lambda \mid \theta ^{*}, x\right) d \lambda .
(b)

Если последовательность {θ^(j)}\left\{ \hat{\theta }_{(j)}\right\} удовлетворяет

max⁡θ∫log⁡π(θ,λ∣x)k(λ∣θ(j),x)dλ=∫log⁡π(θ(j+1),λ∣x)k(λ∣θ(j),x)dλ, \max _{\theta } \int \log \pi (\theta , \lambda \mid x) k\left(\lambda \mid \theta _{(j)}, x\right) d \lambda =\int \log \pi \left(\theta _{(j+1)}, \lambda \mid x\right) k\left(\lambda \mid \theta _{(j)}, x\right) d \lambda ,

покажите, что log⁡π(θ(j+1)∣x)≥log⁡π(θ(j)∣x)\log \pi \left(\theta_{(j+1)} \mid x\right) \geq \log \pi \left(\theta_{(j)} \mid x\right). При каких условиях последовательность {θ^(j)}\left\{ \hat{\theta }_{(j)}\right\} будет сходиться к моде π(θ∣x)\pi (\theta \mid x)?

(c)

Для иерархии

X∣θ∼N(θ),1),Θ∣λ∼N(λ,1)),Λ∼Uniform⁡(−∞,∞), \begin{align} & X \mid \theta \sim N(\theta ), 1), \\ & \Theta \mid \lambda \sim N(\lambda , 1)), \\ & \Lambda \sim \operatorname {Uniform}(-\infty , \infty ), \end{align}

покажите, как использовать EM-алгоритм для вычисления моды апостериорного распределения π(θ∣x)\pi (\theta \mid x).

Задача 6.4.19

Между EM-алгоритмом и сэмплированием Гиббса существует связь, поскольку оба метода основаны на теории марковских цепей. Один из способов убедиться в этом — показать, что правдоподобие неполных данных является решением интегрального уравнения выборки методом последовательных подстановок (см. Задачи 4.5.9–4.5.11), и что затем сэмплирование Гиббса можно использовать для вычисления функции правдоподобия. Если L(θ∣y)L(\theta \mid \mathbf{y}) — правдоподобие неполных данных, а L(θ∣y,z)L(\theta \mid \mathbf{y}, \mathbf{z}) — правдоподобие полных данных, определим

L∗(θ∣y)=L(θ∣y)∫L(θ∣y)dθL∗(θ∣y,z)=L(θ∣y,z)∫L(θ∣y,z)dθ \begin{align} L^{*}(\theta \mid \mathbf{y}) & =\frac{L(\theta \mid \mathbf{y})}{\int L(\theta \mid \mathbf{y}) d \theta } \\ L^{*}(\theta \mid \mathbf{y}, \mathbf{z}) & =\frac{L(\theta \mid \mathbf{y}, \mathbf{z})}{\int L(\theta \mid \mathbf{y}, \mathbf{z}) d \theta } \end{align}
?
(a)

Покажите, что L∗(θ∣y)L^{*}(\theta \mid \mathbf{y}) является решением уравнения

L∗(θ∣y)=∫[∫L∗(θ∣y,z)k(z∣θ′,y)dz]L∗(θ′∣y)dθ′ L^{*}(\theta \mid \mathbf{y})=\int \left[\int L^{*}(\theta \mid \mathbf{y}, \mathbf{z}) k\left(\mathbf{z} \mid \theta ^{\prime }, \mathbf{y}\right) d \mathbf{z}\right] L^{*}\left(\theta ^{\prime } \mid \mathbf{y}\right) d \theta ^{\prime }

где, как обычно, k(z∣θ,y)=L(θ∣y,z)/L(θ∣y)k(\mathbf{z} \mid \theta , \mathbf{y})=L(\theta \mid \mathbf{y}, \mathbf{z}) / L(\theta \mid \mathbf{y}).

(b)

Покажите, как последовательность θ(j)\theta_{(j)}, полученная из итерации Гиббса,

θ(j)∼L∗(θ∣y,z(j−1))z(j)∼k(z∣θ(j),y) \begin{align} & \theta _{(j)} \sim L^{*}\left(\theta \mid \mathbf{y}, \mathbf{z}_{(j-1)}\right) \\ & \mathbf{z}_{(j)} \sim k\left(\mathbf{z} \mid \theta _{(j)}, \mathbf{y}\right) \end{align}

будет сходиться к случайной величине с плотностью L∗(θ∣y)L^{*}(\theta \mid \mathbf{y}) при j→∞j \rightarrow \infty. Как это можно использовать для вычисления функции правдоподобия L(θ∣y)L(\theta \mid \mathbf{y})?

[Используя функции L(θ∣y,z)L(\theta \mid \mathbf{y}, \mathbf{z}) и k(z∣θ,y)k(\mathbf{z} \mid \theta , \mathbf{y}), EM-алгоритм даёт нам ML-оценку из L(θ∣y)L(\theta \mid \mathbf{y}), тогда как сэмплер Гиббса даёт нам всю функцию целиком. Эта реализация сэмплера Гиббса для вычисления правдоподобия использовалась Casella и Berger (1994), а также описана у Smith и Roberts (1993). Версия EM-алгоритма, в которой связь с марковскими цепями вполне очевидна, была предложена Baum и Petrie (1966) и Baum и др. (1970).]