4.5

Иерархический байесовский подход

[21/0%]
Показать
LaTeX
Задача 4.5.1

Для модели (3.3.1) пусть π(θ∣x,λ)\pi (\theta \mid x, \lambda ) — байесовское апостериорное распределение при фиксированном априорном распределении, а π(θ∣x)\pi (\theta \mid x) — иерархическое байесовское апостериорное распределение. Покажите, что π(θ∣x)=∫π(θ∣x,λ)⋅π(λ∣x)dλ\pi (\theta \mid x)=\int \pi (\theta \mid x, \lambda ) \cdot \pi (\lambda \mid x) d \lambda, где π(λ∣x)=∫f(x∣θ)π(θ∣λ)γ(λ)dθ/∬f(x∣θ)π(θ∣λ)γ(λ)dθdλ\pi (\lambda \mid x)=\int f(x \mid \theta ) \pi (\theta \mid \lambda ) \gamma (\lambda ) d \theta / \iint f(x \mid \theta ) \pi (\theta \mid \lambda ) \gamma (\lambda ) d \theta d \lambda.

?
Задача 4.5.2

Для ситуации задачи 5.1 покажите, что:

?
(a)

E[θ∣x]=E[E[θ∣x,λ]]\mathbb {E}\left[\theta \mid x\right]=E[\mathbb {E}\left[\theta \mid x, \lambda \right]];

(b)

var⁡(θ∣x)=E[var⁡(θ∣x,λ)]+var⁡[E[θ∣x,λ]]\operatorname {var}(\theta \mid x)=E[\operatorname {var}(\theta \mid x, \lambda )]+\operatorname {var}[\mathbb {E}\left[\theta \mid x, \lambda \right]];

и, следовательно, что π(θ∣x)\pi (\theta \mid x) будет, как правило, иметь бо́льшую дисперсию, чем π(θ∣x,λ0)\pi \left(\theta \mid x, \lambda_{0}\right).

Задача 4.5.3

Для модели (3.3.3) покажите, что:

?
(a)

Маргинальное априорное распределение θ\theta, безусловное относительно τ2\tau^{2}, задаётся формулой

π(θ)=Γ(a+12)2πΓ(a)ba1(1b+θ22)a+1/2, \pi (\theta )=\frac{\Gamma \left(a+\frac{1}{2}\right)}{\sqrt{2 \pi } \Gamma (a) b^{a}} \frac{1}{\left(\frac{1}{b}+\frac{\theta ^{2}}{2}\right)^{a+1 / 2}},

которое при a=v/2a=v / 2 и b=2/vb=2 / v является tt-распределением Стьюдента с vv степенями свободы.

(b)

Маргинальное апостериорное распределение τ2\tau^{2} задаётся формулой

π(τ2∣xˉ)=[σ2τ2σ2+τ2]1/2e−12xˉ2σ2+τ21(τ2)a+3/2e−1/bτ2∫0∞[σ2τ2σ2+τ2]1/2e−12xˉ2σ2+τ21(τ2)a+3/2e−1/bτ2dτ2 \pi \left(\tau ^{2} \mid \bar{x}\right)=\frac{\left[\frac{\sigma ^{2} \tau ^{2}}{\sigma ^{2}+\tau ^{2}}\right]^{1 / 2} e^{-\frac{1}{2} \frac{\bar{x}^{2}}{\sigma ^{2}+\tau ^{2}}} \frac{1}{\left(\tau ^{2}\right)^{a+3 / 2}} e^{-1 / b \tau ^{2}}}{\int _{0}^{\infty }\left[\frac{\sigma ^{2} \tau ^{2}}{\sigma ^{2}+\tau ^{2}}\right]^{1 / 2} e^{-\frac{1}{2} \frac{\bar{x}^{2}}{\sigma ^{2}+\tau ^{2}}} \frac{1}{\left(\tau ^{2}\right)^{a+3 / 2}} e^{-1 / b \tau ^{2}} d \tau ^{2}}
Задача 4.5.4

Albert and Gupta (1985) исследуют теорию и приложения иерархической модели

Xi∣θi∼b(θi,n),i=1,…,p, независимы, θi∣η∼beta⁡[kη,k(1−η)],k известно, η∼Uniform⁡(0,1). \begin{align} X_{i} \mid \theta _{i} & \sim b\left(\theta _{i}, n\right), \quad i=1, \ldots , p, \text{ независимы, } \\ \theta _{i} \mid \eta & \sim \operatorname {beta}[k \eta , k(1-\eta )], k \text{ известно, } \\ \eta & \sim \operatorname {Uniform}(0,1). \end{align}
?
(a)

Покажите, что

E[θi∣x]=(nn+k)(xin)+(kn+k)E[η∣x],var⁡(θi∣x)=k2(n+k)(n+k+1)var⁡(η∣x). \begin{align} \mathbb {E}\left[\theta _{i} \mid \mathbf{x}\right] & =\left(\frac{n}{n+k}\right)\left(\frac{x_{i}}{n}\right)+\left(\frac{k}{n+k}\right) \mathbb {E}\left[\eta \mid \mathbf{x}\right], \\ \operatorname {var}\left(\theta _{i} \mid \mathbf{x}\right) & =\frac{k^{2}}{(n+k)(n+k+1)} \operatorname {var}(\eta \mid \mathbf{x}). \end{align}

[Заметим, что E[η∣x]\mathbb {E}\left[\eta \mid \mathbf{x}\right] и var⁡(η∣x)\operatorname {var}(\eta \mid \mathbf{x}) не выражаются в простом виде.]

(b)

Безусловно по η\eta, величины θi\theta_{i} имеют условную ковариацию

cov⁡(θi,θj∣x)=(kn+k)2var⁡(η∣x),i≠j. \operatorname {cov}\left(\theta _{i}, \theta _{j} \mid \mathbf{x}\right)=\left(\frac{k}{n+k}\right)^{2} \operatorname {var}(\eta \mid \mathbf{x}), \quad i \neq j.
(c)

Игнорируя априорное распределение η\eta, покажите, как построить эмпирическую байесовскую оценку θi\theta_{i}. (Опять же, она не выражается в простом виде.)

[Albert and Gupta (1985) на самом деле рассматривают более общую модель, чем приведённая здесь, и показывают, как приближённо получить байесовское решение. Они применяют свою модель к задаче об отсутствии ответов при почтовых опросах.]

Задача 4.5.5
?
(a)

По аналогии с задачей 1.7.9 докажите, что для любых случайных величин X,YX, Y и ZZ,

cov⁡(X,Y)=E[cov⁡(X,Y)∣Z]+cov⁡[E[X∣Z],E[Y∣Z]]. \operatorname {cov}(X, Y)=E[\operatorname {cov}(X, Y) \mid Z]+\operatorname {cov}[\mathbb {E}\left[X \mid Z\right], \mathbb {E}\left[Y \mid Z\right]].
(b)

Для иерархии

Xi∣θi∼f(x∣θi),i=1,…,p, независимы ,Θi∣λ∼π(θi∣λ),i=1,…,p, независимы ,Λ∼γ(λ), \begin{align} X_{i} \mid \theta _{i} & \sim f\left(x \mid \theta _{i}\right), \quad i=1, \ldots , p, \text{ независимы }, \\ \Theta _{i} \mid \lambda & \sim \pi \left(\theta _{i} \mid \lambda \right), \quad i=1, \ldots , p, \text{ независимы }, \\ \Lambda & \sim \gamma (\lambda ), \end{align}

покажите, что cov⁡(Θi,Θj∣x)=cov⁡[E[Θi∣x,λ],E[Θj∣x,λ]]\operatorname {cov}\left(\Theta_{i}, \Theta_{j} \mid \mathbf{x}\right)=\operatorname {cov}\left[\mathbb {E}\left[\Theta_{i} \mid \mathbf{x}, \lambda \right], \mathbb {E}\left[\Theta_{j} \mid \mathbf{x}, \lambda \right]\right].

(c)

Если E[Θi∣x,λ]=g(xi)+h(λ),i=1,…,p\mathbb {E}\left[\Theta_{i} \mid \mathbf{x}, \lambda \right]=g\left(x_{i}\right)+h(\lambda ), i=1, \ldots , p, где g(⋅)g(\cdot ) и h(⋅)h(\cdot ) известны, то

cov⁡(Θi,Θj∣x)=var⁡[E[Θi∣x,λ]]. \operatorname {cov}\left(\Theta _{i}, \Theta _{j} \mid \mathbf{x}\right)=\operatorname {var}\left[\mathbb {E}\left[\Theta _{i} \mid \mathbf{x}, \lambda \right]\right].

[Пункт (c) указывает на определённое ограничение применимости некоторых иерархических моделей, а именно на то, что они влекут положительную корреляционную структуру в апостериорном распределении.]

Задача 4.5.6

Модель однофакторных случайных эффектов из примера 2.7 (см. также примеры 3.5.1 и 3.5.5) можно записать в виде иерархической модели

Xij∣μ,αi∼N(μ+αi,σ2),j=1,…,n,i=1,…,s,αi∼N(0,σA2),i=1,…,s. \begin{align} X_{i j} \mid \mu , \alpha _{i} & \sim N\left(\mu +\alpha _{i}, \sigma ^{2}\right), \quad j=1, \ldots , n, \quad i=1, \ldots , s, \\ \alpha _{i} & \sim N\left(0, \sigma _{A}^{2}\right), \quad i=1, \ldots , s. \end{align}

Если, кроме того, положить μ∼\mu \sim равномерное (−∞,∞)(-\infty , \infty ), покажите, что байесовская оценка μ+αi\mu +\alpha_{i} при квадратичной функции потерь задаётся формулой (3.5.13) — UMVU-предиктором μ+αi\mu +\alpha_{i}.

?
Задача 4.5.7

Обращаясь к примеру 6.6:

?
(a)

Используя априорное распределение для γ(b)\gamma (b), заданное в (5.6.27), покажите, что мода апостериорного распределения π(b∣x)\pi (b \mid \mathbf{x}) равна b^=(pxˉ+α−1)/(pa+β−1)\hat{b}=(p \bar{x}+\alpha -1) /(p a+\beta -1), и, следовательно, эмпирическая байесовская оценка, основанная на этом b^\hat{b}, не совпадает с иерархической байесовской оценкой (5.6.29).

(b)

Покажите, что если оценивать b/(b+1)b /(b+1) с помощью его апостериорного математического ожидания E[b/(b+1)∣x]E[b /(b+1) \mid \mathbf{x}], то получаемая эмпирическая байесовская оценка совпадает с иерархической байесовской оценкой.

Задача 4.5.8

Метод интегрирования Монте-Карло позволяет вычислять (возможно, сложные) интегралы с помощью (возможно, простой) генерации случайных величин.

?
(a)

Чтобы вычислить ∫h(x)fX(x)dx\int h(x) f_{X}(x) d x, сгенерируйте выборку X1,…,XmX_{1}, \ldots , X_{m}, независимую одинаково распределённую, из fX(x)f_{X}(x). Тогда 1/m∑i=1mh(xi)→∫h(x)fX(x)dx1 / m \sum_{i=1}^{m} h\left(x_{i}\right) \rightarrow \int h(x) f_{X}(x) d x при m→∞m \rightarrow \infty.

(b)

Если трудно сгенерировать случайную величину из fX(x)f_{X}(x), то сгенерируйте пары случайных величин

Yi∼fY(y),Xi∼fX∣Y(x∣yi). \begin{align} Y_{i} & \sim f_{Y}(y), \\ X_{i} & \sim f_{X \mid Y}\left(x \mid y_{i}\right). \end{align}

Тогда 1/m∑i=1mh(xi)→∫h(x)fX(x)dx1 / m \sum_{i=1}^{m} h\left(x_{i}\right) \rightarrow \int h(x) f_{X}(x) d x при m→∞m \rightarrow \infty. [Покажите, что если XX генерируется согласно Y∼fY(y)Y \sim f_{Y}(y) и X∼fX∣Y(x∣Y)X \sim f_{X \mid Y}(x \mid Y), то P(X≤a)=∫−∞afx(x)dx\mathbb {P}\left(X \leq a\right)=\int_{-\infty }^{a} f_{x}(x) d x.]

(c)

Если сгенерировать, как в пункте (b), затруднительно, то сгенерируйте

Xmi∼fX∣Y(x∣Ymi−1),Ymi∼fY∣X(y∣Xmi). \begin{align} X_{m_{i}} & \sim f_{X \mid Y}\left(x \mid Y_{m_{i-1}}\right), \\ Y_{m_{i}} & \sim f_{Y \mid X}\left(y \mid X_{m_{i}}\right). \end{align}

для i=1,…,Ki=1, \ldots , K и m=1,…,Mm=1, \ldots , M.

(d)

Покажите, что:

  1. для каждого mm последовательность {Xmi}\left\{ X_{m_{i}}\right\} является цепью Маркова. Если это к тому же эргодическая цепь Маркова, то Xmi→LXX_{m_{i}} \xrightarrow {\mathcal{L}} X при i→∞i \rightarrow \infty, где XX имеет стационарное распределение цепи.

  2. Если стационарное распределение цепи равно fX(x)f_{X}(x), то

    1M∑m=1Mh(xmk)→∫h(x)fX(x)dx \frac{1}{M} \sum _{m=1}^{M} h\left(x_{m_{k}}\right) \rightarrow \int h(x) f_{X}(x) d x

    при K,M→∞K, M \rightarrow \infty.

Примечание.
?

Это основная теория, лежащая в основе сэмплера Гиббса. Для каждого kk мы сгенерировали независимые случайные величины Xmk,m=1,…,MX_{m_{k}}, m=1, \ldots , M, где XmkX_{m_{k}} распределена согласно fX∣Y(x∣ymk−)f_{X \mid Y}\left(x \mid y_{m_{k-}}\right). Также верно, что для каждого mm и большого kk величина XmkX_{m_{k}} распределена приближённо согласно fX(x)f_{X}(x), хотя эти величины уже не являются независимыми. Преимущества и недостатки этих вычислительных схем (одна длинная цепь против многих коротких цепей) обсуждаются в Gelman and Rubin 1992; см. также Geyer and Thompson 1992 и Smith and Roberts 1992. Преобладающее мнение склоняется в пользу одной длинной цепи.

Задача 4.5.9

Чтобы понять сходимость сэмплера Гиббса, пусть (X,Y)∼f(x,y)(X, Y) \sim f(x, y), и определим

k(x,x′)=∫fX∣Y(x∣y)fY∣X(y∣x′)dy k\left(x, x^{\prime }\right)=\int f_{X \mid Y}(x \mid y) f_{Y \mid X}\left(y \mid x^{\prime }\right) d y
?
(a)

Покажите, что функция h∗(⋅)h^{*}(\cdot ), решающая уравнение h∗(x)=∫k(x,x′)h∗(x′)dx′h^{*}(x)=\int k\left(x, x^{\prime }\right) h^{*}\left(x^{\prime }\right) d x^{\prime }, есть h∗(x)=fX(x)h^{*}(x)= f_{X}(x) — маргинальное распределение XX.

(b)

Запишите аналогичное интегральное уравнение, которому удовлетворяет fY(y)f_{Y}(y).

(c)

Определите последовательность функций рекуррентно как hi+1(x)=∫k(x,x′)hi(x′)dxI′h_{i+1}(x)=\int k\left(x, x^{\prime }\right) h_{i}\left(x^{\prime }\right) d x_{I}^{\prime }, где h0(x)h_{0}(x) произвольна, но удовлетворяет sup⁡x∣h0(x)h∗(x)∣<∞\sup_{x}\left|\frac{h_{0}(x)}{h^{*}(x)}\right|<\infty. Покажите, что

∫∣hi+1(x)−h∗(x)∣dx<∫∣hi(x)−h∗(x)∣dx \int \left|h_{i+1}(x)-h^{*}(x)\right| d x<\int \left|h_{i}(x)-h^{*}(x)\right| d x

и, следовательно, hi(x)h_{i}(x) сходится к h∗(x)h^{*}(x).

[Метод пункта (c) называется методом последовательных подстановок. Когда в сэмплере Гиббса участвуют две переменные, он эквивалентен аугментации данных (Tanner and Wong 1987). Даже если переменные векторнозначны, приведённые выше результаты устанавливают сходимость. Если исходный вектор переменных содержит более двух переменных, то требуется более общая версия этого рассуждения (Gelfand and Smith 1990).]

Задача 4.5.10

Прямая реализация подстановочной выборки методом Монте-Карло обеспечивается алгоритмом аугментации данных (Tanner and Wong 1987). Если определить

hi+1(x)=∫[∫fX∣Y(x∣y)fY∣X(y∣x′)dy]hi(x′)dx′ h_{i+1}(x)=\int \left[\int f_{X \mid Y}(x \mid y) f_{Y \mid X}\left(y \mid x^{\prime }\right) d y\right] h_{i}\left(x^{\prime }\right) d x^{\prime }

то по задаче 5.9 hi(x)→fx(x)h_{i}(x) \rightarrow f_{x}(x) при i→∞i \rightarrow \infty.

?
(a)

Чтобы вычислить hi+1h_{i+1} методом интегрирования Монте-Карло:

  1. Сгенерируйте Xj′∼hi(x′),j=1,…,JX_{j}^{\prime } \sim h_{i}\left(x^{\prime }\right), \quad j=1, \ldots , J.

  2. Для каждого xj′x_{j}^{\prime } сгенерируйте Yjk∼fY∣X(y∣xj′),k=1,…,KY_{j k} \sim f_{Y \mid X}\left(y \mid x_{j}^{\prime }\right), k=1, \ldots , K.

  3. Вычислите h^i+1(x)=1J∑j=1J1K∑k=1KfX∣Y(x∣yjk)\hat{h}_{i+1}(x)=\frac{1}{J} \sum_{j=1}^{J} \frac{1}{K} \sum_{k=1}^{K} f_{X \mid Y}\left(x \mid y_{j k}\right). Тогда h^i+1(x)→hi+1(x)\hat{h}_{i+1}(x) \rightarrow h_{i+1}(x) при J,K→∞J, K \rightarrow \infty, и, следовательно, алгоритм аугментации данных сходится.

(b)

Чтобы реализовать (a)(i), нужно уметь генерировать случайную величину из смеси распределений. Покажите, что если fY(y)=∑i=1naigi(y),Σai=1f_{Y}(y)=\sum_{i=1}^{n} a_{i} g_{i}(y), \Sigma a_{i}=1, то алгоритм

  1. Выбрать gig_{i} с вероятностью aia_{i}

  2. Сгенерировать Y∼giY \sim g_{i} порождает случайную величину с распределением fYf_{Y}.

Отсюда покажите, как реализовать шаг (a)(i), генерируя случайные величины из fX∣Yf_{X \mid Y}. Tanner and Wong (1987) отмечают, что этот алгоритм работает даже при J=1J=1, что даёт приближение

h^i+1(x)=1K∑k=1KfX∣Y(x∣yk), \hat{h}_{i+1}(x)=\frac{1}{K} \sum _{k=1}^{K} f_{X \mid Y}\left(x \mid y_{k}\right),

идентичное сэмплеру Гиббса. Алгоритм аугментации данных можно также рассматривать как применение процедуры множественной импутации (multiple imputation) (Rubin 1976, 1987, Little and Rubin 1987).

Задача 4.5.11

Выборку методом последовательных подстановок можно реализовать через сэмплер Гиббса следующим образом. Из задачи 5.8(c) требуется вычислить

hM=1M∑m=1Mk(x∣xmk)=1M∑m=1M∫fX∣Y(x∣y)fX∣Y(y∣xmk)dy. h_{M}=\frac{1}{M} \sum _{m=1}^{M} k\left(x \mid x_{m_{k}}\right)=\frac{1}{M} \sum _{m=1}^{M} \int f_{X \mid Y}(x \mid y) f_{X \mid Y}\left(y \mid x_{m_{k}}\right) d y.
?
(a)

Покажите, что hM(x)→fX(x)h_{M}(x) \rightarrow f_{X}(x) при M→∞M \rightarrow \infty.

(b)

При заданном xmkx_{m_{k}} приближение Монте-Карло к hM(x)h_{M}(x) имеет вид

h^M(x)=1M∑m=1M1J∑j=1JfX∣Y(x∣ykj) \hat{h}_{M}(x)=\frac{1}{M} \sum _{m=1}^{M} \frac{1}{J} \sum _{j=1}^{J} f_{X \mid Y}\left(x \mid y_{k_{j}}\right)

где Ykj∼fY∣X(y∣xmk)Y_{k_{j}} \sim f_{Y \mid X}\left(y \mid x_{m_{k}}\right) и h^M(x)→hM(x)\hat{h}_{M}(x) \rightarrow h_{M}(x) при J→∞J \rightarrow \infty.

(c)

Следовательно, при M,J→∞,h^M(x)→fX(x)M, J \rightarrow \infty , \hat{h}_{M}(x) \rightarrow f_{X}(x).

Примечание.
?

Это сэмплер Гиббса, который обычно реализуется при J=1J=1.

Задача 4.5.12

Для ситуации примера 5.6 покажите, что

?
(a)
E[1M∑i=1MΘi]=E[1M∑i=1ME[Θ∣x,τi]], \mathbb {E}\left[\frac{1}{M} \sum _{i=1}^{M} \Theta _{i}\right]=\mathbb {E}\left[\frac{1}{M} \sum _{i=1}^{M} \mathbb {E}\left[\Theta \mid \mathbf{x}, \tau _{i}\right]\right],
(b)
var⁡(1M∑i=1MΘi)≥var⁡(1M∑i=1ME[Θ∣x,τi]). \operatorname {var}\left(\frac{1}{M} \sum _{i=1}^{M} \Theta _{i}\right) \geq \operatorname {var}\left(\frac{1}{M} \sum _{i=1}^{M} \mathbb {E}\left[\Theta \mid \mathbf{x}, \tau _{i}\right]\right).
(c)

Обсудите, когда в (b) может достигаться равенство. Можете ли вы привести пример?

Задача 4.5.13

Покажите, что для иерархии (5.5.1) апостериорные распределения π(θ∣x)\pi (\theta \mid \mathbf{x}) и π(λ∣x)\pi (\lambda \mid \mathbf{x}) удовлетворяют

π(θ∣x)=∫[∫π(θ∣x,λ)π(λ∣x,θ′)dλ]π(θ′∣x)dθ′π(λ∣x)=∫[∫π(λ∣x,θ)π(θ∣x,λ′)dθ]π(λ′∣x)dλ′ \begin{align} & \pi (\theta \mid \mathbf{x})=\int \left[\int \pi (\theta \mid \mathbf{x}, \lambda ) \pi \left(\lambda \mid \mathbf{x}, \theta ^{\prime }\right) d \lambda \right] \pi \left(\theta ^{\prime } \mid \mathbf{x}\right) d \theta ^{\prime } \\ & \pi (\lambda \mid \mathbf{x})=\int \left[\int \pi (\lambda \mid \mathbf{x}, \theta ) \pi \left(\theta \mid \mathbf{x}, \lambda ^{\prime }\right) d \theta \right] \pi \left(\lambda ^{\prime } \mid \mathbf{x}\right) d \lambda ^{\prime } \end{align}

и, следовательно, являются стационарными точками цепей Маркова в (5.5.13).

?
Задача 4.5.14

Исходя из равномерной случайной величины U∼Uniform⁡(0,1)U \sim \operatorname {Uniform}(0,1), с помощью преобразований можно построить многие случайные величины.

?
(a)

Покажите, что −log⁡U∼exp⁡(1)-\log U \sim \exp (1).

(b)

Покажите, что −∑i=1nlog⁡Ui∼Gamma⁡(n,1)-\sum_{i=1}^{n} \log U_{i} \sim \operatorname {Gamma}(n, 1), где U1,…,UnU_{1}, \ldots , U_{n} — независимые одинаково распределённые как U(0,1)U(0,1).

(c)

Пусть X∼Exp⁡(a,b)X \sim \operatorname {Exp}(a, b). Запишите XX как функцию от UU.

(d)

Пусть X∼Gamma⁡(n,β)X \sim \operatorname {Gamma}(n, \beta ), nn — целое число. Запишите XX как функцию от U1,…,UnU_{1}, \ldots , U_{n}, независимых одинаково распределённых как U(0,1)U(0,1).

Задача 4.5.15

Начиная со случайной величины U(0,1)U(0,1), преобразования из задачи 5.14 не позволяют получить нормальные случайные величины или гамма-случайные величины с нецелым параметром формы. Один из способов сделать это — использовать алгоритм принятия-отклонения (Accept-Reject Algorithm) (Ripley 1987, раздел 3.2), алгоритм для моделирования X∼f(x)X \sim f(x) :

  1. Сгенерировать Y∼g(y),U∼U(0,1)Y \sim g(y), U \sim U(0,1), независимо.

  2. Вычислить ρ(Y)=1Mf(Y)g(Y)\rho (Y)=\frac{1}{M} \frac{f(Y)}{g(Y)} где M=sup⁡tf(t)/g(t)M=\sup_{t} f(t) / g(t).

  3. Если U<ρ(Y)U<\rho (Y), положить X=YX=Y, иначе вернуться к i).

?
(a)

Покажите, что этот алгоритм генерирует X∼f(x)X \sim f(x).

(b)

Начиная с Y∼exp⁡(1)Y \sim \exp (1), покажите, как сгенерировать X∼N(0,1)X \sim N(0,1).

(c)

Покажите, как сгенерировать гамма-случайную величину с нецелым параметром формы.

Задача 4.5.16

Рассмотрим нормальную иерархическую модель

X∣θ1∼n(θ1,σ12),θ1∣θ2∼n(θ2∣σ22),⋮θk−1∣θk∼n(θk,σk2) \begin{align} X \mid \theta _{1} & \sim n\left(\theta _{1}, \sigma _{1}^{2}\right), \\ \theta _{1} \mid \theta _{2} & \sim n\left(\theta _{2} \mid \sigma _{2}^{2}\right), \\ \vdots & \\ \theta _{k-1} \mid \theta _{k} & \sim n\left(\theta _{k}, \sigma _{k}^{2}\right) \end{align}

где σ12,i=1,…,k\sigma_{1}^{2}, i=1, \ldots , k, известны.

?
(a)

Покажите, что апостериорное распределение θi(1≤i≤k−1)\theta_{i}(1 \leq i \leq k-1) равно

π(θi∣x,θk)=N(αix+(1−αi)θk,τi2) \pi \left(\theta _{i} \mid x, \theta _{k}\right)=N\left(\alpha _{i} x+\left(1-\alpha _{i}\right) \theta _{k}, \tau _{i}^{2}\right)

где τi2=(Σ1iσj2)(Σi+1kσj2)/Σikσj2\tau_{i}^{2}=\left(\Sigma_{1}^{i} \sigma_{j}^{2}\right)\left(\Sigma_{i+1}^{k} \sigma_{j}^{2}\right) / \Sigma_{i}^{k} \sigma_{j}^{2} и αi=τi2/Σ1iσj2\alpha_{i}=\tau_{i}^{2} / \Sigma_{1}^{i} \sigma_{j}^{2}.

(b)

Найдите выражение для информации Кульбака—Лейблера K[π(θi∣x,θk),π(θi∣θk)]K\left[\pi \left(\theta_{i} \mid x, \theta_{k}\right), \pi \left(\theta_{i} \mid \theta_{k}\right)\right] и покажите, что она является убывающей функцией ii.

Задача 4.5.17

В первоначальном доказательстве теоремы 5.7 (Goel and DeGroot 1981) использовалась энтропийная функция Реньи (Rényi 1961)

Rα(f,g)=1α−1log⁡∫fα(x)g1−α(x)dμ(x), R_{\alpha }(f, g)=\frac{1}{\alpha -1} \log \int f^{\alpha }(x) g^{1-\alpha }(x) d \mu (x),

где ff и gg — плотности, μ\mu — доминирующая мера, а α\alpha — постоянная, α≠1\alpha \neq 1.

?
(a)

Покажите, что Rα(f,g)R_{\alpha }(f, g) удовлетворяет Rα(f,g)>0R_{\alpha }(f, g)>0 и Rα(f,f)=0R_{\alpha }(f, f)=0.

(b)

Покажите, что теорема 5.7 остаётся верной, если вместо K[f,g]K[f, g] использовать Rα(f,g)R_{\alpha }(f, g).

(c)

Покажите, что lim⁡α→1Rα(f,g)=K[f,g]\lim_{\alpha \rightarrow 1} R_{\alpha }(f, g)=K[f, g], и приведите другое доказательство теоремы 5.7.

Задача 4.5.18

Информация Кульбака—Лейблера K[f,g]K[f, g] (5.5.25) не симметрична по ff и gg, и модификация, называемая дивергенцией, устраняет эту асимметрию. Определим J[f,g]J[f, g] — дивергенцию между ff и gg — как J[f,g]=K[f,g]+K[g,f]J[f, g]=K[f, g]+K[g, f]. Покажите, что, аналогично теореме 5.7, J[π(λ∣x),γ(λ)]<J[π(θ∣x),π(θ)]J[\pi (\lambda \mid x), \gamma (\lambda )]<J[\pi (\theta \mid x), \pi (\theta )].

?
Задача 4.5.19

Goel and DeGroot (1981) определяют байесовский аналог информации Фишера [см. (2.5.10)] как

I[π(θ∣x)]=∫Ω[∂∂xπ(θ∣x)π(θ∣x)]2dθ \mathcal{I}[\pi (\theta \mid x)]=\int _{\Omega }\left[\frac{\frac{\partial }{\partial x} \pi (\theta \mid x)}{\pi (\theta \mid x)}\right]^{2} d \theta

— информацию, которую xx несёт об апостериорном распределении. Как и в теореме 5.7, покажите, что I[π(λ∣x)]<I[π(θ∣x)]\mathcal{I}[\pi (\lambda \mid x)]<\mathcal{I}[\pi (\theta \mid x)], что снова показывает, что влияние λ\lambda меньше влияния θ\theta.

?
Задача 4.5.20

Каждая из mm спор имеет вероятность τ\tau прорастания. Из rr проросших спор каждая имеет вероятность ω\omega изогнуться в определённом направлении. Если ss изгибается в этом определённом направлении, то вероятностная модель, описывающая этот процесс, — двумерное биномиальное распределение с функцией вероятности

f(r,s∣τ,ω,m)=(mr)τr(1−τ)m−r(rs)ωs(1−ω)r−s. f(r, s \mid \tau , \omega , m)=\binom {m}{r} \tau ^{r}(1-\tau )^{m-r}\binom {r}{s} \omega ^{s}(1-\omega )^{r-s}.
?
(a)

Покажите, что априорное распределение Джеффриса равно πJ(τ,ω)=(1−τ)−1/2ω−1/2(1−ω)−1/2\pi_{J}(\tau , \omega )=(1-\tau )^{-1 / 2} \omega^{-1 / 2}(1-\omega )^{-1 / 2}.

(b)

Если τ\tau рассматривается как мешающий параметр, то референсное априорное распределение равно

πR(τ,ω)=τ−1/2(1−τ)−1/2ω−1/2(1−ω)−1/2. \pi _{R}(\tau , \omega )=\tau ^{-1 / 2}(1-\tau )^{-1 / 2} \omega ^{-1 / 2}(1-\omega )^{-1 / 2}.

Сравните апостериорные средние E[ω∣r,s,m]\mathbb {E}\left[\omega \mid r, s, m\right] при априорном распределении Джеффриса и при референсном априорном распределении. Является ли одно из них более подходящим?

(c)

Как разные априорные распределения влияют на апостериорную дисперсию?

[Априорные распределения для двумерного биномиального распределения рассматривались в работах Crowder and Sweeting (1989), Polson and Wasserman (1990) и Clark and Wasserman (1993), которые предлагают компромиссное референсное/джеффрисовское априорное распределение.]

Задача 4.5.21

Пусть F={f(x∣θ);θ∈Ω}\mathcal{F}=\left\{ f(x \mid \theta ) ; \theta \in \Omega \right\} — семейство плотностей вероятности. Информацию Кульбака—Лейблера для различения двух плотностей из F\mathcal{F} можно записать как

ψ(θ1,θ2)=∫f(x∣θ1)log⁡[f(x∣θ1)f(x∣θ2)]dx. \psi \left(\theta _{1}, \theta _{2}\right)=\int f\left(x \mid \theta _{1}\right) \log \left[\frac{f\left(x \mid \theta _{1}\right)}{f\left(x \mid \theta _{2}\right)}\right] d x.

Напомним, что градиент ψ\psi есть ∇ψ={(∂/∂θi)ψ}\nabla \psi =\left\{ \left(\partial / \partial \theta_{i}\right) \psi \right\}, а гессиан — ∇∇ψ={(∂2/∂θi∂θj)ψ}\nabla \nabla \psi = \left\{ \left(\partial^{2} / \partial \theta_{i} \partial \theta_{j}\right) \psi \right\}.

?
(a)

Если интегрирование и дифференцирование можно менять местами, покажите, что

∇ψ(θ,θ)=0 и det⁡[∇∇ψ(θ,θ)]=I(θ), \nabla \psi (\theta , \theta )=0 \quad \text{ и } \quad \operatorname {det}[\nabla \nabla \psi (\theta , \theta )]=I(\theta ),

где I(θ)I(\theta ) — информация Фишера для f(x∣θ)f(x \mid \theta ).

(b)

George and McCulloch (1993) утверждают, что выбор π(θ)=(det⁡[∇∇ψ(θ,θ)])1/2\pi (\theta )=(\operatorname {det}[\nabla \nabla \psi (\theta , \theta )])^{1 / 2} представляет собой привлекательный наименее информативный выбор априорного распределения. Какое обоснование вы можете этому дать?