第 11 章 点估计理论

CHAPTER STATUS编写进度1%查看全书进度

Definition 11.1. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(g\)是定义在\(\Theta\)上的函数,它是一个待估量(estimand),一般默认它为实函数。若将样本的可测函数\(\delta(\mathbf{X})\)作为\(g(\theta)\)的估计,称这种估计方式为点估计(point estimation)\(\delta(\mathbf{X})\)被称为\(g(\theta)\)估计量(estimator)

Definition 11.2. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)是定义在\(\Theta\)上的函数,\(\delta(\mathbf{X})\)\(g(\theta)\)的一个估计量。如果:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\operatorname{E}_{\theta}[\delta(\mathbf{X})]=g(\theta) \end{equation*}\]

则称\(\delta(\mathbf{X})\)\(g(\theta)\)的一个无偏估计(unbiased estimation)。若\(g(\theta)\)存在无偏估计量,则称\(g(\theta)\)U可估(U-estimable)

Definition 11.3. 称满足\(\operatorname{E}_{\theta}[\delta(\mathbf{X})]=0\)的估计量\(\delta(\mathbf{X})\)零无偏估计量

Property 11.0.1. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(p\in[1,+\infty]\)\(\delta(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_p(X,\mathscr{A},P)\),且\(\delta(\mathbf{X})\)是待估量\(g(\theta)\in\mathbb{R}\)的无偏估计量,则所有属于\(\underset{P\in\mathscr{P}}{\cap}L_p(X,\mathscr{A},P)\)\(g(\theta)\)的所有无偏估计量为:

\[\begin{equation*} \left\{\delta(\mathbf{X})-f(\mathbf{X}):f(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_p(X,\mathscr{A},P),\;\operatorname{E}_\theta[f(\mathbf{X})]=0,\;\forall\theta\in\Theta\right\} \end{equation*}\]

证明. 充分性:定理 5.29性质 5.4.3(6)性质 5.5.1性质 5.5.2立即可得。

必要性:任取\(\delta_1(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_p(X,\mathscr{A},P)\)\(g(\theta)\)的一个无偏估计量,由性质 5.5.1性质 5.5.2可知:

\[\begin{equation*} f(\mathbf{X})=\delta(\mathbf{X})-\delta_1(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_p(X,\mathscr{A},P) \end{equation*}\]

根据定理 5.29性质 5.4.3(6)可得:

\[\begin{equation*} \operatorname{E}_\theta[f(\mathbf{X})]=\operatorname{E}_\theta[\delta(\mathbf{X})]-\operatorname{E}_\theta[\delta_1(\mathbf{X})]=g(\theta)-g(\theta)=0 \end{equation*}\]

\(\delta_1(\mathbf{X})\)的任意性可知必要性成立。 ◻

Definition 11.4. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)是定义在\(\Theta\)上的函数,\(\delta(\mathbf{X})\)\(g(\theta)\)的一个估计量。如果:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\lim_{n\to+\infty}\operatorname{E}_{\theta}[\delta_n(\mathbf{X})]=g(\theta) \end{equation*}\]

则称\(\delta_n(\mathbf{X})\)\(g(\theta)\)的一个渐进无偏估计(asymptotically unbiased estimation)

Definition 11.5. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)是定义在\(\Theta\)上的函数,\(\mathcal{D}\)为估计量的取值空间。若函数:

\[\begin{equation*} L:g(\Theta)\times\mathcal{D}\to[0,+\infty] \end{equation*}\]

满足对任意\(\theta\in\Theta\)\(L[g(\theta),\delta(\mathbf{X})]\)\((X^n,\mathscr{A}^n)\)上的可测函数,其中\(\delta(\mathbf{X})\)\(g(\theta)\)的一个估计量,则称\(L\)为该估计问题下的损失函数(loss function),称\(L[g(\theta),\delta(\mathbf{X})]\)为当待估量真值为\(g(\theta)\)且采用估计量\(\delta(\mathbf{X})\)时产生的损失。

Definition 11.6. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)是定义在\(\Theta\)上的函数,\(\delta(\mathbf{X})\)\(g(\theta)\)的一个估计量,\(L\)是该估计问题下的损失函数。称:

\[\begin{equation*} R[g(\theta),\delta(\mathbf{X})]=\operatorname{E}_{\theta}\{L[g(\theta),\delta(\mathbf{X})]\} \end{equation*}\]

为估计量\(\delta(\mathbf{X})\)在待估量真值为\(g(\theta)\)处关于损失函数\(L\)风险函数(risk function)

Definition 11.7. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)是定义在\(\Theta\)上的函数,\(\delta(\mathbf{X})\)\(g(\theta)\)的一个估计量,\(\delta_1(\mathbf{X}),\delta_2(\mathbf{X})\)\(g(\theta)\)的两个不同的无偏估计量。若:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\operatorname{Var}_{\theta}[\delta_1(\mathbf{X})]\leqslant\operatorname{Var}_{\theta}[\delta_2(\mathbf{X})] \end{equation*}\]

且至少存在一个\(\theta\in\Theta\)使得小于号成立,则称估计量\(\delta_1(\mathbf{X})\)\(\delta_2(\mathbf{X})\)有效

Definition 11.8. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X_n}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)是定义在\(\Theta\)上的函数,\(\delta(\mathbf{X})\)\(g(\theta)\)的一个估计量。若\(\delta(\mathbf{X_n})\overset{P}{\longrightarrow}g(\theta)\),则称\(\delta(\mathbf{X})\)\(g(\theta)\)弱相合估计(weakly consistent estimation)。若\(\delta(\mathbf{X_n})\overset{\text{a.s.}}{\longrightarrow}g(\theta)\),则称\(\delta(\mathbf{X})\)\(g(\theta)\)强相合估计(strongly consistent estimation)。若:

\[\begin{equation*} \lim_{n\to+\infty}\operatorname{E}_{\theta}[|\delta(\mathbf{X_n})-g(\theta)|^r]=0 \end{equation*}\]

则称\(\delta(\mathbf{X})\)\(g(\theta)\)r阶矩相合估计,当\(r=2\)时称\(\delta(\mathbf{X})\)\(g(\theta)\)均方相合估计

11.1 一致最小风险无偏估计

Definition 11.9. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)为待估量,\(\operatorname{R}[g(\theta),d]\)为风险函数。若估计量\(\delta(\mathbf{X})\)\(g(\theta)\)的任一估计量\(\delta'(\mathbf{X})\)有:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\operatorname{R}[g(\theta),\delta(\mathbf{X})]\leqslant\operatorname{R}[g(\theta),\delta'(\mathbf{X})] \end{equation*}\]

则称\(\delta(\mathbf{X})\)\(g(\theta)\)一致最小风险估计(uniformly minimum-risk estimation)

note 11.1. 风险函数是用来衡量估计量与真实值差异的函数,估计量的一致最小风险估计常不存在。考虑到上述情况,我们转向研究在某一估计量族中寻找一致最小风险估计,而不是在所有估计量中去寻找。人们关注最多的便是在无偏估计量族中的情况。

Definition 11.10. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)为存在无偏估计量的待估量,\(\operatorname{R}[g(\theta),d]\)为风险函数。若无偏估计量\(\delta(\mathbf{X})\)\(g(\theta)\)的任一无偏估计量\(\delta'(\mathbf{X})\)有:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\operatorname{R}[g(\theta),\delta(\mathbf{X})]\leqslant\operatorname{R}[g(\theta),\delta'(\mathbf{X})] \end{equation*}\]

则称\(\delta(\mathbf{X})\)\(g(\theta)\)一致最小风险无偏估计(uniformly minimum-risk unbiased estimation)

Theorem 11.1. (Rao-Blackwell Theorem)

\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)为待估量,\(\delta(\mathbf{X})\)\(g(\theta)\)的估计量,\(T\)\(\mathscr{P}\)的充分统计量,损失函数\(L[g(\theta),d]\)对任意的\(\theta\in\Theta\)是关于\(d\)的凸函数。若\(\delta(\mathbf{X}),L[g(\theta),\delta(\mathbf{X})]\in\underset{P\in\mathscr{P}}{\cap}L_1(X,\mathscr{A},P)\),则:

\[\begin{equation*} h(T)=\operatorname{E}_{\theta}[\delta(\mathbf{X})|T] \end{equation*}\]

满足:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\operatorname{R}[g(\theta),h(T)]\leqslant\operatorname{R}[g(\theta),\delta(\mathbf{X})] \end{equation*}\]

\(L[g(\theta),d]\)对任意的\(\theta\in\Theta\)关于\(d\)严格凸,则等号成立当且仅当\(\delta(\mathbf{X})=\operatorname{E}_{\theta}[\delta(\mathbf{X})|T]=h(T)\;\)a.s.于\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立。若\(\delta(\mathbf{X})\)\(g(\theta)\)的无偏估计量,则\(h(T)\)也是\(g(\theta)\)的无偏估计量。

证明. 因为\(T\)是充分统计量,所以对任意的\(P\in\mathscr{P}\)\(P(\mathbf{X}|T)\)\(\theta\)无关,于是\(h(T)=\operatorname{E}_{\theta}[\delta(\mathbf{X})|T]\)也与\(\theta\)无关,由条件期望的定义可得\(h(T)\)可测,于是\(h(T)\)是一个统计量。因为\(\delta(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_1(X,\mathscr{A},P)\),由性质 6.3.2(3)可知\(h(T)\in\underset{P\in\mathscr{P}}{\cap}L_1(X,\mathscr{A},P)\)

不等式 19中取\(\varphi(d)=L[g(\theta),d]\)可得:

\[\begin{equation*} \forall\;P\in\mathscr{P},\;\varphi[h(T)]=\varphi\{\operatorname{E}_{\theta}[\delta(\mathbf{X})|T]\}\leqslant\operatorname{E}_{\theta}\{\varphi[\delta(\mathbf{X})]|T\}\;\text{a.s.于}(X,\sigma(T),P) \end{equation*}\]

\(L[g(\theta),d]\)对任意的\(\theta\in\Theta\)关于\(d\)严格凸时等号成立a.s.于\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立当且仅当\(\delta(\mathbf{X})=\operatorname{E}_{\theta}[\delta(\mathbf{X})|T]=h(T)\;\)a.s.于\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立。根据性质 5.4.3(7)性质 6.3.2(3),对上式两边同时求期望可得:

\[\begin{align*} &R[g(\theta),h(T)]=\operatorname{E}_{\theta}\{L[g(\theta),h(T)]\}\leqslant\operatorname{E}_{\theta}\Big\{\operatorname{E}_{\theta}\{\varphi[\delta(\mathbf{X})]|T\}\Big\} \\ =&\operatorname{E}_{\theta}\{\varphi[\delta(\mathbf{X})]\}=\operatorname{E}_{\theta}\{L[g(\theta),\delta(\mathbf{X})]\}=\operatorname{R}[g(\theta),\delta(\mathbf{X})] \end{align*}\]

\(L[g(\theta),d]\)对任意的\(\theta\in\Theta\)关于\(d\)严格凸,由性质 5.4.3(8)可知当\(\delta(\mathbf{X})=\operatorname{E}_{\theta}[\delta(\mathbf{X})|T]=h(T)\;\)a.s.于\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立时上式等号成立。当上式等号成立时,因为\(L[g(\theta),\delta(\mathbf{X})]\in\underset{P\in\mathscr{P}}{\cap}L_1(X,\mathscr{A},P)\),由性质 5.4.3(6)可得:

\[\begin{equation*} \operatorname{E}_{\theta}\{L[g(\theta),h(T)]\}-\operatorname{E}_{\theta}\Big\{\operatorname{E}_{\theta}\{\varphi[\delta(\mathbf{X})]|T\}\Big\}=\operatorname{E}_{\theta}\Big\{\varphi[h(T)]-\operatorname{E}_{\theta}\{\varphi[\delta(\mathbf{X})]|T\}\Big\}=0 \end{equation*}\]

\(\varphi[h(T)]\leqslant\operatorname{E}_{\theta}\{\varphi[\delta(\mathbf{X})]|T\}\;\)a.s.于\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立,根据性质 5.4.3(9)可知\(\varphi[h(T)]=\operatorname{E}_{\theta}\{\varphi[\delta(\mathbf{X})]|T\}\;\)a.s.于\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立,由不等式 19可知\(\delta(\mathbf{X})=\operatorname{E}_{\theta}[\delta(\mathbf{X})|T]=h(T)\;\)a.s.于任意的\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立。于是对任意的\(\theta\in\Theta,\;\operatorname{R}[g(\theta),h(T)]=\operatorname{R}[g(\theta),\delta(\mathbf{X})]\)当且仅当\(\delta(\mathbf{X})=\operatorname{E}_{\theta}[\delta(\mathbf{X})|T]=h(T)\;\)a.s.于\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立。

\(\delta(\mathbf{X})\)\(g(\theta)\)的无偏估计量时,由性质 6.3.2(3)可知\(h(T)\)也是\(g(\theta)\)的无偏估计量。 ◻

推论 12.1 Corollary 11.1. 若损失函数\(L[g(\theta),d]\)对任意的\(\theta\in\Theta\)是关于\(d\)的严格凸函数,则UMRUE是充分统计量\(T\)的函数a.s.于\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立。

证明. \(\delta(\mathbf{X})\)是一个UMRE,由定理 11.1可知取充分统计量\(T\)则有:

\[\begin{equation*} \operatorname{R}\{\operatorname{E}_{\theta}[\delta(\mathbf{X})|T]\}=\operatorname{R}[\delta(\mathbf{X})] \end{equation*}\]

根据取等条件可知\(\delta(\mathbf{X})=\operatorname{E}_{\theta}[\delta(\mathbf{X})|T]=h(T)\;\)a.s.于\((X,\sigma(T),P)\)对任意的\(P\in\mathscr{P}\)成立,由Doob-Dynkin引理1即可得出结论。 ◻

Definition 11.11. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)为待估量,\(\delta(\mathbf{X})\)\(g(\theta)\)的估计量,\(T\)\(\mathscr{P}\)的充分统计量,称:

\[\begin{equation*} h(T)=\operatorname{E}_{\theta}[\delta(\mathbf{X})|T] \end{equation*}\]

\(\delta(\mathbf{X})\)关于\(T\)的Rao-Blackwell改进。

Theorem 11.2. (Lehmann-Scheffe Theorem)

\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\in\mathbb{R}^{}\)为U可估的待估量,损失函数\(L[g(\theta),d]\in\underset{P\in\mathscr{P}}{\cap}L_1(X,\mathscr{A},P)\)对任意的\(\theta\in\Theta\)是关于\(d\)的凸函数。若\(\mathscr{P}\)存在完全充分统计量\(S(\mathbf{X})\),则\(g(\theta)\)的UMRUE存在,任一\(g(\theta)\)的在\(\underset{P\in\mathscr{P}}{\cap}L_1(X,\mathscr{A},P)\)中的无偏估计量关于\(S(\mathbf{X})\)的Rao-Blackwell改进都是UMRUE。若\(L[g(\theta),d]\)对任意的\(\theta\in\Theta\)关于\(d\)严格凸,则\(g(\theta)\)的UMRUE在a.s.于\((X,\mathscr{F},P)\)对任意的\(P\in\mathscr{P}\)成立的意义下唯一。

证明. 任取\(g(\theta)\)的一个无偏估计量\(\delta(\mathbf{X})\),由定理 11.1可知\(T_1=\operatorname{E}_{\theta}[\delta(\mathbf{X})|S(\mathbf{X})]\)仍是\(g(\theta)\)的一个无偏估计量且风险函数值比\(\delta(\mathbf{X})\)更小。任取\(g(\theta)\)的另一无偏估计量\(\delta'(\mathbf{X})\),同理可知\(T_2=\operatorname{E}_{\theta}[\delta'(\mathbf{X})|S(\mathbf{X})]\)仍是\(g(\theta)\)的一个无偏估计量且风险函数值比\(\delta'(\mathbf{X})\)更小。因为\(g(\theta)\in\mathbb{R}^{}\),所以\(\delta(\mathbf{X}),\delta'(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_1(X,\mathscr{A},P)\),于是对任意的\(\theta\in\Theta\),由性质 6.3.2(5)(3)性质 5.4.3(6)可得:

\[\begin{align*} &\operatorname{E}_{\theta}(T_1-T_2)=\operatorname{E}_{\theta}\{\operatorname{E}_{\theta}[\delta(\mathbf{X})|S(\mathbf{X})]-\operatorname{E}_{\theta}[\delta'(\mathbf{X})|S(\mathbf{X})]\}=\operatorname{E}_{\theta}\{\operatorname{E}_{\theta}[\delta(\mathbf{X})-\delta'(\mathbf{X})|S(\mathbf{X})]\} \\ =&\operatorname{E}_{\theta}[\delta(\mathbf{X})-\delta'(\mathbf{X})]=\operatorname{E}_{\theta}[\delta(\mathbf{X})]-\operatorname{E}_{\theta}[\delta'(\mathbf{X})]=g(\theta)-g(\theta)=0 \end{align*}\]

根据Doob-Dynkin引理和性质 5.3.3(5.a)可知\(T_1-T_2\)是关于\(S(\mathbf{X})\)的可测函数,由完全统计量的定义即可得到\(T_1=T_2\;\)a.s.于\((X,\mathscr{F},P)\)对任意的\(P\in\mathscr{P}\)成立,\(L(\theta,T_1)=L(\theta,T_2)\;\)a.s.于\((X,\mathscr{F},P)\)对任意的\(P\in\mathscr{P}\)成立,于是根据性质 5.4.3(8)定理 11.1可得:

\[\begin{equation*} \operatorname{R}(\delta,T_1)=\operatorname{R}(\delta,T_2)\leqslant\operatorname{R}[\delta,\delta'(\mathbf{X})] \end{equation*}\]

\(\delta'(\mathbf{X})\)的任意性,\(T_1\)\(g(\theta)\)的UMRUE,所以\(g(\theta)\)的UMRUE存在。由\(\delta(\mathbf{X})\)的任意性,任一\(g(\theta)\)的无偏估计量关于\(S(\mathbf{X})\)的Rao-Blackwell改进都是UMRUE。

对于\(g(\theta)\)的任意一个UMRUE\(\;\delta_1(\mathbf{X})\),它的Rao-Blackwell改进的风险函数值一定等于原本的风险函数值,若\(L[g(\theta),d]\)关于\(d\)严格凸,由定理 11.1中的取等条件可知\(\delta_1(\mathbf{X})=h[S(\mathbf{X})]\;\)a.s.于\((X,\mathscr{F},P)\)对任意的\(P\in\mathscr{P}\)成立,修改其在一个零测集上的数值使得得到的\(\delta_1'(\mathbf{X})=h[S(\mathbf{X})]\),由完备性的定义,仿照存在性的证明可得所有经过修改后的UMRUE相等a.s.于\((X,\mathscr{F},P)\)对任意的\(P\in\mathscr{P}\)成立,由性质 5.1.6(2)性质 5.2.1(3)(次有限可加性)可知原本的UMRUE相等a.s.于\((X,\mathscr{F},P)\)对任意的\(P\in\mathscr{P}\)成立,唯一性成立。 ◻

note 11.2. 上述定理给了寻找UMRUE的两个方法:如果损失函数\(L[g(\theta),d]\)是关于\(d\)的凸函数,\(\mathscr{P}\)存在完全充分统计量\(S(\mathbf{X})\),则:

  1. 方程组:

    \[\begin{equation*} \forall\;\theta\in\Theta,\;\operatorname{E}_{\theta}\{\delta[S(\mathbf{X})]\}=g(\theta) \end{equation*}\]

    给出的估计量\(\delta\)即为UMRUE;

  2. 找出一个\(g(\theta)\)的无偏估计,求其关于\(S(\mathbf{X})\)的Rao-Blackwell 改进。

证明也很简单:对于方法一而言,满足条件的\(\delta[S(\mathbf{X})]\)\(g(\theta)\)的一个无偏估计,且其关于\(S(\mathbf{X})\)的Rao-Blackwell改进就是自身;方法二是上述定理的直接结果。

11.1.1 一致最小方差无偏估计

Definition 11.12. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)为存在无偏估计量的待估量。由性质 6.3.6(1),若估计量\(\delta(\mathbf{X})\)\(g(\theta)\)的任一无偏估计量\(\delta'(\mathbf{X})\)有:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\operatorname{MSE}_{\theta}[\delta(\mathbf{X})]=\operatorname{Var}_{\theta}[\delta(\mathbf{X})]\leqslant\operatorname{MSE}_{\theta}[\delta'(\mathbf{X})]=\operatorname{Var}_{\theta}[\delta'(\mathbf{X})] \end{equation*}\]

则称\(\delta(\mathbf{X})\)\(g(\theta)\)一致最小方差无偏估计(uniformly minimum-variance unbiased estimation)

note 11.3. 由定义可知二次函数是严格凸函数,所以前述Rao-Blackwell Theorem和Lehmann-Scheffe Theorem在风险函数为方差时都成立。

Theorem 11.3. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)为U可估的待估量,\(\delta(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P)\)\(g(\theta)\)的一个无偏估计量。令:

\[\begin{equation*} A=\left\{f(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P):\forall\;\theta\in\Theta,\;\operatorname{E}_{\theta}[f(\mathbf{X})]=0\right\} \end{equation*}\]

\(\delta(\mathbf{X})\)\(g(\theta)\)的UMVUE的充要条件为:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\forall\;f(\mathbf{X})\in A,\;\operatorname{Cov}_{\theta}[\delta(\mathbf{X}),f(\mathbf{X})]=\operatorname{E}_{\theta}[\delta(\mathbf{X})\cdot f(\mathbf{X})]=0 \end{equation*}\]

证明. 定理 5.29性质 5.4.3(6)可知\(\operatorname{Var}_{\theta}[\delta(\mathbf{X})],\operatorname{Var}_{\theta}[f(\mathbf{X})],\operatorname{E}_{\theta}\{\delta(\mathbf{X})-\operatorname{E}_{\theta}[\delta(\mathbf{X})]\}\)\(\operatorname{E}_{\theta}\{f(\mathbf{X})-\operatorname{E}_{\theta}[f(\mathbf{X})]\}\)对任意的\(\theta\in\Theta\)都存在,根据不等式 4可得\(\operatorname{Cov}_{\theta}[\delta(\mathbf{X}),f(\mathbf{X})]\)对任意的\(\theta\in\Theta\)都存在。由性质 5.4.3(6)可知:

\[\begin{align*} &\operatorname{Cov}_{\theta}[\delta(\mathbf{X}),f(\mathbf{X})]=\operatorname{E}_{\theta}\{[\delta(\mathbf{X})-g(\theta)]f(\mathbf{X})\} \\ =&\operatorname{E}_{\theta}[\delta(\mathbf{X})\cdot f(\mathbf{X})]-g(\theta)\operatorname{E}_{\theta}[f(\mathbf{X})]=\operatorname{E}_{\theta}[\delta(\mathbf{X})\cdot f(\mathbf{X})] \end{align*}\]

(1)充分性:性质 11.0.1可知对任意\(g(\theta)\)的无偏估计\(\delta'(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P)\)(若\(\delta'(\mathbf{X})\notin\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P)\),由性质 6.3.5(1)可知存在\(P\in\mathscr{P}\)使得\(\operatorname{Var}_{\theta}[\delta'(\mathbf{X})]=+\infty\),没有讨论的必要),都存在一个\(f(\mathbf{X})\in A\)使得\(\delta'(\mathbf{X})=\delta(\mathbf{X})+f(\mathbf{X})\)。由性质 6.3.5(3)性质 5.4.2(2)可得:

\[\begin{align*} \operatorname{Var}_{\theta}[\delta'(\mathbf{X})]&=\operatorname{Var}_{\theta}[\delta(\mathbf{X})+f(\mathbf{X})]=\operatorname{Var}_{\theta}[\delta(\mathbf{X})]+\operatorname{Var}_{\theta}[f(\mathbf{X})]+2\operatorname{Cov}_{\theta}[\delta(\mathbf{X}),f(\mathbf{X})] \\ &=\operatorname{Var}_{\theta}[\delta(\mathbf{X})]+\operatorname{Var}_{\theta}[f(\mathbf{X})]\geqslant\operatorname{Var}_{\theta}[\delta(\mathbf{X})] \end{align*}\]

所以\(\delta(\mathbf{X})\)\(g(\theta)\)的UMVUE。

(2)必要性:性质 5.4.3(6)可知对任意的\(f(\mathbf{X})\in A\)和任意的\(a\in\mathbb{R}^{}\)\(\delta(\mathbf{X})+af(\mathbf{X})\)\(g(\theta)\)的无偏估计量,所以根据性质 5.5.1性质 6.3.5(3)性质 6.3.4(3)性质 5.4.2(10)可得:

\[\begin{align*} &\operatorname{Var}_{\theta}[\delta(\mathbf{X})]\leqslant\operatorname{Var}_{\theta}[\delta(\mathbf{X})+af(\mathbf{X})]=\operatorname{Var}_{\theta}[\delta(\mathbf{X})]+2\operatorname{Cov}_{\theta}[\delta(\mathbf{X}),af(\mathbf{X})]+\operatorname{Var}_{\theta}[af(\mathbf{X})] \\ =&\operatorname{Var}_{\theta}[\delta(\mathbf{X})]+2a\operatorname{Cov}_{\theta}[\delta(\mathbf{X}),f(\mathbf{X})]+a^2\operatorname{Var}_{\theta}[f(\mathbf{X})],\;\forall\;\theta\in\Theta \end{align*}\]

即:

\[\begin{equation*} 2a\operatorname{Cov}_{\theta}[\delta(\mathbf{X}),f(\mathbf{X})]+a^2\operatorname{Var}_{\theta}[f(\mathbf{X})]\geqslant0,\;\forall\;\theta\in\Theta,\;\forall\;a\in\mathbb{R}^{} \end{equation*}\]

将上式看作关于\(a\)的一元二次方程,由判别式可得:

\[\begin{equation*} \operatorname{Cov}_{\theta}^2[\delta(\mathbf{X}),f(\mathbf{X})]\leqslant0,\;\forall\;\theta\in\Theta \end{equation*}\]

\(\operatorname{Cov}_{\theta}[\delta(\mathbf{X}),f(\mathbf{X})]=0\)对任意的\(\theta\in\Theta\)成立。由\(f(\mathbf{X})\)的任意性,必要性成立。 ◻

推论 12.2 Corollary 11.2. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)为U可估的待估量,\(T\)\(\mathscr{P}\)的充分统计量,\(\delta(T)\in\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P)\)\(g(\theta)\)的一个无偏估计量。令:

\[\begin{equation*} A=\left\{f(T)\in\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P):\forall\;\theta\in\Theta,\;\operatorname{E}_{\theta}[f(T)]=0\right\} \end{equation*}\]

\(\delta(T)\)\(g(\theta)\)的UMVUE的充要条件为:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\forall\;f(T)\in A,\;\operatorname{Cov}_{\theta}[\delta(T),f(T)]=\operatorname{E}_{\theta}[\delta(T)\cdot f(T)]=0 \end{equation*}\]

note 11.4. 其实这个定理也可以推广到凸函数的情况,但是要涉及到一些优化的知识,我对优化了解的太少了,看不懂。

11.1.1.1 信息不等式

现在我们来换一种角度去思考,能否求出所有无偏估计量方差的下界(它应该是个关于参数的函数),然后通过计算一个估计量的方差是否等于该下界来判断它是不是UMVUE?于是我们想到了不等式 4,设\(\delta\)是一个无偏估计量,\(\varphi\)\(x\)和参数\(\theta\)的函数,当\(\delta,\varphi\in L_2(X)\)时有:

\[\begin{equation*} \operatorname{Var}(\delta)\geqslant\frac{[\operatorname{Cov}(\delta,\varphi)]^2}{\operatorname{Var}(\varphi)} \end{equation*}\]

可此时还是没用,因为左右两边都包含了\(\delta\)。当右式依赖于\(\delta\)的方式是仅依赖于它的期望\(g(\theta)\)时,上式就能给出\(\operatorname{Var}(\delta)\)的一个下界了。

Lemma 11.1. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)为U可估的待估量,\(\delta\)\(g(\theta)\)的一个无偏估计量,\(\varphi\)\(\mathbf{X}\)和参数\(\theta\)的函数,\(\delta,\varphi\in\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P)\)。令:

\[\begin{equation*} A=\{f(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P):\forall\;\theta\in\Theta,\;\operatorname{E}_{\theta}[f(\mathbf{X})]=0\} \end{equation*}\]

\(\operatorname{Cov}_{\theta}(\delta,\varphi)\)依赖于\(\delta\)的方式是仅依赖于\(g(\theta)\)的充要条件是对任意的\(\theta\in\Theta\)和任意的\(f(\mathbf{X})\in A\)\(\operatorname{Cov}_{\theta}(f,\varphi)=0\)

证明. 根据不等式 4可知\(\operatorname{Cov}_{\theta}(\delta,\varphi)\)存在对任意的\(\theta\)成立,\(\operatorname{Cov}_{\theta}(\delta,\varphi)\)依赖于\(\delta\)的方式是仅依赖于\(g(\theta)\)当且仅当对\(g(\theta)\)的任意两个无偏估计量\(\delta_1,\delta_2\)\(\operatorname{Cov}_{\theta}(\delta_1,\varphi)=\operatorname{Cov}_{\theta}(\delta_2,\varphi)\),由性质 6.3.4(3)(5)可知上式成立当且仅当\(\operatorname{Cov}_{\theta}(\delta_1-\delta_2,\varphi)=0\),由性质 5.4.3(6)可知\(\operatorname{E}_{\theta}(\delta_1-\delta_2)=\operatorname{E}_{\theta}(\delta_1)-\operatorname{E}_{\theta}(\delta_2)=0\),必要性成立。充分性使用反证法即可。 ◻

note 11.5. 由上述引理,我们可以构造\(\varphi\)来让\(\operatorname{Cov}_{\theta}(f,\varphi)=0\),一个在可控结构下很容易想到的情况导出了下面的定理。

Theorem 11.4. (Hammersley-Chapman-Robbins Inequality)

\((X,\mathscr{A},\mathscr{P})\)是可控参数结构,控制测度为\(\mu\)\(\Theta\)是参数空间,概率函数族\(\left\{p_{\theta}=\dfrac{\mathop{}\!\mathrm{d}P_{\theta}}{\mathop{}\!\mathrm{d}\mu}:\theta\in\Theta\right\}\)有共同支撑,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(\delta(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P)\)\(g(\theta)\)的一个估计量,则:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\operatorname{Var}_{\theta}[\delta(\mathbf{X})]\geqslant\sup_{\theta'\ne\theta}\dfrac{[\operatorname{E}_{\theta'}(\delta)-\operatorname{E}_{\theta}(\delta)]^2}{\operatorname{E}_{\theta}\left\{\left[\dfrac{p_{\theta'}(\mathbf{X})}{p_{\theta}(\mathbf{X})}-1\right]^2\right\}} \end{equation*}\]

在:

\[\begin{equation*} \forall\;\theta,\theta'\in\Theta,\;\operatorname{E}_{\theta}\left\{\left[\dfrac{p_{\theta'}(\mathbf{X})}{p_{\theta}(\mathbf{X})}-1\right]^2\right\}\in(0,+\infty) \end{equation*}\]

时成立,其中\(\theta\ne\theta'\)

证明. 给出\(\varphi\)的两种构造:

\[\begin{equation*} \varphi_1(x,\theta)=\frac{p_{\theta'}(x)}{p_{\theta}(x)}-1,\quad\varphi_2(x,\theta)=\frac{p_{\theta'}(x)-p_{\theta}(x)}{\theta'-\theta}\frac{1}{p_{\theta}(x)} \end{equation*}\]

仅对第二种情况进行证明。

引理 5.10性质 5.4.3(6)可得:

\[\begin{gather*} \begin{aligned} &\operatorname{E}_{\theta}[\varphi(\mathbf{X},\theta)]=\int_{X}\frac{p_{\theta'}(x)-p_{\theta}(x)}{\theta'-\theta}\frac{1}{p_{\theta}(x)}p_{\theta}(x)\mathop{}\!\mathrm{d}\mu \\ =&\frac{1}{\theta'-\theta}\left[\int_{X}p_{\theta'}(x)\mathop{}\!\mathrm{d}\mu-\int_{X}p_{\theta}(x)\mathop{}\!\mathrm{d}\mu\right]=\frac{1}{\theta'-\theta}\cdot0=0 \end{aligned} \\ \begin{aligned} \operatorname{Var}_{\theta}[\varphi(\mathbf{X},\theta)]=\operatorname{E}_{\theta}\left\{\left[\frac{p_{\theta'}(\mathbf{X})-p_{\theta}(\mathbf{X})}{p_{\theta}(\mathbf{X})(\theta'-\theta)}\right]^2\right\}=\frac{1}{(\theta'-\theta)^2}\operatorname{E}_{\theta}\left\{\left[\frac{p_{\theta'}(\mathbf{X})}{p_{\theta}(\mathbf{X})}-1\right]^2\right\}\in(0,+\infty) \end{aligned} \\ \begin{aligned} &\operatorname{Cov}_{\theta}(\delta,\varphi)=\operatorname{E}_{\theta}\{[\delta-\operatorname{E}_{\theta}(\delta)]\varphi\}=\int_{X}[\delta-\operatorname{E}_{\theta}(\delta)]\frac{p_{\theta'}(x)-p_{\theta}(x)}{\theta'-\theta}\frac{1}{p_{\theta}(x)}p_{\theta}(x)\mathop{}\!\mathrm{d}\mu \\ =&\frac{1}{\theta'-\theta}\left\{\int_{X}\delta[p_{\theta'}(x)-p_{\theta}(x)]\mathop{}\!\mathrm{d}\mu-\operatorname{E}_{\theta}(\delta)\left[\int_{X}p_{\theta'}(x)\mathop{}\!\mathrm{d}\mu-\int_{X}p_{\theta}(x)\mathop{}\!\mathrm{d}\mu\right]\right\} \\ =&\frac{1}{\theta'-\theta}\left[\int_{X}\delta p_{\theta'}(x)\mathop{}\!\mathrm{d}\mu-\int_{X}\delta p_{\theta}(x)\mathop{}\!\mathrm{d}\mu\right]=\frac{\operatorname{E}_{\theta'}(\delta)-\operatorname{E}_{\theta}(\delta)}{\theta'-\theta} \end{aligned} \end{gather*}\]

不等式 4性质 5.4.3(6)可得:

\[\begin{align*} &\operatorname{Var}_{\theta}[\delta(\mathbf{X})]\geqslant\frac{\operatorname{Cov}_{\theta}^2(\delta,\varphi)}{\operatorname{Var}_{\theta}(\varphi)} \\ =&\left[\frac{\operatorname{E}_{\theta'}(\delta)-\operatorname{E}_{\theta}(\delta)}{\theta'-\theta}\right]^2\Big/\operatorname{E}_{\theta}\left\{\left[\frac{p_{\theta'}(\mathbf{X})-p_{\theta}(\mathbf{X})}{p_{\theta}(\mathbf{X})(\theta'-\theta)}\right]^2\right\} \\ =&[\operatorname{E}_{\theta'}(\delta)-\operatorname{E}_{\theta}(\delta)]^2\Big/\operatorname{E}_{\theta}\left\{\left[\frac{p_{\theta'}(\mathbf{X})}{p_{\theta}(\mathbf{X})}-1\right]^2\right\} \end{align*}\]

由上确界的不等式性即可得出结论。 ◻

note 11.6. 在 Hammersley-Chapman-Robbins 不等式的证明中,第二种构造为:

\[\begin{equation*} \varphi_2(x,\theta)=\frac{p_{\theta'}(x)-p_\theta(x)}{\theta'-\theta}\frac{1}{p_\theta(x)} \end{equation*}\]

\(\theta'=\theta+h\),则可将其写成:

\[\begin{equation*} \varphi_h(x,\theta)=\frac{p_{\theta+h}(x)-p_\theta(x)} {hp_\theta(x)} \end{equation*}\]

这是一个微分的结构,很自然的促进我们去研究\(\theta+h\)\(\theta\)靠近时这个构造的极限行为,这就需要先保证 \(\theta+h\) 仍然属于参数空间。因此,参数空间\(\Theta\)最好是\(\mathbb{R}\)中的开集,或者至少要求所讨论的\(\theta\)\(\Theta\)的内点。

其次,\(\varphi_h(x,\theta)\)中出现了比值:

\[\begin{equation*} \frac{p_{\theta+h}(x)}{p_\theta(x)} \end{equation*}\]

为了使这个比值有定义,至少需要避免分母\(p_\theta(x)\)为零而分子\(p_{\theta+h}(x)\)不为零的情况。因此通常要求概率函数族相对于同一个控制测度\(\mu\)有密度,并且这些密度具有共同支撑。

综上,从Hammersley-Chapman-Robbins不等式中的第二种构造出发,可以看出后续需要引入若干条件。要求\(\Theta\)有内点,是为了能够讨论\(\theta+h\)\(\theta\)的局部扰动;要求概率函数族有共同控制测度和共同支撑,是为了保证似然比型构造有定义;要求\(p_\theta(x)\)关于\(\theta\)可微,是为了让有限差分有自然的极限候选。

Definition 11.13. 设\(\mathscr{P}=\{P_{\theta}:\theta\in\Theta\}\)是一族概率测度,对任意的\(\theta\in\Theta\),根据定理 5.35\(P_{\theta}\)有关于\(\sigma\)有限测度\(\mu\)的密度\(p_{\theta}(x)\)。令:

\[\begin{equation*} S_{\theta}(x)=\left(\frac{\partial\ln p_{\theta}(x)}{\partial\theta_1},\frac{\partial\ln p_{\theta}(x)}{\partial\theta_2},\dots,\frac{\partial\ln p_{\theta}(x)}{\partial\theta_n}\right)^{\top} \end{equation*}\]

若对任意的\(\theta\in\Theta\)\(p_{\theta}(x)\)满足如下正则条件:

  1. \(S_{\theta}(x)\)有定义;

  2. \(\operatorname{E}[S_{\theta}(\mathbf{X})]=\mathbf{0}\)

  3. 对任意的\(i,j=1,2,\dots,n\)\(\operatorname{E}_{\theta}[S_{\theta i}( \mathbf{X})S_{\theta j}( \mathbf{X})]\in\mathbb{R}^{}\)

根据性质 6.3.4(6),称:

\[\begin{equation*} I(\theta)=\operatorname{Cov}_{\theta}[S_{\theta}( \mathbf{X})]=\operatorname{E}_{\theta}[S_{\theta}( \mathbf{X})S_{\theta}^{\top}( \mathbf{X})] \end{equation*}\]

\(\{p_{\theta}:\theta\in\Theta\}\)Fisher信息矩阵(Fisher information matrix)\(n=1\)时称\(I(\theta)\)\(\{p_{\theta}:\theta\in\Theta\}\)Fisher信息量。类似定义随机变量概率函数族的Fisher信息量。

Definition 11.14. 密度族\(\{p_{\theta}(x):\theta\in\Theta\}\)若满足:

  1. 参数空间\(\Theta\)是欧氏空间上的开矩形;

  2. \(\ln p_{\theta}(x)\)关于\(\theta\)的一阶偏导数对所有\(\theta\in\Theta\)都存在且有限;

  3. \(p_{\theta}(x)\)的支撑与\(\theta\)无关;

  4. \(p_{\theta}(x)\)的积分与微分可交换顺序;

  5. 对任意的\(i,j\)和任意的\(\theta\in\Theta\)有:

    \[\begin{equation*} \operatorname{E}_{\theta}\left[\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\theta_i}\cdot\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\theta_j}\right]\in\mathbb{R}^{} \end{equation*}\]

则称该密度族为Cramer-Rao正则族

Property 11.1.1. \(\{p_{\theta}(x):\theta\in\Theta\}\)是一个满足正则条件的密度族。Fisher信息矩阵具有如下性质:

  1. Cramer-Rao正则族具有Fisher信息矩阵;

  2. \(\ln p_{\theta}(x)\)有关于\(\theta\)的所有二阶导数,且可以交换对一阶导数进行求导与积分的顺序,则:

    \[\begin{equation*} [I(\theta)]_{ij}=-\operatorname{E}_{\theta}\left[\frac{\partial^2\ln p_{\theta}( \mathbf{X})}{\partial\theta_i\partial\theta_j}\right] \end{equation*}\]

  3. Fisher信息量与参数选择有关,若\(\theta=h(\xi)\)\(h\)具有所有一阶偏导数,则\(I(\xi)=J_{\theta}^{\top}(\xi)I(\theta)J_{\theta}(\xi)\),其中\(J_{\theta}(\xi)=\operatorname{D}h\xi\)

  4. \(X_1, X_2, \dots, X_{n}\)相互独立,参数空间都是\(\Theta\)且联合密度族是Cramer-Rao正则族,\(I_i(\theta)\)\(X_i\)的Fisher信息矩阵,则\((X_1, X_2, \dots, X_{n})\)的Fisher信息矩阵为\(\sum\limits_{i=1}^{n}I_i(\theta)\)

  5. \(\{p_{\theta}(x):\theta\in\Theta\}\)是可识别满秩指数族的密度族,\(T\)的每一个分量都在\(\underset{\theta\in\Theta}{\cap}L_2(X)\)中,令\(\theta=\operatorname{E}_{\eta}(T)\),则在:

    \[\begin{equation*} \left\{\eta:G(\eta)=\int_{X}\exp[\eta^{\top}T(x)]h(x)\mathop{}\!\mathrm{d}\mu\in\mathbb{R}^{}\right\} \end{equation*}\]

    的内点处有\(I(\eta)=\operatorname{Cov}_{\eta}(T)\),在:

    \[\begin{equation*} \left\{\eta:G(\eta)=\int_{X}T(x)\exp[\eta^{\top}T(x)]h(x)\mathop{}\!\mathrm{d}\mu\in\mathbb{R}^{}\right\} \end{equation*}\]

    和上面集合的共同内点处有\(I(\theta)=[\operatorname{Cov}_{\eta}^{\top}(T)]^{-1}\)

证明. (1)由定义、性质 4.1.1(3)引理 5.10可得:

\[\begin{equation*} \operatorname{E}_{\theta}\left[\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\theta_i}\right]=\int_{X}\frac{1}{p_{\theta}(x)}\frac{\partial p_{\theta}(x)}{\partial\theta_i}\mathop{}\!\mathrm{d}P_{\theta}=\int_{X}\frac{\partial p_{\theta}(x)}{\partial\theta_i}\mathop{}\!\mathrm{d}\mu=\frac{\partial}{\partial\theta_i}\int_{X}p_{\theta}(x)\mathop{}\!\mathrm{d}\mu=0 \\ \end{equation*}\]

于是结论成立。

(2)由引理 5.10乘积可微正则条件和性质 5.4.3(6)可得:

\[\begin{gather*} \frac{\partial}{\partial\theta_j}\operatorname{E}_{\theta}\left[\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\theta_i}\right]=0 \\ \frac{\partial}{\partial\theta_j}\int_{X}\frac{\partial\ln p_{\theta}(x)}{\partial\theta_i}p_{\theta}(x)\mathop{}\!\mathrm{d}\mu=0 \\ \int_{X}\frac{\partial}{\partial\theta_j}\left[\frac{\partial\ln p_{\theta}(x)}{\partial\theta_i}p_{\theta}(x)\right]\mathop{}\!\mathrm{d}\mu=0 \\ \int_{X}\left[\frac{\partial^2\ln p_{\theta}(x)}{\partial\theta_j\partial\theta_i}p_{\theta}(x)+\frac{\partial\ln p_{\theta}(x)}{\partial\theta_i}\frac{\partial p_{\theta}(x)}{\partial\theta_j}\right]\mathop{}\!\mathrm{d}\mu=0 \\ \int_{X}\left[\frac{\partial^2\ln p_{\theta}(x)}\partial\theta_j{\partial\theta_i}p_{\theta}(x)+\frac{\partial\ln p_{\theta}(x)}{\partial\theta_i}\frac{\partial \ln p_{\theta}(x)}{\partial\theta_j}p_{\theta}(x)\right]\mathop{}\!\mathrm{d}\mu=0 \\ \operatorname{E}_{\theta}\left[\left(\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\theta_i}\right)\left(\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\theta_j}\right)\right]=-\operatorname{E}_{\theta}\left[\frac{\partial^2\ln p_{\theta}( \mathbf{X})}{\partial\theta_i\partial\theta_j}\right] \end{gather*}\]

(3)由性质 4.1.1(5)可知:

\[\begin{align*} [I(\xi)]_{ij}&=\operatorname{E}_{\xi}\left[\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\xi_i}\cdot\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\xi_j}\right] \\ &=\operatorname{E}_{\xi}\left\{\left[\sum_{k=1}^n\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\theta_k}\cdot\frac{\partial\theta_k}{\partial\xi_i}\right]\cdot\left[\sum_{l=1}^n\frac{\partial\ln p_{\theta}( \mathbf{X})}{\partial\theta_l}\cdot\frac{\partial\theta_l}{\partial\xi_j}\right]\right\} \\ &=\operatorname{E}_{\xi}\left[\left(\frac{\partial\theta}{\partial\xi_i}\right)^{\top}S_{\theta}( \mathbf{X})S_{\theta}^{\top}( \mathbf{X})\left(\frac{\partial\theta}{\partial\xi_j}\right)\right] \end{align*}\]

于是结论成立。

(4)设\(X_i\)在参数\(\theta\in\Theta\)下的概率函数为\(p_{\theta i}(x_i)\),由性质 6.2.1(5.c)性质 5.4.3(6)可得:

\[\begin{align*} I(\theta)_{ij}&=\operatorname{E}_{\theta}\left\{\frac{\partial}{\partial\theta_i}\ln\left[\prod_{k=1}^{n}p_{\theta k}(X_k)\right]\cdot\frac{\partial}{\partial\theta_j}\ln\left[\prod_{l=1}^{n}p_{\theta l}(X_l)\right]\right\} \\ &=\operatorname{E}_{\theta}\left\{\left[\sum_{k=1}^{n}\frac{\partial\ln p_{\theta k}(X_k)}{\partial\theta_i}\right]\cdot\left[\sum_{l=1}^{n}\frac{\partial\ln p_{\theta l}(X_l)}{\partial\theta_j}\right]\right\} \\ &=\sum_{k=1}^{n}\sum_{l=1}^{n}\operatorname{E}_{\theta}[S_{\theta k}(X_k)S_{\theta l}^{\top}(X_l)] \end{align*}\]

\(k\ne l\)时,由性质 6.2.1(4)可测性比较复杂这里性质 6.3.1(2)和正则条件可知:

\[\begin{align*} &\{\operatorname{E}_{\theta}[S_{\theta k}(X_k)S_{\theta l}^{\top}(X_l)]\}_{p q}=\operatorname{E}_{\theta}\left[\frac{\partial\ln p_{\theta k}(X_k)}{\partial\theta_p}\cdot\frac{\partial\ln p_{\theta l}(X_l)}{\partial\theta_q}\right] \\ =&\operatorname{E}_{\theta}\left[\frac{\partial\ln p_{\theta k}(X_k)}{\partial\theta_p}\right]\cdot\operatorname{E}_{\theta}\left[\frac{\partial\ln p_{\theta l}(X_l)}{\partial\theta_q}\right]=0 \end{align*}\]

所以:

\[\begin{equation*} I(\theta)_{ij}=\sum_{k=1}^{n}\operatorname{E}_{\theta}[S_{\theta k}(X_k)S_{\theta k}(X_k)] \end{equation*}\]

\(I(\theta)=\sum\limits_{i=1}^{n}I_i(\theta)\)

(5)为了书写方便,下面的积分展开式都是多维的情况。由于\(T\)的每一个分量都在\(\underset{\theta\in\Theta}{\cap}L_2(X)\)中,根据定理 5.29性质 6.3.5(1)不等式 4可知\(\operatorname{Cov}_{\eta}(T)\)存在。因为:

\[\begin{gather*} \ln p_{\eta}(x)=\ln\left\{\exp\left[\eta^{\top}T(x)-\xi(\eta)\right]h(x)\right\}=\eta^{\top}T(x)-\xi(\eta)+\ln h(x) \\ \frac{\partial\ln p_{\eta}(x)}{\partial\eta}=T(x)-\frac{\partial\xi(\eta)}{\partial\eta} \end{gather*}\]

性质 10.1.5(2)性质 4.1.1(5)性质 10.1.5(6)性质 5.4.3(6)可知:

\[\begin{align*} &\frac{\partial\xi(\eta)}{\partial\eta}=\frac{\partial}{\partial\eta}\ln\left\{\int_{X}\exp\left[\eta^{\top}T(x)\right]h(x)\mathop{}\!\mathrm{d}\mu\right\} \\ =&\frac{1}{\int_{X}\exp\left[\eta^{\top}T(x)\right]h(x)\mathop{}\!\mathrm{d}\mu}\int_{X}\frac{\partial}{\partial\eta}\exp\left[\eta^{\top}T(x)\right]h(x)\mathop{}\!\mathrm{d}\mu \\ =&\frac{\int_{X}T(x)\exp\left[\eta^{\top}T(x)\right]h(x)\mathop{}\!\mathrm{d}\mu}{\int_{X}\exp\left[\eta^{\top}T(x)\right]h(x)\mathop{}\!\mathrm{d}\mu} \\ =&\frac{\int_{X}T(x)C(\eta)\exp\left[\eta^{\top}T(x)\right]h(x)\mathop{}\!\mathrm{d}\mu}{\int_{X}C(\eta)\exp\left[\eta^{\top}T(x)\right]h(x)\mathop{}\!\mathrm{d}\mu}=\operatorname{E}_{\eta}(T) \end{align*}\]

所以根据性质 5.4.3(6)可得:

\[\begin{equation*} \operatorname{E}_{\eta}\left[\frac{\partial\ln p_{\eta}(\mathbf{X})}{\partial\eta}\right]=\operatorname{E}_{\eta}(T)-\frac{\partial\xi(\eta)}{\partial\eta}=\mathbf{0} \end{equation*}\]

于是:

\[\begin{equation*} I(\eta)=\operatorname{Cov}_{\eta}\left[\frac{\partial\ln p_{\eta}(\mathbf{X})}{\partial\eta}\right]=\operatorname{Cov}_{\eta}\{T(\mathbf{X})-\operatorname{E}_{\eta}[T(\mathbf{X})]\}=\operatorname{Cov}_{\eta}(T) \end{equation*}\]

因为\(T\)是统计量,所以根据性质 10.1.5(6)性质 4.1.1(5)性质 5.4.3(6)性质 6.3.4(6)可得:

\[\begin{align*} &J_{\theta}(\eta)=\frac{\partial\theta}{\partial\eta^{\top}}=\frac{\partial}{\partial\eta^{\top}}\operatorname{E}_{\eta}(T)=\int_{X}\frac{\partial}{\partial\eta^{\top}}\left\{T(x)\exp\left[\eta^{\top}T(x)-\xi(\eta)\right]h(x)\right\}\mathop{}\!\mathrm{d}\mu \\ =&\int_{X}T(x)\left\{T^{\top}(x)-\left[\frac{\partial\xi(\eta)}{\partial\eta}\right]^{\top}\right\}\exp\left[\eta^{\top}T(x)-\xi(\eta)\right]h(x)\mathop{}\!\mathrm{d}\mu \\ =&\operatorname{E}_{\eta}(TT^{\top})-\operatorname{E}_{\eta}(T)[\operatorname{E}_{\eta}(T)]^{\top}=\operatorname{Cov}_{\eta}(T) \end{align*}\]

由(3)可知:

\[\begin{equation*} I(\eta)=J_{\theta}^{\top}(\eta)I(\theta)J_{\theta}^{\top}(\eta)=\operatorname{Cov}_{\eta}^{\top}(T)I(\theta)\operatorname{Cov}_{\eta}(T) \end{equation*}\]

因为指数族满秩,由性质 10.1.5(3)性质 6.3.4(8)可得\(\operatorname{Cov}_{\eta}(T)\)可逆,根据性质 2.1.10(12)即可得出结论。 ◻

Theorem 11.5. 设\((X,\mathscr{A},\mathscr{P})\)是可控参数结构,\(\Theta\)\(n\)维参数空间,\(\mu\)是控制测度,\(\mathscr{P}\)的密度族\(\{p_{\theta}(x):\theta\in\Theta\}\)是Cramer-Rao正则族,其Fisher信息矩阵\(I(\theta)\)可逆,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(\delta(\mathbf{X})\in\underset{P\in\mathscr{P}}{\cap}L_2(X,\mathscr{A},P)\)是一个估计量且:

\[\begin{equation*} \frac{\partial\operatorname{E}_{\theta}(\delta)}{\partial\theta_i}=\int_{X}\frac{\partial}{\partial\theta_i}[\delta p_{\theta}(x)]\mathop{}\!\mathrm{d}\mu,\;i=1,2,\dots,n \end{equation*}\]

则有:

\[\begin{equation*} \operatorname{Var}_{\theta}[\delta(\mathbf{X})]\geqslant\left[\frac{\partial\operatorname{E}_{\theta}(\delta)}{\partial\theta}\right]^{\top}[I(\theta)]^{-1}\left[\frac{\partial\operatorname{E}_{\theta}(\delta)}{\partial\theta}\right] \end{equation*}\]

证明. 对任意\(n\)维实向量\(\alpha\),由正则条件、性质 6.3.5(1)(3)不等式 4可得:

\[\begin{equation*} \operatorname{Var}_{\theta}(\delta)\geqslant\frac{\operatorname{Cov}_{\theta}^2[\delta,\alpha^{\top}S_{\theta}(x)]}{\operatorname{Var}_{\theta}[\alpha^{\top}S_{\theta}(x)]} \end{equation*}\]

令:

\[\begin{equation*} \gamma_i=\operatorname{Cov}_{\theta}[\delta,S_{\theta,i}(x)],\;\gamma=(\gamma_1, \gamma_2, \dots, \gamma_{n}) \end{equation*}\]

由最值的不等式性和注意这个代数不等式可得:

\[\begin{equation*} \operatorname{Var}_{\theta}(\delta)\geqslant\max_{\alpha}\frac{\operatorname{Cov}_{\theta}^2[\delta,\alpha^{\top}S_{\theta}(x)]}{\operatorname{Var}_{\theta}[\alpha^{\top}S_{\theta}(x)]}=\max_{\alpha}\frac{\alpha^{\top}\gamma\gamma^{\top}\alpha}{\alpha^{\top}I(\theta)\alpha}=\gamma^{\top}[I(\theta)]^{-1}\gamma \end{equation*}\]

根据引理 5.10性质 5.4.3(6)和条件可得:

\[\begin{align*} &\operatorname{Cov}_{\theta}[\delta,S_{\theta,i}(x)]=\int_{X}[\delta-\operatorname{E}_{\theta}(\delta)]\frac{\partial\ln p_{\theta}(x)}{\partial\theta_i}p_{\theta}(x)\mathop{}\!\mathrm{d}\mu \\ =&\int_{X}\delta\frac{\partial\ln p_{\theta}(x)}{\partial\theta_i}p_{\theta}(x)\mathop{}\!\mathrm{d}\mu-\operatorname{E}_{\theta}(\delta)\int_{X}\frac{\partial\ln p_{\theta}(x)}{\partial\theta_i}p_{\theta}(x)\mathop{}\!\mathrm{d}\mu \\ =&\frac{\partial}{\partial\theta_i}\operatorname{E}_{\theta}(\delta)-\int_{X}\frac{\partial p_{\theta}(x)}{\partial\theta_i}\mathop{}\!\mathrm{d}\mu=\frac{\partial}{\partial\theta_i}\operatorname{E}_{\theta}(\delta) \end{align*}\]

于是结论成立。 ◻

11.2 矩估计

Definition 11.15. 设\((X,\mathscr{A},\mathscr{P})\)是参数统计结构,\(\mathbf{X_n}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本。将:

\[\begin{equation*} \mu_{nk}=\frac{1}{n}\sum_{i=1}^{n}X_i^k,\quad \nu_{nk}=\frac{1}{n}\sum_{i=1}^{n}(X_i-\mu_{n1})^k \end{equation*}\]

分别称为样本\(k\)阶原点矩和样本\(k\)阶中心矩。

Theorem 11.6. \(\nu_{nk}\)与原点矩\(\mu_{nk}\)之间存在如下关系:

\[\begin{equation*} \nu_{nk}=\sum_{i=0}^{k}\binom{k}{i}\mu_{ni}(-\mu_{n1})^{k-i} \end{equation*}\]

证明. 由样本中心矩的定义可得:

\[\begin{align*} \nu_{nk} &=\frac{1}{n}\sum_{i=1}^{n}(X_i-\mu_{n1})^k =\frac{1}{n}\sum_{i=1}^{n}\sum_{j=0}^{k}\binom{k}{j}X_i^j(-\mu_{n1})^{k-j} \\ &=\sum_{j=0}^{k}\binom{k}{j}\frac{1}{n}\sum_{i=1}^{n}X_i^j(-\mu_{n1})^{k-j} =\sum_{j=0}^{k}\binom{k}{j}\mu_{nj}(-\mu_{n1})^{k-j} \end{align*}\]

Definition 11.16. 设\((X,\mathscr{A},\mathscr{P})\)是一个参数统计结构,\(\Theta\)是参数空间,\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(g(\theta)\)是定义在\(\Theta\)上的函数,它可以表示为总体分布的一些矩的函数,即:

\[\begin{equation*} g(\theta)=f(\mu_1, \mu_2, \dots, \mu_{s},\nu_1, \nu_2, \dots, \nu_{t}) \end{equation*}\]

\(f\)中的总体矩用样本矩代替,得到:

\[\begin{equation*} \delta(\mathbf{X})=f(\mu_{n1},\mu_{n2},\dots,\mu_{ns},\nu_{n1},\nu_{n2},\dots,\nu_{nt}) \end{equation*}\]

\(\delta(\mathbf{X})\)成为\(g(\theta)\)的一个点估计,称\(\delta(\mathbf{X})\)\(g(\theta)\)矩估计(moment estimation),这种求矩估计量的方法称为矩法(method of moments)

Property 11.2.1. 矩估计具有如下性质:

  1. 样本\(k\)阶原点矩\(\mu_{nk}\)是总体\(k\)阶原点矩\(\mu_k\)的无偏估计、强相合估计;

  2. \(k=1\)时,样本\(k\)阶中心矩\(\nu_{nk}\)是总体\(k\)阶中心矩\(\nu_k\)的无偏估计,对\(k\geqslant2\)\(\nu_{nk}\)不是\(\nu_k\)的无偏估计。\(\nu_{nk}\)\(\nu_k\)的强相合估计;

  3. 若待估量\(g(\theta)\)可以表示为一些总体原点矩的线性组合时,即:

    \[\begin{equation*} g(\theta)=\sum_{i=1}^{n}c_i\mu_{m_i},\;m_i\in\mathbb{N}^+ \end{equation*}\]

    则其矩估计:

    \[\begin{equation*} \delta(\mathbf{X})=\sum_{i=1}^{n}c_i\mu_{nm_i},\;m_i\in\mathbb{N}^+ \end{equation*}\]

    \(g(\theta)\)的无偏估计;

  4. 若待估量\(g(\theta)\)满足:

    \[\begin{equation*} g(\theta)=f(\mu_1, \mu_2, \dots, \mu_{s},\nu_1, \nu_2, \dots, \nu_{t}) \end{equation*}\]

    其中\(f\)是一个连续函数,则:

    \[\begin{equation*} \delta(\mathbf{X})=f(\mu_{n1},\mu_{n2},\dots,\mu_{ns},\nu_{n1},\nu_{n2},\dots,\nu_{nt}) \end{equation*}\]

    \(g(\theta)\)的强相合估计;

证明. (1)由性质 5.4.3(6)可得:

\[\begin{equation*} \operatorname{E}_{\theta}(\mu_{nk})=\operatorname{E}_{\theta}\left(\frac{1}{n}\sum_{i=1}^{n}X_i^k\right)=\frac{1}{n}\sum_{i=1}^{n}\operatorname{E}_{\theta}(X_i^k)=\frac{1}{n}\sum_{i=1}^{n}\mu_k=\mu_k \end{equation*}\]

可得无偏性。

定理 7.7可得:

\[\begin{equation*} \mu_{nk}=\frac{1}{n}\sum_{i=1}^{n}X_i^k\overset{\text{a.s.}}{\longrightarrow}\operatorname{E}(X_1^k)=\mu_k \end{equation*}\]

(2)不无偏还未证明性质 6.3.3(2)可得:

\[\begin{equation*} \nu_k=\sum_{i=0}^{k}\binom{k}{i}\mu_i(-\mu_1)^{k-i}=f(\mu_1, \mu_2, \dots, \mu_{k}) \end{equation*}\]

所以\(\nu_k\)\(\mu_1, \mu_2, \dots, \mu_{k}\)的连续函数。由定理 11.6、(1)和定理 7.4(1)可得:

\[\begin{equation*} \nu_{nk}=f(\mu_{n1},\mu_{n2},\dots,\mu_{nk})\overset{\text{a.s.}}{\longrightarrow}f(\mu_1, \mu_2, \dots, \mu_{k})=\nu_{k} \end{equation*}\]

(3)由(1)直接可得。

(4)由定理 7.4(1)、(1)(2)直接可得需要证明各分量几乎处处收敛则随机向量几乎处处收敛。 ◻

11.3 极大似然估计

Definition 11.17. 设\((X,\mathscr{A},\mathscr{P})\)是可控参数结构,\(\mu\)为控制测度,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(f(\mathbf{X},\theta)\)为样本\(\mathbf{X}\)的概率函数。把\(f(\mathbf{X},\theta)\)看作\(\theta\)的函数,称该函数为似然函数(likelihood function),记为\(L(\theta,\mathbf{X})\),称\(\ell(\theta,\mathbf{X})=\ln L(\theta,\mathbf{X})\)对数似然函数(log-likelihood function)

Definition 11.18. 设\((X,\mathscr{A},\mathscr{P})\)是可控参数结构,\(\mu\)为控制测度,\(\Theta\)\(n\)维参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(L(\theta,\mathbf{X})\)是似然函数。若存在统计量\(\delta(\mathbf{X})\)使得:

\[\begin{equation*} L[\delta(\mathbf{X}),\mathbf{X}]=\max_{\theta\in\Theta}L(\theta,\mathbf{X}) \end{equation*}\]

或等价地使得:

\[\begin{equation*} \ell[\delta(\mathbf{X}),\mathbf{X}]=\max_{\theta\in\Theta}\ell(\theta,\mathbf{X}) \end{equation*}\]

则称\(\delta(\mathbf{X})\)\(\theta\)极大似然估计(maximum likelihood estimation)。称:

\[\begin{equation*} \frac{\partial L(\theta,\mathbf{X})}{\partial\theta_i}=0,\; i=1,2,\dots,n \end{equation*}\]

似然方程(likelihood equation),称:

\[\begin{equation*} \frac{\partial \ell(\theta,\mathbf{X})}{\partial\theta_i}=0,\; i=1,2,\dots,n \end{equation*}\]

对数似然方程(log-likelihood equation)

Property 11.3.1. 设\((X,\mathscr{A},\mathscr{P})\)是可控参数结构,\(\mu\)为控制测度,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本。极大似然估计具有如下性质:

  1. 若极大似然估计是参数空间的内点且似然函数有关于\(\theta\)的所有一阶导数,则其满足似然方程;

  2. 极大似然估计具有不变性,即:若\(\theta\)的MLE为\(\theta^{\star}\),则\(\theta\)的任一可测函数\(g(\theta)\)的MLE为\(g(\theta^{\star})\)

  3. \(\mathscr{P}\)为可识别满秩指数族,只要似然方程组的解是自然参数空间的内点,则解必唯一且是MLE;

  4. \(T\)\(\theta\)的充分统计量且\(\theta\)的MLE\(\;\delta\)唯一存在,则\(\delta\)必为\(T\)的函数;

证明. (1)由定理 4.7(1)立即可得。

(2)若\(\theta^{\star}\)\(\theta\)的极大似然估计,则:

\[\begin{equation*} L(\theta^{\star},\mathbf{X})=\sup_{\theta\in\Theta}L(\theta,\mathbf{X}) \end{equation*}\]

\(\Gamma=g(\Theta)\)。由于\(g\)未必是单射,所以同一个\(\gamma\in\Gamma\)可能对应多个\(\theta\in\Theta\),因此定义:

\[\begin{equation*} \forall\;\gamma\in\Gamma,\quad L_g(\gamma,\mathbf{X})=\sup_{\theta\in\Theta:g(\theta)=\gamma}L(\theta,\mathbf{X}) \end{equation*}\]

对任意\(\gamma\in\Gamma\),有:

\[\begin{equation*} \{\theta\in\Theta:g(\theta)=\gamma\}\subseteq \Theta \end{equation*}\]

所以:

\[\begin{equation*} L_g(\gamma,\mathbf{X})=\sup_{\theta\in\Theta:g(\theta)=\gamma}L(\theta,\mathbf{X})\leqslant\sup_{\theta\in\Theta}L(\theta,\mathbf{X})=L(\theta^{\star},\mathbf{X}) \end{equation*}\]

\(\gamma=g(\theta^{\star})\)时,由于:

\[\begin{equation*} \theta^{\star}\in\{\theta\in\Theta:g(\theta)=g(\theta^{\star})\} \end{equation*}\]

因此:

\[\begin{equation*} L_g[g(\theta^{\star}),\mathbf{X}]=\sup_{\theta\in\Theta:g(\theta)=g(\theta^{\star})}L(\theta,\mathbf{X})\geqslant L(\theta^{\star},\mathbf{X}) \end{equation*}\]

于是:

\[\begin{equation*} L_g[g(\theta^{\star}),\mathbf{X}]=L(\theta^{\star},\mathbf{X})=\sup_{\gamma\in\Gamma}L_g(\gamma,\mathbf{X}) \end{equation*}\]

\(g(\theta^{\star})\)\(g(\theta)\)的极大似然估计,极大似然估计具有不变性。

(3)设\(\mathbf{X}=(X_1,X_2,\dots,X_n)\)为来自\(P_\eta\)的简单样本,\(\eta\in\Xi\),由性质 6.2.1(5.c)可知联合密度为:

\[\begin{equation*} \frac{\mathop{}\!\mathrm{d}P_\eta^n}{\mathop{}\!\mathrm{d}\mu^n}=\prod_{i=1}^{n}\exp\{\eta^{\top}T(x_i)-\xi(\eta)\}h(x_i) \end{equation*}\]

因此对数似然函数为:

\[\begin{equation*} \ell[\eta,\mathbf{X}]=\eta^{\top}\sum_{i=1}^{n}T(X_i)-n\xi(\eta)+\sum_{i=1}^{n}\ln h(X_i) \end{equation*}\]

根据性质 10.1.5(6)性质 4.1.1(6)\(\eta\)求导,有:

\[\begin{equation*} \frac{\partial\ell[\eta,\mathbf{X}]}{\partial\eta}=\sum_{i=1}^{n}T(X_i)-n\frac{\partial\xi(\eta)}{\partial\eta} \end{equation*}\]

根据性质 10.1.5(6)性质 4.1.1(6)\(\eta\)再次求导可得:

\[\begin{equation*} \frac{\partial^2\ell[\eta,\mathbf{X}]}{\partial\eta\partial\eta^{\top}}=-n\frac{\partial^2\xi(\eta)}{\partial\eta\partial\eta^{\top}} \end{equation*}\]

性质 10.1.5(9)可得:

\[\begin{equation*} \frac{\partial^2\xi(\eta)}{\partial\eta\partial\eta^{\top}}=\operatorname{Cov}_{\eta}[T(\mathbf{X})] \end{equation*}\]

根据性质 10.1.5(3)性质 6.3.4(2)(8)定理 2.18(6)可知\(\dfrac{\partial^2\xi(\eta)}{\partial\eta\partial\eta^{\top}}\)正定,从而\(\dfrac{\partial^2\ell[\eta,\mathbf{X}]}{\partial\eta\partial\eta^{\top}}\)负定,由性质 8.0.8(3)可知\(\ell[\eta,\mathbf{X}]\)关于\(\eta\)严格凹。

因为\(\hat{\eta}\)\(\Xi\)的内点,根据(1)可知:

\[\begin{equation*} \frac{\partial\ell[\eta,\mathbf{X}]}{\partial\eta}\bigg|_{\eta=\hat{\eta}}=\mathbf{0} \end{equation*}\]

性质 8.0.8(2)可知对任意\(\eta\in\Xi\)有:

\[\begin{equation*} \ell[\eta,\mathbf{X}]\leqslant\ell[\hat{\eta},\mathbf{X}]+\left[\frac{\partial\ell[\eta,\mathbf{X}]}{\partial\eta}\bigg|_{\eta=\hat{\eta}}\right]^{\top}(\eta-\hat{\eta})=\ell[\hat{\eta},\mathbf{X}] \end{equation*}\]

等号成立当且仅当\(\eta=\hat{\eta}\)。因此\(\hat{\eta}\)\(\ell[\eta,\mathbf{X}]\)\(\Xi\)上的唯一最大点,\(\hat{\eta}\)是唯一的MLE。

(4)由定理 10.2可得:

\[\begin{equation*} \forall\;\theta\in\Theta,\;\frac{\mathop{}\!\mathrm{d}P_{\theta}}{\mathop{}\!\mathrm{d}\mu}(x)=g_{\theta}[T(x)]h(x),\;\text{a.e.于}(X,\mathscr{A},\mu) \end{equation*}\]

于是有:

\[\begin{equation*} \ell[\theta,\mathbf{X}]=\ln g_{\theta}[T(\mathbf{X})]+\ln h(\mathbf{X}),\;\text{a.e.于}(X,\mathscr{A},\mu) \end{equation*}\]

上式最大化等价于\(g_{\theta}[T(\mathbf{X})]\)最大化,即:

\[\begin{equation*} \delta(\mathbf{X})=\underset{\theta\in\Theta}{\arg\max}\ln g_{\theta}[T(\mathbf{X})] \end{equation*}\]

下面证明\(\delta(\mathbf{X})\)确为\(T(\mathbf{X})\)的函数。任取两个样本点 \(\mathbf{X}_1,\mathbf{X}_2\),若

\[\begin{equation*} T(\mathbf{X}_1)=T(\mathbf{X}_2) \end{equation*}\]

则对任意\(\theta\in\Theta\),有

\[\begin{equation*} \ln g_{\theta}[T(\mathbf{X}_1)]=\ln g_{\theta}[T(\mathbf{X}_2)] \end{equation*}\]

因此二者关于\(\theta\)的极大化问题完全相同,即:

\[\begin{equation*} \underset{\theta\in\Theta}{\arg\max}\ln g_{\theta}[T(\mathbf{X}_1)]=\underset{\theta\in\Theta}{\arg\max}\ln g_{\theta}[T(\mathbf{X}_2)] \end{equation*}\]

由于\(\delta(\mathbf{X})\)存在且唯一,所以上述极大点均为单点集,从而极大似然估计:

\[\begin{equation*} \delta(\mathbf{X}_1)=\delta(\mathbf{X}_2) \end{equation*}\]

这说明只要两个样本点给出相同的充分统计量取值,则其对应的极大似然估计相同。于是可在\(T(\mathbf{X})\)的值域上定义函数\(\varphi\)

\[\begin{equation*} \varphi(t)=\delta(\mathbf{X}),\;T(\mathbf{X})=t,\quad\text{a.s.于}(X,\mathscr{A},\mu) \end{equation*}\]

上式定义良好,故\(\delta(\mathbf{X})\)必为\(T(\mathbf{X})\)的函数。 ◻

Property 11.3.2. 设\((X,\mathscr{A},\mathscr{P})\)是可控参数结构,\(\mu\)为控制测度,\(\Theta\subset\mathbb{R}^p\)为参数空间。设真实参数为\(\theta_0\in\Theta\),并记:

\[\begin{equation*} p_\theta(x)=\frac{\mathop{}\!\mathrm{d}P_\theta}{\mathop{}\!\mathrm{d}\mu}(x). \end{equation*}\]

\(X_1,\ldots,X_n\)为来自\(P_{\theta_0}\)的简单样本,对数似然函数为:

\[\begin{equation*} \ell_n(\theta) = \sum_{i=1}^{n}\log p_\theta(X_i), \end{equation*}\]

并记样本平均对数似然函数为:

\[\begin{equation*} M_n(\theta) = \frac{1}{n}\ell_n(\theta) = \frac{1}{n}\sum_{i=1}^{n}\log p_\theta(X_i). \end{equation*}\]

设总体目标函数为:

\[\begin{equation*} M(\theta) = \operatorname{E}_{\theta_0}[\log p_\theta(X)]. \end{equation*}\]

若满足如下条件:

  1. \(\Theta\)是紧集;

  2. \(M(\theta)\)\(\Theta\)上连续;

  3. \(M(\theta)\)\(\theta_0\)处唯一取最大值,即:

    \[\begin{equation*} M(\theta)<M(\theta_0),\qquad \theta\neq\theta_0; \end{equation*}\]

  4. 样本平均对数似然函数一致收敛于总体目标函数,即:

    \[\begin{equation*} \sup_{\theta\in\Theta} \left| M_n(\theta)-M(\theta) \right| \xrightarrow{P_{\theta_0}}0. \end{equation*}\]

若MLE存在,且\(\hat{\theta}_n\)为MLE,即:

\[\begin{equation*} \hat{\theta}_n \in \underset{\theta\in\Theta}{\arg\max}\;M_n(\theta), \end{equation*}\]

\(\hat{\theta}_n\)\(\theta_0\)的一致估计量,即:

\[\begin{equation*} \hat{\theta}_n\xrightarrow{P_{\theta_0}}\theta_0. \end{equation*}\]

证明. 任取\(\varepsilon>0\)。定义:

\[\begin{equation*} C_\varepsilon = \{\theta\in\Theta:\|\theta-\theta_0\|\geqslant \varepsilon\}. \end{equation*}\]

因为\(\Theta\)是紧集,所以\(C_\varepsilon\)也是紧集。又因为\(M(\theta)\)\(\Theta\)上连续,所以\(M(\theta)\)\(C_\varepsilon\)上可以取到最大值。

由于\(M(\theta)\)\(\theta_0\)处唯一取最大值,所以对任意\(\theta\in C_\varepsilon\),都有:

\[\begin{equation*} M(\theta)<M(\theta_0). \end{equation*}\]

于是存在\(\eta_\varepsilon>0\),使得:

\[\begin{equation*} \sup_{\theta\in C_\varepsilon}M(\theta) = M(\theta_0)-\eta_\varepsilon. \end{equation*}\]

也就是说,对任意\(\theta\in C_\varepsilon\),有:

\[\begin{equation*} M(\theta) \leqslant M(\theta_0)-\eta_\varepsilon. \end{equation*}\]

记:

\[\begin{equation*} \Delta_n = \sup_{\theta\in\Theta} \left| M_n(\theta)-M(\theta) \right|. \end{equation*}\]

由一致收敛假设可知:

\[\begin{equation*} \Delta_n\xrightarrow{P_{\theta_0}}0. \end{equation*}\]

下面证明:

\[\begin{equation*} P_{\theta_0}(\|\hat{\theta}_n-\theta_0\|\geqslant\varepsilon) \longrightarrow 0. \end{equation*}\]

若事件

\[\begin{equation*} \{\|\hat{\theta}_n-\theta_0\|\geqslant\varepsilon\} \end{equation*}\]

发生,则\(\hat{\theta}_n\in C_\varepsilon\)。于是:

\[\begin{equation*} M(\hat{\theta}_n) \leqslant M(\theta_0)-\eta_\varepsilon. \end{equation*}\]

另一方面,因为\(\hat{\theta}_n\)\(M_n(\theta)\)的最大点,所以:

\[\begin{equation*} M_n(\hat{\theta}_n) \geqslant M_n(\theta_0). \end{equation*}\]

\(\Delta_n\)的定义,有:

\[\begin{equation*} M_n(\hat{\theta}_n) \leqslant M(\hat{\theta}_n)+\Delta_n \leqslant M(\theta_0)-\eta_\varepsilon+\Delta_n, \end{equation*}\]

并且:

\[\begin{equation*} M_n(\theta_0) \geqslant M(\theta_0)-\Delta_n. \end{equation*}\]

因此在事件\(\{\|\hat{\theta}_n-\theta_0\|\geqslant\varepsilon\}\)上,有:

\[\begin{equation*} M(\theta_0)-\Delta_n \leqslant M_n(\theta_0) \leqslant M_n(\hat{\theta}_n) \leqslant M(\theta_0)-\eta_\varepsilon+\Delta_n. \end{equation*}\]

从而:

\[\begin{equation*} \Delta_n\geqslant\frac{\eta_\varepsilon}{2}. \end{equation*}\]

所以有事件包含关系:

\[\begin{equation*} \{\|\hat{\theta}_n-\theta_0\|\geqslant\varepsilon\} \subset \left\{ \Delta_n\geqslant\frac{\eta_\varepsilon}{2} \right\}. \end{equation*}\]

于是:

\[\begin{equation*} P_{\theta_0}(\|\hat{\theta}_n-\theta_0\|\geqslant\varepsilon) \leqslant P_{\theta_0}\left( \Delta_n\geqslant\frac{\eta_\varepsilon}{2} \right). \end{equation*}\]

由于\(\Delta_n\xrightarrow{P_{\theta_0}}0\),所以:

\[\begin{equation*} P_{\theta_0}\left( \Delta_n\geqslant\frac{\eta_\varepsilon}{2} \right) \longrightarrow 0. \end{equation*}\]

因此:

\[\begin{equation*} P_{\theta_0}(\|\hat{\theta}_n-\theta_0\|\geqslant\varepsilon) \longrightarrow 0. \end{equation*}\]

\(\varepsilon>0\)的任意性可得:

\[\begin{equation*} \hat{\theta}_n\xrightarrow{P_{\theta_0}}\theta_0. \end{equation*}\]

11.4 常见点估计及其性质

Theorem 11.7. 设\((X,\mathscr{A},\mathscr{P})\)是统计结构,\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(F\)的期望为\(\mu\)\(\mathbf{Y}=(Y_1, Y_2, \dots, Y_{n})\)为从总体\(G\)中抽取的简单样本,\(\overline{X}=\dfrac{1}{n}\sum\limits_{i=1}^{n}X_i,\overline{Y}=\dfrac{1}{n}\sum\limits_{i=1}^{n}Y_i\)\(a,b\in\mathbb{R}^{}\)。有如下等式:

\[\begin{gather*} \sum_{i=1}^{n}(X_i-a)(Y_i-b)=\sum_{i=1}^{n}(X_i-\overline{X})(Y_i-\overline{Y})+n(\overline{X}-a)(\overline{Y}-b) \\ \sum_{i=1}^{n}(X_i-\overline{X})^2=\sum_{i=1}^{n}X_i^2-n\overline{X}^2=\sum_{i=1}^{n}(X_i-\mu)^2-n(\overline{X}-\mu)^2 \end{gather*}\]

证明. 注意到:

\[\begin{gather*} \begin{aligned} &\sum_{i=1}^{n}(X_i-a)(Y_i-b)=\sum_{i=1}^{n}(X_i-\overline{X}+\overline{X}-a)(Y_i-\overline{Y}+\overline{Y}-b) \\ =&\sum_{i=1}^{n}[(X_i-\overline{X})(Y_i-\overline{Y})+(X_i-\overline{X})(\overline{Y}-b)+(\overline{X}-a)(Y_i-\overline{Y})+(\overline{X}-a)(\overline{Y}-b)] \\ =&\sum_{i=1}^{n}(X_i-\overline{X})(Y_i-\overline{Y})+(\overline{Y}-b)\sum_{i=1}^{n}(X_i-\overline{X})+(\overline{X}-a)\sum_{i=1}^{n}(Y_i-\overline{Y})+n(\overline{X}-a)(\overline{Y}-b) \\ =&\sum_{i=1}^{n}(X_i-\overline{X})(Y_i-\overline{Y})+n(\overline{X}-a)(\overline{Y}-b) \end{aligned} \\ \begin{aligned} &\sum_{i=1}^{n}(X_i-\overline{X})=\sum_{i=1}^{n}(X_i^2-2X_i\overline{X}+\overline{X}^2)=\sum_{i=1}^{n}X_i^2-2\overline{X}\sum_{i=1}^{n}X_i+n\overline{X}^2 \\ =&\sum_{i=1}^{n}X_i^2-2n\overline{X}^2+n\overline{X}^2=\sum_{i=1}^{n}X_i^2-n\overline{x}^2 \end{aligned} \\ \begin{aligned} &\sum_{i=1}^{n}(X_i-\overline{X})^2=\sum_{i=1}^{n}(X_i-\mu+\mu-\overline{X})^2 \\ =&\sum_{i=1}^{n}(X_i-\mu)^2+2\sum_{i=1}^{n}(X_i-\mu)(\mu-\overline{X})+n(\mu-\overline{X})^2 \\ =&\sum_{i=1}^{n}(X_i-\mu)^2+2(\mu-\overline{X})(n\overline{X}-n\mu)+n(\mu-\overline{X})^2 \\ =&\sum_{i=1}^{n}(X_i-\mu)^2-n(\mu-\overline{X})^2 \end{aligned} \end{gather*}\]

Property 11.4.1. 设\((X,\mathscr{A},\mathscr{P})\)是统计结构,总体\(F\)的期望和方差分别为\(\mu,\sigma^2\)\(\mathbf{X}=(X_1, X_2, \dots, X_{n})\)为从总体\(F\)中抽取的简单样本,\(X_i\in L_2(X)\)。总体期望和方差的点估计:

\[\begin{equation*} \overline{X}=\frac{1}{n}\sum_{i=1}^{n}X_i,\quad S^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\overline{X})^2 \end{equation*}\]

具有如下性质:

  1. \(\operatorname{E}(\overline{X})=\mu,\;\operatorname{Var}(\overline{X})=\dfrac{\sigma^2}{n},\;\operatorname{E}(S^2)=\sigma^2\)。若\(\nu_4\)存在,则:

    \[\begin{equation*} \operatorname{Var}(S^2)=\frac{n(\nu_4-\sigma^4)}{(n-1)^2}+\frac{\nu_4-3\sigma^4}{n(n-1)^2}-\frac{2(\nu_4-2\sigma^4)}{(n-1)^2} \end{equation*}\]

    \(\nu_3\)存在,则\(\operatorname{Cov}(\overline{X},S^2)=\dfrac{\nu_3}{n}\)

  2. \(\overline{X}\)\(S^2\)分别为期望和方差的强相合估计;

  3. \(\overline{X}\overset{a}{\longrightarrow}\operatorname{N}\left(\mu,\dfrac{\sigma^2}{n}\right)\)。若\(\nu_4\)存在,则\(S^2\overset{a}{\longrightarrow}\operatorname{N}\left(\sigma^2,\dfrac{\nu_4-\sigma^4}{n}\right)\)

  4. \(\operatorname{Corr}(X_i-\overline{X},X_j-\overline{X})=-\dfrac{1}{n-1}(i\ne j),\;S^2=\dfrac{1}{n(n-1)}\sum\limits_{i<j}^{}(X_i-X_j)^2\)

证明. 因为\(X_i\in L_2(X)\),由定理 5.29可知\(\mu<+\infty\),根据性质 6.3.5(1)可得\(\sigma^2<+\infty\)

(1)由性质 5.4.3(6)可得:

\[\begin{equation*} \operatorname{E}(\overline{X})=\frac{1}{n}\sum_{i=1}^{n}\operatorname{E}(X_i)=\mu \end{equation*}\]

根据性质 5.4.3(6)性质 6.3.5(3)性质 6.3.4(7)可得:

\[\begin{equation*} \operatorname{Var}(\overline{X})=\frac{1}{n^2}\sum_{i=1}^{n}\operatorname{Var}(X_i)=\frac{n\sigma^2}{n^2}=\frac{\sigma^2}{n} \end{equation*}\]

定理 11.7可得:

\[\begin{equation*} S^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\overline{X})^2=\frac{1}{n-1}\left(\sum_{i=1}^{n}X_i^2-n\overline{X}^2\right) \end{equation*}\]

根据性质 5.4.3(6)性质 6.3.5(1)\(\overline{X}\)对应的转换需要根据性质 5.4.3(6)另推)可得:

\[\begin{align*} &\operatorname{E}(S^2)=\frac{1}{n-1}\sum_{i=1}^{n}\operatorname{E}(X_i^2)-\frac{n}{n-1}\operatorname{E}(\overline{X}^2) \\ =&\frac{1}{n-1}n\{\operatorname{Var}(X_i)+[\operatorname{E}(X_i)]^2\}-\frac{n}{n-1}\{\operatorname{Var}(\overline{X})+[\operatorname{E}(\overline{X})]^2\} \\ =&\frac{n}{n-1}(\sigma^2+\mu^2)-\frac{n}{n-1}\left(\frac{\sigma^2}{n}+\mu^2\right)=\frac{n}{n-1}\sigma^2-\frac{n}{n-1}\frac{\sigma^2}{n}=\sigma^2 \end{align*}\]

\(\nu_4\)存在时,由定理 11.7可得:

\[\begin{equation*} \sum_{i=1}^{n}(X_i-\overline{X})^2=\sum_{i=1}^{n}(X_i-\mu)^2-n(\overline{X}-\mu)^2 \end{equation*}\]

因为\(\nu_4\)存在,所以\((X_i-\mu)^2\in L_2(X)\)证明\((\overline{X}-\mu)^2\in L_2(X)\),检查协方差公式适用条件以及协方差的良定义,由性质 5.4.3(6)性质 6.3.5(3)性质 6.3.4(7)(5)(3)性质 6.3.5(1)可得:

\[\begin{align*} &\operatorname{Var}(S^2)=\operatorname{Var}\left[\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\overline{X})^2\right]=\frac{1}{(n-1)^2}\operatorname{Var}\left[\sum_{i=1}^{n}(X_i-\mu)^2-n(\overline{X}-\mu)^2\right] \\ =&\frac{1}{(n-1)^2}\left\{\operatorname{Var}\left[\sum_{i=1}^{n}(X_i-\mu)^2\right]+\operatorname{Var}[n(\overline{X}-\mu)^2]-2\operatorname{Cov}\left[\sum_{i=1}^{n}(X_i-\mu)^2,n(\overline{X}-\mu)^2\right]\right\} \\ =&\frac{1}{(n-1)^2}\left\{\sum_{i=1}^{n}\operatorname{Var}[(X_i-\mu)^2]+n^2\operatorname{Var}[(\overline{X}-\mu)^2]-2n\sum_{i=1}^{n}\operatorname{Cov}[(X_i-\mu)^2,(\overline{X}-\mu)^2]\right\} \end{align*}\]

性质 6.3.5(1)可得:

\[\begin{equation*} \operatorname{Var}[(X_i-\mu)^2]=\operatorname{E}[(X_i-\mu)^4]-\{\operatorname{E}[(X_i-\mu)^2]\}^2=\nu_4-\sigma^4 \end{equation*}\]

性质 5.4.3(6)性质 6.3.5(3)性质 6.2.1(4)性质 6.3.4(7)(5)性质 6.3.1(2)可得:

\[\begin{align*} &n^2\operatorname{Var}[(\overline{X}-\mu)^2]=n^2\operatorname{Var}\left\{\left[\frac{\sum\limits_{i=1}^{n}(X_i-\mu)}{n}\right]^2\right\}=\frac{1}{n^2}\operatorname{Var}\left\{\left[\sum_{i=1}^{n}(X_i-\mu)\right]^2\right\} \\ =&\frac{1}{n^2}\operatorname{Var}\left[\sum_{i=1}^{n}(X_i-\mu)^2+2\sum_{i=1}^{n}\sum_{j>i}^{}(X_i-\mu)(X_j-\mu)\right] \\ =&\frac{1}{n^2}\left\{\sum_{i=1}^{n}\operatorname{Var}[(X_i-\mu)^2]+\operatorname{Var}\left[2\sum_{i=1}^{n}\sum_{j>i}^{}(X_i-\mu)(X_j-\mu)\right]\right. \\ &\left.+2\operatorname{Cov}\left[\sum_{i=1}^{n}(X_i-\mu)^2,2\sum_{i=1}^{n}\sum_{j>i}^{}(X_i-\mu)(X_j-\mu)\right]\right\} \\ =&\frac{1}{n^2}\left\{n(\nu_4-\sigma^4)+\operatorname{Cov}\left[2\sum_{i=1}^{n}\sum_{j>i}^{}(X_i-\mu)(X_j-\mu)\right]\right. \\ &\left.+4\sum_{i=1}^{n}\sum_{j=1}^{n}\sum_{k>j}^{}\operatorname{Cov}\left[(X_i-\mu)^2,(X_j-\mu)(X_k-\mu)\right]\right\} \\ =&\frac{1}{n^2}\left\{n(\nu_4-\sigma^4)+4\sum_{i=1}^{n}\sum_{j>i}^{}\sum_{k=1}^{n}\sum_{l>k}^{}\operatorname{Cov}\left[(X_i-\mu)(X_j-\mu),(X_k-\mu)(X_l-\mu)\right]\right. \\ &\left.+4\sum_{i=1}^{n}\sum_{j=1}^{n}\sum_{k>j}^{}\{\operatorname{E}[(X_i-\mu)^2(X_j-\mu)(X_k-\mu)]-\operatorname{E}[(X_i-\mu)^2]\operatorname{E}[(X_j-\mu)(X_k-\mu)]\}\right\} \\ =&\frac{1}{n^2}\left\{n(\nu_4-\sigma^4)+4\sum_{i=1}^{n}\sum_{j>i}^{}\sum_{k=1}^{n}\sum_{l>k}^{}\{\operatorname{E}[(X_i-\mu)(X_j-\mu)(X_k-\mu)(X_l-\mu)]\right. \\ &\Big.-\operatorname{E}[(X_i-\mu)(X_j-\mu)]\operatorname{E}[(X_k-\mu)(X_l-\mu)]\}\Big\} \\ =&\frac{1}{n^2}\left\{n(\nu_4-\sigma^4)+4\sum_{i=1}^{n}\sum_{j>i}^{}\operatorname{E}[(X_i-\mu)^2(X_j-\mu)^2]\right\} \\ =&\frac{1}{n^2}\left\{n(\nu_4-\sigma^4)+4\sum_{i=1}^{n}\sum_{j>i}^{}\operatorname{E}[(X_i-\mu)^2]\operatorname{E}[(X_j-\mu)^2]\right\}=\frac{1}{n^2}\left[n(\nu_4-\sigma^4)+4\frac{n(n-1)}{2}\sigma^4\right] \\ =&\frac{1}{n}[(\nu_4-\sigma^4)+2(n-1)\sigma^4]=\frac{1}{n}[\nu_4+(2n-3)\sigma^4] \end{align*}\]

根据性质 6.3.4(3)(5)(6)性质 6.3.1(2)可得:

\[\begin{align*} &-2n\sum_{i=1}^{n}\operatorname{Cov}[(X_i-\mu)^2,(\overline{X}-\mu)^2] \\ =&-2n\frac{1}{n^2}\operatorname{Cov}\left[(X_i-\mu)^2,\sum_{j=1}^{n}(X_j-\mu)^2+2\sum_{j=1}^{n}\sum_{k>1}^{}(X_j-\mu)(X_k-\mu)\right] \\ =&-\frac{2}{n}\sum_{i=1}^{n}\sum_{j=1}^{n}\operatorname{Cov}[(X_i-\mu)^2,(X_j-\mu)^2]-4n\sum_{i=1}^{n}\sum_{j=1}^{n}\sum_{k>j}^{}\operatorname{Cov}[(X_i-\mu)^2,(X_j-\mu)(X_k-\mu)] \\ =&-\frac{2}{n}\sum_{i=1}^{n}\sum_{j=1}^{n}\{\operatorname{E}[(X_i-\mu)^2(X_j-\mu)^2]-\operatorname{E}[(X_i-\mu)^2]\operatorname{E}[(X_j-\mu)^2]\} \\ =&-\frac{2}{n}\sum_{i=1}^{n}\sum_{j=1}^{n}\operatorname{E}[(X_i-\mu)^2(X_j-\mu)^2]+\frac{2}{n}\sum_{i=1}^{n}\sum_{j=1}^{n}\operatorname{E}[(X_i-\mu)^2]\operatorname{E}[(X_j-\mu)^2] \\ =&-\frac{2}{n}[n\nu_4+n(n-1)\sigma^4]+2n^3\sigma^4=-2\nu_4-2(n-1)\sigma^4+2n\sigma^4=-2\nu_4+2\sigma^4 \end{align*}\]

综上:

\[\begin{align*} \operatorname{Var}(S^2)&=\frac{1}{(n-1)^2}\left\{n(\nu_4-\sigma^4)+\frac{1}{n}[\nu_4+(2n-3)\sigma^4]-2\nu_4+2\sigma^4\right\} \\ &=\frac{n(\nu_4-\sigma^4)}{(n-1)^2}+\frac{\nu_4-3\sigma^4}{n(n-1)^2}-\frac{2(\nu_4-2\sigma^4)}{(n-1)^2} \end{align*}\]

\(\nu_3\)存在时,由性质 6.3.4(3)(5)性质 5.4.3(6)性质 6.2.1(6)性质 6.3.1(2)可得:

\[\begin{align*} &\operatorname{Cov}(\overline{X},S^2)=\operatorname{Cov}\left[\frac{1}{n}\sum_{i=1}^{n}X_i,\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\overline{X})^2\right] \\ =&\operatorname{Cov}\left\{\frac{1}{n}\sum_{i=1}^{n}X_i,\frac{1}{n-1}\left[\sum_{i=1}^{n}(X_i-\mu)^2-n(\overline{X}-\mu)^2\right]\right\} \\ =&\frac{1}{n(n-1)}\sum_{i=1}^{n}\sum_{j=1}^{n}\operatorname{Cov}[X_i,(X_j-\mu)^2]-\frac{n}{n(n-1)}\sum_{i=1}^{n}\operatorname{Cov}[X_i,(\overline{X}-\mu)^2] \\ =&\frac{1}{n(n-1)}\sum_{i=1}^{n}\sum_{j=1}^{n}\{\operatorname{E}[X_i(X_j-\mu)^2]-\operatorname{E}(X_i)\operatorname{E}[(X_j-\mu)^2]\}-\frac{1}{n-1}\sum_{i=1}^{n}\operatorname{Cov}\left[X_i,\left(\frac{1}{n}\sum_{j=1}^{n}X_i-\mu\right)^2\right] \\ =&\frac{1}{n(n-1)}\sum_{i=1}^{n}\{\operatorname{E}[X_i(X_i-\mu)^2]-\operatorname{E}(X_i)\operatorname{E}[(X_i-\mu)^2]\} \\ &+\frac{1}{n(n-1)}\sum_{i=1}^{n}\sum_{j\ne i}^{}\{\operatorname{E}[X_i(X_j-\mu)^2]-\operatorname{E}(X_i)\operatorname{E}[(X_j-\mu)^2]\} \\ &-\frac{1}{n^2(n-1)}\sum_{i=1}^{n}\operatorname{Cov}\left[X_i,\sum_{j=1}^n(X_j-\mu)^2+2\sum_{j=1}^n\sum_{k>j}(X_j-\mu)(X_k-\mu)\right] \\ =&\frac{1}{n(n-1)}\sum_{i=1}^{n}\operatorname{E}[(X_i-\mu)^3]-\frac{1}{n^2(n-1)}\sum_{i=1}^{n}\sum_{j=1}^n\operatorname{Cov}[X_i,(X_j-\mu)^2] \\ &-\frac{2}{n^2(n-1)}\sum_{i=1}^{n}\sum_{j=1}^n\sum_{k>j}\operatorname{Cov}[X_i,(X_j-\mu)(X_k-\mu)] \\ =&\frac{\nu_3}{(n-1)}-\frac{\nu_3}{n(n-1)}-\frac{2}{n^2(n-1)}\sum_{i=1}^{n}\sum_{j=1}^n\sum_{k>j}\{\operatorname{E}[X_i(X_j-\mu)(X_k-\mu)] \\ &-\operatorname{E}(X_i)\operatorname{E}[(X_j-\mu)(X_k-\mu)]\}\frac{n\nu_3-\nu_3}{n(n-1)}=\frac{\nu_3}{n} \end{align*}\]

(2)由性质 11.2.1(1)可知\(\overline{X}\)\(\mu\)的强相合估计,由性质 11.2.1(2)可知\(\nu_{n2}\)\(\sigma^2\)的强相合估计,即\(\nu_{n2}\overset{P}{\longrightarrow}\sigma^2\),注意到:

\[\begin{equation*} S^2=\dfrac{n}{n-1}\nu_{n2},\quad\frac{n}{n-1}\to1 \end{equation*}\]

性质 7.0.3(1)(3)可得\(S^2\overset{P}{\longrightarrow}\sigma^2\),即\(S^2\)\(\sigma^2\)的强相合估计。

(3)由定理 7.8可得:

\[\begin{equation*} \frac{\sqrt{n}(\overline{X}-\mu)}{\sigma}\overset{d}{\longrightarrow}\operatorname{N}(0,1) \end{equation*}\]

即:

\[\begin{equation*} \overline{X}\overset{a}{\longrightarrow}\operatorname{N}\left(\mu,\frac{\sigma^2}{n}\right) \end{equation*}\]

定理 11.7可得:

\[\begin{equation*} \frac{1}{n-1}\sum_{i=1}^{n}(X_i-\overline{X})^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\mu)^2-\frac{n}{n-1}(\overline{X}-\mu)^2 \end{equation*}\]

性质 5.2.1(5)可得:

\[\begin{equation*} \operatorname{Var}[(X_i-\mu)^2]=\operatorname{E}\{[(X_i-\mu)^2-\sigma^2]^2\}=\operatorname{E}[(X_i-\mu)^4-2\sigma^2(X_i-\mu)^2+\sigma^4]=\nu_4-\sigma^4 \end{equation*}\]

根据定理 7.8可得:

\[\begin{equation*} \sqrt{n}\frac{\dfrac{1}{n}\sum\limits_{i=1}^{n}(X_i-\mu)^2-\sigma^2}{\sqrt{\nu_4-\sigma^4}}\overset{d}{\longrightarrow}\operatorname{N}(0,1) \end{equation*}\]

性质 7.0.3(1)定理 7.3即:

\[\begin{equation*} \sqrt{n}\left[\frac{1}{n}\sum_{i=1}^{n}(X_i-\mu)^2-\sigma^2\right]\overset{d}{\longrightarrow}\operatorname{N}\left(0,\frac{\nu_4-\sigma^4}{n}\right) \end{equation*}\]

注意到:

\[\begin{equation*} \sqrt{n}\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\overline{X})^2=\frac{n}{n-1}\frac{1}{n}\sum_{i=1}^{n}(X_i-\mu)^2-\frac{n}{n-1}(\overline{X}-\mu)^2 \end{equation*}\]

(4)由性质 6.3.4(3)(5)(7)可得:

\[\begin{align*} &\operatorname{Cov}(X_i-\overline{X},X_j-\overline{X})=\frac{1}{n^2}\operatorname{Cov}\left[\sum_{k\ne i}^{}(X_i-X_k),\sum_{l\ne j}^{}(X_j-X_l)\right] \\ =&\frac{1}{n^2}\sum_{k\ne i}^{}\sum_{l\ne j}^{}[\operatorname{Cov}(X_i,X_j)-\operatorname{Cov}(X_i,X_l)-\operatorname{Cov}(X_k.X_j)+\operatorname{Cov}(X_k,X_l)] \\ =&\frac{1}{n^2}\sum_{k\ne i}^{}\sum_{l\ne j}^{}[-\operatorname{Cov}(X_i,X_l)-\operatorname{Cov}(X_k,X_j)+\operatorname{Cov}(X_k,X_l)] \\ =&\frac{1}{n^2}\left[-\sum_{k\ne i}^{}\sum_{l\ne j}^{}\operatorname{Cov}(X_i,X_l)-\sum_{k\ne i}^{}\sum_{l\ne j}^{}\operatorname{Cov}(X_k,X_j)+\sum_{k\ne i}^{}\sum_{l\ne j}^{}\operatorname{Cov}(X_k,X_l)\right] \\ =&\frac{1}{n^2}\left[-\sum_{k\ne i}^{}\sigma^2-\sum_{k\ne i}^{}(n-1)\operatorname{Cov}(X_k,X_j)+(n-2)\sigma^2\right] \\ =&\frac{1}{n^2}\left[-(n-1)\sigma^2-(n-1)\sigma^2+(n-2)\sigma^2\right]=-\frac{\sigma^2}{n} \end{align*}\]

由(1)和性质 5.4.3(6)性质 6.3.5(3)性质 6.3.4(7)有:

\[\begin{align*} \operatorname{Var}(X_i-\overline{X})=\frac{1}{n^2}\operatorname{Var}\left[(n-1)X_i-\sum_{k\ne i}^{}X_k\right]=\frac{1}{n^2}[(n-1)^2\sigma^2+(n-1)\sigma^2]=\frac{(n-1)\sigma^2}{n} \end{align*}\]

所以:

\[\begin{equation*} \operatorname{Corr}(X_i-\overline{X},X_j-\overline{X})=\frac{\operatorname{Cov}(X_i-\overline{X},X_j-\overline{X})}{\sqrt{\operatorname{Var}(X_i-\overline{X})\operatorname{Var}(X_j-\overline{X})}}=\dfrac{-\dfrac{\sigma^2}{n}}{\dfrac{(n-1)\sigma^2}{n}}=\frac{-1}{n-1} \end{equation*}\]

注意到:

\[\begin{align*} &\sum_{i<j}^{}(X_i-X_j)^2=\sum_{i=1}^{n-1}\sum_{j>i}^{}(X_i^2-2X_iX_j+X_j^2)=\sum_{i=1}^{n-1}\sum_{j>i}^{}(X_i^2+X_j^2)-2\sum_{i=1}^{n-1}\sum_{j>i}^{}X_iX_j \\ =&(n-1)\sum_{i=1}^{n}X_i^2-2\sum_{i=1}^{n-1}\sum_{j>i}^{}X_iX_j=n\sum_{i=1}^{n}X_i^2-\left(\sum_{i=1}^{n}X_i\right)^2=n\sum_{i=1}^{n}X_i^2-n^2\overline{X}^2 \end{align*}\]

定理 11.7可得:

\[\begin{equation*} \frac{1}{n(n-1)}\sum_{i<j}^{}(X_i-X_j)^2=\frac{1}{n-1}\sum_{i=1}^{n}X_i^2-\frac{n}{n-1}\overline{X}^2=\frac{1}{n-1}\left(\sum_{i=1}^{n}X_i^2-n\overline{X}^2\right)=S^2 \end{equation*}\]

Definition 11.19. 称上述两个点估计为样本均值(sample mean)样本方差(sample variance)

11.4.0.1 数值运算

Theorem 11.8. 对于样本方差和样本均值:

  1. 记:

    \[\begin{equation*} \overline{x}_n=\frac{1}{n}\sum_{i=1}^{n}x_i,\quad s_n^2=\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\overline{x}_n)^2 \end{equation*}\]

    则有:

    \[\begin{equation*} \overline{x}_{n+1}=\overline{x}_n+\frac{1}{n+1}(x_{n+1}-\overline{x}_n),\quad s_{n+1}^2=\frac{n-1}{n}s_n^2+\frac{1}{n}(x_{n+1}-\overline{x}_n)^2 \end{equation*}\]

  2. 从同一总体中抽取两个大小分别为\(m\)\(n\)的样本,样本均值分别记为\(\overline{x}_1,\overline{x}_2\),样本方差分别为\(s_1^2,s_2^2\),将两组样本合并,其均值和样本方差分别为\(\overline{x},s^2\),则有:

    \[\begin{equation*} \overline{x}=\frac{m\overline{x}_1+n\overline{x}_2}{m+n},\quad s^2=\frac{(m-1)s_1^2+(n-1)s_2^2}{m+n-1}+\frac{mn(\overline{x}_1-\overline{x}_2)^2}{(m+n)(m+n+1)} \end{equation*}\]

证明. (1)对于均值有:

\[\begin{align*} \overline{x}_{n+1}&=\frac{1}{n+1}\sum_{i=1}^{n+1}x_i=\frac{n}{n+1}\frac{1}{n}\left(\sum_{i=1}^{n}x_i+x_{n+1}\right) \\ &=\frac{n}{n+1}\overline{x}_n+\frac{1}{n+1}x_{n+1}=\overline{x}_n+\frac{1}{n+1}(x_{n+1}-\overline{x}_n) \end{align*}\]

对于方差有:

\[\begin{align*} s_{n+1}^2&=\frac{1}{n}\sum_{i=1}^{n+1}(x_i-\overline{x}_{n+1})^2=\frac{1}{n}\sum_{i=1}^{n+1}\left[x_i-\overline{x}_n-\frac{1}{n+1}(x_{n+1}-\overline{x}_n)\right]^2 \\ &=\frac{1}{n}\sum_{i=1}^{n+1}\left[(x_i-\overline{x}_n)^2+\frac{1}{(n+1)^2}(x_{n+1}-\overline{x}_n)^2-\frac{2}{n+1}(x_i-\overline{x}_n)(x_{n+1}-\overline{x}_n)\right] \\ &=\frac{1}{n}\sum_{i=1}^{n}(x_i-\overline{x}_n)^2+\frac{1}{n}(x_{n+1}-\overline{x}_n)^2+\frac{1}{n(n+1)}(x_{n+1}-\overline{x}_n)^2-\frac{2}{n(n+1)}(x_{n+1}-\overline{x}_n)^2 \\ &=\frac{n-1}{n}s_n^2+\frac{1}{n}(x_{n+1}-\overline{x}_n)^2-\frac{1}{n(n+1)}(x_{n+1}-\overline{x}_n)^2 \\ &=\frac{n-1}{n}s_n^2+\frac{1}{n}(x_{n+1}-\overline{x}_n)^2 \end{align*}\]

(2)均值的结论是显然的,对于方差有:

\[\begin{align*} s^2&=\frac{1}{m+n-1}\sum_{i=1}^{m+n}(x_i-\overline{x})^2=\frac{1}{m+n-1}\left[\sum_{i=1}^{m}(x_i-\overline{x})^2+\sum_{i=m+1}^{m+n}(x_i-\overline{x})^2\right] \\ &=\frac{1}{m+n-1}\left[\sum_{i=1}^{m}(x_i-\overline{x}_1+\overline{x}_1-\overline{x})^2+\sum_{i=m+1}^{m+n}(x_i-\overline{x}_2+\overline{x}_2-\overline{x})^2\right] \\ &=\frac{1}{m+n-1}\left[(m-1)s_1^2+m(\overline{x}_1-\overline{x})^2+2\sum_{i=1}^{m}(x_i-\overline{x}_1)(\overline{x_1}-\overline{x})\right. \\ &\quad\left.+(n-1)s_2^2+n(\overline{x}_2-\overline{x})^2+2\sum_{i=m+1}^{m+n}(x_i-\overline{x}_2)(\overline{x_2}-\overline{x})\right] \\ &=\frac{1}{m+n-1}\left[(m-1)s_1^2+m(\overline{x}_1-\overline{x})^2+(n-1)s_2^2+n(\overline{x}_2-\overline{x})^2\right] \\ &=\frac{(m-1)s_1^2+(n-1)s_2^2}{m+n-1}+\frac{m(\overline{x}_1-\overline{x})^2+n(\overline{x}_2-\overline{x})^2}{m+n-1} \end{align*}\]

由于:

\[\begin{gather*} m(\overline{x}_1-\overline{x})^2=m\left(\overline{x}_1-\frac{m\overline{x}_1+n\overline{x}_2}{m+n}\right)^2=m\frac{n^2(\overline{x}_1-\overline{x}_2)^2}{(m+n)^2} \\ n(\overline{x}_2-\overline{x})^2=n\left(\overline{x}_2-\frac{m\overline{x}_1+n\overline{x}_2}{m+n}\right)^2=n\frac{m^2(\overline{x}_1-\overline{x}_2)^2}{(m+n)^2} \end{gather*}\]

所以:

\[\begin{align*} s^2&=\frac{(m-1)s_1^2+(n-1)s_2^2}{m+n-1}+\frac{m(\overline{x}_1-\overline{x})^2+n(\overline{x}_2-\overline{x})^2}{m+n-1} \\ &=\frac{(m-1)s_1^2+(n-1)s_2^2}{m+n-1}+\frac{(m+n)mn(\overline{x}_1-\overline{x}_2)^2}{(m+n-1)(m+n)^2} \\ &=\frac{(m-1)s_1^2+(n-1)s_2^2}{m+n-1}+\frac{mn(\overline{x}_1-\overline{x}_2)^2}{(m+n-1)(m+n)} \end{align*}\]

11.5 区间估计

Definition 11.20. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\Theta\)是参数空间,\(\mathbf{X}\)为从总体\(F\)中抽取的简单样本,\(g_1(\theta)\in\mathbb{R}^{n},g_2(\theta)\in\mathbb{R}^{}\)是待估量,\(\delta(\mathbf{X}),\delta_1(\mathbf{X}),\delta_2(\mathbf{X})\)是统计量且满足对任意的样本有\(\delta_1(\mathbf{X})\leqslant\delta_2(\mathbf{X})\)\(\alpha\in(0,1)\)为给定值。若统计量\(\delta(\mathbf{X})\)满足:

\[\begin{equation*} \forall\;\theta\in\Theta,\;P_{\theta}(\{g_1(\theta)\in \delta(\mathbf{X})\})\geqslant 1-\alpha \end{equation*}\]

则称\(\delta(\mathbf{X})\)\(g_1(\theta)\)置信水平(confidence level)\(1-\alpha\)置信域(confidence region),若\(n=1\)则称\(\delta(\mathbf{X})\)\(g_1(\theta)\)置信水平为\(1-\alpha\)置信区间(confidence interval),上式取等号时称\(\delta(\mathbf{X})\)\(g_1(\theta)\)置信水平为\(1-\alpha\)同等置信域,称:

\[\begin{equation*} \inf_{\theta\in\Theta}P_{\theta}(\{g_1(\theta)\in\delta(\mathbf{X})\}) \end{equation*}\]

为其置信系数(confidence coefficient)。若\(\delta_1(\mathbf{X})\)满足:

\[\begin{equation*} \forall\;\theta\in\Theta,\;P_{\theta}(\{\delta_1(\mathbf{X})\leqslant g_2(\theta)\})\geqslant 1-\alpha \end{equation*}\]

则称\(\delta_1(\mathbf{X})\)\(g_2(\theta)\)置信水平为\(1-\alpha\)置信下限(lower confidence limit),上式取等号时称\(\delta_1(\mathbf{X})\)\(g_2(\theta)\)置信水平为\(1-\alpha\)同等置信下限,称:

\[\begin{equation*} \inf_{\theta\in\Theta}P_{\theta}(\{\delta_1(\mathbf{X})\leqslant g_2(\theta)\}) \end{equation*}\]

为其置信系数。若\(\delta_2(\mathbf{X})\)满足:

\[\begin{equation*} \forall\;\theta\in\Theta,\;P_{\theta}(\{g_2(\theta)\leqslant\delta_2(\mathbf{X})\})\geqslant 1-\alpha \end{equation*}\]

则称\(\delta_2(\mathbf{X})\)\(g_2(\theta)\)置信水平为\(1-\alpha\)置信上限(upper confidence limit),上式取等号时称\(\delta_2(\mathbf{X})\)\(g_2(\theta)\)置信水平为\(1-\alpha\)同等置信上限,称:

\[\begin{equation*} \inf_{\theta\in\Theta}P_{\theta}(\{g_2(\theta)\leqslant\delta_2(\mathbf{X})\}) \end{equation*}\]

为其置信系数。

note 11.7. 什么样的置信域是好的?我们当然希望置信域能够包含待估量的真实值(即提高置信水平或置信系数),并且包含的非真实值尽可能的少,但这两点往往是冲突的:置信域越大,更有可能包含真实值,但精度就会降低;置信域小则包含真实值的概率也小。Nyeman提出了一个区间估计的标准:在保持置信水平尽可能大的前提下,使得置信域尽可能的小,即可靠度优先。

note 11.8. (枢轴量法)

枢轴量法是一个常见的构造区间估计的方法,下面给出其实现的具体步骤:

  1. 找到一个待估量\(g(\theta)\)的良好的点估计\(\delta(\mathbf{X})\)

  2. 求出随机变量\(f(g,\delta)\)的分布,要求\(f\)的分布与\(g(\theta)\)的取值无关,称\(f(g,\delta)\)枢轴量(pivotal quantity)

  3. 根据\(f(g,\delta)\)的分位点给出给定置信水平的区间估计或置信上(下)限。

考虑置信区间的情况,若\(f(g,\delta)\)的分布是单峰对称分布(如一元正态分布),很容易找出给定置信水平的最小置信区间(\(g\)\(f\)的分子位置时即取\(f(g,\delta)\)分布的\(\frac{\alpha}{2}\)\(1-\frac{\alpha}{2}\)分位点),但很多情况下我们需要数值方法来求解最小置信区间,为了避免这些麻烦,我们在多数情况下会构造等尾置信区间,即依旧取\(f(g,\delta)\)分布的\(\frac{\alpha}{2}\)\(1-\frac{\alpha}{2}\)分位点作为区间估计的两端。

Theorem 11.9. 设\((X,\mathscr{A},\mathscr{P})\)是参数结构,\(\mathbf{X}=(X_1, X_2, \dots, X_{m})\)为从总体\(F\)中抽取的简单样本,\(\mathbf{Y}=(Y_1, Y_2, \dots, Y_{n})\)为从总体\(G\)中抽取的简单样本,\(\overline{X},\overline{Y}\)为样本均值,\(S_X^2,S_Y^2\)为样本方差,\(g(\theta)\)为待估量,其区间估计有如下结论:

  1. 若置信水平为\(1-\alpha_1\)\(g(\theta)\)的置信上限\(\delta_1(\mathbf{X})\)和置信水平为\(1-\alpha_2\)\(g(\theta)\)的置信上限\(\delta_2(\mathbf{X})\)满足对任意的样本有\(\delta_1(\mathbf{X})\leqslant\delta_2(\mathbf{X})\),则\([\delta_1(\mathbf{X}),\delta_2(\mathbf{X})]\)\(g(\theta)\)置信水平为\(1-\alpha_1-\alpha_2\)的置信区间;

  2. 若总体\(F\)服从\(\operatorname{N}(\mu,\sigma^2)\),在\(\sigma^2\)已知时\(g(\theta)=\mu\)置信水平为\(1-\alpha\)的区间估计为:

    \[\begin{equation*} \left[\overline{X}-u_{1-\frac{\alpha}{2}}\sqrt{\dfrac{\sigma^2}{m}},\overline{X}+u_{1-\frac{\alpha}{2}}\sqrt{\dfrac{\sigma^2}{m}}\right] \end{equation*}\]

    \(\sigma^2\)未知时\(g(\theta)=\mu\)置信水平为\(1-\alpha\)的区间估计为:

    \[\begin{equation*} \left[\overline{X}-\operatorname{t}_{m-1}\left(1-\frac{\alpha}{2}\right)\sqrt{\dfrac{S_X^2}{m}},\overline{X}+\operatorname{t}_{m-1}\left(1-\frac{\alpha}{2}\right)\sqrt{\dfrac{S_X^2}{m}}\right] \end{equation*}\]

  3. 若总体\(F\)服从\(\operatorname{N}(\mu,\sigma^2)\),在\(\mu\)已知时\(g(\theta)=\sigma^2\)置信水平为\(1-\alpha\)的区间估计为:

    \[\begin{equation*} \left[\frac{1}{\chi_{m}^2\left(1-\frac{\alpha}{2}\right)}\sum_{i=1}^{m}(X_i-\mu)^2,\frac{1}{\chi_{m}^2\left(\frac{\alpha}{2}\right)}\sum_{i=1}^{m}(X_i-\mu)^2\right] \end{equation*}\]

    \(\mu\)未知时\(g(\theta)=\sigma^2\)置信水平为\(1-\alpha\)的区间估计为:

    \[\begin{equation*} \left[\frac{(m-1)S_X^2}{\chi_{m-1}^2\left(1-\frac{\alpha}{2}\right)},\frac{(m-1)S_X^2}{\chi_{m-1}^2\left(\frac{\alpha}{2}\right)}\right] \end{equation*}\]

  4. 若总体\(F\)服从\(\operatorname{N}(\mu,\sigma_1^2)\)\(G\)服从\(\operatorname{N}(\nu,\sigma_2^2)\)\(\sigma_1^2\)\(\sigma_2^2\)已知时\(g(\theta)=\mu-\nu\)置信水平为\(1-\alpha\)的区间估计为:

    \[\begin{equation*} \left[\overline{X}-\overline{Y}-u_{1-\frac{\alpha}{2}}\sqrt{\dfrac{\sigma_1^2}{m}+\dfrac{\sigma_2^2}{n}},\overline{X}-\overline{Y}+u_{1-\frac{\alpha}{2}}\sqrt{\dfrac{\sigma_1^2}{m}+\dfrac{\sigma_2^2}{n}}\right] \end{equation*}\]

    \(\sigma_1^2=c\sigma_2^2(c>0)\)\(g(\theta)=\mu-\nu\)置信水平为\(1-\alpha\)的区间估计为:

    \[\begin{equation*} \left[\overline{X}-\overline{Y}-\operatorname{t}_{m+n-2}\left(1-\frac{\alpha}{2}\right)S_w\sqrt{\dfrac{mc+n}{mn}},\overline{X}-\overline{Y}+\operatorname{t}_{m+n-2}\left(1-\frac{\alpha}{2}\right)S_w\sqrt{\dfrac{mc+n}{mn}}\right] \end{equation*}\]

    其中:

    \[\begin{equation*} S_w^2=\frac{(m-1)S_X^2+(n-1)S_Y^2/c}{m+n-2} \end{equation*}\]

  5. 若总体\(F\)服从\(\operatorname{N}(\mu,\sigma_1^2)\)\(G\)服从\(\operatorname{N}(\nu,\sigma_2^2)\),在\(\mu,\nu\)已知时\(g(\theta)=\dfrac{\sigma_1^2}{\sigma_2^2}\)置信水平为\(1-\alpha\)的区间估计为:

    \[\begin{equation*} \left[\frac{n\sum\limits_{i=1}^{m}(X_i-\mu)^2}{m\sum\limits_{i=1}^{n}(Y_i-\nu)^2\operatorname{F}_{m,n}\left(1-\frac{\alpha}{2}\right)},\frac{n\sum\limits_{i=1}^{m}(X_i-\mu)^2}{m\sum\limits_{i=1}^{n}(Y_i-\nu)^2\operatorname{F}_{m,n}\left(\frac{\alpha}{2}\right)}\right] \end{equation*}\]

    \(\mu,\nu\)未知时\(g(\theta)=\dfrac{\sigma_1^2}{\sigma_2^2}\)置信水平为\(1-\alpha\)的区间估计为:

    \[\begin{equation*} \left[\frac{S_X^2}{S_Y^2\operatorname{F}_{m-1,n-1}\left(1-\frac{\alpha}{2}\right)},\frac{S_X^2}{S_Y^2\operatorname{F}_{m-1,n-1}\left(\frac{\alpha}{2}\right)}\right] \end{equation*}\]

证明. (1)由性质 5.2.1(3)(次有限可加性)可得:

\[\begin{align*} P(\{g(\theta)\leqslant\delta_1(\mathbf{X})\}\cup\{g(\theta)\geqslant\delta_2(\mathbf{X})\})&\leqslant P(\{g(\theta)\leqslant\delta_1(\mathbf{X})\})+P(\{g(\theta)\geqslant\delta_2(\mathbf{X})\}) \\ &\leqslant\alpha_1+\alpha_2,\;\forall\;P\in\mathscr{P} \end{align*}\]

根据性质 5.2.1(2)可得:

\[\begin{equation*} \forall\;P\in\mathscr{P},\;P\left(\{\delta_1(\mathbf{X})\leqslant g(\theta)\leqslant\delta_2(\mathbf{X})\}\right)\geqslant1-\alpha_1-\alpha_2 \end{equation*}\]

(2)已知\(\sigma^2\)定理 10.16(1)性质 6.4.6(2)可知:

\[\begin{equation*} f(\mu,\overline{X})=\frac{\sqrt{m}(\overline{X}-\mu)}{\sigma}\sim\operatorname{N}(0,1) \end{equation*}\]

根据(1)可知可取:

\[\begin{equation*} u_{\frac{\alpha}{2}}\leqslant f(\mu,\overline{X})\leqslant u_{1-\frac{\alpha}{2}} \end{equation*}\]

即:

\[\begin{equation*} \left[\overline{X}-u_{1-\frac{\alpha}{2}}\sqrt{\dfrac{\sigma^2}{m}},\overline{X}-u_{1-\frac{\alpha}{2}}\sqrt{\dfrac{\sigma^2}{m}}\right] \end{equation*}\]

未知\(\sigma^2\)定理 10.16(4)可知:

\[\begin{equation*} f(\mu,\overline{X})=\frac{\sqrt{m}(\overline{X}-\mu)}{S_X}\sim\operatorname{t}_{m-1} \end{equation*}\]

根据(1)可知可取:

\[\begin{equation*} \operatorname{t}_{m-1}\left(\frac{\alpha}{2}\right)\leqslant f(\mu,\overline{X})\leqslant\operatorname{t}_{m-1}\left(1-\frac{\alpha}{2}\right) \end{equation*}\]

即:

\[\begin{equation*} \left[\overline{X}-\operatorname{t}_{m-1}\left(1-\frac{\alpha}{2}\right)\sqrt{\dfrac{S_X^2}{m}},\overline{X}+\operatorname{t}_{m-1}\left(1-\frac{\alpha}{2}\right)\sqrt{\dfrac{S_X^2}{m}}\right] \end{equation*}\]

(3)已知\(\mu\)性质 6.4.6(2)\(\chi^2\)分布的定义可知:

\[\begin{equation*} f\left(\sigma^2,\frac{1}{m}\sum_{i=1}^{m}(X_i-\mu)^2\right)=\frac{1}{\sigma^2}\sum_{i=1}^{m}(X_i-\mu)^2\sim\chi_{m}^2 \end{equation*}\]

根据(1)可知可取:

\[\begin{equation*} \chi_{m}^2\left(\frac{\alpha}{2}\right)\leqslant f\left(\sigma^2,\frac{1}{m}\sum_{i=1}^{m}(X_i-\mu)^2\right)\leqslant\chi_{m}^2\left(1-\frac{\alpha}{2}\right) \end{equation*}\]

即:

\[\begin{equation*} \left[\frac{1}{\chi_{m-1}^2\left(1-\frac{\alpha}{2}\right)}\sum_{i=1}^{m}(X_i-\mu)^2,\frac{1}{\chi_{m-1}^2\left(\frac{\alpha}{2}\right)}\sum_{i=1}^{m}(X_i-\mu)^2\right] \end{equation*}\]

未知\(\mu\)定理 10.16(2)可知:

\[\begin{equation*} f\left(\sigma^2,\frac{S_X^2}{m-1}\right)=\frac{(m-1)S_X^2}{\sigma^2}\sim\chi_{m-1}^2 \end{equation*}\]

根据(1)可知可取:

\[\begin{equation*} \chi_{m-1}^2\left(\frac{\alpha}{2}\right)\leqslant f\left(\sigma^2,\frac{S_X^2}{m-1}\right)\leqslant\chi_{m-1}^2\left(1-\frac{\alpha}{2}\right) \end{equation*}\]

即:

\[\begin{equation*} \left[\frac{(m-1)S_X^2}{\chi_{m-1}^2\left(1-\frac{\alpha}{2}\right)},\frac{(m-1)S_X^2}{\chi_{m-1}^2\left(\frac{\alpha}{2}\right)}\right] \end{equation*}\]

(4)已知\(\sigma_1^2,\sigma_2^2\)由(1)(得到\(\overline{X}\)\(\overline{Y}\)的分布)、\(X_1, X_2, \dots, X_{m}\)\(Y_1, Y_2, \dots, Y_{n}\)相互独立(由性质 6.4.6(6)得到二维随机向量\((\overline{X},\overline{Y})^{\top}\)的分布)和性质 6.4.6(2)(对\((\overline{X},\overline{Y})^{\top}\)用二维行向量\((1,-1)\)做线性变换,再做标准化标准化)可得:

\[\begin{equation*} f(\mu-\nu,\overline{X}-\overline{Y})=\frac{\overline{X}-\overline{Y}-(\mu-\nu)}{\sqrt{\dfrac{\sigma_1^2}{m}+\dfrac{\sigma_2^2}{n}}}\sim\operatorname{N}\left(0,1\right) \end{equation*}\]

根据(1)可知可取:

\[\begin{equation*} u_{\frac{\alpha}{2}}\leqslant f(\mu-\nu,\overline{X}-\overline{Y})\leqslant u_{1-\frac{\alpha}{2}} \end{equation*}\]

即:

\[\begin{equation*} \left[\overline{X}-\overline{Y}-u_{1-\frac{\alpha}{2}}\sqrt{\dfrac{\sigma_1^2}{m}+\dfrac{\sigma_2^2}{n}},\overline{X}-\overline{Y}+u_{1-\frac{\alpha}{2}}\sqrt{\dfrac{\sigma_1^2}{m}+\dfrac{\sigma_2^2}{n}}\right] \end{equation*}\]

\(\sigma_1^2=\sigma_2^2\)类似定理 10.16(5)可得:

\[\begin{equation*} f(\mu-\nu,\overline{X}-\overline{Y})=\dfrac{\overline{X}-\overline{Y}-(\mu-\nu)}{\sqrt{(m-1)S_X^2+(n-1)S_Y^2/c}}\sqrt{\dfrac{mn(m+n-2)}{mc+n}}\sim \operatorname{t}_{m+n-2} \end{equation*}\]

根据(1)可知可取:

\[\begin{equation*} \operatorname{t}_{m+n-2}\left(\frac{\alpha}{2}\right)\leqslant f(\mu-\nu,\overline{X}-\overline{Y})\leqslant \operatorname{t}_{m+n-2}\left(1-\frac{\alpha}{2}\right) \end{equation*}\]

记:

\[\begin{equation*} S_w^2=\frac{(m-1)S_X^2+(n-1)S_Y^2/c}{m+n-2} \end{equation*}\]

于是可得:

\[\begin{equation*} \left[\overline{X}-\overline{Y}-\operatorname{t}_{m+n-2}\left(1-\frac{\alpha}{2}\right)S_w\sqrt{\dfrac{mc+n}{mn}},\overline{X}-\overline{Y}+\operatorname{t}_{m+n-2}\left(1-\frac{\alpha}{2}\right)S_w\sqrt{\dfrac{mc+n}{mn}}\right] \end{equation*}\]

(5)已知\(\mu,\nu\)性质 6.4.6(2)\(\chi^2\)分布的定义可知:

\[\begin{equation*} \delta_1(\mathbf{X})=\frac{1}{\sigma_1^2}\sum_{i=1}^{m}(X_i-\mu)^2\sim\chi_{m}^2,\quad\delta_2(\mathbf{Y})=\frac{1}{\sigma_2^2}\sum_{i=1}^{n}(Y_i-\nu)^2\sim\chi_{n}^2 \end{equation*}\]

因为\(X_1, X_2, \dots, X_{m}\)\(Y_1, Y_2, \dots, Y_{n}\)相互独立,所以\(\delta_1(\mathbf{X})\)\(\delta_2(\mathbf{Y})\)也相互独立,于是有:

\[\begin{equation*} f\left(\frac{\sigma_1^2}{\sigma_2^2},\frac{S_X^2(n-1)}{S_Y^2(m-1)}\right)=\frac{n\sum\limits_{i=1}^{m}(X_i-\mu)^2\sigma_2^2}{m\sum\limits_{i=1}^{n}(Y_i-\nu)^2\sigma_1^2}\sim\operatorname{F}_{m,n} \end{equation*}\]

根据(1)可知可取:

\[\begin{equation*} \operatorname{F}_{m,n}\left(\frac{\alpha}{2}\right)\leqslant f\left(\frac{\sigma_1^2}{\sigma_2^2},\frac{S_X^2(n-1)}{S_Y^2(m-1)}\right)\leqslant\operatorname{F}_{m,n}\left(1-\frac{\alpha}{2}\right) \end{equation*}\]

即:

\[\begin{equation*} \left[\frac{n\sum\limits_{i=1}^{m}(X_i-\mu)^2}{m\sum\limits_{i=1}^{n}(Y_i-\nu)^2\operatorname{F}_{m,n}\left(1-\frac{\alpha}{2}\right)},\frac{n\sum\limits_{i=1}^{m}(X_i-\mu)^2}{m\sum\limits_{i=1}^{n}(Y_i-\nu)^2\operatorname{F}_{m,n}\left(\frac{\alpha}{2}\right)}\right] \end{equation*}\]

未知\(\mu,\nu\)定理 10.16(6)可得:

\[\begin{equation*} f\left(\frac{\sigma_1^2}{\sigma_2^2},\frac{S_X^2(n-1)}{S_Y^2(m-1)}\right)=\frac{S_X^2\sigma_2^2}{S_Y^2\sigma_1^2}\sim\operatorname{F}_{m-1,n-1} \end{equation*}\]

根据(1)可知可取:

\[\begin{equation*} \operatorname{F}_{m-1.n-1}\left(\frac{\alpha}{2}\right)\leqslant f\left(\frac{\sigma_1^2}{\sigma_2^2},\frac{S_X^2(n-1)}{S_Y^2(m-1)}\right)\leqslant\operatorname{F}_{m-1,n-1}\left(1-\frac{\alpha}{2}\right) \end{equation*}\]

即:

\[\begin{equation*} \left[\frac{S_X^2}{S_Y^2\operatorname{F}_{m-1,n-1}\left(1-\frac{\alpha}{2}\right)},\frac{S_X^2}{S_Y^2\operatorname{F}_{m-1,n-1}\left(\frac{\alpha}{2}\right)}\right] \end{equation*}\]

11.5.0.1 样本量问题

Definition 11.21. 称置信区间的半径为误差限(margion of error)

note 11.9. 可以通过控制误差幅度来计算样本量,比如我们要控制误差幅度在\(a\)以内,列出不等式可以去计算满足要求的样本量范围,一般来讲误差幅度越小所需的样本量就越大,由此可得到最小样本量。当方程难以求解时,可以采用Monte Carlo算法计算出大量样本量与其对应的MOE值,从而选择出合适的样本量。


  1. 自行搜索。↩︎