Ch1 概率论基础知识
原目录:概率论与数理统计
1. 常用性质
2. 等可能概型
等可能概型适用于"有限个等可能性结果的随机试验"
古典概率
\(P(A)=\frac{k}{n}=\frac{A中样本总数}{\Omega中样本点总数}\)
超几何概率
假设袋子中N个球,m个红球,其余白球,则以此取出n个求,从中恰好取出k个红球的概率为
\(p_k=\frac{C^k_m C^{m-k}_{N-m}}{C^n_N},k=0,1,2...\)
几何概率
把\(\Omega\)作为一般的欧氏区域,m(A)作为A的度量(一维下长度,二维下面接,三维下体积...),可得几何概型下时间A的概率
\(P(A)=\frac{m(A)}{m(\Omega)}\)
3. 条件概率和三个派生公式
条件概率
AB为同一试验下两事件,如下表示了事件B发生情况下A发生的条件概率
\(P(A|B)=\frac{P(AB)}{P(B)}\)
乘法公式
\(P(AB)=P(A|B)P(B)=P(B|A)P(A)\)
全概率公式
设\(A_1,A_2...A_n\)为样本空间的一个完备事件组,则
\(P(B)=\sum_{i=1}^nP(A_i)P(B|A_i)\)
贝叶斯公式
设\(A_1,A_2...A_n\)为样本空间\(\Omega\)的一个完备事件组,则
\(P(A_i|B)=\frac{P(A_i)P(B|A_i)}{P(B)}=\frac{P(A_i)P(B|A_i)}{\sum_{j=1}^nP(A_j)P(B|A_j)},i=1,2...n\)
4. 事件独立性和伯努利概型
事件独立
事件A和B之间的发生并不影响另一个的发生时,二者独立,即
\(P(AB)=P(A)P(B)\)
事件独立和事件互斥是不同概念,前者针对概率,后者针对事件:互斥一定不独立,独立一定不互斥
伯努利概型
n重独立试验中,每次试验结果只有"发生"和"不发生"两种,这样的试验为n重伯努利试验,对应伯努利概型
二项概率
n次伯努利试验中,假设\(p=P(A)\),则A恰好发生k次的概率为
\(P_n(k)=C^k_np^k(1-p)^{n-k}\)
因为上式恰为二项式\([p+(1-p)]^n\)展开式的第k+1项,因此称为二项概率
多项概率
n次伯努利试验中,每次试验结果是\(A_1,A_2...A_k\),对应发生概率为\(p_i=P(A_i)\),则\(A_1,A_2...A_k\)在n次试验中各发生\(r_1,r_2...r_k\)的概率为
\(C^{r_1}_nC^{r_2}_{n-r_1}...C^{r_k}_{n-(r_1+...r_{k-1})}p^{r_1}_1p^{r_2}_2...p^{r_k}_k=\frac{n!}{r_1!r_2!...r_k!}p^{r_1}_1p^{r_2}_2...p^{r_k}_k\)
5. 扩展:贝叶斯原理
参考链接: 小白之通俗易懂的贝叶斯定理(Bayes' Theorem) - 地平线下面的土豆的文章 - 知乎
贝叶斯原理是机器学习和数据科学中的基石,是关于随机事件A和B的条件概率的一则定理
\(P(A|B)=\frac{P(A)P(B|A)}{P(B)}\)
- P(A|B)是已知B发生后A的条件概率,由于得自B的取值也被称为A的后验概率(Posterior)
- P(A)是A的先验概率(Prior)或者边缘概率,因为他不考虑任何B方面的因素
- P(B|A)/P(B)有时称为标准似然度(standardised likelihood)
按照术语,贝叶斯定理表述为
\(后验概率=先验概率*标准似然度\)
通俗理解:
先验概率是我们对A事件发生概率的初始主观判断,我们未曾考虑事件B可以带来的新信息;而标准似然度就是一个"可能性函数",作为一个调整因子,事件B传输了新的信息,就发生调整,使得先验概率更接近真实概率
- 如果"可能性函数"P(B|A)/P(B)>1,意味着"先验概率"被增强,事件A的发生的可能性变大;
- 如果"可能性函数"=1,意味着B事件无助于判断事件A的可能性;
- 如果"可能性函数"<1,意味着"先验概率"被削弱,事件A的可能性变小
直接使用上面链接知乎答主总结的:
贝叶斯的底层思想就是:
如果我能掌握一个事情的全部信息,我当然能计算出一个客观概率(古典概率、正向概率)
可是生活中绝大多数决策面临的信息都是不全的,我们手中只有有限的信息。既然无法得到全面的信息,我们就在信息有限的情况下,尽可能做出一个好的预测。也就是,在主观判断的基础上,可以先估计一个值(先验概率),然后根据观察的新信息不断修正(可能性函数)
6. 例题
贝叶斯原理:假阳性问题
一种检验50岁以上人群关节炎患病情况的检验法:
(1)对于确实患有关节炎的病人有85%的概率检验结果为患有关节炎
(2)对于未患有关节炎的病人有4%的概率检验结果认为患有关节炎
已知50以上人群有10%概率患有关节炎,求一个检验者经检验没有关节炎,实际患有关节炎的概率
\[\begin{aligned} &设A:实际患有关节炎,B:检验认为患有关节炎\\ &易得P(B|A)=0.85,P(B|\bar A)=0.04,P(A)=0.1,求P(A|\bar B)\\ &则P(\bar B|A)=0.15,P(\bar B|\bar A)=0.96\\ &P(A|\bar B)=\frac{P(A)P(\bar B|A)}{P(\bar B)}=\frac{P(A)P(\bar B|A)}{P(\bar A)P(\bar B|\bar A)+P(A)P(\bar B|A)}=\frac{0.1*0.15}{0.9*0.96+0.1*0.15}≈0.017 \end{aligned}\]
Ch2 随机变量及其分布
原目录:概率论与数理统计
1. 随机变量及其分布函数
首先区分三个概念:
- 随机变量:随机变量用于说明随机试验可能结果与数之间的关系,毕竟随机试验需要和数学先建立联系
\(在样本空间\Omega中,每个样本\omega\in\Omega,规定实数X(\omega),则函数X=X(\omega)为随机变量\)
- 随机变量的概率分布:概率分布是随机变量所有可能结果及其相应概率的列表
在下面的离散和连续型随机变量中他们的概率分布意义有所不同:
(1)离散型:概率分布(概率质量函数),也叫分布律,其对应某个x的输出结果就是P(X=x)
(2)连续型:概率密度函数,但是其结果不等于概率,概率必须要求fx的区间积分
- 分布函数F(x):函数允许我们简洁地定义一个概率分布,避免了列表的繁琐
\(F(x)=P(X\leq x),x\in R\)
随机变量分布函数的性质
- \(单调不减,x_1<x_2,则F(x_1)<F(x_2)\)
- \(F(-∞)=P(x\leq-∞)=0,F(+∞)=P(x\leq+∞)=1 \)
- \(右连续,即F(x)=F(x+0)\)
- \(对任意x_0,P(X=x_0)=F(x_0)-F(x_0-0)\)
2. 离散型随机变量及分布
对于离散概率分布,我们关心的是取得一个特定数值的概率。例如抛硬币正面向上的概率为:p(x=正面)=1/2
概率分布(概率质量函数)
离散型随机变量的概率分布主要有三种形式,都描述了随机变量取某个离散值时的概率:
\(\begin{cases} P_k=P(X=x_k),k=1,2...\\或 \begin{array}{c|c|c}X & x_1 & x_2 & ... \\ \hline p_k & p_1 & p_1 & ... \end{array}\\ 或X\sim \begin{pmatrix} x_1 & x_2 & ... & x_n \\ p_1 & p_2 & ... & p_n \end{pmatrix} \end{cases}\)
分布函数
概率分布函数是一个普通的实函数,用于表示"X取值不超过x的概率"
\(F(x)=P(X\leq x)=\sum_{x_k\leq x} p_k\)
常见离散型分布
当统计学家们开始研究概率分布时,有几种形状反复出现,于是就研究他们的规律,根据这些规律来解决特定条件下的问题,这就是为什么会产生许多知名的随机变量分布
分布 | 表示 | 概率分布 | 分布函数 | 实际应用 |
几何分布 | 可列重伯努利试验中,事件A首次发生在第k次的概率 | |||
超几何分布 | N个球的袋中,其中m个红球,求一次性模n个小球,里面有恰好k个红球的概率 | |||
二项分布 | n重伯努利试验中,事件A发生k次的概率: N个球的袋中,其中m个红球,摸n次,每次1个球,摸完放回,求n次后恰好摸出k次红球概率 | |||
0-1分布 | n=1的n重伯努利试验,此时X只能取0,1两个值 | |||
泊松分布 | 当n≥50,p≤0.1时,二项分布概率近似等于泊松分布概率 |
3. 连续型随机变量及分布
而对于连续型概率分布来说,我们无法给出每一个数值的概率,因为我们不可能列举每一个精确数值,我们关注给定变量范围的概率
概率密度函数
\(随机变量X的分布函数为F(x),若存在非负函数f(x),使对x\in R,有:\\ F(x)=\int_{-∞}^{x} f(t)\, dt\\ 则X为连续型随机变量,f(x)为X的概率密度函数/密度函数/密度\)
和概率质量函数不同,概率密度函数的输出不是概率值,这是一个极为重要的差别
实际上给定密度函数f(x)后,对f(x)在某一区间的积分才是真正的概率,此时尝试对某一点积分的结果为0:连续概率分布重要的一个性质是随机变量取得特定结果的概率为0
如下图的阴影面积就是\(P(0<x<1)=P(0≤x<1)=P(0<x≤1)=P(0≤x≤1)\)

分布函数
通过求密度函数在某一区间的积分得到给定变量范围的概率
\(F(x)=\int_{-∞}^{x} f(t)\, dt\\\)
重要性质
密度函数 |
|
分布函数 |
常见连续型分布
分布 | 表示 | 密度函数 | 分布函数 | 实际应用 |
均匀分布 | 等可能的再区间[a,b]中取值的随机变量,虽然每点被取到的概率相等,但绝不是1/b-a,再次说明连续随机变量取得特定结果的概率为0,求区间积分才能得到概率,其fx和Fx图像如下 | |||
指数分布 | 指数分布常描述元器件寿命,但其时唯一具有无记忆性的连续型分布: | |||
Γ(Gamma)分布 | Γ分布常描述元器件或系统寿命,当0<α<1时,失效概率随时间下降,当α>1相反 | |||
4. 随机变量函数的分布
一句话:已知X是某个随机变量分布,则y=f(x)的分布就是随机变量函数的分布
离散型
\(已知Y=g(x),x有概率分布p_k=P(X=x_k),k=1,2...时, P(Y=y_k)=\sum_{g(x_k)=y_j}p_k\)
比如已知\(X\sim \begin{pmatrix} -1 & 0 & 1 & 2 \\ 0.2 & 0.3 & 0.3 & 0.2 \end{pmatrix},Y=X^2\),则Y的概率分布为\(Y\sim \begin{pmatrix} 0 & 1 & 4 \\ 0.3 & 0.5 & 0.2 \end{pmatrix}\)
连续型
求连续随机变量函数Y的密度函数流程如下:
已知\(f_X(x),Y=g(X)\)
- \(根据X取值范围,求出g(X)值域R(Y),即Y的取值区间\)
- \(对y\in R(Y): F_Y(y)=P(Y\leq y)=P(g(X)\leq y)=P(X\in G(y))=\int_{G(y)}f_X(x)dx\)
5. 例题
例题1: 一维连续随机变量函数的分布
\(随机变量X有密度函数f(x)= \begin{cases} \frac14|x|,-2\leq x <0\\ x, 0\leq x \leq 1\\ 0, 其他 \end{cases}, Y=X^2,求f_Y(y)\)
\[\begin{aligned} &R(Y)=[0,4],则对y\in[0,4]有:\\ &F_Y(y)=P(Y\leq y)=P(-\sqrt{y}\leq X\leq \sqrt{y})\\ &当y\in[0,1]\\ &F_Y(y)=\int_{-\sqrt{y}}^{\sqrt{y}}f_X(x)dx=\int_{-\sqrt{y}}^{0}-\frac14xdx+\int_{0}^{\sqrt{y}}xdx=\frac58y\\ &当y\in(0,4]\\ &F_Y(y)=\int_{-\sqrt{y}}^1f_X(x)dx=\int_{-\sqrt{y}}^0\frac14xdx+\int_0^1xdx=\frac{y}8+\frac12\\ &综上f_Y(y)=F'_Y(y)= \begin{cases} \frac58,0\leq y\leq 1\\ \frac18,1<y\leq 4\\ 0, 其他 \end{cases}\end{aligned}]
Ch3 二维随机变量及其分布
原目录:概率论与数理统计
1. 二维随机变量及其分布函数
二维随机变量分布函数F(x)
\(设(X,Y)是二维随机变量,对任意实数x,y,称F(x,y)=P(X\leq x, Y\leq y)称为二维分布函数/联合分布函数\)
1.1 离散型
类似一维时,概率分布即为随机变量(X,Y)取特定值时的概率;二维分布函数可通过概率分布求和得到
联合概率分布/联合质量函数
\(p_{ij}=P(X=x_i,Y=y_j),i,j=1,2...\)
联合分布函数
\(F(x,y)=\sum_{x_i\leq x}\sum_{y_i\leq y}p_{ij}\)
常见二维离散型分布
三项分布 | |
表示 | |
联合概率分布 | |
联合分布函数 | |
实际应用 | n重独立试验中,每次试验有 |
1.2 连续型
二维概率密度函数/联合密度函数
\(对二维随机变量(X,Y),有二元非负函数f(x,y),使得对任意实数x,y,有F(x,y)=\int^x_{-∞}\int^y_{-∞}f(u,v)dudv,称f(x,y)为(X,Y)的联合密度函数\)
二维分布函数
\(F(x,y)=\int^x_{-∞}\int^y_{-∞}f(u,v)dudv\)
如何理解二维分布函数:首先既然是二重积分,就大致是曲顶柱体体积,根据宋浩老师的说法,大致是一个"草帽",F(x)就是草帽给定区间的体积
而联合密度函数f(x,y)就是上面这层曲顶对应的函数
常见二维连续型分布
均匀分布 | |
表示 | |
联合概率分布 | |
联合分布函数 | |
实际应用 | 描述(X,Y)等可能落入区域G中的随机点(对比一维均匀分布是落入区间[a,b]) |
2. 边缘分布及随机变量的独立性
二维变量(X,Y)中某一维分布函数\(F_X(x),F_Y(y)\)相对于二维分布函数\(F(x,y)\)被称为边缘分布函数
边缘分布函数
\(F_X(x)=F(y,+∞),x\in R\\ F_Y(y)=F(+∞,y),y\in R \)
独立性
\(对任意x,y,当F(x,y)=F_X(x)F_Y(y),则X与Y相互独立\)
2.1 离散型
边缘概率分布/边缘质量函数
二维离散型随机变量边缘分布可通过联合概率分布求出
\(pi.=\sum_jpij,其中i=1,2...(同行相加)\\ p.j=\sum_ipij,其中j=1,2...(同列相加)\\ \)
参考例题1: 二维离散,可以简要叙述边缘概率分布的意义:
- pi.:当考虑Y取得所有可能结果时,X分别等于xi时的概率
- p.j:当考虑X取得所有可能结果时,y分别等于yj时的概率
独立性
\(当X与Y独立\iff p_{ij}=p_{i.}p_{.j}\)
2.2 连续型
边缘密度函数
\(f_X(x)=\int^{+∞}_{-∞}f(x,y)dy\\ f_Y(y)=\int^{+∞}_{-∞}f(x,y)dx\)
如何理解边缘密度函数:一重积分就是面积:
- 对边缘密度函数\(f_X(x)\)来说就是给定某个x,此时曲顶对应一条曲线,把曲线投影到YOZ平面后的面积,因此对R上的y积分
- 对边缘密度函数\(f_Y(y)\)来说就是给定某个y,此时曲顶对应一条曲线,把曲线投影到XOZ平面后的面积,因此对R上的x积分
独立性
\(当X与Y独立\iff f(x,y)=f_X(x)f_Y(y)\)
3. 条件分布和条件密度
条件分布函数(通用)
\(F_{X|Y}(x|y)=P(X\leq x|Y=y),x\in R\)
3.1 离散型
条件分布
\(Y=y_i条件下X的条件概分布P(X=x_i|Y=y_j)=\frac{p_{ij}}{p_{.j}},\, i=1,2...\\ X=x_j条件下Y的条件概分布P(Y=y_i|X=x_j)=\frac{p_{ij}}{p_{i.}},\, j=1,2...\\\)
条件分布函数
\(F_{X|Y}(x|y_j)=P(X\leq x|Y=y_j)=\sum_{x_i\leq x}\frac{p_{ij}}{p_{.j}}\\ F_{Y|X}(y|x_i)=P(Y\leq y|X=x_i)=\sum_{y_j\leq y}\frac{p_{ij}}{p_{i.}}\\\)
3.2 连续型
条件密度函数
\(f_{X|Y}(x|y)=\frac{f(x,y)}{f_Y{(y)}}\\ f_{Y|X}(y|x)=\frac{f(x,y)}{f_X{(x)}}\)
条件分布函数
\(F_{X|Y}(x|y)=P(X\leq x|Y=y)=\int^x_{-∞}\frac{f(u,y)}{f_Y{(y)}}du\\
F_{Y|X}(y|x)=P(Y\leq y|X=x
)=\int^y_{-∞}\frac{f(x,v)}{f_X{(x)}}dv
\)
上述结论的证明有点技巧,首先\(F_{X|Y}(x|y)=\frac{P(X\leq x,Y=y)}{P(Y=y)}\),对于连续随机变量,某点的概率取值为0,因此分母直接为0,有点反直觉,其证明如下(不清楚可看宋老师视频24min处):
\[\begin{aligned} F_{X|Y}(x|y)&=\frac{P(X\leq x,Y=y)}{P(Y=y)}\\ &=\lim_{\epsilon\to0}\frac{P(X\leq x,y\leq Y\leq y+\epsilon )}{P(y\leq Y\leq y+\epsilon )}\\ &=\lim_{\epsilon\to0}\frac{\int^x_{-∞}\int^{y+\epsilon}_{y}f(u,v)dudv}{\int^{y+\epsilon}_{y}f_Y(v)dv}\\ &=\lim_{\epsilon\to0}\frac{\cfrac{1}{\epsilon}\int^x_{-∞}\int^{y+\epsilon}_{y}f(u,v)dudv}{\cfrac{1}{\epsilon}\int^{y+\epsilon}_{y}f_Y(v)dv}\\ \end{aligned}\]此时使用积分中值定理,在区间[y,y+ε]中可找到ξ使得\(\cfrac{1}{\epsilon}\int^{y+\epsilon}_{y}f_Y(v)dv=\cfrac{1}{\epsilon}f_Y(\xi)(y+\epsilon-y)=f_Y(\xi),又\xi\in[y,y+\epsilon](\epsilon\to0),则f_Y(\xi)=f_Y(y)\)
则分母变成常数,分子同样使用中值定理得到\(\cfrac{1}{\epsilon}\int^x_{-∞}\int^{y+\epsilon}_{y}f(u,v)dudv=\int^x_{-∞}f(u,y)du\)
综上\(F_{X|Y}(x|y)=\int^x_{-∞}\frac{f(u,y)}{f_Y{(y)}}du\)
在做题中,通常有两种问法
- 问\(P(X\leq \frac12|Y=\frac14)\)
此时为条件分布知识,使用\(F_{X|Y}(\frac12|\frac14)=P(X\leq \frac12|Y=\frac14)=\int^\frac12_{-∞}\frac{f(u,\frac14)}{f_Y{(\frac14)}}du\)
- 问\(P(X\leq \frac12|Y\leq \frac14)\)
此时并非条件分布:
分子为一般二维分布函数\(F(\frac12,\frac14)=P(X\leq \frac12,Y\leq \frac14)=\int^\frac12_{-∞}\int^\frac14_{-∞}f(x,y)dydx\)
分母为边缘分布函数\(F_Y(\frac14)=\int^{\frac14}_{-∞}f_Y(y)dy\)
4. 二维随机变量函数的分布
4.1 离散型
\(P(Z=z_k)=\sum_{g(x_i,y_j)=z_k}p_{ij}\)
4.2 连续型
求\(f_Z(z)\)的一般方法:
- \(确定R(Z) \)
- \(对任意z\in R(Z): F_Z(z)=P(Z\leq z)=P(g(X,Y)\leq z)=P((X,Y)\in G(z))=\int\int_{G(z)}f(x,y)dxdy\)
Ch3 例题
原目录:概率论与数理统计 / Ch3 二维随机变量及其分布
例题1:二维离散
生物群体t=0时只有一个个体,t=1时要么分裂为两个独立个体,要么死亡;t=2时两个个体独立演化.假设分裂与死亡概率同为1/2,X,Y分别表示t=1和t=2时个体数,则:
(1) t=2时,群体灭绝概率(Y=0)
(2) t=2时群体灭绝的条件下,求t=1时未灭绝概率
(3) 求(X,Y)概率分布
(4) 求X,Y的边缘分布,判断是否独立
- \(Y=0,则可能t=1时灭绝,可能t=2时灭绝:P(Y=0)=\frac12+\frac12C_2^2(\frac12)^2=\frac58\)
\[\begin{aligned} &设A:t=2时灭绝,B:t=1时灭绝\\ &P(B|A)=\frac{P(AB)}{P(A)}=\frac{\frac12C_2^2(\frac12)^2}{\frac58}=\frac15 \end{aligned}\]
\[\begin{aligned} &\begin{array}{|c|c|c|c|} x/y & 0 & 1 & 2\\ \hline 0&\frac12&/&/\\ 1&\frac18&\frac14&\frac18\\ \end{array} \\ &P(X=Y=0)=\frac12\\ &P(X=1,Y=0)=\frac12C_2^2(\frac12)^2=\frac18\\ &P(X=1,Y=1)=\frac12C_2^1\frac12\frac12=\frac14\\ &P(X=1,Y=2)=\frac12C_2^2(\frac12)^2=\frac18\\ \end{aligned}\]
\[\begin{aligned} &\begin{array}{|c|c|c|c|c|} x/y & 0 & 1 & 2 & p_{i.}\\ \hline 0&\frac12&/&/&\frac12\\ 1&\frac18&\frac14&\frac18&\frac12\\ \hline p_{.j}&\frac58&\frac14&\frac18&1\\ \end{array} &p12=\frac18 \ne p_{1.}p_{.2}=\frac{1}{16},则XY不独立 \end{aligned}\]
例题2:二维连续+边缘分布+条件分布
设G(X,Y)为G上的均匀分布,G={(X,Y)|0≤y≤1,-y≤x≤y}
(1) 求XY的边缘密度函数\(f_X(x)和f_Y(y)\),并判断独立性
(2) 求\(P(X\leq 0|Y=\frac12)和P(X\leq 0|Y\leq \frac12)\)
(3) 若Z=X+Y,求Z的密度函数\(f_Z(z)\)
\[\begin{aligned} &由已知,f(x,y)= \begin{cases} \dfrac1{m(G)},(x,y)\in G\\ 0,其他 \end{cases}= \begin{cases} 1,0\leq y\leq 1,-y\leq x\leq y\\ 0,其他 \end{cases}\\ &X:\\ &当x\in[-1,0]时,f_X(x)=\int_{-x}^11dy=1+x \ (红线)\\ &当x\in(0,1]时,f_X(x)=\int_{x}^11dy=1-x\\ &Y:\\ &y\in [0,1]时,f_Y(y)=\int_{-y}^{y}1dx=2y \ (蓝线)\\ &综上:\\ &f_X(x)= \begin{cases} 1+x,-1\leq x\leq 0\\ 1-x,0< x\leq 1\\ 0,其他 \end{cases} \ f_Y(y)= \begin{cases} 2y,0\leq y \leq 1\\ 0,其他 \end{cases} \end{aligned}\]
\[\begin{aligned} &当0\leq y\leq 1,-y\leq x\leq y,f_{X|Y}(x|y)=\frac{f(x,y)}{f_Y(y)}=\frac{1}{2y}\\ &当y=\frac12,-\frac12\leq x\leq \frac12,f_{X|Y}(x|\frac12)=1,求X的分布函数\\ &F_{X|Y}(x|\frac12)=\int_{-∞}^xf_{X|Y}(u|\frac12)du= \begin{cases} 0,x<-\frac{1}{2}\\ \int_{-\frac{1}{2}}^x1dx, -\frac12\leq x\leq \frac12\\ 1,x>\frac12 \end{cases}\ = \begin{cases} 0,x<-\frac{1}{2}\\ x+\frac12, -\frac12\leq x\leq \frac12\\ 1,x>\frac12 \end{cases}\\ &则\\ &P(X\leq 0|Y=\frac12)=F_{X|Y}(0|\frac12)=\frac12\\ &P(X\leq 0|Y\leq \frac12)=\frac{P(X\leq 0,Y\leq \frac12)}{P(Y\leq \frac12)}=\frac{\int_0^{\frac12}dy\int_{-y}^01dx}{\int_0^{\frac12}2ydy}=\frac{\frac18}{\frac14}=\frac12\end{align} )
不同于一重积分,在二重积分中,画图只是为了确定积分上下限,此图像的面积和积分结果无关
- \(\begin{align} &Z=X+Y,R(Z)=[0,2]\\ &P(Z\leq z)\\ &=P(X+Y\leq z)\\ &=\int\int_{X+Y\leq z}f(x,y)dxdy\\ &=\int_0^{\frac{z}{2}}dy\int_{-y}^{y}1dx+\int_{\frac{z}{2}}^{1}dy\int_{-y}^{z-y}1dx(红线分为两部分求积分)\\ &=z-\frac{z^2}{4}\\ \therefore\ &F_Z(z)= \begin{cases} 0,z<0\\ z-\dfrac{z^2}{4},0\leq z\leq 2\\ 1,z>2 \end{cases}\\ \therefore\ &f_Z(z)=F_Z'(z)= \begin{cases} 1-\frac12z,0\leq z\leq 2\\ 0,其他 \end{cases}
\end{aligned}]
例题3:二维连续+边缘分布+条件分布
已知\(f(x,y)= \begin{cases} Ay,0<y<x<1\\ 0,其他 \end{cases}\)
(1) 求A
(2) 求\(P(x\leq \frac12,y=\frac14)\)
(3) 求\(P(X+Y\leq \frac12) \)
(4) 求\(f_{X|Y}(x|y)和f_{Y|X}(y|x) \)
(5) 求\(当Y=\frac14时P(X\leq \frac12|Y=\frac14)和P(X\leq \frac12|Y\leq \frac14)\)
\[\begin{aligned} 根据概率分布函数性质\\ \int_0^1dx\int_0^xAydy&=1\\ \int_0^1\frac{A}2x^2dx&=1\\ A&=6 &\therefore f(x,y)= \begin{cases} Ay,0<y<x<1\\ 0,其他 \end{cases} \end{aligned}\]
\[\begin{aligned} &P(x\leq \frac12,y=\frac14)\\ =&\int_0^{\frac14}dy\int_y^\frac126ydx\\ =&\int_0^{\frac14}3y-6y^2dy\\ =&\frac{1}{16} \end{aligned}\]
\[\begin{aligned} &实际上是二维变量函数的分布\\ &P(X+Y\leq \frac12)\\ =&\int\int_{x+y\leq \frac12}f(x,y)dxdy\\ =&\int_0^\frac14dy\int_y^{\frac12-y}6ydx\\ =&\int_0^\frac143y-12y^2dy\\ =&\frac1{12} \end{align} \)
- \(\begin{align}
\end{aligned}]
\[\begin{aligned} &X:f_X(x)=\int_{-∞}^{+∞}f(x,y)dy=\int_{0}^x6ydy=3x^2 \ (红线)\\ &Y:f_Y(y)=\int_{y}^{1}6ydx=6y-y^2 \ (蓝线)\\ &f_{X|Y}(x|y)=\frac{6y}{6y-6y^2}=\frac{1}{6-y}\\ &\therefore\ f_X(x)= \begin{cases} 3x^2,0<x<1\\ 0,其他 \end{cases}\ f_Y(y)= \begin{cases} 6y-6y^2,0<y<1\\ 0,其他 \end{cases}\\ &\therefore\ f_{X|Y}(x|y)=\frac{6y}{6y-6y^2}=\frac{1}{1-y}\ f_{Y|X}(y|x)=\frac{6y}{3x^2}=\frac{2y}{x^2}\\ &综上:\\ &f_{X|Y}(x|y)= \begin{cases} \dfrac1{1-y},0<y<x<1\\ 0,其他 \end{cases} \ f_{Y|X}(y|x)= \begin{cases} \dfrac{2y}{x^2},0<y<x<1\\ 0,其他 \end{cases} \end{aligned}\]
\[\begin{aligned} \end{aligned}\]\[\begin{aligned} &(1)\ P(X\leq \frac12|Y=\frac14)=F_{X|Y}(\frac12|\frac14)\\ &当y=\frac14,\frac14<x<1,f_{X|Y}(x|\frac14)=\frac43,求X的分布函数\\ &F_{X|Y}(x|\frac14)=\int_{-∞}^xf_{X|Y}(u|\frac14)du= \begin{cases} 0,x\leq \frac14\\ \int_{\frac{1}{4}}^x\frac43dx, \frac14<x<1\\ 1,x\geq1 \end{cases}\ = \begin{cases} 0,x\leq \frac14\\ \frac43x-\frac13,\frac14<x<1\\ 1,x\geq 1 \end{cases}\\ &\therefore P(X\leq \frac12|Y=\frac14)=F_{X|Y}(\frac12|\frac14)=\frac43*\frac14=\frac13\\ &(2)\ P(X\leq \frac12|Y\leq \frac14)=\frac{P(X\leq \frac12,Y\leq \frac14)}{P(y\leq \frac14)}=\frac{\frac1{16}}{\int_0^{\frac14}6y-6y^2dy}=\frac{\frac1{16}}{\frac5{32}}=\frac25 \end{aligned}\]
Ch4 随机变量的数字特征
原目录:概率论与数理统计
前三章主要关注随机变量及其统计规律性,本章关注随机变量本身的数字特征.
描述随机变量的数字特征有数学期望,方差,矩;描述二维随机变量(X,Y)中XY关系的有协方差和相关系数
1. 数学期望
以概率为权的加权平均值称为随机变量的数学期望
1.1 离散型
\(E(X)=\sum_{k=1}^{∞}x_kp_k\)
1.2 连续型
\(E(X)=\int_{-∞}^{+∞}xf(x)dx\)
个人理解:对于连续随机变量,上式\(\int_{-∞}^{+∞}f(x)dx \)即为概率/权值,因此"权×随机变量取值x"后在(-∞,+∞)上积分即得到连续离散变量的期望
1.3 随机变量函数
同理,\(\int_{-∞}^{+∞}f(x)dx和\int_{-∞}^{+∞}\int_{-∞}^{+∞}f(x,y)dxdy\)是随机变量的概率分布函数,再乘随机变量函数值\(g(x)或g(x,y)\)得到期望
1.4 期望性质
- \[\begin{aligned},常数的期望是它本身
\end{aligned}]
- 当X与Y相互独立时
2. 方差
方差用来描述随机变量X的取值在期望E(X)周围集中的程度,本质是一个随机变量函数的期望
\(D(X)=E(g(X))=E[X-E(X)]^2,其中g(X)=[X-E(X)]^2\)
2.1 离散型
\(D(X)=\sum_{k=1}^∞[x_k-E(X)]^2p_k\)
2.2 连续型
\(D(X)=\int_{-∞}^{+∞}[x_k-E(X)]^2f(x)dx\)
在实际计算中一般使用
\(D(X)=E(X^2)-E(X)^2\)
2.3 方差性质
- \(D(C)=0\)
- \(D(ax+b)=a^2D(X)\)
- 当XY独立时\(D(X±Y)=D(X)+D(Y)\)
小结常见分布的期望与方差
分布 | 期望 | 方差 | |
离散 | |||
连续 | |||
3. 变异系数,原点矩,中心距
3.1 变异系数
D(x)衡量了X取值在E(X)周围的集中程度,但D(X)会受到量纲的影响,比如同一组数据以cm标注的身高D(X)一定大于以m标注的,此时考虑变异系数
\(C_v=\frac{\sqrt{D(X)}}{|E(X)|}\)
变异系数衡量了X取值在E(X)周围的相对集中程度,可以理解为分子标准差和分母期望同时上下约去单位
3.2 原点矩和中心矩
期望和方差和推广为X的原点矩和中心矩
\(m_k=E(X^k),称m_k为X的k阶原点矩\)
\(\mu_k=E[X-E(X)]^k,称\mu_k为X的k阶中心距\)
可以发现期望就是一阶原点矩,方差就是二阶中心距(一阶中心距为0)
原点矩:因为\(m_k=E(X^k)=E(X-0)^k\),相对于原点来说
中心距:因为\(\mu_k=E[X-E(X)]^k\),以E(X)为中心
4. 协方差和相关系数
4.1 协方差
对于二维随机变量(X,Y)我们使用协方差描述X和Y的关系
\(Cov(X,Y)=E[[X-E(X)][Y-E(Y)]]=E(XY)-E(X)E(Y)\)
协方差性质
协方差矩阵
(X,Y)的协方差矩阵
\(\boldsymbol{V}= \begin{pmatrix} D(X)&Cov(X,Y)\\ Cov(Y,X)&D(Y) \end{pmatrix}\)
扩展
\(\begin{align} &对n维随机变量(X_1,X_2...X_n),记\sigma_{ij}=Cov(X_i,X_j),i,j=1,2...n\\ &则下方矩阵即为(X_1,X_2...X_n)的协方差阵\\ &\boldsymbol{V}= \begin{pmatrix} \sigma_{11}&\sigma_{12}&...&\sigma_{1n}\\ \sigma_{21}&\sigma_{22}&...&\sigma_{2n}\\ ...&...&...&...\\ \sigma_{n1}&\sigma_{n2}&...&\sigma_{nn} \end{pmatrix} \end{align} \)
4.2 相关系数
类似于D(X)被量纲影响所以引入变异系数,协方差同样受量纲影响,为此引入相关系数
首先需要标准化随机变量X,Y
\(X^*=\frac{X-E(X)}{\sqrt{D(X)}},Y^*=\frac{Y-E(Y)}{\sqrt{D(Y)}}\\ 则相关系数R(X,Y)=Cov(X^*,Y^*)\)
性质
- \(E(X^*)=E(Y^*)=0,D(X^*)=D(Y^*)=1\)
- \(R(X,Y)=\frac{Cov(X,Y)}{\sqrt{D(X)}\sqrt{D(Y)}}=\frac{E(XY)-E(X)E(Y)}{\sqrt{D(X)}\sqrt{D(Y)}}\),常用于计算R(X,Y)
意义
\(\begin{align}
&若\rho_{XY}=0,则X与Y不(线性)相关,即无法找出y=ax+b的关系\\
&若\rho_{XY}>0,则X与Y线性正相关,如y=2x+1\\
&若\rho_{XY}<0,则X与Y线性负相关,如y=-3x+1 \end{aligned}]
不相关和独立性是两个概念:不相关专门指不线性相关,但此时可存在其他相关关系,则XY就不独立
Ch4 例题
原目录:概率论与数理统计 / Ch4 随机变量的数字特征
例题1:(离散型)期望/方差
一车载有20人开出,经过10站,每人在每站下车的概率相同,且各人在一站下车的事件独立,车只有在有人下车时停车,求平均停车次数
\[\begin{aligned} &解:设X为停车次数,X_i为在第i站下车(在第i站停车),以X_i=0,1分别表示有人下车(停车)或无人下车(不停车),则有\\ &\begin{array}{|c|c|} X_i & 0 & 1\\ \hline p&(\frac{9}{10})^{20}&1-(\frac{9}{10})^{20}\\ \end{array}\\ & 根据二项分布可加性E(X)=E(X_1+X_2+...+X_{10})=E(X_1)+...+E(X_{10})=10*[1-(\frac{9}{10})^{20}] \end{aligned}\]
例题2:(连续型)期望/方差
已知X服从均匀分布U(a,b),推导E(X),D(X)
\[\begin{aligned} &解:已知f(x)= \begin{cases} \dfrac{1}{b-a},a\leq x\leq b\\ 0,其他 \end{cases}\\ &E(X)=\int_a^bx\dfrac{1}{b-a}dx=\dfrac{a+b}{2}\\ &D(X)=E(X^2)-E(X)^2=\int_a^bx^2\dfrac{1}{b-a}dx-E(X)^2=\dfrac{(b-a)^2}{12} \end{aligned}\]
例题3:(函数)期望/方差
投资两项目的收益为X,Y,已知E(X)=E(Y)=μ,D(X)=D(Y)=σ2,现共有资本为1,把α[0≤α≤1]投入X项目,其余投入Y,总收益Z=αX+(1-α)Y,求问最优投资方案
\[\begin{aligned} 解:E(Z)&=E[\alpha X+(1-\alpha)Y]\\ &=\alpha E(X)+(1-\alpha)E(Y)\\ &=E(Y)=\alpha\mu\\ D(Z)&=D[\alpha X+(1-\alpha)Y]\\ &=\alpha^2 D(X)+(1-\alpha)^2D(Y)\\ &=(2\alpha^2 -2\alpha +1)\sigma^2\\ &=[2(\alpha^2 -\frac12)^2+\frac12]\sigma^2,\quad因此①\ 不考虑风险,不论如何投资收益都为\alpha\mu;②\ 考虑风险,则\alpha=\frac12时,投资风险最小 \end{aligned}\]
例题4:(二维)期望/协方差
(X,Y)已有如下二维分布律,求(X,Y)的期望和协方差阵
\(\begin{array}{|c|c|c|} X/Y & 0 & 1 & 2\\ \hline 0&\dfrac{1}{6}&\dfrac{1}{12}&\dfrac{1}{6}\\ 1&\dfrac{1}{12}&\dfrac{1}{3}&\dfrac{1}{6}\\ \end{array}\)
\[\begin{aligned} &解:可得X\sim \begin{pmatrix} 0 & 1 \\ \dfrac5{12} & \dfrac7{12} \end{pmatrix} Y\sim \begin{pmatrix} 0 & 1 & 2\\ \dfrac3{12} & \dfrac5{12} &\dfrac4{12} \end{pmatrix}\\ &E(X)=\frac7{12},E(Y)=\frac{13}{12}\\ &D(X)=np(1-p)=\frac{35}{144},D(Y)=E(Y^2)-E(Y)^2=\frac{83}{144}\\ &E(XY)=\sum_i\sum_jX_iY_jp_{ij}=0*0*\frac16+...+1*2*\frac16=\frac23\\ &\therefore Coc(X,Y)=E(XY)-E(X)E(Y)=\frac{5}{144}\\ &综上E(X,Y)=(E(X),E(Y))=(\frac7{12},\frac{13}{12})\quad \boldsymbol V= \begin{pmatrix} D(X)&Cov(X,Y)\\ Cov(Y,X)&D(Y)\\ \end{pmatrix}= \begin{pmatrix} \dfrac{35}{144}&\dfrac{5}{144}\\ \dfrac{5}{144}&\dfrac{83}{144}\\ \end{pmatrix}\\ \end{aligned}\]
例题5:相关系数
\(已知X_1...X_n...X_{n+m}独立同分布,共同方差为\sigma^2,则Y=X_1+X_2+...X_{n+m}与Z=X_{n+1}+X_{n+2}+...+X_{n+m}的相关系数R(Y,Z)为?\)
\[\begin{aligned} &解:令U=X_1+...X_n,Y=U+Z\\ &由已知U,Z相互独立,E(UZ)=E(U)E(Z)\\ &R(Y,Z)=\frac{Cov(Y,Z)}{\sqrt{D(Y)}\sqrt{D(Z)}}\\ &=\frac{E[(U+Z)Z]-E(U+Z)E(Z)}{\sqrt{D(Y)}\sqrt{D(Z)}}\\ &=\frac{E(UZ+Z^2)-E(U+Z)E(Z)}{\sqrt{D(Y)}\sqrt{D(Z)}}\\ &=\frac{E(UZ)+E(Z^2)-E(U)E(Z)-E(Z)^2}{\sqrt{D(Y)}\sqrt{D(Z)}}\\ &=\frac{E(Z^2)-E(Z)^2}{\sqrt{D(Y)}\sqrt{D(Z)}}=\sqrt{\frac{D(Z)}{D(Y)}}=\sqrt{\frac{m\sigma^2}{(n+m)\sigma^2}}=\sqrt{\frac{m}{n+m}} \end{aligned}\]
方差性质:D(X±Y)=D(X)+D(Y)±Cov(X,Y),当X,Y相互独立D(X±Y)=D(X)+D(Y)
Ch5 正态分布
原目录:概率论与数理统计
客观世界的实际问题中非常多随机变量都服从或近似于正态分布,它在数理统计中有重要意义.
1. 密度函数与分布函数
标准正态分布
概率密度函数 | 若随机变量X的概率密度函数为 则称X服从标准正态分布,记作 |
概率分布函数 | |
性质 |
一般正态分布
概率密度函数 | |
概率分布函数 | |
密度曲线f(x)性质 | |
2. 数字特征与线性性质
\(\begin{align} &1.对X\sim N(\mu, \sigma^2),E(X)=\mu,D(X)=\sigma^2\\ &2.若X\sim N(\mu, \sigma^2),则有Y=a+bX\sim N(a+b \mu,b^2\sigma^2)\\ &3.若X\sim N(\mu_1, \sigma_1^2),Y\sim N(\mu_2, \sigma_2^2)且X与Y相互独立,则Z=X+Y\sim N(\mu_1+\mu_2,\sigma_1^2+\sigma_2^2)\\ &推广\\ &设X_1,X_2...X_n相互独立,且X_i\sim N(\mu_i, \sigma_i^2),i=1,2...n,C_1,C_2...为常数,则: Z=\sum_{i=1}^nC_iX_i\sim N(\sum_{i=1}^nC_i\mu_i,\sum_{i=1}^nC_i^2\sigma_i^2)\\ &当X_i独立同参数正态分布,则 \begin{cases} X_1+X_2+...+X_n\sim N(n\mu,n\sigma^2)\\ \dfrac{X_1+X_2+...+X_n}{n}\sim N(\mu,\dfrac{\sigma^2}{n}) \end{cases} \end{align} \)
3. 二维正态分布
当(X,Y)有如下密度函数则称(X,Y)服从二维正态分布,记作\((X,Y)\sim N(\mu_1,\mu_2;\sigma_1^2,\sigma_2^2;r),其中r=R(X,Y)\)
\(f(x,y)=\frac{1}{2\pi\sigma_1\sigma_2\sqrt{1-r^2}}exp \begin{Bmatrix} -\cfrac{1}{2(1-r^2)}[\cfrac{(x-\mu_1)^2}{\sigma_1^2}-2r\cfrac{(x-\mu_1)(y-\mu_2)}{\sigma_1\sigma_2}+\cfrac{(y-\mu_2)^2}{\sigma_2^2}] \end{Bmatrix}\)
此时X,Y的边缘分布满足
\(X\sim N(\mu_1,\sigma_1^2),Y\sim N(\mu_2,\sigma_2^2)\)
由上,XY独立的充要条件即r=0
此外\((X,Y)\sim N(\mu_1,\mu_2;\sigma_1^2,\sigma_2^2;r)\)的充要条件是\(X与Y的任意非零线性组合Z=aX+bY服从一维正态分布,即Z\sim N(E(Z),D(Z))\)
Ch5 例题
原目录:概率论与数理统计 / Ch5 正态分布
例题1:一维正态分布
设电子元件寿命Xi(单位h),服从λ=0.1的指数分布,使用中一个元件坏后第二个立刻激活使用,则在年计划中准备231个元件,能以多大概率够用?(250个工作日,每天8h)
\(\begin{align} &解:易得X_i\sim e(0.1),E(X_i)=10,D(X_i)=100,设随机变量X表示所有元件一年总共工作时间\\ &则由独立同部分极限定理,,X=X_1+...+X_{231}\sim N(2310,23100)\\
&P(X\geq 250*8)=1-P(X\leq 2000)\ &=1-\Phi(\frac{2000-2310}{\sqrt{23100}})≈\Phi(2.04)≈0.9772,\quad有97.72%概率够用一年 \end{align} )
例题2:二维正态分布
\(设(X,Y)\sim N(3,1,4,9,\frac13),令Z=2X-Y,求E(Z)和D(Z)\)
\(\begin{align} &解:易得X\sim N(3,4),Y\sim N(1,9),R(X,Y)=\frac13\\ &则Cov(X,Y)=R(X,Y)\sqrt{D(X)}\sqrt{D(Y)}=2\\ &D(Z)=4D(X)+D(Y)-4Cov(X,Y)=17\\ \end{align} \)
Ch6 极限定理
原目录:概率论与数理统计
作为概率论部分的尾声,这章讨论了大数律和中心极限定理
- 大数律解释了为什么在n次独立重复试验中,当n充分大时,事件A发生的频率fn(A)充分接近于A发生的概率P(A)
- 中心极限定理说明了独立同分布的随机变量之和近似地服从正态分布
1. 大数律
1.1 切比雪夫不等式
D(X)既然刻画了X取值在E(X)周围的集中程度,那么对任意ε>0,事件\(|X-E(X)|<\epsilon\)的概率一定和D(X)有关,且D(X)越小,这个概率一定越大,由此引出切比雪夫不等式
\(设X的E(X),D(X)都存在,则对任意\epsilon>0,有\\ P(|X-E(X)|<\epsilon)\geq1-\frac{D(X)}{\epsilon^2}\\ 或\\ P(|X-E(X)|\geq\epsilon)\leq\frac{D(X)}{\epsilon^2} \)
1.2 大数律
首先说明几个概念
(1)随机变量序列
\(在n次独立重复实验中,事件A只有发生与否两种结果,假设X_1,X_2...为 X_k= \begin{cases} 1,A在第k次试验中发生\\ 0,A在第k次试验不发生 \end{cases} ,则X_i独立且同分布于B(1,p),此时\begin{Bmatrix}X_k\end{Bmatrix}即为一个随机变量序列 \)
(2)随机变量序列的"收敛性"
\(已知\begin{Bmatrix}X_k\end{Bmatrix},同时a为常数,若对任意\epsilon>0,有\\ \lim_{n\to∞}P(|X_n-a|<\epsilon)=1\\ 则称X_1,X_2...依概率收敛于a,记作X_n\stackrel{P}{\longrightarrow}a\)
"收敛性"的直观意义就是n充分大时虽然不能保证\(|X_n-a|<\epsilon\)绝对成立,但时可以使得其概率无限接近1,即Xn取值以极大的概率充分接近a
\(结合切比雪夫不等式,可以得到对于\begin{Bmatrix}X_k\end{Bmatrix},当E(X_n)=μ_n,D(X_n)=σ_n^2都存在,且n\to∞时,\color{red}{σ_n^2\to0是{X_n}依概率收敛的充分条件},即可使得X_n-\mu_n\stackrel{P}{\longrightarrow}0\\ 证明:1\geq P(|X_n-E(X_n)|<\epsilon)\geq1-\frac{σ_n^2}{\epsilon^2},当n\to ∞\\ \lim_{n\to ∞}P(|X_n-\mu_n|<\epsilon)=1,即X_n-\mu_n\stackrel{P}{\longrightarrow}0 \)
切比雪夫大数律
\(对独立随机变量序列\begin{Bmatrix}X_k\end{Bmatrix},E(X_k),D(X_k)存在,有常数C使得D(X_k)\leq C则有\\ \frac1n\sum_{k=1}^nX_k-\frac1n\sum_{k=1}^nE(X_k)\stackrel{P}{\longrightarrow}0 \)
切比雪夫大数律证明中使用了上面"收敛性"的充分条件,证明了\(n\to0时D(\frac1n\sum_{k=1}^nX_k)\to 0\)
推论1:独立同分布大数律
\(对独立同分布\begin{Bmatrix}X_k\end{Bmatrix},E(X_k)=\mu,D(X_k)=\sigma^2,则有\\ \bar X\stackrel{P}{\longrightarrow}\mu \)
\(证明:对独立同分布随机变量序列\begin{Bmatrix}X_k\end{Bmatrix},\bar X=\frac{1}{n}\sum_{k=1}^nX_k,\mu依旧作为共同期望\mu=\frac1n\sum_{k=1}^nE(X_k),带入切比雪夫大数律,得到独立同分布大数律\)
大数律即说明n充分大时\(\bar X\)在概率意义下的取值充分接近于\(X_k的共同期望\mu(独立同分布),因此可以用平均值估计\mu\),这也是为什么实际问题中常用多次测量取平均作为期望
推论2:伯努利大数律
\(在n次伯努利试验中,事件A发生的频率为f_n(A)=\frac{n_A}{n},且A发生的概率为p=P(A),则\\ f_n(A)\stackrel{P}{\longrightarrow}p=P(A)\)
\(证明:每个X_k都服从B(1,p),E(X_k)=p,D(X_k)=p(1-p)则其共同期望还是p,f_n(A)=\bar X=\frac{1}{n}\sum_{k=1}^nX_k,带入独立同分布大数律,得到伯努利大数律\)
2. 中心极限定理
在正态分布数字特征与线性性质中得到相互独立的正态分布随机变量之和仍服从正态分布,那非正态分布随机变量呢?
中心极限定理即说明相互独立的非正态分布随机变量之和仍服从正态分布
2.1 独立同分布中心极限定理
\(对独立同分布随机变量序列\begin{Bmatrix}X_k\end{Bmatrix},E(X_n)=\mu,D(X_n)=\sigma^2,k=0,1,2...记\\ Y_n=\frac{\sum_{k=1}^{n}X _k-n\mu}{\sqrt{n}\sigma}=\frac{\frac1n\sum_{k=1}^{n}X _k-\mu}{\dfrac{\sigma}{\sqrt{n}}}\\ 则对任意X\in R,有\lim_{n \to ∞}F_n(x)=\lim_{n\to ∞}(Y_n\leq x)=\Phi(x)\)
上述定理的应用形式
\(当充分大时,近似有\sum_{k=1}^nX_k\dot\sim N(n\mu,n\sigma^2)或\frac1n\sum_{k=1}^nX_k\dot\sim N(\mu,\frac{\sigma^2}{n})或\frac{\sum_{k=1}^nX_k-n\mu}{\sqrt{n}\sigma}\dot\sim N(0,1)\)
2.2 二项分布的中心极限定理
\(对独立同分布随机变量序列\begin{Bmatrix}X_k\end{Bmatrix},若X_n\sim B(n,p),E(X_n)=np,D(X_n)=np(1-p),则对任意x\in R,有\\ \lim_{n\to ∞}P(\frac{X_n-np}{\sqrt{npq}}\leq x)=\Phi(x)\)
- 定理的证明运用了"二项分布可加性"
\(独立同分布随机变量序列\begin{Bmatrix}Y_k\end{Bmatrix}中Y_k服从分布B(1,p),E(Y_n)=p,D(Y_n)=pq,则令X_n=\sum_{k=1}^nY_k,X_n\sim B(n,p),E(X_n)=np,D(X_n)=npq,带入独立同分布中心极限定理\)
- 关于"二项分布可加性"
\(假设抛硬币10次,X_i表示"第i次正面向上",X_i\sim B(1,\frac12),X表示"10次中正面向上次数",则X\sim B(10,\frac12),则X=X_1+X_2+...+X_{10}\)
- 上述定理的应用形式
\(n充分大时,近似有X_n\dot\sim N(np,npq)\)
推论
\(X\sim B(n,p),n充分大时P(a<X\leq b)≈\phi(\frac{b-np}{\sqrt{npq}})-\phi(\frac{a-np}{\sqrt{npq}})\)
Ch6 例题
原目录:概率论与数理统计 / Ch6 极限定理
例题1:二项分布中心极限定理
一个系统由100个独立元件组成,每个元件工作中的损坏率为0.1,若至少85个元件正常工作时系统才能正常工作,求
(1)系统正常工作的概率
(2)上述系统由n个元件组成,至少80%的元件正常系统才可正常工作,若系统正常工作的概率不少于0.95,则至少应该装多少元件?
\[\begin{aligned} &解:(1)\ 设X为正常工作的元件数,X\sim B(100,0.9),E(X)=90,D(X)=9\\ &根据中心极限定理,X\sim N(90,9)\\ &\therefore若系统正常,X\geq 85\\ &P(X\geq 85)=1-P(X\leq 85)\\ &=1-\Phi(\frac{85-90}{3})=\Phi(\frac53)≈0.952,\ 系统有95.2\%概率正常工作\\ &(2)由已知X\sim B(n,0.9)近似X\sim N(0.9n,0.09n)\\ &则P(X\geq 0.8n)=1-P(X<0.8n)\geq 0.95\\ &P(X<0.8n)\leq0.05\\ &\Phi(\frac{0.8n-0.9n}{0.3\sqrt{n}})\leq 0.05\\ &\Phi(\frac13\sqrt{n})\geq 0.95 解得整数n=25,则至少应该安装25个元件 \end{aligned}\]
Ch7 数理统计基础
原目录:概率论与数理统计
前六章概率论部分研究了随机变量的统计规律性,然而现实问题中随机变量的分布基本都是未知的,数理统计就是抽取一小部分产品/元件做试验,使用试验结果确定总体随机变量的分布情况
1. 总体与样本
设随机变量\(X_1,X_2...X_n与总体X\)独立同分布,则称\(X_1,X_2...X_n\)为一样本容量为n的来自总体X的样本,而\(X_1,X_2...X_n\)的取值\(x_1,x_2...x_n\)为样本观测值
从总体中抽取的样本应该满足随机性&独立性,则:
2. 基本分布
\(\chi^2分布,t分布,F分布和正态分布\)构成了数理统计中四个重要的基本分布,Ch5中已经介绍了正态分布
2.1 卡方分布
定义 | |
表示 | |
密度函数 | |
数字特征 | |
f(x)图像 | |
性质 |
2.2 t分布
定义 | |
表示 | |
密度函数 | |
数字特征 | |
f(x)图像 | |
性质 |
2.3 F分布
定义 | |
表示 | |
密度函数 | |
f(x)图像 |
3. 分位点
通常分布已知时,\(给定a,求P(x\leq a)=p \)
数理统计中,\(给定0<p<1,求P(x\leq a)=p \)成立时的a(up)
关于分位点,通常需要查表确定
分布 | 分位点 | 定义 | 图像 |
4. 统计量
采集样本后需要对样本数据即观测值处理,构造样本的函数
\(\begin{align} &样本X_1,X_2...X_n的一个连续函数g(X_1,X_2...X_n)称为样本函数:\\ &若g(X_1,X_2...X_n)\color\red{不含任何未知量},则g(X_1,X_2...X_n)为一个统计量\\ &带入观测值后的g(x_1,x_2...x_n)叫统计量的观测值 \end{aligned}\]
- \(\color\red{统计量\subset样本函数\subset随机变量}\)
- \(\color\red{观测值∈实数}\)
| 常用统计量 | 观测值 | |
| 样本均值 | ||
| 样本方差 | ||
样本标准差 | ||
样本k阶原点矩 | ||
样本k阶中心矩 | ||
- 和Ch4中的一般随机变量的方差等于二阶中心距不同,样本方差S2不等于二阶样本中心距B2
- 样本原点矩/中心距对比随机变量原点矩/中心距
\(m_k=E(X^k),称m_k为X的k阶原点矩\)
\(\mu_k=E[X-E(X)]^k,称\mu_k为X的k阶中心距\)
5. 抽样分布定理
常用统计量和样本函数的分布被总结为抽样分布定理,以下定理都建立在样本独立基础上
5.1 一个正态总体下
- 定理1:正态分布线性性质
- 定理2:构造自由度n-1的卡方分布
- 定理3:构造自由度n-1的t分布
- 定理4:构造符合要求的新随机变量
5.2 两个正态总体下
- 定理1:上述定理1+正态分布可加性
- 定理2:构造自由度n1+n2-2的t分布
- 定理3:构造自由度(n1-1,n2-1)的t分布
Ch7 例题
原目录:概率论与数理统计 / Ch7 数理统计基础
例题1:四个基本分布
\[\begin{aligned} &X_1...X_9是来自正态总体N(\mu,\sigma^2)的样本,则下列命题中错误的是?\\ &A.\ \frac{X_1-\mu}{\sigma}\sim N(0,1)\quad B.\ \frac{1}{\sigma^2}\sum_{i=3}^9(X_i-\mu)^2\sim\chi^2(7)\quad C.\ \frac{\sqrt{\frac72}(X_1-X_2)}{\sqrt{\sum^9_{i=3}(X _i-\mu)^2}}\sim t(7)\quad D.\ \frac{(X_1-X_2)^2}{\sum_{i=3}^9(X_i-\mu)^2}\sim F(1,7) \end{aligned}\]
\[\begin{aligned} &A.\ 由正态分布X_1\sim N(\mu,\sigma^2)则 \frac{X_1-\mu}{\sigma}\sim N(0,1),正确\\ &B.由A得\frac{X_i-\mu}{\sigma}\sim N(0,1)再根据\chi^2分布\sum_{i=3}^9\frac{(X_i-\mu)^2}{\sigma^2}\sim\chi^2(7),正确\\ &C.由正态分布可加性X_1-X_2\sim N(0,2\sigma^2),\frac{X_1-X_2}{\sqrt{2}\sigma}\sim N(0,1),\ 已知B选项成立,由t=\frac{X}{\sqrt{\dfrac{Y}{n}}}则\frac{\sqrt{\frac72}(X_1-X_2)}{\sqrt{\sum^9_{i=3}(X _i-\mu)^2}}\sim t(7),正确\\ &D.分子部分无法构造\chi^2分布,错误 \end{aligned}\]
例题2:抽样分布定理
\[\begin{aligned} &X_1...X_{17}是来自正态总体N(\mu,\sigma^2)的样本,\bar X和S^2是样本均值与方差,若P(\bar X\geq \mu+kS)=0.05,则k=?\\ \end{aligned}\]
\[\begin{aligned} &解:由已知,构造\frac{\bar X-\mu}{S/\sqrt{n}}\sim N(0,1)\\ &则P(\bar X\geq \mu+kS)=P(\frac{\bar X-\mu}{S/\sqrt{17}}\geq \sqrt{17}k)=0.05\\ &\Phi(\sqrt{17}k)=0.95,k≈0.3978 \end{aligned}\]
例题3:基本分布+抽样分布定理
\[\begin{aligned} &X_1...X_{9}和Y_1...Y_{12}是来自正态总体X\sim N(30,3^2)和Y\sim N(40,2^2)的样本,求\\ &(1)\ P(|\bar X-\bar Y|<12)\\ &(2)\ 确定常数c_1,c_2使得P(\dfrac{\bar X-30}{\frac{S_1}{3}}<c_1)=0.975,P(\dfrac{S_2^2}{S_1^2}<c_2)=0.05 \end{aligned}\]
\[\begin{aligned} &解(1)\bar X\sim N(30,1),\bar Y\sim N(40,\frac13),则\bar X-\bar Y\sim N(-10,\frac43)\\ &则P(|\bar X-\bar Y|<12)=P(-12<\bar X-\bar Y<12)\\ &=\Phi(\frac{12+10}{\frac{2}{\sqrt{3}}})-\Phi(\frac{-12+10}{\frac{2}{\sqrt{3}}})≈\Phi(\sqrt{3})=0.9583\\ &(2)由抽样分布定理易得\frac{\bar X-30}{S_1/3}\sim t(8)\\ &则P(\dfrac{\bar X-30}{\frac{S_1}{3}}<c_1)=0.975,c_1=t_{0.975}(8),c_1=2.3060\\ &又易得\frac{S_2^2/4}{S_1^2/9}\sim F(11,8)\\ &P(\dfrac{S_2^2}{S_1^2}<c_2)=P(\dfrac94\dfrac{S_2^2}{S_1^2}<\dfrac94c_2)=0.05\\ &则根据F分布性质\dfrac94c_2=F_{0.05}(11,8)=\frac{1}{F_{0.95}(8,11)},查表得\\ &c_2=\frac49\frac{1}{F_{0.95}(8,11)}=0.151 \end{aligned}\]
Ch8 参数估计
原目录:概率论与数理统计
总体X的分布函数中可能有未知参数或未知参数向量θ,此时记总体分布函数\(F(x,\theta)\)
- \(如X\sim P(\lambda),当\lambda未知,其中\theta=\lambda是未知参数\)
- \(如X\sim N(\mu,\sigma^2),当(\mu,\sigma^2)未知,其中\theta=(\mu,\sigma^2)是未知参数向量\)
利用样本了解未知参数/参数向量θ即为参数估计
1. 点估计
- 估计值和估计量统称为θ的一个点估计
- 点估计量是一个统计量,因此是随机变量
- 点估计值是一个实数,点估计值和点估计量可同时记为\(\hat\theta\)
1.1 矩估计法
使用k阶样本原点矩代替k阶总体原点矩进行估计
- 一阶
\(已知X有F(x,\theta),此时m=E(X)一般为\theta的函数即m=m(\theta),可以反解出\theta=g(m),此时使用样本均值\bar X(一阶原点矩)代替m,可得\hat\theta=g(\bar X)称为\theta的\color\red{矩估计量}\)
- 二阶(黑粗体θ为向量)
\(已知X有F(x,\boldsymbol\theta),\boldsymbol\theta=(\theta_1,\theta_2)此时 \begin{cases} m_1=E(X)=m_1(\theta_1,\theta_2)\\ m_2=E(X^2)=m_2(\theta_1,\theta_2) \end{cases} 可以反解出 \begin{cases} \theta_1=g_1(m_1,m_2)\\ \theta_2=g_2(m_1,m_2) \end{cases},已知 \begin{cases} m_1=E(X)\\ m_2=E(X_2)=D(X)+(E(X))^2 \end{cases}\\ 使用样本一阶原点矩\bar X代替m_1, 使用样本二阶原点矩A_2代替m_2\\ 可得\begin{cases} \hat\theta_1=g_1(\bar X,A_2)\\ \hat\theta_2=g_2(\bar X,A_2) \end{cases}\)
\(设总体X服从任何分布,E(X)=\mu,D(X)=\sigma^2存在,是两个未知参数,已知样本X_1...X_n,求\mu和\sigma的矩估计量? \)
\(解:\begin{cases} m_1=E(X)=\mu\\ m_2=E(X^2)=D(X)+E(X)^2=\sigma^2+\mu^2 \end{cases}反解 \begin{cases} \mu=m_1\\ \sigma^2=m_2-m_1^2 \end{cases}已知样本,可求样本\bar X和A_2代替m_1,m_2\\ 则 \begin{cases} \hat\mu=\bar X\\ \hat\sigma^2=A_2-\bar X^2 \end{cases} \color\red{(此结论可作为定理)}
)
- k阶
\(类似一二阶,对应m_1...m_k使用样本A_1到A_k进行替换,最终得到\hat\theta_1...\hat\theta_k\)
1.2 极大似然估计法
假设当前样本观测值发生概率为所有可能结果中发生概率最大的
首先了解"似然函数(Likelihood function)":统计学中,似然函数是一种关于统计模型参数的函数:给定输出x时,关于参数θ的似然函数L(θ|x)(在数值上)等于给定参数θ后变量X的概率,即
由上定义
\[\begin{aligned} &1.\ 对于来自离散总体X的独立样本X_1,X_2...X_n,有观测值x_1,x_2...x_n则\color\red{L(\theta)=\Pi_{i=1}^np(x_i,\theta)}\\ &2.\ 对于来自连续总体X的独立样本X_1,X_2...X_n,有观测值x_1,x_2...x_n则X_i落在x_i领域概率近似为f(x_i,\theta)\Delta x_i,那么(X_1,X_2...X_n)落在(x_1,x_2...x_n)的概率为\Pi_{i=1}^nf(x_i,\theta)\Delta x_i, \\&但该式最大值和\Delta x_i无关,则\color\red{L(\theta)=\Pi_{i=1}^nf(x_i,\theta)} \end{align} \)</span></p></blockquote><p data-lake-id="fb98d877651a8c4b89d0396089f09e5b"><br /></p><p data-lake-id="78d677800525204a4e5561feb08e9d80"><span class="math-fallback yuque-math">\(\begin{align} \end{aligned}\]\[\begin{aligned} &极大似然估计法基于以下思想:\\ &假设总体所有可能结果最大概率为p,根据小概率事件原理,\color\red{随机试验中某次试验出现的结果(样本观测值)代表其发生概率较大,我们就认为它是发生概率最高的事件},\\ &那么其发生概率就可作为极大似然估计值L(\hat\theta)=max\left\{L(\theta)\right\}\\ &因此在实际问题中:\\ &(1)\ 根据样本观测值写出L(\theta),认为其就是max\left\{L(\theta)\right\}\\ &(2)\ 若L(\hat\theta)=max\left\{L(\theta)\right\}必有\frac{dL(\theta)}{d\theta}=0或\frac{d(lnL(\theta))}{d\theta}=0,由此解得\hat\theta,如果无解,此时需要借助定义判断(见Ch8\ 例题) \end{aligned}\]2. 估计量的评选标准
标准
定义
含义
无偏性
比较估计量期望和被估计参数的期望
有效性
同为无偏估计量时,比较估计量在θ附近的集中程度
一致性
n充分大时,
的误差应充分小 均方误差
无偏估计量在θ附件的集中程度也许不高;有偏估计量的集中也许更高.此时使用需要衡量估计量在θ周围取值的密集程度
3. 区间估计
点估计的结果点估计值是一个实数,而我们知道一般的估计都有误差,只是误差范围不好确定.区间估计的思想就是指定一个概率,在这个可靠程度下计算估计值可能的误差范围.
\[\begin{aligned} &设总体X的分布函数F(x,\theta)中含有未知参数\theta.X_1,X_2...X_n为总体X的一个样本,\hat\theta_1=\hat\theta_1(X_1,X_2...X_n)与\hat\theta_2=\hat\theta_2(X_1,X_2...X_n)是两个统计量.若对于给定概率1-\alpha,有:\\ &\qquad\qquad\qquad\qquad\qquad\qquad\qquad\qquad\qquad\qquad\qquad\qquad\qquad\qquad\qquad\qquad P(\hat\theta_1<\theta<\hat\theta_2)=1-\alpha\\ &则称(\hat\theta_1,\hat\theta_2)为参数\theta的置信度1-\alpha的置信区间,\hat\theta_1,\hat\theta_2分别为置信上下限 \end{aligned}\]下面是θ区间估计问题解法步骤:
接下来讨论正态总体下参数的区间估计
3.1 一个正态总体下的区间估计
\(假设总体X\sim N(\mu,\sigma^2),X_1...X_n为总体的一个样本\)
下方选择样本函数时要根据条件使得样本函数中只能有一个未知量θ
条件
样本函数与分布
概率式&分位点不等式&置信区间
图像
3.2 两个正态总体下的区间估计
条件
样本函数与分布
概率式&分位点不等式&置信区间
13216543219865432
Ch8 例题
原目录:概率论与数理统计 / Ch8 参数估计
例题1:点估计-矩估计
\[\begin{aligned} 设总体X有密度函数f(x,\theta_1,\theta_2)= \begin{cases} \dfrac{1}{\theta_2}e^{-\dfrac{x-\theta_1}{\theta_2}},x>\theta_1\\ 0,x\leq \theta_1 \end{cases},其中-∞<\theta_1<+∞,\theta_2>0为两个未知参数,X_1...X_n为样本,求\theta_1和\theta_2的矩估计量 \end{aligned}\]
\[\begin{aligned} &解:m_1=E(X)=\int_{\theta_1}^{+∞}x\dfrac{1}{\theta_2}e^{-\dfrac{x-\theta_1}{\theta_2}}dx\\ &(\color\red{第二类换元积分})令t=\frac{x-\theta_1}{\theta_2},x=t\theta_2+\theta_1,dx=\theta_2dt\\ &m_1=\int_{0}^{+∞}(t\theta_2+\theta_1)e^{-t}dt=\theta_1+\theta_2\\ &类似可求m_2=2\theta_2(\theta_1+\theta_2)+\theta_1^2\\ &\therefore \theta_1=m_1-\sqrt{m_2-m_1^2},\theta_2=\sqrt{m_2-m_1^2},\color\red{使用样本一二阶原点矩\bar X和A_2代替总体原点矩}\\ &\hat\theta_1=\bar X-\sqrt{A_2-\bar X^2},\hat\theta_2=\sqrt{A_2-\bar X^2} \end{aligned}\]例题2:点估计-极大似然估计
\[\begin{aligned} 设总体X有密度函数f(x,\theta)= \begin{cases} e^{-(x-\theta)},x\geq \theta\\ 0,x<\theta \end{cases},其中X_1...X_n为样本,求\theta的极大似然估计量 \end{aligned}\]
\[\begin{aligned} &解:L(\theta)=\Pi_{i=1}^{n}f(x_i,\theta)=e^{-(x_1+...x_n)+n\theta}\\ &\therefore lnL(\theta)=-(x_1+...x_n)+n\theta\quad则\dfrac{dlnL(\theta)}{d\theta}=n≠0\\ &根据定义,L(\hat\theta)=max\left\{L(\theta)\right\},已知X\geq\theta时f(x,\theta)是关于x的减函数,则\hat\theta=min\left\{X_1,...,X_n\right\}极大似然估计量 \end{aligned}\]
总结:求极大似然估计值思路
\[\begin{aligned} &对于连续整体,有L(\theta)=\Pi_{i=1}^{n}f(x_i,\theta),求\theta的极大似然估计量:\\ &(1)解\dfrac{dL(\theta)}{d\theta}=0或\dfrac{dlnL(\theta)}{d\theta}=0得到极大似然估计值,再得到极大似然估计量\\ &(2)若(1)无解,此时必须根据极大似然估计定义L(\hat\theta)=max\left\{L(\theta)\right\}和密度函数单调性确定L(\hat\theta)=min{X_i}或max{X_i} \end{aligned}\]例题3:点估计-极大似然估计
\[\begin{aligned} 设总体X\sim N(\mu,\sigma^2)有密度函数f(x,\mu,\sigma^2)= \begin{cases} \dfrac{1}{\sqrt{2\pi}\sigma x}e^{-\dfrac{(lnx-\mu)^2}{2\sigma^2}},x>\theta_1\\ 0,x\leq \theta_1 \end{cases},其中\mu,\sigma^2为两个未知参数,求\mu,\sigma^2的极大似然估计量 \end{aligned}\]
\[\begin{aligned} &解:L(\mu,\sigma^2)=\Pi_{i=1}^n\dfrac{1}{\sqrt{2\pi}\sigma x_i}e^{-\dfrac{(lnx_i-\mu)^2}{2\sigma^2}}\\ &=(\frac{1}{\sqrt{2\pi}\sigma})^n(x_1...x_n)^{-1}e^{-\dfrac{1}{2\sigma^2}[(lnx_1-\mu)^2+(lnx_2-\mu)^2+...+(lnx_n-\mu)^2]}\\ &=(\frac{1}{2\pi})^\frac n2(\sigma^2)^{-\frac n2}(x_1...x_n)^{-1}e^{-\dfrac{1}{2\sigma^2}[(lnx_1-\mu)^2+(lnx_2-\mu)^2+...+(lnx_n-\mu)^2]}\\ &\therefore lnL(\mu,\sigma^2)=\frac n2ln\frac{1}{2\pi}-\frac n2ln\sigma^2-ln(x_1+...+x_n)-\dfrac{1}{2\sigma^2}[(lnx_1-\mu)^2+(lnx_2-\mu)^2+...+(lnx_n-\mu)^2]\\ &\therefore \begin{cases} \dfrac{\varphi lnL(\mu,\sigma^2)}{\varphi \mu}=\dfrac1{\sigma^2}(lnx_1+...+lnx_n )-\dfrac1{2\sigma^2}2n\mu=0\\ \dfrac{\varphi lnL(\mu,\sigma^2)}{\varphi \sigma^2}=-\dfrac{n}{2\sigma^2}+\dfrac{1}{2\sigma^4}[(lnx_1-\mu)^2+(lnx_2-\mu)^2+...+(lnx_n-\mu)^2]=0\\ \end{cases}\\ &\therefore解得极大似然估计值 \begin{cases} \hat\mu=\dfrac1n\sum_{i=1}^{n}lnx_i\\ \hat\sigma^2=\dfrac1n\sum_{i=1}^n(lnx_i-\hat\mu)^2=\dfrac1n\sum_{i=1}^n(lnx_i-\dfrac1n\sum_{j=1}^{n}lnx_j)^2 \end{cases},则极大似然估计量为 \begin{cases} \hat\mu=\dfrac1n\sum_{i=1}^{n}lnX_i\\ \hat\sigma^2=\dfrac1n\sum_{i=1}^n(lnX_i-\dfrac1n\sum_{j=1}^{n}lnX_j)^2 \end{cases} \end{aligned}\]
- 有多个未知参数时,求偏导数
- \(式中\sigma^{-n}可以转换为(\sigma^2)^{-\dfrac n2}计算\)
例题4:点估计-估计量评选
\[\begin{aligned} &总体X有E(X)=0,D(X)=\sigma^2,X_1...X_n是样本,则错误的是?\\ & A.\ A_2是\sigma^2的矩估计\quad B.\ A_2是\sigma^2的极大似然估计\quad C.\ A_2是\sigma^2的无偏估计\quad D.\ A_2是\sigma^2的一致估计\quad \end{aligned}\]
\[\begin{aligned} &解:\\ &A.\ \begin{cases} m_1=E(X)=0\\ m_2=E(X^2)=D(X)+E(X)^2=A_2 \end{cases}, \hat{\sigma^2}=A_2,正确\\ &B.\ 无法得到,错误\\ &C.\ E(A_2)=E(\frac1n\sum_{i=1}^{n}X_i^2)=\frac1n\sum_{i=1}^{n}E(X_i^2)=\frac1n\sum_{i=1}^{n}[D(X_i)+E(X_i)^2]=\sigma^2,则E(A_2)=\sigma^2,A_2是\sigma^2的无偏估计,正确\\ &D.由大数律\color\red{\ A_k\stackrel{P}{\longrightarrow}E(X^k)},则A_2\stackrel{P}{\longrightarrow}E(X^2)=\sigma^2,A_2是\sigma^2的一致估计,正确\\ \end{aligned}\]例题5:点估计-估计量评选
\[\begin{aligned} &X\sim N(0,\sigma^2),\hat{\sigma^2}是\sigma^2的极大似然估计量,S^2是样本方差,证明:\\ &(1)\ \hat{\sigma^2}是\sigma^2的无偏估计\\ &(2)\ \hat{\sigma^2}比S^2更有效 \end{aligned}\]
\[\begin{aligned} &证明:\\ &(1)\ f(x)=\frac{1}{\sqrt{2\pi}\sigma}e^{-\dfrac{x^2}{2\sigma^2}}\\ &\therefore L(\sigma^2)=\Pi_{i=1}^nf(x_i,\sigma ^2)\\ &=(\frac{1}{\sqrt{2\pi}\sigma})^ne^{-\dfrac{(x_1^2+...x_n^2)}{2\sigma^2}}\\ &lnL(\sigma^2)=-nln\sqrt{2\pi}-\frac n2ln\sigma^2-\frac12(\sigma^2)^{-1}(x_1^2+...x_n^2)\\ &\frac{dln(\sigma^2)}{d\sigma^2}=-\frac n2\frac{1}{\sigma^2}+\frac12(\sigma^2)^{-2}(x_1^2+...x_n^2)=0\\ &\therefore\ \sigma^2的极大似然估计值=\frac{x_1^2+...x_n^2}{n},\sigma^2的极大似然估计量\hat{\sigma^2}为\frac{X_1^2+...X_n^2}{n}\\ &E(\hat{\sigma^2})=\frac1n\sum_{i=1}^nE(X_i^2)=\frac1n\sum_{i=1}^n[D(X_i)+E(X_i)^2]=\frac1n\sum_{i=1}^nD(X_i)=\frac1n*n\sigma^2=\sigma^2,则\hat{\sigma^2}是\sigma^2的无偏估计\\ &(2)\ X\sim N(0,\sigma^2),\frac X\sigma\sim N(0,1),则\chi_1^2=\sum_{i=1}^n(\frac{X^2}{\sigma^2})\sim \chi^2(n)\\ &由(1)D(\hat{\theta^2})=D((X_1^2+...X_n^2)/n)=D(\dfrac{1}{n}\sum_{i=1}^{n}X_i^2)=D(\dfrac{\sigma^2}{n}\chi_1^2)=\dfrac{\sigma^4}{n^2}D(\chi_1^2)=\dfrac{\sigma^4}{n^2}*2n=\dfrac{2\sigma^4}{n}\\ &此外根据抽样分布定理构造\chi_2^2=\frac{(n-1)S^2}{\sigma^2}\sim \chi^2(n-1)\\ &D(S^2)=D(\dfrac{\sigma^2}{n-1}\chi_2^2)=\frac{\sigma^4}{(n-1)^2}*2(n-1)=\frac{2\sigma^4}{n-1}\\ &\therefore D(\hat{\sigma^2})<D(S^2),\hat{\sigma^2}比S^2更有效 \end{aligned}\]例题6:点估计-综合
\[\begin{aligned} &设总体X有密度函数f(x,\theta)= \begin{cases} 3e^{-3(x-\theta)},x\geq \theta\\ 0,x<\theta \end{cases},其中\theta>0,X_1...X_n为样本,求:\\ &(1)\theta的矩估计量\hat{\theta_1}\\ &(2)\theta的极大似然估计量\hat{\theta_2}\\ &(3)求二者无偏性 \end{aligned}\]
\[\begin{aligned} &解:\\ &(1)m_1=E(X)=\int_\theta^{+∞}3e^{-3(x-\theta)}xdx\\ &=\theta+\frac13=\bar X\\ &\therefore \hat{\theta_1}=\bar X-\frac13\\ &(2)L(\theta)=\Pi_{i=1}^{n}f(x_i,\theta)=3^ne^{-3(x_1+...+x_n-n\theta)}\\ &lnL(\theta)=nln3-3(x_1+...+x_n)+3n\theta\\ &\dfrac{lnL(\theta)}{d\theta}=3n≠0\\ &根据定义且L(\theta)在\theta>0时为减函数,则\hat{\theta_2}=min\left\{X_1...X_n\right\}\\ &(3)由(1)(2)\\ &E(\hat{\theta_1})=E(\bar X-\frac13)=E(\frac1n\sum_{i=1}^nX_i)-\frac13=\frac1n\sum_{i=1}^nE(X_i)-\frac13=\frac1n\sum_{i=1}^n\int_{\theta}^{+∞}x3e^{-3(x-\theta)}dx-\frac13=\frac1n\sum_{i=1}^n(\theta+\frac13)-\frac13=\theta,则\hat{\theta_1}是无偏估计\\ &F(X)=\int_{\theta}^{x}3e^{-3(x-\theta)}dx=1-e^{-3(x-\theta)}\\ &由(2),\hat{\theta_2}=min\left\{X_1...X_n\right\},F_X(\hat{\theta_2})=1-[1-F(x)^n]=1-e^{-3n(x-\theta)}\\ &\therefore f(\hat{\theta_2})=F'(\hat{\theta_2})=3ne^{-3n(x-\theta)}\\ &E(\hat{\theta_2})=\int_{\theta}^{+∞}x*3ne^{-3n(x-\theta)}dx,第二类换元法,令t=3n(x-\theta),解得E(\hat{\theta_2})=\frac{1}{3n}+\theta≠\theta,则\hat{\theta_2}非无偏估计量 \end{aligned}\]
\[\begin{aligned} &\color\red{对于定义法求得\hat\theta=min\left\{X_i\right\}或max\left\{X_i\right\},若要计算E(\hat\theta):}\\ &(1)先求F_x(\hat\theta)= \begin{cases} F_1(X)F_2(X)...F_n(X),\hat\theta=max\left\{X_i\right\}\\ 1-[1-F_1(X)][1-F_2(X)]...[1-F_n(X)],\hat\theta=min\left\{X_i\right\}\\ \end{cases}\\ &(2)求f_x(\hat\theta)=F_x'(\theta)\\ &(3)E(\hat\theta)=\int_{-∞}^{+∞} xf(x)dx \end{aligned}\]例题7:区间估计-一个正态总体下
\[\begin{aligned} &总体X\sim N(\mu,\sigma^2),已知\sigma=\sigma_0,要使得\mu的置信度为1-\alpha的置信区间长度不超l,则样本容量应不低于?\\ \end{aligned}\]
\[\begin{aligned} &解:\sigma已知,则U=\frac{\bar X-\mu}{\sigma_0/\sqrt{n}}\sim N(0,1)\\ &-u_{1-\frac\alpha2}<\frac{\bar X-\mu}{\sigma_0/\sqrt{n}}<u_{1-\frac\alpha2},置信区间(\bar X-\frac{\sigma_0u_{1-\frac\alpha2}}{\sqrt n},\bar X+\frac{\sigma_0u_{1-\frac\alpha2}}{\sqrt n})\\ &\therefore 2\frac{\sigma_0u_{1-\frac\alpha2}}{\sqrt n}\leq l,则n\geq \frac{4\sigma_0^2u_{1-\frac\alpha2}^2}{l^2} \end{aligned}\]例题8:区间估计-一个正态总体下
\[\begin{aligned} &糖生产线上抽取12包糖,重(kg)分别为10.1,10.3,10.4,10.5,10.2,9.7,9.8,9.9,10,10.1,10.2,9.8,假设每包糖重服从N(\mu,\sigma^2),求\mu,\sigma^2的90\%置信区间 \end{aligned}\]
\[\begin{aligned} &解:\bar X=10.08,S^2=0.06,S=0.25\\ &(1)\sigma^2未知,则选择t=\frac{\bar X-\mu}{S/\sqrt{n}}\sim t(n-1)\\ &查表t_{1-\frac\alpha2}(11)=1.7959\\ &则-1.7959<\frac{10.08-\mu}{0.25/\sqrt{12}}<1.7959,可得\mu的90\%置信区间为(9.9529,10.2138)\\ &(2)\mu未知,则选择\chi^2=\frac{(n-1)S^2}{\sigma^2}\sim \chi^2(n-1)\\ &查表\chi^2_{1-\frac\alpha2}(11)=19.675,\chi^2_{\frac\alpha2}(11)=4.575\\ &则4.575<\frac{11*0.06}{\sigma^2}<19.675,可得\sigma^2的90\%置信区间为(0.0354,0.1523)\\ \end{aligned}\]例题9:区间估计-两个个正态总体下
\[\begin{aligned} &失眠者21人,A组11人使用一种药,B组10人使用另一种,测得用后睡眠时间(h)A:\bar X=7.82,S_1=0.28;B:\bar Y=6.75,S_2=0.63,A\sim N(\mu_1,\sigma_1^2),B\sim N(\mu_2,\sigma_2^2)求\\ &(1)\frac{\sigma_1^2}{\sigma_2^2}的95\%置信区间\\ &(2)若\sigma_1^2=\sigma_2^2=\sigma^2,求\mu_1-\mu_2的95\%置信区间 \end{aligned}\]
\[\begin{aligned} &解:\\ &(1)选取F=\frac{S_1/\sigma_1^2}{S_2/\sigma_2^2}\sim F(n_1-1,n_2-1),1-\alpha=0.95\\ &查表F_{1-\frac\alpha2}(10,9)=3.96,F_{\frac\alpha2}(10,9)=1/F_{1-\frac\alpha2}(9,10)=0.26455\\ &\therefore 0.26455<\frac{S_1/\sigma_1^2}{S_2/\sigma_2^2}<3.96,解得\frac{\sigma_1^2}{\sigma_2^2}的95\%置信区间为(0.04988,0.7467)\\ &(2)若\sigma_1^2=\sigma_2^2=\sigma^2,取T=\frac{\bar X-\bar Y-(\mu_1-\mu_2)}{S_w\sqrt{\frac1n_1+\frac1n_2}}\sim t(n_1+n_2-2)\\ &t_{0.975}(19)=2.093,则-t_{1-\frac\alpha2}(n-1)<\frac{\bar X-\bar Y-(\mu_1-\mu_2)}{S_w\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}}<t_{1-\frac\alpha2}(n-1),解得\mu_1-\mu_2的95\%置信区间为(0.6321,1.5079)\end{aligned}]
Ch9 假设检验
原目录:概率论与数理统计
1. 基本思想
假设检验的思想是给定总体的样本,提出有关总体的假设,使用样本的信息判断假设是否成立
\[\begin{aligned} &假设检验问题的一般形式:\\ &当总体X\sim N(\mu,\sigma_0^2),\sigma_0^2已知,取得样本X_1...X_n和观测值x_1...x_n,\\&提出原假设H_0:\mu=\mu_0和备择假设H_1:\mu≠\mu_0,其中哪一个成立?\\ &由于样本均值\bar X是总体期望\mu的无偏估计,所以\\ &(1)若H_0成立,则偏差|\bar X-\mu_0|取值应相应较小,反映样本均值产生的抽样误差\\ &(2)若H_1成立,则偏差|\bar X-\mu_0|取值应相应较大,反映\mu≠与\mu_0产生的系统误差\\ &则令|U|=\frac{|\bar X-\mu_0|}{\sigma_0/\sqrt{n}},规定一个临界值k,关注|U|和k相对大小\\\end{aligned}]
\[\begin{aligned} &由于决策基于样本,当H_0实际为真时,可能做出拒绝H_0的决策(无法消除这种可能性),\\&这种错误称为\color\red{第一类错误,记为:P(当H_0为真拒绝H_0)或P_{\mu_0}(拒绝H_0)}\\ &我们只能控制犯这类错误的概率,给定一个很小的\alpha,称为显著性水平,使得犯错概率小于它:\\&P(当H_0为真拒绝H_0)<\alpha , 则最大出错概率下:\\ &\qquad P(|U|=\frac{|\bar X-\mu_0|}{\sigma_0/\sqrt{n}}>k)=\alpha,P(-k\leq \frac{\bar X-\mu_0}{\sigma_0/\sqrt{n}}\leq k)=1-\alpha,根据分位点定义,k=u_{1-\frac\alpha2},\\&综上,事件【H_0为真且拒绝H_0 】即【|U|>u_{1-\frac\alpha2}】是个小概率事件,称\left\{|U|>u_{1-\frac\alpha2}\right\}为拒绝域\\ &此时带入样本观测值求出样本均值\bar X继而得到|U|:\\&若|U|>u_{1-\frac\alpha2}成立,说明这个小概率事件发生即观测值落入拒绝域,概率不小,与H_0的矛盾,故H_1成立\\ \end{aligned}\]
\[\begin{aligned} &术语表:\\ &\color\red{U:检验统计量\\ u_{\frac\alpha2}:临界值\\ W=\left\{|U|>u_{1-\frac\alpha2}\right\}:拒绝域} \end{aligned}\]1.1 双侧检验
\(H_1:\mu≠\mu_0,则\mu位于\mu_0两端\)
1.2 单侧检验
\[\begin{aligned} &右侧检验:已经知道样本的某个参数值只会偏高,即H_1:\mu>\mu_0,则\mu位于\mu_0右端,此时H_0可以是\mu=\mu_0或\mu\leq\mu_0(两个假设的检验统计量和拒绝域相同,但实际意义不同)\\ &\quad *右侧检验中拒绝域只有右侧,则\color\red{临界值取u_{1-\alpha},即H_0成立且拒绝时有P(U>u_{1-\alpha})=\alpha}\\ &左侧检验:同理H_0:\mu=\mu_0或\mu\geq\mu_0,H_1:\mu<\mu_0\\ &\quad *左侧检验中拒绝域左侧,则\color\red{临界值取-u_{1-\alpha},即H_0成立且拒绝时有P(U<-u_{1-\alpha})=\alpha} \end{aligned}\]
小结
1.3 两类错误
- 一类:弃真,H0确实正确,但检验统计量落入拒绝域,因此拒绝了H0,概率记为α,即显著性水平
- 二类:取伪,H0确实错误,但检验统计量的值未落入拒绝域,因此没有拒绝H0,概率记为β
4种可能及概率
事实
H0真
H1真
决策
拒绝H0
第Ⅰ类错误,α
正确,1-β
不拒绝H0
正确1-α
第Ⅱ类错误,β
1.4 假设检验的一般步骤
\[\begin{aligned} &例题:由于测量误差,测距仪测量值X\sim N(\mu,10^2),现对距离500m的目标测量9次,得到\bar x=507m,问测距仪是否有系统误差(\alpha=0.05)\\ &解:设H_0:\mu=\mu_0=500m(代表无系统误差),设H_1:\mu≠\mu_0\\ &选取U=\frac{\bar X-\mu_0}{\sigma_0/\sqrt{n}},当H_0成立时\frac{\bar X-\mu_0}{\sigma_0/\sqrt{n}}\sim N(0,1)\\ &\alpha=0.05,查表得u_{1-\frac\alpha2}=u_{0.975}=1.96\\ &带入\bar x=507,|u|=\frac{|507-500|}{10\sqrt{9}}=2.1>1.96,超过临界值,则有系统误差 \end{aligned}\](1)根据问题确定假设H0和H1
(2)根据已知条件选择合适检验统计量U
(3)根据显著性水平α,查表确定临界值
(4)根据观测值计算检验统计量得观测值,和临界值比较,再对假设判断
2. 正态总体下参数的假设检验
需要根据已知条件选择合适检验统计量U
2.1 一个正态总体
\(设总体X\sim N(\mu,\sigma^2),X_1...X_n是总体样本,\bar X和S^2为样本均值和样本方差\)
- \(\sigma^2=\sigma_0^2已知时,\mu的检验\)
\(U=\frac{\bar X-\mu_0}{\sigma_0/\sqrt{n}}\sim N(E(U),D(U))\)
- \(\sigma^2未知时,\mu的检验\)
\(t=\frac{\bar X-\mu_0}{S/\sqrt{n}}\sim t(n-1)\)
- \(\mu未知时,\sigma^2的检验\)
\(\chi^2 =\frac{(n-1)S^2}{\sigma_0^2}\sim \chi^2(n-1)\)
2.2 两个正态总体
\(设总体X\sim N(\mu_1,\sigma_1^2),Y\sim N(\mu_2,\sigma_2^2),X_1...X_n,Y_1...Y_n是总体样本,\bar X,\bar Y,S_1^2,S_2^2为样本均值和样本方差\)
- \(\sigma_1^2,\sigma_2^2已知时,\mu_1=\mu_2的检验\)
\(U=\frac{\bar X-\bar Y}{\sqrt{\dfrac{\sigma_1^2}{n _1}+\dfrac{\sigma_2^2}{n _2}}}\sim N(E(U),D(U))\)
- \(\sigma_1^2=\sigma_2^2=\sigma^2未知时,\mu_1=\mu_2的检验\)
\(T=\frac{\bar X-\bar Y}{S_w\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}}\sim t(n_1+n_2-2)\)
\(其中S_w^2=\frac{(n_1-1)S_1^2+(n_2-1)S_2^2}{n_1+n_2-2}\)
- \(\mu_1,\mu_2未知时,\sigma_1^2=\sigma_2^2的检验\)
\(F=\frac{S_1^2}{S_2^2}\sim F(n_1-1,n_2-1)\)
对比Ch8 区间估计可以发现相同总体和未知参数的情况下,样本函数与检验统计量形式类似.
- 区间估计是未知参数值时,估计在给定可靠程度下参数值可能的误差范围
- 假设检验是已知观测值下的参数值,判断它是否落入给定可靠程度下可接收的误差范围中(接受域)
Ch9 例题
原目录:概率论与数理统计 / Ch9 假设检验
例题1:(右侧)正态总体均值检验
\[\begin{aligned} &某种元件寿命X(h)服从N(\mu,\sigma^2),\mu,\sigma^2均未知,测得16个元件的寿命的\bar X=241.5,S=98.7259\\ &请问是否由理由认为元件总体的平均寿命大于225h?(\alpha=0.05) \end{aligned}\]
\[\begin{aligned} &解:设H_0:元件总体平均寿命小于等于225,\mu\leq \mu_0=225,\ H_1:\mu>225\\ &选择t=\frac{\bar X-\mu_0}{s/\sqrt{n}}\sim t(n-1),拒绝域为\left\{t\geq t_{1-\alpha}(n-1)\right\}\\ &代入数据,t=0.6685<t_{0.95}(n-1)=1.7531,未落入拒绝域\\ &\therefore 接受H_0,无理由认为元件平均寿命大于225h \end{aligned}\]例题2:(右侧)样本容量选取
\[\begin{aligned} &设总体X\sim N(\mu,\sigma_0^2),X_1,X_2...X_n是样本,检验假设H_0:\mu=\mu_0,H_1:\mu\geq \mu_0,求:\\ &(1)犯第二类错误概率\beta为\\ &(2)证明n固定时,一二类错误概率\alpha和\beta无法同时减小,且\alpha固定时,n增大吗\beta减小\\ &(3)设\sigma_0=1,\mu_0=10,当\mu=11,\alpha=0.05时,为了使\beta\leq 0.05,应取多大样本容量n \end{aligned}\]
\[\begin{aligned} &解:\\ &(1)右侧检验,拒绝域\left\{U>u_{1-\alpha}\right\},\ \beta=P(H_0为假时接受H_0)\\ &\sigma_0^2已知,\ 则取U=\frac{\bar X-\mu}{\sigma_0/\sqrt{n}}\\ &当接受H_0:E(U)=\frac{1}{\sigma_0/\sqrt{n}}[E(\bar X)-E(\mu_0)]=\frac{\mu-\mu_0}{\sigma_0/\sqrt{n}},D(U)=(\frac{1}{\sigma_0/\sqrt{n}})^2D(\bar X)=\frac{n}{\sigma_0^2}\frac1n\sigma_0^2=1\\ &\therefore U=\frac{\bar X-\mu_0}{\sigma_0/\sqrt{n}}\sim N(\frac{\mu-\mu_0}{\sigma_0/\sqrt{n}},1)\\ &当H_0假时还被接受,即样本没有落入拒绝域:\beta=P(U\leq u_{1-\alpha})=\Phi(u_{1-\alpha}-\frac{\mu-\mu_0}{\sigma_0/\sqrt{n}})\\ &(2)证明:由分位点定义\\ &\beta=\Phi(u_\beta)=\Phi(-u_{1-\beta}),由(1)\ \beta=\Phi(u_{1-\alpha}-\frac{\mu-\mu_0}{\sigma_0/\sqrt{n}}),\ 则u_{1-\alpha}+u_{1-\beta}=\frac{\mu-\mu_0}{\sigma_0/\sqrt{n}}\\ &u_{1-\alpha}和u_{1-\beta}在\alpha,\beta\in(0,1)时都单调减,则当n固定,\alpha和\beta无法同时减小,若\alpha固定,n增大,\beta减小\\ &(3)由(1)\ 当接受H_0,U=\frac{\bar X-10}{1/\sqrt{n}}\sim N(\frac{11-10}{1/\sqrt{n}},1)即N(\sqrt{n},1)\\ &\beta=\Phi(u_{0.95}-\sqrt{n})=\Phi(1.645-\sqrt{n}),带入\beta=0.05,得到n=10.8241\\ &\because 由(2)\ 若\alpha固定,n增大,\beta减小\\ &\therefore 只有n \geq 10.8241时\beta\leq 0.05 \end{aligned}\]
"样本容量选取"问题
一般进行假设检验时,题目会给出显著性水平α以控制第一类错误概率,而第二类错误的概率依赖于样本容量n.
样本容量n和第二类错误概率的关系可通过"OC函数(实行特征函数)"表达,具体可以参考浙大版教材Ch8.5内容
如果不考虑OC函数也可通过上题分析过程得到结果
例题3:(右侧)样本容量选取
为了巩固,再来一题
\[\begin{aligned} &解:由题意H_0:\mu\leq \mu_0,H_1:\mu>\mu_0\\ &已知\sigma^2,则选择U=\frac{\bar X-\mu}{\sigma/\sqrt{n}}, 拒绝域U\geq u_{1-\alpha}\\ &当接受H_0,可求E(U)=\frac{\mu-\mu_0}{30/\sqrt{n}},D(U)=1,U\sim N(\frac{\mu-\mu_0}{30/\sqrt{n}},1)\\ &根据第二类错误定义,则\beta=P(U<u_{1-\alpha})=\Phi(u_{1-\alpha}-\frac{\mu-\mu_0}{30/\sqrt{n}})\\ &\therefore -u_{1-\beta}=u_{1-\alpha}-\frac{\mu-\mu_0}{30/\sqrt{n}},\quad解得\sqrt{n}=\frac{ u_{1-\beta}+u_{1-\alpha}}{\mu-\mu_0}\\ &当\alpha=\beta=0.05,取\mu-\mu_0最小值\delta=20,解得n=24.35取25\\ &所以抽取25件样品最合适 \end{aligned}\]
该问题中
- 满足厂方需求:给出显著性水平α,控制第一类错误概率
- 满足买方需求:给出第二类错误概率β以确定样本容量













