尧图精选

概率论常见分布全手册:分布表、期望方差与题眼速查

🕒 发布时间:2026/10/2 1:11:27 📁 来源:尧图网络
先说个现象很多同学学完概率论公式背了一堆一到做题还是懵。最常见的问题不是“不会算”而是“分不清”——题目给了一段描述不知道应该套哪个分布或者知道是二项分布但分布律、期望、方差全记串了。我自己当年复习时也踩过这个坑后来把常见分布全部整理成一张“分布表”从分布律/密度函数到期望方差再配合典型的应用场景和题眼才真正把这块啃下来。这篇文章就把我整理过、也一直在给学生用的“常见分布全手册”拿出来分享。覆盖离散和连续两大阵营的经典分布每个都给出分布表、期望、方差、适用场景和记忆技巧再加上分布表尤其是标准正态分布表的查表方法以及最容易出差错的几个考点。不管你是期末冲刺、考研复习还是准备面试时恶补概率基础这份内容都可以直接拿去用建议收藏后反复对照题目练习。1. 先搭框架分布表到底在记什么1.1 所有分布都在回答同一个问题概率论里研究随机现象核心就一句话每个可能的结果发生的概率是多少。分布的作用就是把“结果”和“概率”之间的对应关系完整描述出来。打个比方分布就是一张“概率地图”。地图告诉你某个地点在哪个位置、周围有什么路分布告诉你某个随机变量取哪些值、每个值或每个区间对应的概率有多大。所以记分布不需要死记硬背每一个公式你只需要抓住三个核心要素分布本身离散型看分布律连续型看概率密度函数这是最根本的定义期望随机变量的“平均水平”方差随机变量取值偏离平均水平的程度。考试里九成题目翻来覆去考的就是这三样。你把这套框架记牢再往里面填具体分布的内容思路就会清晰很多。1.2 先用两张总表建立全局观常见分布可以分成两大类离散型和连续型。离散型随机变量只能取有限个或可列个值比如抛硬币、抽扑克、数设备故障次数连续型随机变量取值是某个区间内的任意实数比如测量误差、零件寿命、等待时间。我习惯先把两张总表放在最前面每次复习先看整体再看细节这样不容易迷失方向。离散型常见分布总览分布名称参数分布律Xk的概率期望方差0-1分布伯努利pp^k (1-p)^(1-k)k0,1pp(1-p)二项分布n, pC(n,k) p^k (1-p)^(n-k)npnp(1-p)泊松分布λ(λ^k / k!) e^(-λ)λλ几何分布p(1-p)^(k-1) p1/p(1-p)/p²超几何分布N, M, nC(M,k) C(N-M,n-k) / C(N,n)nM/NnM(N-M)(N-n)/[N²(N-1)]连续型常见分布总览分布名称参数概率密度函数期望方差均匀分布a, b1/(b-a)axb(ab)/2(b-a)²/12指数分布λλe^(-λx)x01/λ1/λ²正态分布μ, σ²(1/√(2π)σ) e^(-(x-μ)²/(2σ²))μσ²伽马分布α, λ(λ^α/Γ(α)) x^(α-1) e^(-λx)α/λα/λ²这两张表就是文章的“骨架”。下面的内容就是帮你看懂这张表背后隐藏的“为什么”。1.3 三个必背数比记公式更重要有很多同学记分布喜欢先背公式但公式再熟离开“这个分布描述什么场景”的理解照样不会用。我建议的顺序是先记场景再记分布律/密度最后记期望和方差。举个例子看到“独立重复n次试验每次成功概率为p”大脑要立刻反应出二项分布看到“单位时间内随机事件发生的次数”立刻想到泊松分布看到“无记忆性的等待时间”立刻想到指数分布。场景对应上了公式查表或者推导都不会错。期望和方差在考试里主要用于“参数估计”和“检验统计量”的计算也是必须拿下的基本功。2. 离散分布逐个拆解从“一次试验”到“一堆试验”2.1 伯努利分布最简单的概率模型伯努利分布也叫0-1分布它描述一次试验只有两种结果的情况成功记1或者失败记0。比如抛一次硬币正面朝上概率0.5买一张彩票中奖概率p。这种“要么成功要么失败”的试验在概率论里叫伯努利试验。它的分布律非常简单P(X1)pP(X0)1-p期望E(X)p方差D(X)p(1-p)。注意伯努利分布虽然简单但它是二项分布和几何分布的“地基”。很多同学觉得0-1分布太简单跳过了结果后面学二项、几何时对p和1-p为什么反复出现一头雾水。地基一定不能跳。2.2 二项分布n次独立重复试验的成功次数把伯努利试验重复n次关心这n次中一共成功多少次这个随机变量就服从二项分布记作X~B(n, p)。它的分布律是最重要的一个公式P(Xk)C(n,k) p^k (1-p)^(n-k)k0,1,...,n其中C(n,k)是从n次试验中选出k次成功的组合数。为什么要有这个组合数因为这k次成功不一定发生在哪几次试验中所有可能的位置都要算进去。期望E(X)np方差D(X)np(1-p)。一个很容易记的规律二项分布的期望和方差就是n个独立伯努利分布的期望和方差之和。典型场景射击n次命中次数、一批产品中的次品数有放回抽样、答题猜对n道题的数量。常见错误提醒很多同学一看到“合格品/次品”就往二项分布上套。但如果题目说的是“不放回抽取”试验之间不独立这时候要用超几何分布不能用二项分布。判断标准只有一个每次试验是否独立概率p是否不变。2.3 泊松分布单位时间内的稀有事件泊松分布记作X~P(λ)分布律是P(Xk)(λ^k / k!) e^(-λ)k0,1,2,...它的最大特点期望等于方差等于λ。这个性质在考试里经常用来反推参数十分好用。泊松分布的典型场景是“单位时间或单位面积、单位体积内随机事件发生的次数”比如一小时内到达服务台的顾客数一平方米内出现的瑕疵点数一本书中的印刷错误数某地区一天内交通事故的次数。这类事件的特点是事件本身比较“稀有”但发生的次数可以在较大的范围内取值。还有一个高频考点是泊松分布与二项分布的关系当n很大、p很小时二项分布B(n,p)可以近似为泊松分布P(λ)其中λnp。这个近似在后面专门讲。实操提示考试中如果遇到“n很大比如n≥20且p很小比如p≤0.05”的二项分布题目直接考虑泊松近似。很多时候题目给的n和p就是专门为近似设置的硬算组合数反而容易出错。2.4 几何分布等待第一次成功和二项分布关注“成功几次”不同几何分布关心的是“第几次试验才第一次成功”。比如不断掷骰子直到掷出6点为止问“第k次才掷出6点”的概率。这个随机变量服从几何分布P(Xk)(1-p)^(k-1)pk1,2,...这里(1-p)^(k-1)表示前k-1次都失败最后一次才成功。期望E(X)1/p方差D(X)(1-p)/p²。这里有个特别容易踩的坑几何分布有两种定义方式。第一种X表示首次成功时总共试验的次数取值范围是1,2,3,...这时E(X)1/p第二种X表示首次成功之前失败的次数取值范围是0,1,2,...这时E(X)(1-p)/p。很多教材和考试卷会用第二种定义所以做题前一定要先看清楚题目给的随机变量到底代表什么。我的习惯是先看取值范围再决定用哪套公式。2.5 超几何分布不放回抽样的次品数超几何分布描述的是一批产品共有N件其中M件次品从中不放回抽取n件抽到的次品数X服从超几何分布P(Xk)C(M,k) C(N-M,n-k) / C(N,n)它的期望E(X)nM/N方差计算比较复杂这里不展开推导直接查表用。超几何分布和二项分布的区别是高频考点中的重点对比项二项分布超几何分布抽样方式有放回或独立重复不放回每次概率固定为p会随抽取改变近似关系当N很大、n相对较小时超几何可近似为二项题库里经常这样设计先问你“有放回抽样用哪个分布”再问你“不放回用哪个分布”或者反过来给你一个不放回场景但总体很大、抽取比例很小让你判断能否近似用二项分布计算。这个近似条件是n/N ≤ 0.1左右考试中可以直接用。3. 连续分布逐个拆解从“概率密度”理解一切3.1 均匀分布一段区间内的“绝对公平”均匀分布描述的是随机变量在区间(a,b)内任意等长子区间上取值的概率相同记作X~U(a,b)。概率密度函数是一个常数f(x)1/(b-a)axb它的分布函数是F(x)0x≤a(x-a)/(b-a)axb1x≥b期望E(X)(ab)/2方差D(X)(b-a)²/12。均匀分布在生成随机数、蒙特卡洛模拟中非常常用。考试里常见的有公交车到站等待时间在[0,10]分钟均匀分布、在圆弧上随机取一点的角度等。一个容易被忽略的细节连续型随机变量在某一点的取值概率永远是0所以均匀分布的密度函数在端点a和b处取什么值其实不影响概率计算。这在理解“连续分布求某个点的概率”时非常关键。3.2 指数分布等待时间与“无记忆性”指数分布描述的是“两次独立随机事件之间的时间间隔”比如电子元件的寿命到下一通电话的等待时间设备发生故障的间隔时间。指数分布的概率密度是f(x)λe^(-λx)x0分布函数是F(x)1-e^(-λx)x0期望E(X)1/λ方差D(X)1/λ²。这里有一个概念非常重要也是考试中区分指数分布和别的分布的核心考点无记忆性。用生活化语言解释假设一个元件已经工作了t小时它再继续工作s小时的概率和一个全新元件工作s小时的概率是一样的。公式表达为P(Xts | Xt)P(Xs)这就是“无记忆性”。它说明指数分布的“剩余寿命”不受已经过去的时间影响。考试里常见的陷阱题目说某元件寿命服从λ1/100的指数分布已经使用了300小时问再使用100小时的概率。很多同学会直接算 P(X400)/P(X300)虽然结果没错但没有意识到无记忆性可以直接简化成P(X100)。如果题目数据设计得巧妙比如t很大用无记忆性往往能节省大量计算时间。3.3 正态分布分布家族里的“顶流”正态分布是概率论里最重要的分布没有之一记作X~N(μ, σ²)。概率密度函数f(x)(1/√(2π)σ)e^(-(x-μ)²/(2σ²))期望E(X)μ方差D(X)σ²。正态分布的密度曲线是钟形曲线关于xμ对称在xμ处达到最高点。σ越小曲线越“瘦高”σ越大曲线越“矮胖”。标准化是一个核心操作。如果X~N(μ, σ²)那么令Z(X-μ)/σ则Z~N(0,1)即标准正态分布。这个变换是所有查表计算的基础原因在第5章会详细说明。正态分布还有一个实用结论就是3σ原则P(μ-σXμσ)≈0.6827P(μ-2σXμ2σ)≈0.9545P(μ-3σXμ3σ)≈0.9973在很多质量管理场景里“超出3σ”就意味着异常这个原则在考题中也常常直接用来估算概率。3.4 伽马分布与卡方分布进阶的“大管家”伽马分布是一个参数更灵活的分布族记作X~Ga(α, λ)概率密度为f(x)(λ^α/Γ(α)) x^(α-1)e^(-λx)x0期望E(X)α/λ方差D(X)α/λ²。伽马分布之所以是“大管家”是因为很多分布都是它的特例当α1时伽马分布退化为指数分布当αn/2、λ1/2时伽马分布变成卡方分布χ²(n)。卡方分布在数理统计中非常重要用于总体方差的估计与检验。它的期望是n方差是2n这是统计部分的核心公式。学有余力的同学可以把伽马分布当成一个“收纳箱”把指数、卡方都装进去记忆量反而更少。如果时间紧张至少要记住卡方分布的期望方差因为在区间估计和假设检验中一定会用到。4. 分布之间怎么“生”出来近似与转化4.1 泊松分布近似二项分布前面说过当n很大、p很小时二项分布B(n,p)可以用泊松分布P(λ)近似其中λnp。为什么能这样近似从直观上理解二项分布描述的是n次独立试验的总成功次数当p非常小成功事件变得“稀有”并且单位时间/单位样本中事件发生的次数自然呈现泊松分布的特征。实际使用条件一般是n≥20、p≤0.05n≥100、np≤10时效果更好。举一个考试常见的例子保险公司有500个客户每个客户一年内出险的概率为0.01求一年内出险人数不多于5人的概率。如果直接按二项分布计算要算P(X0)到P(X5)共6个组合数计算量很大。用泊松分布近似λ500×0.015查泊松分布表或算累和几步就出来了。4.2 正态分布近似二项分布当n足够大且np和n(1-p)都大于等于5时二项分布B(n,p)可以用正态分布N(np, np(1-p))近似。这就是棣莫弗-拉普拉斯中心极限定理的一个直接应用场景。特别注意用正态分布近似二项分布时通常需要做连续性修正。二项分布是离散的正态分布是连续的直接把离散点连成连续区间会产生偏差。比如计算P(X≤k)修正为P(X≤k0.5)计算P(X≥k)修正为P(X≥k-0.5)。这个0.5的修正很容易被忽略但考试中如果不做结果往往和标准答案差得比较远。我的经验是只要看到“用正态近似”几个字就默认要加0.5修正。4.3 正态分布的可加性与样本均值正态分布有一个很好的性质独立正态随机变量的线性组合仍然是正态分布。两个独立正态X~N(μ1,σ1²)、Y~N(μ2,σ2²)则XY~N(μ1μ2, σ1²σ2²)。这个性质引申出一个统计推断里最重要的结论如果X1,X2,...,Xn是来自正态总体N(μ,σ²)的简单随机样本那么样本均值X̄~N(μ, σ²/n)也就是说均值的波动范围比单个观测值小样本量n越大均值越稳定。这解释了为什么抽样调查中增加样本量能提高估计精度。对于非正态总体只要n足够大样本均值也近似服从正态分布中心极限定理。这个“近似正态”的思想贯穿整个假设检验和置信区间章节。4.4 抽样分布三兄弟卡方、t、F数理统计后续内容绕不开三个抽样分布它们本质上都是由标准正态分布“派生”出来的我管它们叫“抽样分布三兄弟”。卡方分布若Z1,Z2,...,Zn独立且都服从N(0,1)则它们的平方和服从χ²(n)。自由度n就是独立标准正态变量的个数。t分布若Z~N(0,1)V~χ²(n)且Z与V独立则TZ/√(V/n)服从t(n)分布。t分布和标准正态分布很像但尾巴更厚样本量越大越接近正态。F分布若V1~χ²(n1)、V2~χ²(n2)且独立则F(V1/n1)/(V2/n2)服从F(n1,n2)分布。这三个分布的密度函数公式非常复杂基本不用背。你需要记住的是它们的构造方式、自由度和用途。记法心得t分布是“标准正态除以卡方的根号再除以自由度”F分布是“两个卡方各自除以自由度后的比值”。每次记不住时把这句话默念一遍比死记公式靠谱得多。5. 分布表怎么查以标准正态分布表为例5.1 标准正态分布表左表还是右表先看清楚标准正态分布表通常是考试附件里出现率最高的表但也是查错率最高的表。市面上的标准正态表有两种形式左侧概率表给出Φ(z)P(Z≤z)即从-∞到z的累计概率右侧概率表给出P(Zz)即从z到∞的概率。这两种表数值完全互补查之前必须先看表头说明或表内图形确定它是哪种。如果表里z0对应的值是0.5那就是左侧累计表如果z0对应0.5两侧呈递减趋势要小心是不是右侧表。查表步骤以左侧累计表为例先把非标准正态通过Z(X-μ)/σ标准化在表的最左边一列找到z的小数点前两位比如1.9在表的最上面一行找到z的小数点后第二位比如0.06行列交叉处就是Φ(1.96)0.9750。查表方向也很重要。考试时经常是反过来查已知概率求临界值。比如要找z使得Φ(z)0.975就在表里找0.9750这个值反推出z1.96。这个值在置信区间中几乎是必用的建议直接背下来。5.2 卡方表、t表、F表行列各代表什么这三个表的结构不一样我第一次用也绕了很久这里一次说清楚。卡方分布表表头是显著性水平α或者概率p左侧第一列是自由度n表中数值是χ²_α(n)表示“自由度为n的卡方分布右侧尾部的概率为α时对应的临界值”。查法口诀先定α再定n行列交叉找数值。t分布表表头上通常标着“单侧概率α”和“双侧概率2α”两行或者两列左侧第一列是自由度n查表时要特别注意区分“单侧t_α(n)”和“双侧t_{α/2}(n)”。举一个典型场景构造95%置信区间时需要查t_{0.025}(n)这里用的是双侧0.05对应的值。如果表头是“单侧尾部概率”那么要查α0.025这一列如果表头是“双侧概率”那么要查α0.05这一列。这个细节是统计题目失分重灾区。我的建议是用t表之前先把“要单侧还是要双侧”写清楚再动笔查表。F分布表表头是分子的自由度n1左侧第一列是分母的自由度n2通常按显著性水平分别成表比如α0.05一张表、α0.01一张表。查F表需要给定α和两个自由度直接找对应表再行列交叉。F分布有一个常用性质F_{1-α}(n1,n2)1/F_α(n2,n1)这个性质用于求左侧临界值考试里偶尔会出现记下来能省不少事。5.3 查表前必须做的“标准化”动作很多同学拿着标准正态分布表却把X~N(μ,σ²)的原始值直接塞进去查这是概念错误。标准正态表里只有标准正态分布N(0,1)的值其他正态分布必须先标准化。标准化公式P(X≤x)P((X-μ)/σ≤(x-μ)/σ)Φ((x-μ)/σ)注意标准化之后不等号方向不变但每一步都要检查如果原来算的是P(X≥x)标准化后是1-Φ((x-μ)/σ)。完整流程我总结为三步写出原始分布X~N(μ,σ²)把题目中要求的概率转成标准正态Z的形式查表必要时用1-Φ(z)转换上侧概率。这三步每一步都可能出错但每一步也都有办法验证。比如标准正态的对称性Φ(-z)1-Φ(z)可以用来检查负数z的计算。6. 高频易错点与复习建议经验之谈6.1 常见错误清单这些错误是我在教学和批改作业中反复看到的建议大家直接“抄作业”式避开。错误一二项分布与超几何分布混淆判断标准只看抽样方式放回、独立选二项不放回、不独立选超几何。如果总体N很大、抽样数n相对较小超几何可以近似为二项。错误二指数分布无记忆性用反方向无记忆性说的是“已经用了t小时后再用s小时的概率”等于“全新元件用s小时的概率”。它是把条件概率简化成无条件概率不是把无条件概率复杂化成条件概率。看到“已经”“剩余寿命”等词优先想无记忆性。错误三连续型分布中求“某一点的概率”连续型随机变量在任意一点的概率为0所以P(Xa)0。有同学会代入密度函数得到一个值那是密度值不是概率。如果是密度函数在一个点的值它表示的是概率的“密集程度”单位是概率/长度和概率不是一回事。错误四查表时加错标准化的正负号标准化后遇到负数一定要用对称性转换。比如Φ(-1.5)1-Φ(1.5)。直接查负数是查不到的因为很多表只给正z值。错误五把方差和标准差混用正态分布N(μ,σ²)里第二个参数是方差σ²不是标准差σ。标准化时分母要除以σ而不是σ²。这个错误在参数估计和置信区间里会导致结果差一个数量级防不胜防。6.2 快速识别分布的“题眼”速查表做题速度快的人不是计算快而是识别快。下面是常见的题眼对照整理成速查表复现题目时先对号入座题目关键词对应分布一次试验、成功/失败伯努利0-1分布独立重复n次、成功k次二项分布单位时间/面积内事件次数泊松分布首次成功发生在第k次几何分布不放回抽样、总数为N、次品M超几何分布区间内任意等长位置等可能均匀分布等待时间、寿命、无记忆指数分布测量误差、体重、成绩、许多独立因素叠加正态分布样本均值、大样本统计推断正态分布中心极限定理总体方差估计与检验卡方分布均值检验、小样本t分布两个总体方差比F分布每次做题之前花10秒钟看题眼把分布定下来再动手算。很多人丢分不是因为不会算而是因为分布选错一步错步步错。6.3 我一直用的复习方法三遍法最后分享一个我自己一直在用的复习方法叫“三遍法”对学生朋友尤其管用。第一遍只看总表。把离散和连续两张总表放在手边不看教材挨个回忆每个分布对应什么场景分布律/密度函数长什么样期望方差是多少想不起来的做标记。第二遍合上书默写。拿出一张白纸把6个离散分布、4个连续分布的公式分布律或密度、期望、方差全部默写一遍再对照总表检查。这个过程很痛苦但非常有价值相当于给记忆做了一次“压力测试”。第三遍做综合题。找10道以上混合了不同分布的题目不看章节提示自己判断每个题该用哪个分布、用什么公式、需不需要查表。这个环节练的是“题眼识别”和“公式调用”的配合是真正把知识变成解题能力的关键。三遍法看起来简单但每遍的侧重点不同第一遍建立框架第二遍强化记忆第三遍训练实战。我自己当年用这个方法复习完概率论从看到题目大脑空白到基本能稳定拿到分布相关题目的全部分数一共只用了三天。最后再分享一个小技巧可以把分布表抄在一张A4纸上只写分布名称、分布律/密度、期望、方差四列贴在书桌前。每次做题卡壳就瞄一眼看多了自然就记住了。到考前这张纸就是你最精简的“武器库”。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →