一文搞懂似然函数:它为什么不是概率
似然函数(likelihood function)是统计学中”由果推因”的数学工具。它的核心作用是:在已知实验结果(数据)的情况下,衡量不同参数值对这一结果的支持程度。它既是最大似然估计(MLE)的引擎,也是贝叶斯推断的桥梁。

很多人第一眼看到 $L(\theta \mid x)$ 都会困惑:它长得和概率一模一样,凭什么说它不是概率?为了彻底搞懂它,我们分三步来看:先看它的数学定义,再抓住它与”概率”的本质区别,最后用一个抛硬币的例子把它彻底讲透。
数学定义:同一个式子,两种读法
先记住一句结论:似然函数和概率密度在数值上完全相等,但视角截然相反。假设我们有一组独立同分布的数据 $X$,其概率分布依赖于未知参数 $\theta$,概率密度记为 $P(X \mid \theta)$。似然函数 $L(\theta \mid X)$ 在数值上就等于 $P(X \mid \theta)$,但两者的”问法”完全不同:
- 概率函数:固定参数 $\theta$,数据 $X$ 是变量。它回答:”已知硬币是公平的,抛 10 次出现 7 次正面的概率是多少?”
- 似然函数:固定数据 $X$,参数 $\theta$ 是变量。它回答:”已经抛出了 7 次正面,请问硬币正面概率 $p = 0.5$ 有多’像’真相?$p = 0.7$ 又有多’像’?”
同一个数学式子,谁是”已知”、谁是”待求”,方向完全相反。R. A. Fisher 在 1922 年刻意创造 “likelihood” 一词并坚持与 “probability” 区分,强调的就是这种视角差别。
关键:似然函数不是概率分布!
这是理解似然函数最重要的一句话。概率分布要求所有可能结果的概率之和(或积分)等于 1;但似然函数对参数 $\theta$ 的积分(或求和)通常不等于 1。它度量的不是”参数 $\theta$ 有多真实”,而是”参数 $\theta$ 对当前这组数据有多合理”——专业上叫 relative plausibility(相对合理性)。
举个例子:如果 $L(\theta = 0.7)$ 是 $L(\theta = 0.5)$ 的 2 倍,只代表参数 0.7 比 0.5 更能解释眼前这组数据,绝不代表”$\theta = 0.7$ 的真实概率是 70%”。参数到底是真是假,那是”真值”问题,似然回答不了——它只回答”支持度”。
初学者 90% 的困惑,都源于把似然当成了概率。记住:似然是支持度函数,不是概率分布。
一个直观的例子:抛硬币
你抛了一枚未知硬币 10 次,结果得到 7 次正面。现在来比较两种对硬币的猜测:
- 假设硬币公平($\theta = 0.5$):出现这个结果的概率是 $\binom{10}{7} \times 0.5^{10} \approx 0.117$。
- 假设硬币偏正面($\theta = 0.7$):出现这个结果的概率是 $\binom{10}{7} \times 0.7^{7} \times 0.3^{3} \approx 0.267$。
此时,似然函数 $L(\theta)$ 就是”所有可能的 $\theta$ 值对应的这些数值”构成的集合。因为 0.267 > 0.117,我们说 $\theta = 0.7$ 的似然比 $\theta = 0.5$ 更大——数据更”支持” 0.7 这个猜测。
统计上最常用的最大似然估计(MLE),就是找出那个让似然函数值最大的 $\theta$。在这个例子里显然是 0.7——它就是基于这组数据,我们对真实参数的最佳猜测。

从图中可直接读出:曲线在 p=0.7 处达到峰值(L≈0.267),即这组数据”最支持”的参数——MLE 就是这座信任山峰的顶点;对比 p=0.5 处 L≈0.117,0.7 的解释力是 0.5 的两倍多
为什么似然函数如此重要?
一句话:它是现代统计推断的基石。
频率学派用它做参数估计。最大似然估计(MLE)之所以成为默认选项,是因为它有两个直观上很棒的优点:数据越多,估计越接近真实参数(一致性);并且它充分利用了数据中的全部信息,估计的波动是最小的(有效性)。大白话就是——样本够大时,MLE 是最”聪明”的猜测方式。
贝叶斯学派则把它当作桥梁:后验概率 ∝ 似然函数 × 先验概率。
没有似然函数,数据就无法更新我们对世界的认知。两个学派的根本分歧,其实浓缩在”要不要乘一个先验”这一点上——但它们脚下的地基,都是似然。
参考文献 / 扩展阅读
- Fisher, R. A. (1922). On the mathematical foundations of theoretical statistics.Philosophical Transactions of the Royal Society A, 222, 309–(”likelihood”一词的起源,坚持与 probability 区分)
- Casella, G., & Berger, R. L. (2002).Statistical Inference (2nd ed.). Duxbury.(第 6 章:似然原理与 MLE 的系统论述)





