更新于 2026年7月22日

条件概率#


术语解释#

条件概率(Conditional Probability) 是概率论中的核心概念,表示在已知某一事件发生的前提下,另一事件发生的可能性。 具体地,条件概率 $P(B|A)$ 表示在事件 $A$ 已经发生的条件下,事件 $B$ 发生的概率。根据贝叶斯公式,其基本定义式为:

$$ P(B|A) = \frac{P(AB)}{P(A)} $$

或者通过先验概率与条件概率的组合表示为:

$$ P(B|A) = \frac{P(B)P(A|B)}{P(A)} $$

条件概率是许多现代 AI 算法的底层数学支撑:

  • 朴素贝叶斯(Naive Bayes): 在该算法中,我们需要计算后验概率 $P(Y=c_k|X=x)$,即在已知特征 $x$ 的条件下,样本属于类别 $c_k$ 的概率。

  • 语言模型(Language Model): 语言模型的本质就是利用条件概率来预测序列。对于长度为 $T$ 的文本序列,其联合概率可以分解为一系列条件概率的乘积 $P(x^{(1)},...,x^{(T)}) = \prod_{t=1}^T P(x^{(t)}|x^{(t-1)},...,x^{(1)})$。$N$-gram 模型则通过马尔可夫假设简化条件概率,例如 2-gram 只考虑前一个词的条件概率 $P(x^{(t)}|x^{(t-1)})$。

  • Word2Vec 词向量:

    CBOW 模型的目标是最大化给定上下文词时中心词出现的条件概率$P(w_t|w_{t-m},...,w_{t+m})$。

    CBOW原理示意图
    CBOW原理示意图
    Skip-gram 模型则相反,目标是最大化给定中心词时上下文词出现的条件概率。
    Skip-gram原理示意图
    Skip-gram原理示意图
  • Seq2Seq 架构: 在解码(Decoding)过程中,模型需要最大化条件概率 $p(y_t|\mathcal{c}, y_1, ..., y_{t-1})$,即根据上下文向量 $\mathcal{c}$ 和已生成的序列预测当前时刻的输出。


直观示例#

  • 预测联想:在搜索引擎中输入 “Natural Language”,系统自动弹出 “Processing” 或 “Understanding”,其背后逻辑就是计算并在概率分布中选择最大的条件概率结果。

    搜索引擎关键词联想
    搜索引擎关键词联想
  • 特征评估:在信用卡审批示例中,可以计算“有房”条件下“审批通过”的条件概率 $P(Y=1|X^{(2)}=1)$ 来评估该特征的分类能力。相关内容可参见 「7.1 朴素贝叶斯原理:条件概率与分类模型基础」


相关术语#

  • 后验概率

  • 条件概率

  • 条件熵

  • 朴素贝叶斯

阅读 --

7.1 朴素贝叶斯算法

在本节中,我们首先介绍了朴素贝叶斯算法中的几个基本概念,然后详细介绍了朴素贝叶斯算法的原理,知道了“朴素”一词的含义及为什么可以通过贝叶斯算法来完成分类任务,最后对朴素贝叶斯算法的具体计算流程进行了总结。

9.2 Word2Vec词向量

在9.1节内容中,我们详细梳理了自然语言处理发展时所经历的3个核心阶段,并且同时提到目前主流的是基于深度学习的语言模型。在本节内容中我们将会介绍第1种基于神经网络的将单词表示为连续向量的自然语言处理技术——Word2Vec。

9.1 自然语言处理介绍

在本节内容中,我们首先介绍了自然语言处理出现的背景和目的;然后简单介绍了什么是语言模型以及语言模型的应用场景;最后以自然语言处理的技术发展为脉络分别介绍了基于规则的语言模型、基于统计的语言模型和基于神经网络的语言模型三者的基本概念和原理。

10.13 GPT-1模型

经过10.2节和10.6节内容的介绍,我们对基于多头注意力机制的网络模型已经有了深刻的认识。根据10.6节内容可知,BERT模型本质上只是一个基于Transformer编码器的网络结构,它通过多层多头注意力机制来对输入序列进行编码并完成后续 …