条件概率#
术语解释#
条件概率(Conditional Probability) 是概率论中的核心概念,表示在已知某一事件发生的前提下,另一事件发生的可能性。 具体地,条件概率 $P(B|A)$ 表示在事件 $A$ 已经发生的条件下,事件 $B$ 发生的概率。根据贝叶斯公式,其基本定义式为:
$$ P(B|A) = \frac{P(AB)}{P(A)} $$或者通过先验概率与条件概率的组合表示为:
$$ P(B|A) = \frac{P(B)P(A|B)}{P(A)} $$条件概率是许多现代 AI 算法的底层数学支撑:
-
朴素贝叶斯(Naive Bayes): 在该算法中,我们需要计算后验概率 $P(Y=c_k|X=x)$,即在已知特征 $x$ 的条件下,样本属于类别 $c_k$ 的概率。
-
语言模型(Language Model): 语言模型的本质就是利用条件概率来预测序列。对于长度为 $T$ 的文本序列,其联合概率可以分解为一系列条件概率的乘积 $P(x^{(1)},...,x^{(T)}) = \prod_{t=1}^T P(x^{(t)}|x^{(t-1)},...,x^{(1)})$。$N$-gram 模型则通过马尔可夫假设简化条件概率,例如 2-gram 只考虑前一个词的条件概率 $P(x^{(t)}|x^{(t-1)})$。
-
Word2Vec 词向量:
CBOW 模型的目标是最大化给定上下文词时中心词出现的条件概率$P(w_t|w_{t-m},...,w_{t+m})$。
CBOW原理示意图 Skip-gram 模型则相反,目标是最大化给定中心词时上下文词出现的条件概率。
Skip-gram原理示意图 -
Seq2Seq 架构: 在解码(Decoding)过程中,模型需要最大化条件概率 $p(y_t|\mathcal{c}, y_1, ..., y_{t-1})$,即根据上下文向量 $\mathcal{c}$ 和已生成的序列预测当前时刻的输出。
直观示例#
-
预测联想:在搜索引擎中输入 “Natural Language”,系统自动弹出 “Processing” 或 “Understanding”,其背后逻辑就是计算并在概率分布中选择最大的条件概率结果。
搜索引擎关键词联想 -
特征评估:在信用卡审批示例中,可以计算“有房”条件下“审批通过”的条件概率 $P(Y=1|X^{(2)}=1)$ 来评估该特征的分类能力。相关内容可参见 「7.1 朴素贝叶斯原理:条件概率与分类模型基础」 。
相关术语#
-
后验概率
-
条件概率
-
条件熵
-
朴素贝叶斯