摘录自公众号「@跟我学机器学习」
确定!Transformer 中 Decoder 真不需要 Padding Mask!
本文从读者实际提问出发,逐行推导 Transformer Decoder 中 self-attention 的 Q/K/V 计算流程与 Attention Mask 矩阵结构,详细分析 key padding mask 是否真的可以省略,并通过 PyTorch nn.MultiheadAttention 与 torch.nn.Transformer 的源码验 …
从编码到信息熵、交叉熵与KL散度,直观理解!
本文是深度学习损失函数基础教程,从「如何用尽量少的 0 和 1 编码世界信息」这一直觉出发,逐步推导出信息熵 Entropy、交叉熵 Cross Entropy、KL 散度 KL Divergence 的数学含义与相互关系,并通过二分类、多分类、Transformer 语言建模等典型场景解释为什么 CrossEntropyLoss 是分类任务标配、为什么 …
LangGraph Runtime 是什么?一文讲清Runtime与Context!
本文围绕 LangGraph v0.6 引入的 Runtime 机制展开,讲清为什么需要把用户 ID、线程 ID、数据库连接等运行环境信息从 State 中剥离出去,系统对比 Runtime、RunnableConfig 与 Context 三者的定位、生命周期与适用场景,并给出 Agent 节点中读取 Runtime 与跨节点共享数据库连接器的实战代码示例 …
彻底搞懂KV Cache大模型推理加速的核心!
本文从 ChatGPT、Claude 等大模型首 Token 慢、其余瞬间输出的现象切入,系统讲清 KV Cache 原理:自回归推理中如何缓存每一层的 Key 与 Value 矩阵并避免每步重算历史 token,以及 PagedAttention、Grouped Query Attention GQA 等关键优化,配合 GPT-2 与 Llama 等模型的 …
什么是深度学习?这篇文章说透了!
本文是深度学习入门科普教程,从机器学习与神经网络的关系讲起,系统讲清深度学习的基本概念、与传统机器学习的差异、深度神经网络 DNN 的层级结构、自动特征提取机制与表达能力来源,并配套图像、语音、NLP 等典型应用示例,帮助零基础读者一次搞懂深度学习是什么、为什么有效以及适用于哪些场景。
随机森林是如何进行特征重要性评估的?
本文系统讲解决策树与随机森林中的特征重要性评估机制,从基尼不纯度减少量推导单棵树的重要性加权计算公式,并扩展到 sklearn 内置的 feature_importances_ 与 Permutation Importance 置换重要性两种常用评估方式,配套 Python 代码示例与结果解读指南,帮助读者正确理解特征重要性数值、合理筛选特征并避免高基数特征 …
全面对比贝叶斯三大算法异同点!附实验结果!
本文是朴素贝叶斯 Naive Bayes 算法对比教程,以贝叶斯定理与条件概率建模为基础,系统比较高斯朴素贝叶斯 Gaussian NB、多项式朴素贝叶斯 Multinomial NB、伯努利朴素贝叶斯 Bernoulli NB 与类别型 Categorical NB 在特征假设、适用数据类型和典型场景上的差异,并配套 sklearn 实战代码与文本分类实验 …