摘录自公众号「@跟我学机器学习」
为什么大模型损失函数采用交叉熵而不是 MSE?反直觉梯度实验告诉你答案
本文是面向深度学习与 LLM 入门读者的损失函数科普教程,从反向传播梯度推导的角度系统对比 Softmax+交叉熵、Sigmoid+交叉熵、Softmax+MSE、Sigmoid+MSE 四种分类损失组合。讲清「为什么分类模型不能用 MSE」的根因:Softmax+MSE 的反向梯度被 softmax 导数拖累,预测越自信梯度越小,导致学习停滞;而 …
LLaMA 2 奖励模型样本构建与训练流程:为什么需要两个 RM(Helpfulness + Safety)
本文是奖励模型与 RLHF 系列工程实现第一篇,详细讲清 LLaMA 2 中奖励模型的完整训练流程与代码实现。从 LLaMA 2 整体训练链路(自监督预训练 → SFT → 双奖励模型 RLHF)出发,重点介绍 LLaMA 2 同时训练两个奖励模型的工程做法:一个用于让回答更符合人类偏好(Helpfulness),一个用于让输出更符合安全规范 …
OpenAI 的三篇论文告诉你大模型中奖励模型的变迁过程
本文是奖励模型与 RLHF 系列正文第二篇,详细讲清 RLHF 中奖励模型目标函数 ℓ(θ)=-logσ(r_θ(x,y_w)-r_θ(x,y_l)) 的完整推导逻辑。从「为什么不能用绝对分数做监督」的标注尺度问题切入,介绍成对比较(pairwise comparison)+ Bradley-Terry 排序建模思路;并以 OpenAI 三篇经典论文 …
到底是谁提出了大模型中的对齐问题?原来并不是出自 OpenAI!
本文是奖励模型与 RLHF 系列正文第一篇,反直觉点出大模型对齐问题并非由 OpenAI 首先提出,而是源自 DeepMind 2018 年的 Agent Alignment Problem 研究。系统讲清从 Agent Alignment 到 InstructGPT、LLaMA 2 奖励模型训练的完整演进路径:用户反馈数据 → 学习 reward …
从第一性原理看 GPT 系列模型:LLM 起源、奖励模型与 RLHF
本文是面向大模型入门读者的 LLM 演进科普教程,从「为什么大模型能取得颠覆式效果」这一问题出发,系统梳理 GPT 系列模型从 GPT-1(0.117B)→ GPT-2(1.5B)→ GPT-3(175B)→ InstructGPT(RLHF 对齐)→ LLaMA 2 的完整范式变迁,覆盖 Transformer 架构、参数规模 Scaling Law、奖励 …
奖励模型中的核心思想 Bradley-Terry 模型
本文是奖励模型与 RLHF 系列的数学前置篇,系统讲清 InstructGPT、LLaMA 2/3、GPT-4 奖励模型目标函数的数学来源 Bradley-Terry 模型。从「成对比较无法直接打分」的直觉问题出发,推导 P(i>j)=π_i/(π_i+π_j) 的成对胜率公式,并通过足球排名 / 饮料对比等具体示例展示最大似然估计如何恢复潜在能力参数 …
看图秒懂自监督、有监督、无监督到底有什么区别?
本文是面向大模型入门读者的基础概念科普教程,用对比表 + 图示方式一次讲清自监督学习 Self-Supervised、有监督学习 Supervised、无监督学习 Unsupervised 与半监督学习 Semi-Supervised 之间的本质区别。自监督学习的「监督信号」并非人工标注,而是通过 pretext task(如 MLM 掩码预测、NSP 下句 …