返回主页

    • 精选文章
      • 图解 Transformer 入门指南教程
      • 从零玩转 Bert 详解6大下游任务
      • 手把手带你从零构建 ChatGPT
    • 大模型Agent开发(更新中……)
        • 1.1 RAG 提出背景
        • 1.2 RAG 流程概览
        • 2.1 SDK 介绍
        • 2.2 现代大模型中的 SDK
        • 2.3 DashScope 接口体系
        • 2.4 千问大模型接入与使用
        • 3.1 文档加载与标准化
        • 3.2 常见文本切分策略
        • 3.3 向量数据库选择
        • 3.4 Qwen3 Embedding 模型介绍
        • 3.5 语义搜索引擎构建
        • 3.6 Milvus 模块解析
        • 4.1 两步式 RAG 搭建
        • 4.2 Function Calling 概念介绍
        • 4.3 LangChain 中的 Tool 修饰器
        • 4.4 RAG Agent 原理与搭建
        • 4.5 复杂问题拆解与ReAct框架
        • 4.6 RAG 中的两阶段索引
        • 4.7 Qwen3 Reranking 原理与使用
        • 4.8 基于两阶段索引的 RAG Agent
        • 4.9 LangGraph 基本概念介绍
        • 4.10 基于 LangGraph 构建自定义 RAG Agent
        • 5.1 Agent 记忆机制概览
        • 5.2 短期记忆持久化与使用
        • 5.3 短期记忆管理
        • 5.4 拥有短期记忆的 RAG Agent
        • 5.5 长期记忆管理与持久化
        • 5.6 从零实现 Mini ChatGPT 助手
        • 5.7 pgvector 配置安装
        • 5.8 长期记忆检索与遗忘
        • 5.9 基于 LangGraph 的Mini ChatGPT 助手
        • 5.10 使用 create_agent 搭建 Mini ChatGPT
    • 深度学习
      • 目录思维导图
        • 1.1 深度学习的发展阶段
        • 1.2 深度学习中的关键人物
        • 1.3 深度学习框架介绍
        • 2.1 体系结构介绍
        • 2.2 深度学习环境安装
        • 2.3 开发环境安装配置
        • 3.1 线性回归
        • 3.2 线性回归简洁实现
        • 3.3 梯度下降与反向传播
        • 3.4 从零实现回归模型
        • 3.5 从逻辑回归到Softmax回归
        • 3.6 Softmax回归简洁实现
        • 3.7 从零实现分类模型
        • 3.8 回归模型评估指标
        • 3.9 分类模型评估指标
        • 3.10 过拟合与正则化
        • 3.11 超参数与交叉验证
        • 3.12 激活函数
        • 3.13 多标签分类
        • 4.1 卷积的概念
        • 4.2 卷积的计算过程
        • 4.3 填充和池化
        • 4.4 LeNet5网络
        • 4.5 AlexNet网络
        • 4.6 VGG网络
        • 4.7 NIN网络
        • 4.8 GoogLeNet网络
        • 4.9 ResNet网络
        • 4.10 DenseNet网络
        • 5.1 参数及日志管理
        • 5.2 Tensorboard可视化
        • 5.3 模型的保存与复用
        • 5.4 模型的迁移学习
        • 5.5 开源模型复用
        • 5.6 多GPU训练
        • 5.7 数据预处理与缓存
        • 6.1 学习率调度器
        • 6.2 梯度裁剪
        • 6.3 批归一化
        • 6.4 层归一化
        • 6.5 组归一化
        • 6.6 动量法
        • 6.7 AdaGrad算法
        • 6.8 AdaDelta算法
        • 6.9 Adam算法
        • 6.10 初始化方法
        • 7.1 RNN网络
        • 7.2 时序数据
        • 7.3 LSTM网络
        • 7.4 GRU网络
        • 7.5 BiRNN网络
        • 7.6 CharRNN网络
        • 8.1 TextCNN网络
        • 8.2 TextRNN网络
        • 8.3 CNN-RNN网络
        • 8.4 ConvLSTM网络
        • 8.5 3DCNN网络
        • 8.6 STResNet网络
        • 9.1 自然语言处理介绍
        • 9.2 Word2Vec词向量
        • 9.3 Word2Vec训练与使用
        • 9.4 GloVe词向量
        • 9.5 词向量的微调使用
        • 9.6 fastText网络
        • 9.7 Seq2Seq网络
        • 9.8 序列模型评价指标
        • 9.9 NMT网络
        • 9.10 注意力机制
        • 9.11 含注意力的NMT网络
        • 9.12 含注意力的RNN网络
        • 10.1 ELMo网络
        • 10.2 Transformer网络
        • 10.3 Transformer结构
        • 10.4 Transformer实现
        • 10.5 Transformer对联模型
        • 10.6 BERT网络
        • 10.7 从零实现BERT
        • 10.8 BERT文本分类模型
        • 10.9 BERT问题选择模型
        • 10.10 BERT问题回答模型
        • 10.11 BERT命名体识别模型
        • 10.12 BERT从零训练
        • 10.13 GPT-1模型
        • 10.14 GPT-2与GPT-3模型
        • 10.15 基于GPT-2的中文预训练模型
        • 10.16 InstructGPT与ChatGPT
        • 10.17 ChatGPT与提示词工程
        • 10.18 百川大模型使用
        • 10.19 百川大模型实现
        • 10.20 GPT-4与GPTs使用
    • 机器学习
      • 目录思维导图
        • 1.1 安装使用Conda
        • 1.2 开发环境安装配置
        • 2.1 模型的建立与求解
        • 2.2 多变量线性回归
        • 2.3 多项式回归
        • 2.4 回归模型评估
        • 2.5 梯度下降
        • 2.6 正态分布
        • 2.7 目标函数推导
        • 3.1 模型的建立与求解
        • 3.2 多分类任务
        • 3.3 常见的分类评估指标
        • 3.4 目标函数推导
        • 4.1 基本概念
        • 4.2 特征标准化
        • 4.3 过拟合
        • 4.4 正则化
        • 4.5 偏差、方差与交叉验证
        • 4.6 实例分析手写体识别
        • 5.1 K近邻思想
        • 5.2 K近邻原理
        • 5.3 sklearn接口与示例代码
        • 5.4 kd树构建与搜索
        • 5.5 从零实现K近邻
        • 6.1 词袋模型
        • 6 .2 基于K近邻算法的垃圾邮件分类
        • 6.3 考虑权重的词袋模型
        • 6.4 词云图
        • 7.1 朴素贝叶斯算法
        • 7.2 贝叶斯估计
        • 7.3 朴素贝叶斯实现
        • 7.4 多项式朴素贝叶斯原理与实现
        • 7.5 高斯朴素贝叶斯原理与实现
        • 8.1 决策树的基本思想
        • 8.2 决策树建模与可视化
        • 8.3 决策树生成之ID3与C4.5
        • 8.4 决策树剪枝过程
        • 8.5 从零实现ID3与C4.5算法
        • 8.6 连续型特征变量下决策树实现
        • 8.7 CART生成与剪枝算法
        • 8.8 从零实现CART算法及剪枝示例
        • 9.1 集成学习算法
        • 9.2 随机森林
        • 9.3 泰坦尼克号生还预测
        • 9.4 AdaBoost原理与实现
        • 9.5 MultiAdaBoost原理与实现
        • 9.6 Gradient Boost 原理与实现
        • 10.1 SVM思想
        • 10.2 SVM线性不可分
        • 10.3 SVM原理
        • 10.4 SVM中的软间隔
        • 10.5 拉格朗日乘数法
        • 10.6 对偶性与KKT条件
        • 10.7 SVM优化问题
        • 10.8 SVM核函数原理
        • 10.9 SMO算法求解SVM
        • 10.10 从零实现SVM分类算法
        • 11.1 聚类算法的思想
        • 11.2 Kmeans聚类算法
        • 11.3 Kmeans算法求解
        • 11.4 从零实现Kmeans聚类算法
        • 11.5 Kmeans++聚类算法
        • 11.6 聚类外部评价指标
        • 11.7 加权Kmeans聚类算法
        • 11.8 聚类内部评价指标
        • 11.9 聚类K值选取与分析
        • 11.10 基于密度的聚类算法
        • 11.11 基于层次的聚类算法
        • 12.1 主成分分析
        • 12.2 基于核函数的主成分分析
        • 13.1 Self-Training 自训练算法
        • 13.2 Label Propagation算法
        • 13.3 Label Spreading 算法

    精选文章


    摘录自公众号「@跟我学机器学习」


    2026年7月26日更新于 2026年7月26日2 分钟阅读

    为什么大模型损失函数采用交叉熵而不是 MSE?反直觉梯度实验告诉你答案

    本文是面向深度学习与 LLM 入门读者的损失函数科普教程,从反向传播梯度推导的角度系统对比 Softmax+交叉熵、Sigmoid+交叉熵、Softmax+MSE、Sigmoid+MSE 四种分类损失组合。讲清「为什么分类模型不能用 MSE」的根因:Softmax+MSE 的反向梯度被 softmax 导数拖累,预测越自信梯度越小,导致学习停滞;而 …

    2026年7月26日更新于 2026年7月26日6 分钟阅读

    LLaMA 2 奖励模型样本构建与训练流程:为什么需要两个 RM(Helpfulness + Safety)

    本文是奖励模型与 RLHF 系列工程实现第一篇,详细讲清 LLaMA 2 中奖励模型的完整训练流程与代码实现。从 LLaMA 2 整体训练链路(自监督预训练 → SFT → 双奖励模型 RLHF)出发,重点介绍 LLaMA 2 同时训练两个奖励模型的工程做法:一个用于让回答更符合人类偏好(Helpfulness),一个用于让输出更符合安全规范 …

    2026年7月26日更新于 2026年7月26日4 分钟阅读

    OpenAI 的三篇论文告诉你大模型中奖励模型的变迁过程

    本文是奖励模型与 RLHF 系列正文第二篇,详细讲清 RLHF 中奖励模型目标函数 ℓ(θ)=-logσ(r_θ(x,y_w)-r_θ(x,y_l)) 的完整推导逻辑。从「为什么不能用绝对分数做监督」的标注尺度问题切入,介绍成对比较(pairwise comparison)+ Bradley-Terry 排序建模思路;并以 OpenAI 三篇经典论文 …

    2026年7月26日更新于 2026年7月26日3 分钟阅读

    到底是谁提出了大模型中的对齐问题?原来并不是出自 OpenAI!

    本文是奖励模型与 RLHF 系列正文第一篇,反直觉点出大模型对齐问题并非由 OpenAI 首先提出,而是源自 DeepMind 2018 年的 Agent Alignment Problem 研究。系统讲清从 Agent Alignment 到 InstructGPT、LLaMA 2 奖励模型训练的完整演进路径:用户反馈数据 → 学习 reward …

    2026年7月26日更新于 2026年7月26日3 分钟阅读

    从第一性原理看 GPT 系列模型:LLM 起源、奖励模型与 RLHF

    本文是面向大模型入门读者的 LLM 演进科普教程,从「为什么大模型能取得颠覆式效果」这一问题出发,系统梳理 GPT 系列模型从 GPT-1(0.117B)→ GPT-2(1.5B)→ GPT-3(175B)→ InstructGPT(RLHF 对齐)→ LLaMA 2 的完整范式变迁,覆盖 Transformer 架构、参数规模 Scaling Law、奖励 …

    2026年7月26日更新于 2026年7月26日4 分钟阅读

    奖励模型中的核心思想 Bradley-Terry 模型

    本文是奖励模型与 RLHF 系列的数学前置篇,系统讲清 InstructGPT、LLaMA 2/3、GPT-4 奖励模型目标函数的数学来源 Bradley-Terry 模型。从「成对比较无法直接打分」的直觉问题出发,推导 P(i>j)=π_i/(π_i+π_j) 的成对胜率公式,并通过足球排名 / 饮料对比等具体示例展示最大似然估计如何恢复潜在能力参数 …

    2026年7月26日更新于 2026年7月26日1 分钟阅读

    看图秒懂自监督、有监督、无监督到底有什么区别?

    本文是面向大模型入门读者的基础概念科普教程,用对比表 + 图示方式一次讲清自监督学习 Self-Supervised、有监督学习 Supervised、无监督学习 Unsupervised 与半监督学习 Semi-Supervised 之间的本质区别。自监督学习的「监督信号」并非人工标注,而是通过 pretext task(如 MLM 掩码预测、NSP 下句 …

    • ← 上一页
    • 1
    • 2
    • 3
    • 4
    • 下一页 →
    专题文章 Forward
    • 术语百科
    • 代码实现
    • 名校公开课
    • 开发中……