笃行
首页
个人 & 心法
互联网/硬件后台
游戏基础架构
UE 引擎
游戏业务
AI / 大模型
数据结构与算法
机器学习数学
通用基础
GitHub
首页
个人 & 心法
互联网/硬件后台
游戏基础架构
UE 引擎
游戏业务
AI / 大模型
数据结构与算法
机器学习数学
通用基础
GitHub
  • 向量入门

    • 看得见的机器学习数学
    • 向量是什么
    • 向量的加减与数乘
    • 线性组合与张成
  • 矩阵与变换

    • 矩阵是一次变换
    • 矩阵乘法
  • 度量与求解

    • 行列式与面积
    • 解方程组就是倒着走回去
    • 特征向量的直觉
    • 点积与相似度
  • 高维与结构

    • 高维空间的直觉
    • 正交基与投影
    • 秩与低秩
    • 长度与归一化
    • 线性与非线性
  • 概率与信息

    • 概率分布与采样
    • 期望与方差
    • 指数与 softmax
    • 对数与信息量
    • 交叉熵
  • 学习与优化

    • 导数就是坡度
    • 梯度下降
    • 链式法则与反向传播

看得见的机器学习数学(专栏)

这一域讲机器学习和大模型底下那套数学,但讲法和这个站点其余部分完全不同:全程用方格纸、箭头、蛋糕和山坡建立直觉,共 22 个专题,分两大板块。

这个专栏是给谁看的

小学高年级到初中生,以及任何"当年学过、但从来没真的看懂"的人。

  • 不需要任何前置知识——会数格子、会加减乘除就够了
  • 不考试、不刷题:没有面试题、没有复杂度分析、没有一行代码
  • 每个概念都先有能指着说的生活类比,再有图,符号最后才出场

站点其余部分是给准备技术面试的工程师看的;这一域不是。它就是想把一件被符号挡住的漂亮事情讲明白。

为什么值得看这一篇

课本一上来就说"矩阵是 m×n 个数排成的矩形阵列"——这句话没错,但它把最直观的事实藏起来了:

矩阵其实就是"把整张方格纸搬一次家"。

一旦你看见了这件事,行列式、逆矩阵、特征向量全都会变成看得见的东西,而不是要背的公式。再往后,softmax 是"先拉开差距再分蛋糕",交叉熵是"猜错了扣多少分",梯度下降是"蒙着眼睛下山"——大模型底下那套数学,没有一样是必须靠背的。

专题清单

第一板块 · 线性代数(1–14 篇)

向量入门(把"箭头"和"数字"打通)

  • 向量是什么 · 向量的加减与数乘 · 线性组合与张成

矩阵与变换(本专栏的枢纽)

  • 矩阵是一次变换 · 矩阵乘法

度量与求解(能量出来的性质)

  • 行列式与面积 · 解方程组就是倒着走回去 · 特征向量的直觉 · 点积:两个箭头有多顺

高维与结构(把二维直觉推到大模型真正干活的地方)

  • 高维空间的直觉 · 正交基与投影 · 秩与低秩 · 长度与归一化 · 线性与非线性

第二板块 · 概率与优化(15–22 篇)

概率与信息(模型怎么"拿主意"、怎么知道自己错了)

  • 概率分布与采样 · 期望与方差 · 指数与 softmax · 对数与信息量 · 交叉熵

学习与优化(模型到底怎么"学会"的)

  • 导数就是坡度 · 梯度下降 · 链式法则与反向传播

读到哪能看懂什么

这个专栏可以中途停,停在哪儿都是一个完整的成就:

读到你已经能看懂
第 9 篇两段文字"像不像"是怎么算出来的——检索、推荐背后那个"相似度"就是点积
第 14 篇一个大模型算一遍是怎么回事——箭头进来、矩阵搬家、折一下、再搬、再折,中间要比像不像就做点积
第 19 篇模型怎么拿主意、怎么知道自己错了——采样、temperature、top-k/top-p、损失函数、困惑度
第 22 篇模型到底怎么"学会"的——蒙眼下山、学习率、反向传播、梯度消失与爆炸

前 14 篇讲的是模型算一遍;后 8 篇讲的是模型怎么学会。

推荐学习顺序

请按 1 到 22 的顺序读。 这个专栏不是二十二篇独立文章,而是一条链子——每一篇都用到前一篇建立的图和说法:

向量是箭头 → 加减是走路、数乘是拉伸 → 几根箭头能拼出一片范围 → 矩阵是把整张网格搬一次家 → 乘法是连搬两次 → 行列式是面积放大几倍 → 解方程是倒着走回去 → 特征向量是没被拐弯的方向 → 点积是两个箭头有多顺 → 量尺一多大家就都快垂直了 → 换一组量尺看同一件事 → 真正独立的方向有几个 → 先把尺子拉齐再比 → 折一下才能造出弯的 → 一堆可能性怎么分蛋糕 → 平均落在哪、抖得多厉害 → 先拉开差距再摊成一整块 → 越不可能的事发生了越意外 → 猜错该扣多少分 → 导数就是坡度 → 蒙着眼睛往低处走 → 传动比倒着乘回去

第 3 篇末尾那句"坐标 (3,2) 就是 3 个向右 + 2 个向上"是第 4 篇的钥匙;第 6 篇的"面积归零"是第 7 篇"倒不回去"的原因;第 9 篇的"投影"是第 11 篇"换量尺"的算法本体;第 5 篇的"连搬两次还是一次"是第 14 篇"叠一百层还是一层"的直接推论;第 14 篇末尾那句"模型怎么知道该在哪儿折"是第二板块的入口;第 19 篇的"罚分"就是第 21 篇要下的那座山。跳着读会觉得后面几篇突然变难,顺着读会觉得每篇都只多了一点点。

完整有序路径(含时间估算)见 学习路径 · 零基础几何直觉。

如果你会写代码,另有一份「怎么学」

机器学习数学 · 怎么学 提供闪卡优先的学习协议、五级阶梯与一份 2 小时速成课表。

但请注意:那一页面向会写代码的读者,正文含 Python / numpy 代码,不属于本专栏的零基础定位。 本专栏的读者可以完全不看它——上面 22 篇按顺序读完,本来就是完整的。

每篇怎么读

每篇都是同样的骨架:

  1. 场景问题 —— 一个具体的生活困境("你只能说一句话,怎么让同学找到你家?")
  2. 实现方案 —— 概念本体,配图和动画
  3. 为什么这么做 —— 数学家为什么选了这个约定
  4. 为什么别的选择不行 —— 常见的错误直觉,以及它们在哪撞墙(这一节最值得看)
  5. 沉淀结论 + 记忆口诀 —— 能背下来的几句话

第 4 节是特意为零基础读者准备的:很多人学不下去不是因为没看懂正确的说法,而是因为心里那个错误的直觉一直没被戳破。

每篇还配一份闪卡(.cards.md),全是"为什么"型的问题,可以合上正文自测。

一句话记住这二十二篇

向量是箭头,矩阵是搬家,行列式是面积放大几倍,特征向量是没被拐弯的方向,点积是两个箭头有多顺;量尺一多大家就都快垂直,换组量尺只换读数,秩是真正独立的方向有几根,归一化是把尺子拉齐,折一下才能造出弯的;分布是把蛋糕切开、采样是闭眼落一点,期望说重心方差说抖动,softmax 先拉差距再摊成一块,对数问的是翻了多少次,交叉熵是猜错该扣多少分;导数是坡度,梯度下降是蒙眼下山,反向传播是把传动比倒着乘回去。

最近更新: 2026/9/10 11:38
Next
向量是什么