看得见的机器学习数学(专栏)
这一域讲机器学习和大模型底下那套数学,但讲法和这个站点其余部分完全不同:全程用方格纸、箭头、蛋糕和山坡建立直觉,共 22 个专题,分两大板块。
这个专栏是给谁看的
小学高年级到初中生,以及任何"当年学过、但从来没真的看懂"的人。
- 不需要任何前置知识——会数格子、会加减乘除就够了
- 不考试、不刷题:没有面试题、没有复杂度分析、没有一行代码
- 每个概念都先有能指着说的生活类比,再有图,符号最后才出场
站点其余部分是给准备技术面试的工程师看的;这一域不是。它就是想把一件被符号挡住的漂亮事情讲明白。
为什么值得看这一篇
课本一上来就说"矩阵是 m×n 个数排成的矩形阵列"——这句话没错,但它把最直观的事实藏起来了:
矩阵其实就是"把整张方格纸搬一次家"。
一旦你看见了这件事,行列式、逆矩阵、特征向量全都会变成看得见的东西,而不是要背的公式。再往后,softmax 是"先拉开差距再分蛋糕",交叉熵是"猜错了扣多少分",梯度下降是"蒙着眼睛下山"——大模型底下那套数学,没有一样是必须靠背的。
专题清单
第一板块 · 线性代数(1–14 篇)
向量入门(把"箭头"和"数字"打通)
矩阵与变换(本专栏的枢纽)
度量与求解(能量出来的性质)
- 行列式与面积 · 解方程组就是倒着走回去 · 特征向量的直觉 · 点积:两个箭头有多顺
高维与结构(把二维直觉推到大模型真正干活的地方)
第二板块 · 概率与优化(15–22 篇)
概率与信息(模型怎么"拿主意"、怎么知道自己错了)
- 概率分布与采样 · 期望与方差 · 指数与 softmax · 对数与信息量 · 交叉熵
学习与优化(模型到底怎么"学会"的)
读到哪能看懂什么
这个专栏可以中途停,停在哪儿都是一个完整的成就:
| 读到 | 你已经能看懂 |
|---|---|
| 第 9 篇 | 两段文字"像不像"是怎么算出来的——检索、推荐背后那个"相似度"就是点积 |
| 第 14 篇 | 一个大模型算一遍是怎么回事——箭头进来、矩阵搬家、折一下、再搬、再折,中间要比像不像就做点积 |
| 第 19 篇 | 模型怎么拿主意、怎么知道自己错了——采样、temperature、top-k/top-p、损失函数、困惑度 |
| 第 22 篇 | 模型到底怎么"学会"的——蒙眼下山、学习率、反向传播、梯度消失与爆炸 |
前 14 篇讲的是模型算一遍;后 8 篇讲的是模型怎么学会。
推荐学习顺序
请按 1 到 22 的顺序读。 这个专栏不是二十二篇独立文章,而是一条链子——每一篇都用到前一篇建立的图和说法:
向量是箭头 → 加减是走路、数乘是拉伸 → 几根箭头能拼出一片范围 → 矩阵是把整张网格搬一次家 → 乘法是连搬两次 → 行列式是面积放大几倍 → 解方程是倒着走回去 → 特征向量是没被拐弯的方向 → 点积是两个箭头有多顺 → 量尺一多大家就都快垂直了 → 换一组量尺看同一件事 → 真正独立的方向有几个 → 先把尺子拉齐再比 → 折一下才能造出弯的 → 一堆可能性怎么分蛋糕 → 平均落在哪、抖得多厉害 → 先拉开差距再摊成一整块 → 越不可能的事发生了越意外 → 猜错该扣多少分 → 导数就是坡度 → 蒙着眼睛往低处走 → 传动比倒着乘回去
第 3 篇末尾那句"坐标 (3,2) 就是 3 个向右 + 2 个向上"是第 4 篇的钥匙;第 6 篇的"面积归零"是第 7 篇"倒不回去"的原因;第 9 篇的"投影"是第 11 篇"换量尺"的算法本体;第 5 篇的"连搬两次还是一次"是第 14 篇"叠一百层还是一层"的直接推论;第 14 篇末尾那句"模型怎么知道该在哪儿折"是第二板块的入口;第 19 篇的"罚分"就是第 21 篇要下的那座山。跳着读会觉得后面几篇突然变难,顺着读会觉得每篇都只多了一点点。
完整有序路径(含时间估算)见 学习路径 · 零基础几何直觉。
如果你会写代码,另有一份「怎么学」
机器学习数学 · 怎么学 提供闪卡优先的学习协议、五级阶梯与一份 2 小时速成课表。
但请注意:那一页面向会写代码的读者,正文含 Python / numpy 代码,不属于本专栏的零基础定位。 本专栏的读者可以完全不看它——上面 22 篇按顺序读完,本来就是完整的。
每篇怎么读
每篇都是同样的骨架:
- 场景问题 —— 一个具体的生活困境("你只能说一句话,怎么让同学找到你家?")
- 实现方案 —— 概念本体,配图和动画
- 为什么这么做 —— 数学家为什么选了这个约定
- 为什么别的选择不行 —— 常见的错误直觉,以及它们在哪撞墙(这一节最值得看)
- 沉淀结论 + 记忆口诀 —— 能背下来的几句话
第 4 节是特意为零基础读者准备的:很多人学不下去不是因为没看懂正确的说法,而是因为心里那个错误的直觉一直没被戳破。
每篇还配一份闪卡(.cards.md),全是"为什么"型的问题,可以合上正文自测。
一句话记住这二十二篇
向量是箭头,矩阵是搬家,行列式是面积放大几倍,特征向量是没被拐弯的方向,点积是两个箭头有多顺;量尺一多大家就都快垂直,换组量尺只换读数,秩是真正独立的方向有几根,归一化是把尺子拉齐,折一下才能造出弯的;分布是把蛋糕切开、采样是闭眼落一点,期望说重心方差说抖动,softmax 先拉差距再摊成一块,对数问的是翻了多少次,交叉熵是猜错该扣多少分;导数是坡度,梯度下降是蒙眼下山,反向传播是把传动比倒着乘回去。