会代入和真正理解之间

看懂一页推导,不等于遇到新问题时知道该用它。矩阵乘法在模型里可以表示投影与混合,梯度告诉参数往哪里改,但具体训练是否稳定,还受数据、尺度、初始化和优化过程影响。我更想把公式和现象对起来:改变一个条件,结果为什么变?

公开的 Learning-Notes 仓库是这条学习线的原始记录。博客只整理一部分问题,不把学习笔记写成原创算法,也不拿“理解了深度学习”这种没有边界的话作结。

后续的阅读方法

每次遇到新模型,我想先标出三个层次:目标函数是什么、结构带来了什么归纳偏置、实验又实际验证了什么。论文里的解释不一定等于机制证明,公式漂亮也不等于部署容易。若能写一个小例子,我会同时保留反例,免得笔记只剩顺利跑通的截图。

当前重点是把 ML、DL、RL 的概念互相接起来,而不是追求覆盖所有术语。读得慢一点,留下能回头修改的线索,比快速收集摘要更适合这个 Garden。

一个会逼我回头看公式的问题

假如训练误差持续下降、验证误差却上升,我不会先背一个“过拟合”的标准答案就结束。数据是不是有重复或泄漏?划分方式是否破坏了时间顺序?模型容量、正则化和优化器各在起什么作用?同一个曲线形状可能对应不同的原因,必须回到数据与实验设置。

这种追问也适用于强化学习:回报变高时,策略是真的完成目标,还是钻了奖励函数的空子?数学笔记如果不能帮助我辨认这些歧义,就只是在积累符号。