尧图精选

神经网络入门教程:从手写反向传播到搭建语言模型的完整路线

🕒 发布时间:2026/9/5 19:32:10 📁 来源:尧图网络
神经网络入门教程从手写反向传播到搭建语言模型的完整路线【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero你能跑通 PyTorch 的训练循环却说不出loss.backward()背后梯度到底在算什么这正是 Neural Networks: Zero to Hero 想填上的缺口——一套从第一讲就带你手推每一步的系统课程每讲先推数学、再敲代码把神经网络从最底层一步步搭起来。 项目定位仓库很小一份 README加上 lectures 目录里的七个 Jupyter 笔记本。但它解决的问题很明确。多数人是从框架 API 开始学神经网络的会用、不会改这里反过来从标量微积分出发先让你手写一个能训练的微型自动求导引擎再回到 PyTorch 里搭语言模型。和直接啃框架文档相比它多了一条为什么的链路每个 API 背后都垫着你亲手推过的推导。 两大核心系列Micrograd手推反向传播第一讲不讲框架只讲反向传播。课程从最简单的标量运算开始一点点拼出计算图最后手写完成整个训练流程。学完这一讲你能回答训练一步到底在算什么前向怎么算损失、反向怎么算梯度、参数怎么更新。建议先跑通 micrograd 上半场笔记本再读 micrograd 下半场笔记本。Makemore从字符级语言模型一路搭到 Transformer第二讲回到 PyTorch。makemore 第一课笔记本 从最简单的二元bigram字符级模型入手先建立训练、采样、算损失这套语言建模的基本框架。后面几讲依次加入多层感知机MLP 篇笔记本、批归一化BatchNorm 篇笔记本、手工反向传播手推反向传播篇笔记本和类 WaveNet 卷积结构卷积篇笔记本。README 里还排了第 7 讲从零实现 GPT 的计划这条线一路通向现代 Transformer 语言模型。 三步上手法先补数学短板。重点是微积分的链式法则、线性代数的矩阵运算、基础概率。做到求导规则张口就来、矩阵乘法不心算就可以进入下一步。准备工具。装好 Python 和 PyTorch熟悉 Jupyter Notebook 的基本操作。做到能在笔记本里自由读写一个张量并打印出形状就够开工了。按系列顺序推进。先 Micrograd 后 Makemore不要跳。做到能独立复述训练一步的完整流程再开 Makemore 第一课。 学习中的坑与解法梯度忽大忽小、训练跑飞多半不是你的 bug而是深度网络的固有脆弱。第 4 讲专门讲激活值与梯度的统计监控并用批归一化给出第一个现代解法。只看不练看时都懂作者自己强调这一课不是用来看的。卡住时暂停视频对照答案但一定要先自己算完。跳过 micrograd 直接上语言模型最常见的捷径也是最亏的。没有第一讲的标量直觉后面张量级的反向传播会一直隔着一层纱。 工具链一览名称用途Python主要编程语言PyTorch深度学习框架Makemore 系列的主力Jupyter Notebook交互式实验环境所有课程笔记本的载体NumPy科学计算基础库 适合谁不适合谁适合从零起步、想搞懂为什么而不只是怎么调的机器学习新手也适合会调框架但说不清训练细节、想系统补课的开发者。如果你已经能熟练手写并调优 Transformer这套课程的大部分推导对你偏基础可以只挑 makemore 手推反向传播篇 当复习用。最小启动路径就两步克隆仓库git clone https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero然后打开 micrograd 第一课笔记本跟着第一讲把第一个标量节点跑起来。当你能推导出第一个梯度再回头看那些调模型的帖子读法会完全不一样。【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →