youtube video,侧重从头推导神经网络等,口碑极佳,喜欢去黑箱化,taste好; 这本书主要作为增加底层理解和从底层构建和手搓; 甚至大多数集的课程都有引用论文,相当于教你复现,你学完课程还可以看经典论文,以及他推荐的文章; 讲的极好,虽然少部分内容由于语言和知识原因还是要问AI,但总体流畅,夯;
第一集:神经网络基础,手搓简易版神经网络,理解封装和背后的数据流动,最后实现一个类似pytorch的神经网络文件 第二集:bigram,两个字符的语言模型,通过前一个字符预测下一个字符,造英文名字;从概率统计方法到梯度下降方法; 第三集:第二集方法的局限是若要根据前n个小写字母训练那么输入层神经元将达到27^n,无法扩展到更多字符的情境,因此引入embeding,结合第一集mlp模型;
目标是5月份把10集肝完,彻底打通AI原理层,打通transformer;
核心开源贡献!!!我把卡帕西的课程整理成了一本中文教材!
neural network: zero to hero中文教材
本教材定位为配合 Karpathy 视频课程的中文详解教材。它不是为了替代视频,而是为了在你复习时提供一个结构化的文字参考——当你想要快速回顾某个概念的讲解、查看某段代码的实现、或者寻找课后练习资源时,这份教材应该成为你的首选。
已完成 20260614
我最后在最后一集的基础上训练了诗词模型,48M参数,已能看出有对语义的理解,
学完之后的综合评价是这是一个入门llm/nlp的很好的教程,整个教程一以贯之的想教会你怎么制作好的语言模型,相比之下视觉和图像识别方面其实没有涉及,主要围绕语言模型这个核心topic;另外论文夹杂其中的方式是我开始读论文的一个推动和引导,我开始根据自己的project和遇到的问题去让ai检索以及自己主动阅读相关的论文,比如说关于诗词模型的论文,关于有限数据下的超参数选择等等,我开始把arxiv当成像github一样的一个宝库,去找前人研究过的智慧;
about future:
不打算继续学DL或者图像视觉的方向了;
1 训练模型中暴露出的gpu和分布式训练方面的0掌握促使我去学相关底层,如底层的pytorch,triton,算子优化,通信,以及csapp这门课;
2 ai的两条主线我认为是改变参数的训练包括预训练微调lora等等,以及agent的编排,想研究下cc,codex这种代码智能体架构以及记忆,训练方面想探索lora和自进化;
3 about architecture
nanogpt只实现了transformer的decoder,未来可考虑实现完全体transformer;研究其他的模型架构比如世界模型,扩散模型,多模态相关架构;
一本书,比较全,从神经网络,神经元,逻辑回归,到cnn,rnn,lstm,注意力机制均涉及; 黑箱化程度比parpathy高,主要是调用api,pytorch技术栈,不太从底层搓; 这本书作为主教材,跟着这个流程走; 进度:cnn/rnn
coursera网站上的,缺点是短,只包括基本的线性回归和常见激活函数,主要用numpy,也比较清楚,难度算比较低的,可以入门用,还有优点是作业和题目比较完备,适合去练习检验,且视频比较短;入门资源; 进度:已做完;
这个没学,但是偏应用和工程方向了,适合先把底层打通再学; 进度:0