Skip to content

Repository files navigation

deep-learning 学习杂记 by Siri

学习资料整合

1. karpathy

youtube video,侧重从头推导神经网络等,口碑极佳,喜欢去黑箱化,taste好; 这本书主要作为增加底层理解和从底层构建和手搓; 甚至大多数集的课程都有引用论文,相当于教你复现,你学完课程还可以看经典论文,以及他推荐的文章; 讲的极好,虽然少部分内容由于语言和知识原因还是要问AI,但总体流畅,夯;

第一集:神经网络基础,手搓简易版神经网络,理解封装和背后的数据流动,最后实现一个类似pytorch的神经网络文件 第二集:bigram,两个字符的语言模型,通过前一个字符预测下一个字符,造英文名字;从概率统计方法到梯度下降方法; 第三集:第二集方法的局限是若要根据前n个小写字母训练那么输入层神经元将达到27^n,无法扩展到更多字符的情境,因此引入embeding,结合第一集mlp模型;

目标是5月份把10集肝完,彻底打通AI原理层,打通transformer;

核心开源贡献!!!我把卡帕西的课程整理成了一本中文教材!

neural network: zero to hero中文教材

本教材定位为配合 Karpathy 视频课程的中文详解教材。它不是为了替代视频,而是为了在你复习时提供一个结构化的文字参考——当你想要快速回顾某个概念的讲解、查看某段代码的实现、或者寻找课后练习资源时,这份教材应该成为你的首选。


已完成 20260614

我最后在最后一集的基础上训练了诗词模型,48M参数,已能看出有对语义的理解,

本人亲自训练的诗词模型

学完之后的综合评价是这是一个入门llm/nlp的很好的教程,整个教程一以贯之的想教会你怎么制作好的语言模型,相比之下视觉和图像识别方面其实没有涉及,主要围绕语言模型这个核心topic;另外论文夹杂其中的方式是我开始读论文的一个推动和引导,我开始根据自己的project和遇到的问题去让ai检索以及自己主动阅读相关的论文,比如说关于诗词模型的论文,关于有限数据下的超参数选择等等,我开始把arxiv当成像github一样的一个宝库,去找前人研究过的智慧;


about future:

不打算继续学DL或者图像视觉的方向了;

1 训练模型中暴露出的gpu和分布式训练方面的0掌握促使我去学相关底层,如底层的pytorch,triton,算子优化,通信,以及csapp这门课;

2 ai的两条主线我认为是改变参数的训练包括预训练微调lora等等,以及agent的编排,想研究下cc,codex这种代码智能体架构以及记忆,训练方面想探索lora和自进化;

3 about architecture

nanogpt只实现了transformer的decoder,未来可考虑实现完全体transformer;研究其他的模型架构比如世界模型,扩散模型,多模态相关架构;

2. d2l.ai

一本书,比较全,从神经网络,神经元,逻辑回归,到cnn,rnn,lstm,注意力机制均涉及; 黑箱化程度比parpathy高,主要是调用api,pytorch技术栈,不太从底层搓; 这本书作为主教材,跟着这个流程走; 进度:cnn/rnn

3. 吴恩达 deeplearning and nerual network

coursera网站上的,缺点是短,只包括基本的线性回归和常见激活函数,主要用numpy,也比较清楚,难度算比较低的,可以入门用,还有优点是作业和题目比较完备,适合去练习检验,且视频比较短;入门资源; 进度:已做完;

4. fast.ai

这个没学,但是偏应用和工程方向了,适合先把底层打通再学; 进度:0

About

record my process of learning AI ,including route,resource,experience etc

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages