这是一个围绕大模型开发整理的学习仓库,内容覆盖机器学习基础、LLM 微调、RAG、推理加速、AI Infra、Agent 与项目实践等方向。
仓库内资料以 docx、md、zip 为主,适合按主题查阅,也适合按学习路线逐步推进。
- 想系统补齐大模型开发知识的初学者
- 想从概念理解过渡到项目实践的同学
- 想按专题补课,例如 RAG、Agent、微调、推理加速的人
如果你还没有完整学习过大模型开发,建议按下面顺序推进:
- 先看根目录的前言资料,明确学习目标和整体方向
- 学习机器学习内容 ,补齐基础算法、神经网络、训练常用框架
- 学习大模型微调内容 ,建立对预训练、SFT、RLHF、DPO 的整体认识
- 学习RAG内容 ,理解检索增强生成的原理、搭建方式与优化思路
- 学习LLM开源框架内容 ,补齐
FastAPI、LangChain、LangGraph等开发工具链 - 学习agent和项目内容 ,结合项目资料理解 AI 应用落地方式
- 继续看大模型推理加速内容 和 AI infra内容 ,补齐工程与部署视角
- 最后结合工作流内容 做流程化、产品化思考
如果你已经有一定基础,也可以直接按专题跳读。
前言(在拿到教程之后先看看这个然后搞明白要干什么).docx适合最开始阅读,用来明确整个学习目标与仓库使用方式。后记.docx适合在完成一轮学习后回看,帮助复盘。在线开源笔记(很卡,很容易进不去,写的还算不错).txt可作为补充参考资料。
2. 机器学习内容
这一部分用于补基础,建议在正式进入 LLM 之前先过一遍。
机器学习算法.docx:传统机器学习相关基础神经网络模型.docx:神经网络与深度学习核心概念在训练时候用的一些框架.docx:训练过程常见框架与工具
3. 大模型微调内容
这是仓库里非常重要的一部分,建议重点阅读。
- 基础大模型微调步骤.md 从预训练、SFT、RLHF、DPO 等角度系统梳理大模型训练与微调流程。
大模型微调的全链路.docx适合补充理解完整流程。大模型训练架构系统.docx偏训练系统与工程架构。pipeline是什么?.docx适合补齐训练/数据处理中的流程概念。
4. RAG内容
这一部分适合想做知识库问答、企业检索应用、私有数据增强问答的人。
RAG原理是什么?怎么优化?(现在必看).docx重点理解 RAG 的原理与优化方向。怎么搭建一个rag.docx偏实践搭建。那么向量数据库是什么?怎么用?.docx补充向量数据库相关知识。
5. LLM开源框架内容
这部分是开发工具链入口,适合与 RAG、Agent、项目实践结合阅读。
6. agent和项目内容
这部分更偏应用层和项目层,适合在前面几部分打完基础后阅读。
agent的学习路线.docx适合作为 Agent 方向学习入口。ai应用开发(全是概念,必看,都去搜来看懂就行).docx偏应用开发概念梳理。怎么搭建一个RAG?.docx结合应用视角再次理解 RAG。- 多个
.zip项目资料 适合上手实战,例如MedicalGPT-main、metaGPT的agent项目、迷你mcp、迷你rag项目等。
7. 大模型推理加速内容
适合在掌握基础训练与应用后继续学习推理优化。
KVCache和Pageattendtion.docx主要围绕推理加速中的核心概念展开。
8. AI infra内容
这一部分偏底层基础设施和扩展方向。
扩散模型.docx用于补齐生成式模型中的扩散模型方向。AI infra番外:具身智能.docx作为扩展阅读,了解具身智能等相关方向。
9. 工作流内容
这部分偏实际业务流程和工具化理解。
低代码.docx适合与 AI 应用流程设计一起看。
- 不建议从头到尾机械式通读,优先按“基础 -> 微调 -> RAG -> 框架 -> Agent/项目 -> 推理/Infra”推进
md文件适合优先精读,docx更适合按主题查阅和补充zip项目建议在看完对应概念后再打开,这样更容易看懂- 学习时建议同步输出自己的笔记、流程图和项目复现记录
如果你的目标是尽快具备大模型应用开发能力,可以按下面这条路线走:
- 先看前言资料,明确目标
- 看机器学习基础
- 重点吃透
基础大模型微调步骤.md - 接着看 RAG 三份资料
- 再补
FastAPI、LangChain、LangGraph - 最后上手
agent和项目内容里的项目资料
这样会比单纯堆概念更容易形成完整知识闭环。