🗺️ 内容路线图
这是本项目的完整内容地图。每个 AI 名词按它在知识体系中的位置归类,你既可以从任意节点切入阅读,也可以从最底层一路读到顶层,建立完整认知。
图例:✅ 已完成 ⬜ 待编写
当前进度:58 / 58 进阶 RAG:5 / 5 高效微调:5 / 5 对齐:5 / 5 推理工程:5 / 5 Agent:5 / 5 长上下文:4 / 4 工具与平台:5 / 5 评估与监控:5 / 5 多模态:5 / 5。目标每周更新 2~3 个。想认领某个 ⬜ 词条?读 贡献指南 后开 Issue 说明即可。
🏗️ 模型架构与训练
基础架构
- ✅ Transformer -- 现代大模型的底座
- ⬜ 自注意力 Self-Attention -- Transformer 的核心机制
- ✅ 多头注意力 Multi-Head Attention -- 为什么"多头"比"单头"强
- ✅ 编码器-解码器 Encoder-Decoder -- 三种架构的分工
- ✅ BERT(仅编码器) -- 理解型任务的代表
- ✅ GPT / LLaMA(仅解码器) -- 生成型任务的代表
- ✅ 传统模型:CNN / RNN / LSTM -- Transformer 之前的世界
- ✅ 模型组件:参数 / 层 / 激活函数 -- ReLU、GeLU 为什么长那样
训练范式
- ✅ 预训练 Pre-training -- 先在海量数据上"读万卷书"
- ✅ 微调 Fine-tuning -- 再针对任务"练一套拳"
- ✅ 指令微调 Instruction Tuning -- 让模型学会听人话
- ✅ RLHF -- 用人类反馈做强化学习
- ✅ 迁移学习 Transfer Learning -- 为什么预训练能迁移
- ✅ 损失函数 Loss Function -- 模型怎么知道自己错没错
- ✅ 优化器(Adam / AdamW) -- 怎么沿着梯度下山
- ✅ 过拟合 & 正则化 -- Dropout / 权重衰减为什么有效
⚡ 推理与生成
- ✅ 自回归生成 Autoregressive -- 一个 token 一个 token 往外蹦
- ⬜ 解码策略
- ✅ 温度 Temperature -- 一个参数怎么调节"创造力"
- ✅ 幻觉 Hallucination -- 模型为什么一本正经胡说八道
🗜️ 模型压缩与加速
- ✅ 量化(INT8 / INT4) -- 用更少比特存权重
- ✅ 知识蒸馏 Knowledge Distillation -- 大模型教小模型
- ✅ 剪枝 Pruning -- 删掉没用的连接
- ✅ 推理引擎(vLLM / TensorRT-LLM) -- 生产部署的加速器
🔤 数据表示与编码
文本预处理
- ✅ 分词器 Tokenizer -- BPE / WordPiece / SentencePiece
- ✅ Token 词元 -- 模型的最小处理单位
- ✅ 分块 Chunking -- 长文档怎么切
向量表示
- ✅ Embedding - 嵌入 -- 把语义塞进高维坐标系
- ✅ 高维向量 -- 维度灾难与维度的几何意义
- ✅ 稠密向量 vs 稀疏向量
- ✅ 位置编码 Positional Encoding -- Transformer 怎么知道顺序
- ✅ 多模态 Embedding(CLIP) -- 图文对齐到同一空间
上下文管理
- ✅ 上下文窗口 Context Window -- 模型的"短期记忆"边界
🔍 检索与索引
关键词检索
- ✅ 倒排索引 Inverted Index
- ✅ TF-IDF
- ✅ BM25 -- 关键词检索的工业标准
向量检索
- ✅ KNN / ANN -- 精确 vs 近似最近邻
- ✅ 索引算法:HNSW / IVF / PQ / LSH
- ✅ 算法库:Faiss / ScaNN / Annoy
- ✅ 向量数据库 -- Milvus / Pinecone / Weaviate / Qdrant / Chroma
神经检索模型
- ✅ 双塔模型 Two-Tower -- 稠密召回主力
- ✅ 交叉编码器 Cross-encoder -- 精排主力
- ✅ ColBERT 迟交互 -- 召回与精排的折中
排序与融合
- ✅ 召回 vs 重排序 -- 多阶段排序的分工
- ✅ Top-K 检索
- ✅ 混合搜索 Hybrid Search -- 关键词 + 向量
- ✅ RRF 倒数排名融合
- ✅ 加权重排 Weighted Fusion
- ✅ 学习排序 LTR
📊 评估与应用
评估指标
- ✅ Hit Rate
- ✅ Recall@K / Precision@K
- ✅ MRR 平均倒数排名
- ✅ NDCG 归一化折损累计增益
应用框架
- ✅ RAG - 检索增强生成 -- 给大模型发一本翻到目标页的参考书
- ✅ 知识库 Knowledge Base -- RAG 的知识存储与管理
🚀 进阶专题
进阶专题是基础 58 词条之外的增量系列,按主题分批扩展。每篇都假设你已读过相关基础词条。
进阶 RAG
聚焦 RAG 范式的演进与变体。假设已读 RAG 和 知识库。
- ✅ GraphRAG 图谱增强检索 -- 知识图谱 + 社区聚类,专治全局性问题
- ✅ Self-RAG 自反思检索 -- 反思 token 让 LLM 自决检索与评价
- ✅ Corrective RAG 检索纠错 -- 即插即用的检索质检 + web 兜底
- ✅ Agentic RAG 智能体检索 -- 多轮自主推理循环,专治复杂问题
- ✅ Multi-modal RAG 多模态检索 -- 跨模态对齐,图文混排检索
高效微调 PEFT
聚焦参数高效微调方法。假设已读 微调 Fine-tuning 和 量化。
- ✅ LoRA 低秩适配 -- 冻结基座 + 训低秩 $BA$,事实标准
- ✅ QLoRA 量化低秩适配 -- 4bit NF4 + LoRA,单卡微调 70B
- ✅ Adapter Tuning 适配器微调 -- PEFT 老前辈,瓶颈模块
- ✅ Prefix/Prompt Tuning 前缀调优 -- 只调软提示向量,最省参数
- ✅ PEFT 总览与选型 -- 全参 / LoRA / QLoRA / Adapter / Prefix / Prompt 怎么选
对齐 Alignment
聚焦从监督微调到偏好优化的完整对齐链路。假设已读 RLHF 和 指令微调。
- ✅ SFT 监督微调 -- 对齐起点,指令-回答对 + 仅回答 loss
- ✅ Reward Model 奖励模型 -- 偏好对 + Bradley-Terry,RLHF 的打分器
- ✅ PPO 近端策略优化 -- RLHF 第三阶段,4 模型同框,效果最好
- ✅ DPO 直接偏好优化 -- 绕开 RM 和 PPO,2 模型监督学习
- ✅ KTO / SimPO 变体 -- DPO 之后:二元反馈 / 去 ref / 修过对齐
推理工程
聚焦 LLM 部署侧的加速技术。假设已读 量化 和 推理优化。
- ✅ KV-Cache 键值缓存 -- 避免重复算 K/V,自回归推理的基础优化
- ✅ PagedAttention 分页注意力 -- 按需分页 KV-Cache,vLLM 的内存管理革命
- ✅ Continuous Batching 连续批处理 -- iteration 级动态拼 batch,GPU 利用率 30%→90%
- ✅ Speculative Decoding 推测解码 -- 小模型草拟、大模型并行批改,无损降延迟 2-3x
- ✅ 量化推理算法 GPTQ/AWQ -- 4bit 权重量化,70B 单卡可跑,精度损失 <1%
Agent
聚焦 LLM Agent 系统的核心范式。假设已读 Agentic RAG 和 推理引擎。
- ✅ ReAct 推理与行动 -- Agent 奠基范式,Thought-Action-Observation 交错循环
- ✅ Function Calling 函数调用 -- 结构化工具调用,ReAct 的工程化升级
- ✅ Planning 任务规划 -- Plan-and-Solve / ToT / LATS / Re-plan,先规划再执行
- ✅ Memory 记忆机制 -- 短期+长期+反思,MemGPT 式分层管理
- ✅ Multi-Agent 多智能体 -- 角色分工协作,AutoGen/MetaGPT/CAMEL
长上下文
聚焦 LLM 处理超长序列的能力与局限。假设已读 RAG 和 推理引擎。
- ✅ RoPE 旋转位置编码 -- 用旋转矩阵编码相对位置,LLaMA/Qwen/Mistral 的标准选择
- ✅ Ring Attention 环注意力 -- 多 GPU 环形序列并行,百万 token 上下文不再遥不可及
- ✅ Lost in the Middle 中间迷失 -- LLM 注意力 U 型曲线,中间的痛与缓解策略
- ✅ Long-context RAG -- RAG + Long-context 混合范式,取二者之长
工具与平台
聚焦 LLM 工程师的每日工具箱。假设已读 推理引擎 和 RAG。
- ✅ vLLM 推理引擎 -- PagedAttention + Continuous Batching 五大支柱,生产推理首选
- ✅ SGLang 结构生成语言 -- RadixAttention + FSM 约束,结构化生成利器
- ✅ Prompt Engineering 提示工程 -- Few-shot/CoT/Self-Consistency,把模型当推理引擎
- ✅ HuggingFace 生态 -- Transformers/Datasets/Hub/TRL/PEFT,开源 AI 基础设施
- ✅ Ollama 与本地推理 -- llama.cpp + GGUF,个人设备跑 LLM
评估与监控
聚焦 LLM 应用的质量评估与生产可观测性。假设已读 Perplexity 概念 和 RAG。
- ✅ Perplexity 困惑度 -- 指数化交叉熵,语言模型的体温计
- ✅ BLEU / ROUGE 文本质量 -- N-gram 重叠度,字面匹配的经典与局限
- ✅ MT-Bench & LLM-as-Judge -- GPT-4 当裁判,LLM 评估的现代范式
- ✅ RAGAS RAG 评估框架 -- Faithfulness + Precision + Recall,RAG 质量导航系统
- ✅ 可观测性与追踪 -- Trace + Eval + Monitor + Cost,从能跑到可控
多模态
聚焦视觉和语音 AI 的关键技术。假设已读 CLIP 和 Transformer。
- ✅ ViT 视觉 Transformer -- 图像切 patch 纯 Transformer 分类,大一统架构的第一步
- ✅ 扩散模型原理 -- 前向加噪+反向去噪,Stable Diffusion 的底层基础
- ✅ Stable Diffusion 稳定扩散 -- VAE 压缩+隐空间扩散,消费级 GPU 文生图
- ✅ 多模态 LLM -- ViT+Projector+LLM,让 LLM 睁开眼睛看世界
- ✅ 语音识别与合成 -- Whisper ASR + VALL-E TTS,让 AI 能听会说
阅读建议
这棵树本身也暗示了学习路径:
- 入门:先读 Embedding 和 RAG,理解当下最火的应用栈是怎么搭起来的。
- 打地基:回头补 Transformer / 自注意力 / 预训练,搞清楚生成模型从哪来。
- 做工程:再看 量化 / 推理引擎 / 向量数据库,知道怎么把模型真正部署起来。
每个词条都有 L1~L5 五层,按需取用即可。