一、AI基础底座
1.1 人工智能 / 机器学习 / 深度学习
一句话定义: 人工智能(AI)是让机器模拟人类智能的总目标;机器学习(ML)是实现AI的主流方法——让机器从数据中自动学规律;深度学习(DL)是机器学习的一个分支,用多层神经网络处理复杂问题。
通俗类比: 把AI想象成"做一道好菜"这个目标。机器学习是"通过反复试错总结菜谱"的方法论。深度学习则是"用一口特别深的锅,一层一层地炖,最终炖出极其复杂的风味"。
为什么重要: 这三个词经常被混用,但它们是包含关系:AI ⊃ ML ⊃ DL。理解这层关系,你就不会被各种营销话术迷惑——当有人说"我们用了AI",你可以追问:是规则引擎?是传统机器学习?还是深度学习?
| 维度 | 人工智能 | 机器学习 | 深度学习 |
|---|---|---|---|
| 范围 | 最广义的目标 | 实现AI的方法之一 | ML的子集 |
| 典型手段 | 规则、搜索、学习 | 统计模型、决策树、SVM | 多层神经网络 |
| 数据需求 | 可多可少 | 中等 | 通常需要海量数据 |
| 可解释性 | 规则型高 | 中等 | 较低(“黑箱”) |
🔗 逻辑关系: 深度学习是当下大模型的技术根基。没有深度学习的突破,就没有今天的ChatGPT。
1.2 神经网络 / 反向传播 / 梯度下降
一句话定义:
- 神经网络:一种模仿大脑神经元连接方式的计算模型,由大量"节点"分层排列组成。
- 反向传播:神经网络的学习机制——从输出端的错误"倒推"回每一层,告诉每个节点"你该为这个错误负多少责任"。
- 梯度下降:具体的调整策略——沿着"错误减少最快的方向"一小步一小步地修改参数。
通俗类比: 想象你在蒙眼走迷宫。神经网络是迷宫本身的结构;反向传播是"有人从出口喊话告诉你哪条路走错了";梯度下降是"你根据喊话方向,每次只迈一小步,逐步靠近出口"。
为什么重要: 这三者构成了所有深度学习模型训练的底层引擎。无论是图像识别、语音合成还是大语言模型,训练过程本质上都是:前向计算 → 算误差 → 反向传播 → 梯度下降更新参数 → 循环往复。
🔗 逻辑关系: 神经网络是"骨架",反向传播是"反馈信号",梯度下降是"行动策略"。三者缺一不可,共同完成"学习"这件事。
1.3 四种学习范式
一句话定义:
- 监督学习:给模型"带答案的练习题",让它学会从输入映射到输出。
- 无监督学习:只给"没有答案的数据",让模型自己发现数据中的结构和规律。
- 强化学习:让模型在环境中"试错",做对了给奖励,做错了给惩罚,逐步学会最优策略。
- 自监督学习:从数据本身"制造题目和答案"(如遮住一句话的后半段让模型猜),无需人工标注。
通俗类比:
- 监督学习 = 老师批改作业
- 无监督学习 = 把一堆杂乱的照片扔给你,让你自己分类
- 强化学习 = 训练小狗,做对了给零食
- 自监督学习 = 自己给自己出填空题并自己对答案
为什么重要: 大语言模型的预训练阶段用的正是自监督学习(预测下一个Token),而RLHF阶段用的是强化学习。理解这四种范式,你才能看懂大模型训练流程的每一步在做什么。
| 范式 | 是否需要标签 | 典型应用 | 与大模型的关系 |
|---|---|---|---|
| 监督学习 | ✅ | 分类、回归 | 微调阶段(SFT) |
| 无监督学习 | ❌ | 聚类、降维 | 早期NLP探索 |
| 强化学习 | ❌(需奖励信号) | 游戏AI、机器人 | RLHF对齐阶段 |
| 自监督学习 | ❌(自动生成) | 预训练 | LLM预训练的核心 |
🔗 逻辑关系: 自监督学习解决了"海量数据无标注"的瓶颈,是大模型得以诞生的前提;强化学习(RLHF)则是在预训练之后,让模型"更像人"的关键一步。
1.4 过拟合 / 欠拟合 / 泛化能力
一句话定义:
- 过拟合:模型把训练数据"背下来了",包括其中的噪声,导致在新数据上表现很差。
- 欠拟合:模型太简单,连训练数据中的基本规律都没学到。
- 泛化能力:模型在"没见过的数据"上依然表现良好的能力——这是最终目标。
通俗类比: 过拟合像"死记硬背的学生",考试换个题型就不会了;欠拟合像"完全没听课的学生",什么题都不会;泛化能力则是"真正理解了知识,能举一反三"。
为什么重要: 大模型之所以需要海量数据和各种正则化技巧,核心目的就是对抗过拟合、提升泛化能力。一个在训练集上完美但泛化差的模型,在实际应用中毫无价值。
🔗 逻辑关系: 泛化能力是目标,过拟合和欠拟合是需要避免的两个极端。模型复杂度、数据量、训练策略都是在两者之间寻找平衡。
1.5 特征工程 / 嵌入(Embedding)/ 向量空间
一句话定义:
- 特征工程:人工从原始数据中提取、构造对模型有用的"特征"(输入信号)。
- 嵌入(Embedding):把离散的事物(如单词、图片)映射为一组连续的数字(向量),使计算机能"理解"它们的含义。
- 向量空间:所有嵌入向量存在的数学空间,语义相近的事物在这个空间中距离也近。
通俗类比: 特征工程像"厨师手动挑选食材并切配";嵌入像"给每种食材一个GPS坐标";向量空间则是"整张地图"——番茄和土豆的坐标很近(都是蔬菜),而番茄和钢琴的坐标很远。
为什么重要: 在大模型时代,Embedding是万物互联的基础。文字、图片、音频都被编码为向量后,才能在同一个空间中计算相似度、做检索、做生成。RAG(检索增强生成)技术的核心就是Embedding + 向量空间搜索。
🔗 逻辑关系: 特征工程是传统ML时代的核心工作;深度学习(尤其是大模型)让模型"自动学习特征",大幅减少了人工特征工程的需求;而Embedding则是深度学习处理非数值数据的通用桥梁。
二、大模型核心概念
2.1 大语言模型(LLM)/ 基础模型(Foundation Model)
一句话定义:
- 大语言模型(LLM):在海量文本上训练的、拥有数十亿至万亿参数的深度学习模型,核心能力是"预测下一个词"。
- 基础模型(Foundation Model):更广义的概念——在大规模数据上预训练、可适配多种下游任务的通用模型(不限于语言,也包括视觉、多模态)。
通俗类比: LLM像一个"读了整个互联网"的超级读者,你问它任何问题,它都能基于阅读经验给出流畅回答。基础模型则像"通才教育"——先广泛学习,再根据具体岗位(任务)做专项培训。
为什么重要: LLM是当前AI浪潮的绝对主角。理解它的本质(“下一个Token预测器”),能帮你破除神秘感——它不是"理解"了世界,而是极其擅长模式匹配和语言生成。
🔗 逻辑关系: 基础模型是上位概念,LLM是其在语言领域的具体实例。所有LLM都是基础模型,但基础模型不一定是LLM(如Stable Diffusion是视觉基础模型)。
2.2 Transformer架构 / 注意力机制(Attention)
一句话定义:
- Transformer:2017年Google提出的一种神经网络架构,完全基于注意力机制,摒弃了此前的循环结构,成为几乎所有现代大模型的骨架。
- 注意力机制(Attention):让模型在处理一个词时,能"同时看到"句子中所有其他词,并动态决定"该重点关注谁"。
通俗类比: 在Transformer之前,模型读句子像"逐字逐句读小说,读到后面就忘了前面"。注意力机制则像"把整页纸摊开,眼睛可以随时跳到任何相关的词"。Transformer就是把这种"全局视野"做到极致的架构。
为什么重要: 没有Transformer,就没有今天的大模型。 它的并行计算特性让训练效率提升了数个数量级,使得处理数万甚至数十万Token的超长文本成为可能。GPT、Claude、Qwen、Llama——所有主流大模型都是Transformer的变体。
🔗 逻辑关系: 注意力机制是Transformer的核心组件;Transformer是LLM的架构基础。这是一条从"数学原理"到"工程实现"再到"产品应用"的链条。
2.3 参数规模 / 上下文窗口(Context Window)
一句话定义:
- 参数规模:模型内部可调节的"旋钮"总数(通常以B=十亿为单位),参数越多,模型的"记忆容量"和"表达能力"越强。
- 上下文窗口:模型一次能"看到"的最大文本长度(以Token计),决定了它能处理多长的输入。
通俗类比: 参数规模像"大脑的神经元数量"——越多越聪明,但也越"重"(需要更多算力)。上下文窗口像"工作记忆的容量"——窗口越大,你能同时摊在桌上参考的资料就越多。
为什么重要: 这两个指标是评估大模型能力最直观的参数。参数规模影响模型的"智力上限",上下文窗口影响模型的"实用边界"。例如,一个128K上下文的模型可以一次性读完一本300页的书。
| 指标 | 衡量的是 | 典型数值(2025年) | 影响 |
|---|---|---|---|
| 参数规模 | 模型复杂度/容量 | 7B ~ 405B(开源);万亿级(闭源) | 智力上限、训练成本 |
| 上下文窗口 | 单次输入长度 | 8K ~ 200K+ Token | 能处理多长的文档/对话 |
🔗 逻辑关系: Transformer架构的并行特性使得扩大参数规模和上下文窗口成为可能;而更大的参数和更长的窗口又反过来释放了更强的能力。
2.4 预训练 / 微调 / RLHF / DPO
一句话定义:
- 预训练(Pre-training):在海量无标注文本上用自监督方式训练,让模型获得通用的语言能力。
- 微调(Fine-tuning / SFT):在预训练基础上,用少量"问答对"数据进一步训练,让模型学会"按指令回答"。
- RLHF(基于人类反馈的强化学习):让人类对模型的多个回答进行排序,训练一个"奖励模型",再用强化学习让模型生成人类更偏好的回答。
- DPO(直接偏好优化):RLHF的简化替代方案,跳过奖励模型,直接用人类偏好数据优化策略,更简单高效。
通俗类比: 把训练一个AI助手想象成培养一个员工:
- 预训练 = 这个人上了大学,博览群书(获得通识)
- 微调 = 入职培训,学会公司话术和流程(学会格式)
- RLHF = 老板反复反馈"这个回答好/那个不好",员工逐步调整(学会品味)
- DPO = 直接给员工看"好回答 vs 坏回答"的对比案例,让他自己悟(更高效的品味训练)
为什么重要: 这四步构成了现代大模型从"原始能力"到"产品级体验"的完整训练流水线。理解这个流程,你就能明白为什么同一个基座模型,经过不同公司的对齐训练后,表现差异巨大。
🔗 逻辑关系: 预训练 → 微调 → RLHF/DPO 是严格的先后顺序。预训练是地基,微调是装修,RLHF/DPO是"软装调性"。DPO是RLHF的进化替代,两者解决同一问题。
2.5 Token / Tokenizer / 推理(Inference)
一句话定义:
- Token:模型处理文本的最小单位,可以是一个字、一个词、一个子词,甚至一个标点。
- Tokenizer:把原始文本切分为Token序列的工具/算法。
- 推理(Inference):模型训练完成后,实际"使用"它来生成回答的过程(区别于训练)。
通俗类比: Token像"乐高积木块"——文本被拆成一块块标准件,模型只能操作这些积木。Tokenizer是"拆积木的人"。推理则是"用已经造好的乐高模型去完成任务",而训练是"制造乐高模型的过程"。
为什么重要: Token是大模型计费、限速、上下文窗口计算的基本单位。理解Token化机制,你就能明白为什么中文比英文"更费Token"(中文常被拆成更多子词),以及为什么API按Token收费。
🔗 逻辑关系: Tokenizer产生Token,Token是模型输入输出的基本单元,推理是模型消费Token并产出Token的过程。
2.6 开源模型 vs 闭源模型
一句话定义:
- 开源模型:模型权重(参数)公开,任何人可下载、修改、部署(如Meta的Llama、阿里的Qwen)。
- 闭源模型:模型权重不公开,只能通过API调用(如OpenAI的GPT系列、Anthropic的Claude)。
通俗类比: 开源模型像"公开配方的菜谱"——你可以自己在家做,也可以改良;闭源模型像"米其林餐厅"——你只能去店里吃,看不到厨房。
为什么重要: 这决定了AI能力的分发方式。开源降低了创新门槛,让中小企业和研究者也能构建AI应用;闭源则通过商业壁垒维持技术领先和利润。2025年的趋势是:开源模型在能力上快速追赶闭源,生态日益繁荣。
| 维度 | 开源(Llama, Qwen等) | 闭源(GPT, Claude等) |
|---|---|---|
| 权重获取 | ✅ 可下载 | ❌ 仅API |
| 自定义程度 | 高(可微调、蒸馏) | 低(仅提示词工程) |
| 部署成本 | 需自有算力 | 按调用付费 |
| 数据隐私 | 可本地部署,数据不出域 | 数据发送至服务商 |
| 典型代表 | Llama 4, Qwen3, Mistral | GPT-5, Claude 4, Gemini |
🔗 逻辑关系: 开源与闭源不是技术路线的区别,而是商业策略和分发模式的区别。它们共享相同的底层技术(Transformer、预训练、RLHF等)。
2.7 模型蒸馏 / 量化 / 剪枝
一句话定义:
- 模型蒸馏(Knowledge Distillation):让一个小模型(“学生”)去模仿一个大模型(“老师”)的输出,从而用小模型逼近大模型的效果。
- 量化(Quantization):把模型参数从高精度(如32位浮点)压缩为低精度(如4位整数),大幅减少内存占用和计算量。
- 剪枝(Pruning):移除模型中"不重要"的连接或神经元,让模型更轻量。
通俗类比:
- 蒸馏 = “学霸把解题思路教给普通学生,学生虽然脑容量小,但学会了核心方法”
- 量化 = “把高清照片压缩成缩略图,细节少了但主体还在,文件小了很多”
- 剪枝 = “修剪盆栽的多余枝叶,让主干更突出,整体更紧凑”
为什么重要: 这三者是大模型落地的关键技术。一个万亿参数的模型无法跑在手机或边缘设备上,但经过蒸馏+量化+剪枝后,可能压缩到原来的1/10甚至1/100,同时保留80%以上的能力。这是AI从"实验室"走向"每个人口袋"的必经之路。
| 技术 | 压缩对象 | 典型压缩比 | 精度损失 |
|---|---|---|---|
| 蒸馏 | 整体架构(大→小) | 5x ~ 20x | 中等 |
| 量化 | 参数精度 | 2x ~ 8x | 较小 |
| 剪枝 | 冗余连接/神经元 | 1.5x ~ 5x | 较小~中等 |
🔗 逻辑关系: 三者可以组合使用。典型流程是:先蒸馏得到小模型 → 再剪枝去除冗余 → 最后量化压缩精度。它们共同服务于"模型压缩与高效部署"这一目标。
三、本批概念关系图
人工智能(AI) └── 机器学习(ML) ├── 学习范式 │ ├── 监督学习 ──────────────→ 微调(SFT) │ ├── 无监督学习 │ ├── 强化学习 ──────────────→ RLHF / DPO │ └── 自监督学习 ────────────→ 预训练(Pre-training) │ └── 深度学习(DL) ├── 神经网络(骨架) │ ├── 反向传播(反馈机制) │ └── 梯度下降(优化策略) │ ├── 训练目标 │ ├── 泛化能力(追求) │ ├── 过拟合(避免) │ └── 欠拟合(避免) │ ├── 数据表示 │ ├── 特征工程(传统ML) │ ├── Embedding(深度学习通用桥梁) │ └── 向量空间(Embedding的栖息地) │ └── Transformer架构 ←── 注意力机制(核心组件) │ ▼ 大语言模型(LLM)/ 基础模型 │ ├── 关键指标 │ ├── 参数规模(智力上限) │ └── 上下文窗口(实用边界) │ ├── 训练流水线 │ 预训练 → 微调(SFT) → RLHF/DPO │ ├── 运行要素 │ ├── Tokenizer → Token(输入输出单元) │ └── 推理(Inference)(使用阶段) │ ├── 分发模式 │ ├── 开源(Llama, Qwen, Mistral) │ └── 闭源(GPT, Claude, Gemini) │ └── 压缩与部署 ├── 模型蒸馏(大→小) ├── 量化(高精度→低精度) └── 剪枝(去冗余)
结语
从神经网络的一个神经元,到万亿参数的大语言模型,AI的发展是一条清晰的"从简单到复杂、从专用到通用"的演进路径。掌握本文的概念框架,你就拥有了一张阅读任何AI新闻、评估任何AI产品的"认知地图"。
记住一条主线: 数据 → 模型(Transformer)→ 训练(预训练+对齐)→ 压缩部署 → 应用。所有概念都挂在这条主线上。