AI基础底座 + 大模型核心概念

一、AI基础底座

1.1 人工智能 / 机器学习 / 深度学习

一句话定义: 人工智能(AI)是让机器模拟人类智能的总目标;机器学习(ML)是实现AI的主流方法——让机器从数据中自动学规律;深度学习(DL)是机器学习的一个分支,用多层神经网络处理复杂问题。

通俗类比: 把AI想象成"做一道好菜"这个目标。机器学习是"通过反复试错总结菜谱"的方法论。深度学习则是"用一口特别深的锅,一层一层地炖,最终炖出极其复杂的风味"。

为什么重要: 这三个词经常被混用,但它们是包含关系:AI ⊃ ML ⊃ DL。理解这层关系,你就不会被各种营销话术迷惑——当有人说"我们用了AI",你可以追问:是规则引擎?是传统机器学习?还是深度学习?

维度 人工智能 机器学习 深度学习
范围 最广义的目标 实现AI的方法之一 ML的子集
典型手段 规则、搜索、学习 统计模型、决策树、SVM 多层神经网络
数据需求 可多可少 中等 通常需要海量数据
可解释性 规则型高 中等 较低(“黑箱”)

🔗 逻辑关系: 深度学习是当下大模型的技术根基。没有深度学习的突破,就没有今天的ChatGPT。


1.2 神经网络 / 反向传播 / 梯度下降

一句话定义:

  • 神经网络:一种模仿大脑神经元连接方式的计算模型,由大量"节点"分层排列组成。
  • 反向传播:神经网络的学习机制——从输出端的错误"倒推"回每一层,告诉每个节点"你该为这个错误负多少责任"。
  • 梯度下降:具体的调整策略——沿着"错误减少最快的方向"一小步一小步地修改参数。

通俗类比: 想象你在蒙眼走迷宫。神经网络是迷宫本身的结构;反向传播是"有人从出口喊话告诉你哪条路走错了";梯度下降是"你根据喊话方向,每次只迈一小步,逐步靠近出口"。

为什么重要: 这三者构成了所有深度学习模型训练的底层引擎。无论是图像识别、语音合成还是大语言模型,训练过程本质上都是:前向计算 → 算误差 → 反向传播 → 梯度下降更新参数 → 循环往复。

🔗 逻辑关系: 神经网络是"骨架",反向传播是"反馈信号",梯度下降是"行动策略"。三者缺一不可,共同完成"学习"这件事。


1.3 四种学习范式

一句话定义:

  • 监督学习:给模型"带答案的练习题",让它学会从输入映射到输出。
  • 无监督学习:只给"没有答案的数据",让模型自己发现数据中的结构和规律。
  • 强化学习:让模型在环境中"试错",做对了给奖励,做错了给惩罚,逐步学会最优策略。
  • 自监督学习:从数据本身"制造题目和答案"(如遮住一句话的后半段让模型猜),无需人工标注。

通俗类比:

  • 监督学习 = 老师批改作业
  • 无监督学习 = 把一堆杂乱的照片扔给你,让你自己分类
  • 强化学习 = 训练小狗,做对了给零食
  • 自监督学习 = 自己给自己出填空题并自己对答案

为什么重要: 大语言模型的预训练阶段用的正是自监督学习(预测下一个Token),而RLHF阶段用的是强化学习。理解这四种范式,你才能看懂大模型训练流程的每一步在做什么。

范式 是否需要标签 典型应用 与大模型的关系
监督学习 分类、回归 微调阶段(SFT)
无监督学习 聚类、降维 早期NLP探索
强化学习 ❌(需奖励信号) 游戏AI、机器人 RLHF对齐阶段
自监督学习 ❌(自动生成) 预训练 LLM预训练的核心

🔗 逻辑关系: 自监督学习解决了"海量数据无标注"的瓶颈,是大模型得以诞生的前提;强化学习(RLHF)则是在预训练之后,让模型"更像人"的关键一步。


1.4 过拟合 / 欠拟合 / 泛化能力

一句话定义:

  • 过拟合:模型把训练数据"背下来了",包括其中的噪声,导致在新数据上表现很差。
  • 欠拟合:模型太简单,连训练数据中的基本规律都没学到。
  • 泛化能力:模型在"没见过的数据"上依然表现良好的能力——这是最终目标。

通俗类比: 过拟合像"死记硬背的学生",考试换个题型就不会了;欠拟合像"完全没听课的学生",什么题都不会;泛化能力则是"真正理解了知识,能举一反三"。

为什么重要: 大模型之所以需要海量数据和各种正则化技巧,核心目的就是对抗过拟合、提升泛化能力。一个在训练集上完美但泛化差的模型,在实际应用中毫无价值。

🔗 逻辑关系: 泛化能力是目标,过拟合和欠拟合是需要避免的两个极端。模型复杂度、数据量、训练策略都是在两者之间寻找平衡。


1.5 特征工程 / 嵌入(Embedding)/ 向量空间

一句话定义:

  • 特征工程:人工从原始数据中提取、构造对模型有用的"特征"(输入信号)。
  • 嵌入(Embedding):把离散的事物(如单词、图片)映射为一组连续的数字(向量),使计算机能"理解"它们的含义。
  • 向量空间:所有嵌入向量存在的数学空间,语义相近的事物在这个空间中距离也近。

通俗类比: 特征工程像"厨师手动挑选食材并切配";嵌入像"给每种食材一个GPS坐标";向量空间则是"整张地图"——番茄和土豆的坐标很近(都是蔬菜),而番茄和钢琴的坐标很远。

为什么重要: 在大模型时代,Embedding是万物互联的基础。文字、图片、音频都被编码为向量后,才能在同一个空间中计算相似度、做检索、做生成。RAG(检索增强生成)技术的核心就是Embedding + 向量空间搜索。

🔗 逻辑关系: 特征工程是传统ML时代的核心工作;深度学习(尤其是大模型)让模型"自动学习特征",大幅减少了人工特征工程的需求;而Embedding则是深度学习处理非数值数据的通用桥梁。


二、大模型核心概念

2.1 大语言模型(LLM)/ 基础模型(Foundation Model)

一句话定义:

  • 大语言模型(LLM):在海量文本上训练的、拥有数十亿至万亿参数的深度学习模型,核心能力是"预测下一个词"。
  • 基础模型(Foundation Model):更广义的概念——在大规模数据上预训练、可适配多种下游任务的通用模型(不限于语言,也包括视觉、多模态)。

通俗类比: LLM像一个"读了整个互联网"的超级读者,你问它任何问题,它都能基于阅读经验给出流畅回答。基础模型则像"通才教育"——先广泛学习,再根据具体岗位(任务)做专项培训。

为什么重要: LLM是当前AI浪潮的绝对主角。理解它的本质(“下一个Token预测器”),能帮你破除神秘感——它不是"理解"了世界,而是极其擅长模式匹配和语言生成。

🔗 逻辑关系: 基础模型是上位概念,LLM是其在语言领域的具体实例。所有LLM都是基础模型,但基础模型不一定是LLM(如Stable Diffusion是视觉基础模型)。


2.2 Transformer架构 / 注意力机制(Attention)

一句话定义:

  • Transformer:2017年Google提出的一种神经网络架构,完全基于注意力机制,摒弃了此前的循环结构,成为几乎所有现代大模型的骨架。
  • 注意力机制(Attention):让模型在处理一个词时,能"同时看到"句子中所有其他词,并动态决定"该重点关注谁"。

通俗类比: 在Transformer之前,模型读句子像"逐字逐句读小说,读到后面就忘了前面"。注意力机制则像"把整页纸摊开,眼睛可以随时跳到任何相关的词"。Transformer就是把这种"全局视野"做到极致的架构。

为什么重要: 没有Transformer,就没有今天的大模型。 它的并行计算特性让训练效率提升了数个数量级,使得处理数万甚至数十万Token的超长文本成为可能。GPT、Claude、Qwen、Llama——所有主流大模型都是Transformer的变体。

🔗 逻辑关系: 注意力机制是Transformer的核心组件;Transformer是LLM的架构基础。这是一条从"数学原理"到"工程实现"再到"产品应用"的链条。


2.3 参数规模 / 上下文窗口(Context Window)

一句话定义:

  • 参数规模:模型内部可调节的"旋钮"总数(通常以B=十亿为单位),参数越多,模型的"记忆容量"和"表达能力"越强。
  • 上下文窗口:模型一次能"看到"的最大文本长度(以Token计),决定了它能处理多长的输入。

通俗类比: 参数规模像"大脑的神经元数量"——越多越聪明,但也越"重"(需要更多算力)。上下文窗口像"工作记忆的容量"——窗口越大,你能同时摊在桌上参考的资料就越多。

为什么重要: 这两个指标是评估大模型能力最直观的参数。参数规模影响模型的"智力上限",上下文窗口影响模型的"实用边界"。例如,一个128K上下文的模型可以一次性读完一本300页的书。

指标 衡量的是 典型数值(2025年) 影响
参数规模 模型复杂度/容量 7B ~ 405B(开源);万亿级(闭源) 智力上限、训练成本
上下文窗口 单次输入长度 8K ~ 200K+ Token 能处理多长的文档/对话

🔗 逻辑关系: Transformer架构的并行特性使得扩大参数规模和上下文窗口成为可能;而更大的参数和更长的窗口又反过来释放了更强的能力。


2.4 预训练 / 微调 / RLHF / DPO

一句话定义:

  • 预训练(Pre-training):在海量无标注文本上用自监督方式训练,让模型获得通用的语言能力。
  • 微调(Fine-tuning / SFT):在预训练基础上,用少量"问答对"数据进一步训练,让模型学会"按指令回答"。
  • RLHF(基于人类反馈的强化学习):让人类对模型的多个回答进行排序,训练一个"奖励模型",再用强化学习让模型生成人类更偏好的回答。
  • DPO(直接偏好优化):RLHF的简化替代方案,跳过奖励模型,直接用人类偏好数据优化策略,更简单高效。

通俗类比: 把训练一个AI助手想象成培养一个员工:

  • 预训练 = 这个人上了大学,博览群书(获得通识)
  • 微调 = 入职培训,学会公司话术和流程(学会格式)
  • RLHF = 老板反复反馈"这个回答好/那个不好",员工逐步调整(学会品味)
  • DPO = 直接给员工看"好回答 vs 坏回答"的对比案例,让他自己悟(更高效的品味训练)

为什么重要: 这四步构成了现代大模型从"原始能力"到"产品级体验"的完整训练流水线。理解这个流程,你就能明白为什么同一个基座模型,经过不同公司的对齐训练后,表现差异巨大。

🔗 逻辑关系: 预训练 → 微调 → RLHF/DPO 是严格的先后顺序。预训练是地基,微调是装修,RLHF/DPO是"软装调性"。DPO是RLHF的进化替代,两者解决同一问题。


2.5 Token / Tokenizer / 推理(Inference)

一句话定义:

  • Token:模型处理文本的最小单位,可以是一个字、一个词、一个子词,甚至一个标点。
  • Tokenizer:把原始文本切分为Token序列的工具/算法。
  • 推理(Inference):模型训练完成后,实际"使用"它来生成回答的过程(区别于训练)。

通俗类比: Token像"乐高积木块"——文本被拆成一块块标准件,模型只能操作这些积木。Tokenizer是"拆积木的人"。推理则是"用已经造好的乐高模型去完成任务",而训练是"制造乐高模型的过程"。

为什么重要: Token是大模型计费、限速、上下文窗口计算的基本单位。理解Token化机制,你就能明白为什么中文比英文"更费Token"(中文常被拆成更多子词),以及为什么API按Token收费。

🔗 逻辑关系: Tokenizer产生Token,Token是模型输入输出的基本单元,推理是模型消费Token并产出Token的过程。


2.6 开源模型 vs 闭源模型

一句话定义:

  • 开源模型:模型权重(参数)公开,任何人可下载、修改、部署(如Meta的Llama、阿里的Qwen)。
  • 闭源模型:模型权重不公开,只能通过API调用(如OpenAI的GPT系列、Anthropic的Claude)。

通俗类比: 开源模型像"公开配方的菜谱"——你可以自己在家做,也可以改良;闭源模型像"米其林餐厅"——你只能去店里吃,看不到厨房。

为什么重要: 这决定了AI能力的分发方式。开源降低了创新门槛,让中小企业和研究者也能构建AI应用;闭源则通过商业壁垒维持技术领先和利润。2025年的趋势是:开源模型在能力上快速追赶闭源,生态日益繁荣。

维度 开源(Llama, Qwen等) 闭源(GPT, Claude等)
权重获取 ✅ 可下载 ❌ 仅API
自定义程度 高(可微调、蒸馏) 低(仅提示词工程)
部署成本 需自有算力 按调用付费
数据隐私 可本地部署,数据不出域 数据发送至服务商
典型代表 Llama 4, Qwen3, Mistral GPT-5, Claude 4, Gemini

🔗 逻辑关系: 开源与闭源不是技术路线的区别,而是商业策略和分发模式的区别。它们共享相同的底层技术(Transformer、预训练、RLHF等)。


2.7 模型蒸馏 / 量化 / 剪枝

一句话定义:

  • 模型蒸馏(Knowledge Distillation):让一个小模型(“学生”)去模仿一个大模型(“老师”)的输出,从而用小模型逼近大模型的效果。
  • 量化(Quantization):把模型参数从高精度(如32位浮点)压缩为低精度(如4位整数),大幅减少内存占用和计算量。
  • 剪枝(Pruning):移除模型中"不重要"的连接或神经元,让模型更轻量。

通俗类比:

  • 蒸馏 = “学霸把解题思路教给普通学生,学生虽然脑容量小,但学会了核心方法”
  • 量化 = “把高清照片压缩成缩略图,细节少了但主体还在,文件小了很多”
  • 剪枝 = “修剪盆栽的多余枝叶,让主干更突出,整体更紧凑”

为什么重要: 这三者是大模型落地的关键技术。一个万亿参数的模型无法跑在手机或边缘设备上,但经过蒸馏+量化+剪枝后,可能压缩到原来的1/10甚至1/100,同时保留80%以上的能力。这是AI从"实验室"走向"每个人口袋"的必经之路。

技术 压缩对象 典型压缩比 精度损失
蒸馏 整体架构(大→小) 5x ~ 20x 中等
量化 参数精度 2x ~ 8x 较小
剪枝 冗余连接/神经元 1.5x ~ 5x 较小~中等

🔗 逻辑关系: 三者可以组合使用。典型流程是:先蒸馏得到小模型 → 再剪枝去除冗余 → 最后量化压缩精度。它们共同服务于"模型压缩与高效部署"这一目标。


三、本批概念关系图

code
人工智能(AI) └── 机器学习(ML)      ├── 学习范式      │    ├── 监督学习 ──────────────→ 微调(SFT)      │    ├── 无监督学习      │    ├── 强化学习 ──────────────→ RLHF / DPO      │    └── 自监督学习 ────────────→ 预训练(Pre-training)      └── 深度学习(DL)           ├── 神经网络(骨架)           │    ├── 反向传播(反馈机制)           │    └── 梯度下降(优化策略)           ├── 训练目标           │    ├── 泛化能力(追求)           │    ├── 过拟合(避免)           │    └── 欠拟合(避免)           ├── 数据表示           │    ├── 特征工程(传统ML)           │    ├── Embedding(深度学习通用桥梁)           │    └── 向量空间(Embedding的栖息地)           └── Transformer架构 ←── 注意力机制(核心组件)           大语言模型(LLM)/ 基础模型                ├── 关键指标                │    ├── 参数规模(智力上限)                │    └── 上下文窗口(实用边界)                ├── 训练流水线                │    预训练 → 微调(SFT) → RLHF/DPO                ├── 运行要素                │    ├── Tokenizer → Token(输入输出单元)                │    └── 推理(Inference)(使用阶段)                ├── 分发模式                │    ├── 开源(Llama, Qwen, Mistral)                │    └── 闭源(GPT, Claude, Gemini)                └── 压缩与部署                     ├── 模型蒸馏(大→小)                     ├── 量化(高精度→低精度)                     └── 剪枝(去冗余)

结语

从神经网络的一个神经元,到万亿参数的大语言模型,AI的发展是一条清晰的"从简单到复杂、从专用到通用"的演进路径。掌握本文的概念框架,你就拥有了一张阅读任何AI新闻、评估任何AI产品的"认知地图"。

记住一条主线: 数据 → 模型(Transformer)→ 训练(预训练+对齐)→ 压缩部署 → 应用。所有概念都挂在这条主线上。