AI、机器学习、深度学习与大模型:五层关系一次讲透

这五个词——人工智能、机器学习、深度学习、生成式AI、大语言模型——技术群里天天见,真能分清层级关系的人不多。有人把机器学习当成AI的竞品来聊,有人以为大模型和某个具体的聊天产品是一回事。先把结论摆在前面:

  • 人工智能(AI)是目标;
  • 机器学习(ML)是实现这个目标的主流方法;
  • 深度学习(DL)是机器学习里当前最热的分支;
  • 生成式AI(GenAI)建立在深度学习之上,任务重心从分析转向生成;
  • 大语言模型(LLM)是生成式AI在语言方向上的集大成者。

一句话概括:AI 包含 ML,ML 包含 DL;GenAI 基于 DL,LLM 是 GenAI 的代表。

先说目标:AI 到底是什么

AI 的本质是对人类智能的模拟,横跨统计学、脑神经科学、社会科学的交叉领域。它分两种:强人工智能具备真正的意识,能回答"我是谁"这类问题,至今没有实现;弱人工智能在特定任务上表现出智能,部分场景超过人类——今天能接触到的所有 AI 产品全部属于后者。

"超过人类"并不玄。夜间行车,人眼开灯后有效视距大约 50 米,车载雷达的探测距离能到 100-200 米,对灰色低对比度障碍物的判别也比肉眼可靠,发现障碍立即减速停车,这是机器感知加计算的优势区。

拆开任何一个 AI 系统,流程都是同一个三段式:感知,摄像头和雷达持续采集环境数据;决策,数据交给"大脑"分析,形成判断和策略;执行,策略转化为机械动作。自动驾驶车辆面对斑马线上的行人,从识别到刹车再到重新起步,全程无人工干预,三段式一气呵成。机器狗爬楼梯是同一套逻辑:摄像头识别台阶高度,软件规划抬腿高度和四条腿的迈动顺序,机械部件执行。指纹解锁、刷脸支付、内容推荐算法,底层也全是这套框架的不同变体。

机器学习:把找规律交给数据

传统做法是人列方程:出租车计价里,1 公里 12 元、2 公里 14 元、3 公里 16 元,列出 y = ax + b,解出 a = 2、b = 10。机器学习换了个思路——只把公里数和费用的历史数据喂给算法,让机器自己逼近那组参数。这个过程叫训练。

几个核心概念一张表说清:

概念 含义 出租车例子
特征 影响结果的输入 公里数 x
参数 方程里的系数 a、b 的取值
模型 结构加参数的完整计算单元 y = 2x + 10
模型文件 实际存储的参数值 文件里就是 2 和 10

训练完成后输入新特征算出结果,叫推理。方言识别这类问题,参数规模能到十万级,人工求解没有可能,机器却能自动拟出近似函数 f(x) ≈ y。这就是机器学习的价值:不给规则,给数据。

深度学习:砍掉人工特征工程

传统机器学习最费人力的环节是特征工程——识别车辆得先人为定义"有四个轮子""有后视镜",识别人脸得定义五官比例,全靠领域专家一点点抠。深度学习把这一步直接取消了:输入原始像素,网络逐层自动抽象特征。

拿识别"西红柿炒鸡蛋"举例,看特征是怎么一层层长出来的:

  • 输入层:照片变成 RGB 数字矩阵;
  • 浅层学到颜色:画面里有红(西红柿)有黄(鸡蛋);
  • 中层学到形状:西红柿呈块状,鸡蛋呈絮状;
  • 深层学到空间关系:两种颜色混合分布,不是左边全红右边全黄;
  • 输出层综合判定;若检测到绿色,则转向"青椒炒鸡蛋"。

这些特征没有一个靠人写进去。数学上,深度网络就是函数嵌套:h1 = f1(x),h2 = f2(h1),一层套一层,层数多了就叫"深"。中间层的特征人眼难以解释,参数量上了十亿级更是无法逐层归因,所以叫"隐藏层"。

生成式AI:从分析数据到生成内容

此前的 AI——图像分类、用户画像、文本分类——本质都是分析给定的数据。生成式AI 的任务变了:给一个目标,直接产出从未存在过的作文、图片、视频。

它的生成机制可以概括成"带概率表的接龙"。对"今天天气真____",模型算出候选词分布:好约 45%、不约 20%、热约 15%。采样命中哪个就输出哪个;每次采样后上下文变了,概率表重新计算,再采下一个字,循环到全文完成。所谓创作,就是这么一个基于上下文动态调概率的连续过程。

大语言模型:三个"大"

LLM 是用海量文本训练出来的概率模型,"大"体现在三个维度。数据大:GPT-3 的原始语料 45TB,清洗后约 570GB,DeepSeek V3 吃进了 14.8 万亿 token。参数大:GPT-3 是 1750 亿,如今 Llama 3.1 开源到 4050 亿,DeepSeek V3 总参数 6710 亿、每次激活 370 亿。算力大:GPT-4 级别的训练动用上万张高端显卡,权重文件几百 GB,消费级显卡连加载都做不到。

三个容易踩的认知坑

坑一:把推测当官方数据。网上流传"GPT-4 有 120 层、百亿级参数"——OpenAI 从未公布过 GPT-4 的层数和参数量,120 层出自逆向分析的传言,约 1.8 万亿总参数是 SemiAnalysis 对其 MoE 架构的推测值。写方案、做汇报引用数据时,GPT-3 之前的是官方口径,GPT-4 之后的一律标注"外界估计",别被面试官当场问倒。

坑二:以为输出是确定的。概率采样决定了同一个提问多次生成结果不同。temperature 参数控制采样的随机程度:调到接近 0,模型几乎总选概率最高的词,输出稳定但呆板;调高则多样性强,也更容易跑偏。做自动化测试或结构化数据抽取时,把 temperature 设为 0 或极低值,能明显减少结果抖动——实测这样更稳。

坑三:幻觉是机制自带的。接龙机制决定了模型在不知道答案时,也会挑一个概率上"像话"的词接下去,而不是承认不知道。关键业务里对生成结果做事实校验不是多余动作,是必要工序。

想亲手看看那张概率表?本地跑个 0.5B 的小模型就够了:

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
name = "Qwen/Qwen2.5-0.5B"
tok = AutoTokenizer.from_pretrained(name)
model = AutoModelForCausalLM.from_pretrained(name)
inputs = tok("今天天气真", return_tensors="pt")
with torch.no_grad():
    logits = model(**inputs).logits[0, -1]
probs = torch.softmax(logits, dim=-1)
top = torch.topk(probs, k=5)
for score, idx in zip(top.values, top.indices):
    print(repr(tok.decode(idx)), f"{score:.1%}")

打印出来的就是"好/不/热"那份分布的真身。改一下 temperature 再采样几轮,随机度的变化一眼就能看出来。

收尾清单

五层关系最后压成一张清单:AI 是目标,ML 是方法,DL 是最热分支,GenAI 完成从分析到生成的跨越,LLM 是语言方向的集大成者。再遇到有人混用这五个词,把这层包含关系甩过去就行。

0

评论0

请先
显示验证码
没有账号?注册  忘记密码?