AI大模型架构揭秘:小白如何理清技术层级迷雾

Gen AI 小白入门白皮书

版本:v1.0

核查日期:2026 年 8 月 9 日

适用读者:刚接触 AI,希望搭建完整、清晰概念地图的非技术读者

1. 起点:为什么整理这份白皮书

这份白皮书的创作起点,源于身边普通人接触 AI 时最真实的困惑:大家陆续听过、用过各类 AI 功能,却被一堆零散名词困住 —— 大模型、LLM、GPT、Prompt、Token、RAG、Embedding、MCP、Agent、Workflow、Harness 等。

这些术语单独检索都有释义,但混杂在一起时极易混淆,无法形成系统化认知。为此,我在整理时兼顾三个核心现实限制,适配零基础读者:

第一,零技术门槛原则:解释一个核心名词时,绝不引入大量陌生新术语,避免越学越乱,降低整体理解成本。

第二,动态更新原则:AI 模型、产品迭代速度极快,版本更迭频繁,无永久通用的固定结论。因此全文标注明确核查日期,所有内容均为当前阶段有效参考。

第三,层级分类原则:打破术语平级罗列的误区。厘清不同名词的层级差异:GPT 是模型家族、ChatGPT 是终端产品,RAG 是检索方法,MCP 是连接协议,Loop 是执行机制,Graph 是编排结构。

基于以上原则,这份白皮书不堆砌所有冷门术语,核心只为帮小白解决三个实用问题:

该术语属于 AI 系统的哪一层级?

它核心解决什么问题?

日常使用、落地场景中,我什么时候需要关注它?

2. 观察:小白核心困惑,源于层级概念混杂

梳理大量新手疑问后发现,绝大多数认知混乱,都来自四组核心概念的层级混淆,理清这四组关系,就能打通 80% 的 AI 基础认知。

2.1 模型、产品、品牌公司概念混杂

日常交流中,很多人会混用 GPT 与 ChatGPT、Gemini 模型与 Gemini 应用,口语中可以兼容,但想要理性判断 AI 能力、选型落地,必须严格区分三者:

模型:核心能力载体,负责计算、推理、生成内容,是 AI 的底层能力支撑;

产品:用户可直接操作的交互界面,封装了模型能力,搭配功能、权限、交互体验;

公司 / 品牌:负责模型训练、迭代、产品运营、接口维护的主体。

补充:同一款 AI 产品,后台可随时切换不同版本、不同系列的模型,产品界面不变,底层能力会迭代升级。

2.2 AI 训练知识、实时资料来源混杂

新手常遇到两类典型问题:“AI 突然忘记之前的内容”“AI 不知道我的公司内部规则”,本质是混淆了四类信息来源,AI 能调用的资料是严格区分的:

模型训练固有知识、当前对话实时内容、用户临时上传的文件、专属知识库检索内容,四者相互独立,不会自动互通。AI 的记忆、知识范围,完全由资料来源和上下文配置决定。

2.3 内容生成、任务执行能力混杂

大模型的核心基础能力是「生成文字、代码、思路方案」,但能输出操作建议 ≠ 能执行真实动作。

读取本地文件、查询数据库、发送邮件、修改代码、批量处理数据等实操行为,需要额外配套工具、权限、运行环境、人工确认机制,模型本身无法直接完成落地执行。

2.4 Agent、Workflow、Loop、Graph 概念混杂

四个术语均服务于「完成完整 AI 任务」,但核心定位、关注维度完全不同,不存在互相替代关系,更多是组合使用:

Workflow(工作流):侧重预设固定步骤,流程提前定义,按固定顺序执行;

Agent(智能代理):侧重动态决策,根据最终目标,实时判断下一步动作,无固定流程;

Loop(循环机制):侧重迭代优化,完成一次操作后,校验结果、更新状态、循环执行直至达标;

Graph(任务图):侧重整体结构编排,用节点、边搭建任务框架,支持顺序、分支、并行、回退、循环等复杂逻辑。

3. 判断:AI 系统七层分层认知模型

零基础用户无需从模型参数、算力、算法底层开始学习。优先搭建七层分层地图,即可快速定位问题:是模型能力不足、资料缺失、工具未配置,还是执行流程、管控机制不完善。

注:该分层方式专为小白降本理解、快速定位问题设计,属于科普梳理方案,行业存在多种专业分类标准,无需视作唯一固定规范。

4. 执行:逐层拆解核心 AI 名词(小白通俗版)

4.1 AI、机器学习、深度学习、大模型

四者为层层包含的从属关系,范围从大到小,能力从通用到聚焦:

人工智能(AI):最宽泛的总称,所有让机器模拟人类识别、预测、生成、决策、执行任务的技术,都属于 AI 范畴。

机器学习:AI 的核心分支,摒弃人工编写固定规则的模式,让机器通过海量数据自主学习规律、优化能力。

深度学习:机器学习的主流核心分支,依托多层神经网络处理复杂数据模式,是当下生成式 AI 的核心技术基础。

大模型:基于深度学习打造的通用强能力模型,特点是规模大、训练数据海量、算力投入高、通用场景适配性强,并非特指某家公司、某款软件。

层级关系总结:人工智能 → 机器学习 → 深度学习 → 新一代生成式大模型

4.2 LLM、多模态模型、推理模型

LLM(大语言模型):核心处理文字类任务,包括问答、总结、翻译、文案创作、代码生成、逻辑梳理等。输出内容依托训练规律与当前上下文,不会自动核验事实,“内容完整” 不代表 “事实准确”。

多模态模型:突破文字限制,可同时处理文本、图片、音频、视频等多种格式数据,支持图文理解、视频分析、语音交互等复合任务。

实时模型:主打低延迟、快速响应,适配实时语音对话、屏幕协作、实时翻译等对速度要求极高的场景。

推理模型(思考模式):针对复杂问题投入更多算力,强化多步骤逻辑拆解、深度推理、代码调试、复杂决策能力,但响应速度更慢、调用成本更高,简单日常任务无需开启高推理强度。

4.3 GPT、Gemini、Claude、MiniMax、DeepSeek

以上均为各大科技公司推出的大模型家族 / 底层模型品牌,是 AI 能力的底层载体,而非用户直接使用的产品。各模型均可处理基础文字任务,但在场景适配、工具支持、多模态能力、响应速度、调用价格、稳定性上差异显著。

同一系列模型会区分高低配版本:高性能版本适配复杂推理、专业创作、代码开发等重任务;轻量版本适配高频问答、简单生成等低成本、高并发场景。实际选型无需盲目追求顶配,需结合自身任务实测适配。

官方参考文档:

OpenAI 模型:

Gemini 模型:

MiniMax 模型:

DeepSeek 模型:

4.4 产品入口与 API

AI 产品(用户端):ChatGPT、Gemini、Claude、Kimi、豆包等,是普通用户可直接打开使用的交互产品,封装了模型能力,提供聊天、文件上传、语音、联网搜索等可视化功能,零门槛上手。

API(程序接口):供软件、系统、程序调用模型的专属通道。个人用户无需感知,开发者可通过 API 将 AI 能力嵌入自有系统,例如在文档工具中添加自动摘要、在办公系统中添加智能问答功能。

三者区分极简总结:

底层模型:GPT/Claude/DeepSeek(AI 大脑)

网页 / 客户端产品:豆包、Kimi、ChatGPT(普通人操作界面)

API:系统对接通道(软件自动调用大脑)

4.5 Prompt、System Prompt 和上下文工程

Prompt:你发给 AI 的全部任务要求 + 参考材料,也就是大家常说的提示词。

一份规范好用的 Prompt 必须覆盖 6 个核心要素:

核心需要完成什么任务

输出内容给谁阅读

允许参考哪些资料

输出固定格式要求

哪些信息必须核对原文、保证真实

遇到无法确认的信息,何时停止生成并主动询问人类

实操示例 Prompt

请把下方三份会议纪要整理为一页项目决策简报。

阅读对象:未参会的项目负责人

输出结构:已确认事项、分歧点、对接负责人、下一步截止日期

规则:原文没有写明负责人的条目统一标注【待确认】,禁止自行编造人名。

System Prompt(系统提示词):给 AI 设定长期固定工作准则,全程生效。用来定义 AI 身份、权限、输出规范、禁止行为,每次对话都会默认加载。

提示词工程 vs 上下文工程

提示词工程:只优化当下单次任务的描述话术;

上下文工程:范围更广,包含历史对话、上传文件、工具说明、企业规范、示例模板、权限边界,整套完整信息管理方案。

4.6 Token 和 Context Window(上下文窗口)

Token

AI 处理文字的最小计算单位,可以通俗理解为 AI 世界的「文字流量计费单位」:

你发给 AI 的提问、上传文档 = 消耗输入 Token

AI 生成的回复内容 = 消耗输出 Token

文本越长,Token 消耗越多,响应速度、调用费用同步上升。

补充误区:Token ≠ 固定汉字数量。中文、英文、标点、符号拆分规则随不同模型变化,不能用字数直接换算。

Context Window 上下文窗口

模型单次对话能一次性容纳的全部信息上限,包含:系统指令、历史聊天记录、上传文件、工具返回数据、即将生成的回答。

两者核心区别:

Token:计费、算力消耗指标;

上下文窗口:单次对话内容容量硬性上限。

类比:手机流量(Token)vs 单次文件上传最大限制(上下文窗口)。

4.7 Context、Memory 和知识库

Context(当前上下文):这一轮对话里,模型当下能看见的全部临时信息,对话结束 / 清空记录后直接消失。

Memory(记忆 / 长期存储):独立于模型的外部存储,用来跨会话、跨轮次保存信息。模型本身不会永久记忆内容,需要程序把记忆重新载入上下文,AI 才能调取。

知识库:批量结构化存储的专属资料库,比如公司合同、产品手册、客服记录、项目档案,支持批量检索调用。

三者完整数据流:

知识库 / 长期记忆库 保存海量静态资料

↓ 根据问题语义,检索匹配内容

匹配资料载入 当前上下文 Context

↓ 模型仅依靠上下文可见内容生成回答

4.8 RAG 和 Embedding

RAG 检索增强生成(小白核心刚需技术)

解决一个关键痛点:大模型原生训练知识过时、无法读取私有文件。

标准执行流程(以查询合同条款举例):

接收用户提问:合同是否存在自动续约条款?

在私有合同知识库检索高度相关原文段落

将用户问题 + 检索到的原文一起送入上下文交给模型

强制 AI 依据检索文档作答,标注原文出处

局限性:无法 100% 杜绝错误。文档解析乱码、检索漏匹配、资料过期、模型阅读理解偏差,依旧会造成答案失真。

Embedding 向量嵌入

把文字、图片转换成一串数字向量,用来判断两段内容语义相似度。

举例:“收不到短信验证码” 和 “登录验证短信一直收不到” 字面文字不同,但语义高度接近,Embedding 可以识别匹配,实现知识库模糊检索。

配套工具:向量数据库专门存储、快速查询向量;RAG 不止向量检索,还可搭配关键词检索、混合检索、结果重排序。

4.9 Structured Output 和 Function Calling

Structured Output 结构化输出

强制 AI 严格遵循固定格式返回结果,最常用标准为 JSON。

业务价值:程序可以自动读取字段(负责人、日期、风险等级),不用人工在大段自由文本里提取信息,方便自动化流程校验。

Function Calling 工具调用

AI 自主判断当前任务需要调用外部工具,并自动生成工具入参。

重要边界区分:

模型只负责「决定调用哪个工具、填好参数」;真实执行操作(查数据库、读取表格、发通知)由外部程序完成;系统同时管控权限,可拦截高危操作,工具结果再回传给模型继续处理。

4.10 CLI、工具调用和 MCP

CLI 命令行接口:开发者文本控制台,用来启动服务、批量处理文件、运行代码测试、排查报错。代码类 AI 代理获得受控 CLI 权限后,可读写项目文件、自动运行调试。

安全提醒:CLI 必须严格限制目录、网络、高危命令,不能开放无限制权限。

MCP Model Context Protocol 模型上下文协议

AI 应用连接外部工具、私有数据源的标准化通用协议。统一对接规范,不用为每个数据源单独开发适配代码。

三大核心能力:读取本地文件、对接第三方数据库、调用外部服务 API。

核心误区:MCP 只是连接标准,不会自动解决权限管控、数据质量、安全访问问题;接入 MCP 服务会同步扩大数据访问范围,配套安全规则不可省略。

官方文档参考:

4.11 Workflow、Agent、Loop 和 Graph

Workflow 固定工作流

适用场景:步骤完全提前确定、无动态决策。

示例:每周固定流程:导出业务数据→自动生成图表→填充周报模板→推送负责人邮箱。全程路径不变,无需 AI 自主思考下一步。

Agent 智能代理

适用场景:目标确定,但中间步骤无法提前写死,需要 AI 动态判断路径。

示例:批量校验项目档案完整性:先扫描文件目录→判断缺失材料→动态选择检索档案 / 生成补充清单 / 提醒人工上传。

Loop 循环迭代机制

Agent 核心运行基础逻辑:

读取当前任务全部状态

AI 自主判断下一步动作

调用工具 / 生成文本内容

校验结果是否满足完成标准

├─达标 → 任务结束

└─未达标 → 更新状态,开启新一轮循环

强制配置退出条件,避免无限循环:任务完成、最大循环次数、预算耗尽、连续报错、人工审批终止。

Graph 任务图

用「节点(执行步骤)+ 边(跳转逻辑)」搭建完整任务框架,兼容所有复杂逻辑:顺序执行、多分支判断、并行任务、失败回滚、内嵌多层 Loop 循环。

相互关系:四者不存在互斥选择,可自由组合。Graph 可以包含多个 Agent 与 Loop;Agent 也可以作为单个节点嵌入 Workflow。

参考文档:

4.12 Coding Agent、Vibe Coding 和 Harness

Coding Agent 代码智能代理

拥有项目环境读写权限,可读取源码、修改文件、运行调试命令、捕获报错并自动修复。代表产品:Cursor、Claude Code、Codex。

安全提醒:生产业务代码必须开启人工审核、测试拦截,禁止无限制修改线上代码。

Vibe Coding 自然语言编程

全程用大白话和 AI 协作开发工具、脚本,大幅降低编程入门门槛。

短板:不会自动覆盖软件测试、数据备份、隐私安全、长期维护成本,商用项目不能仅靠自然语言交付。

Harness 运行管控层

包裹在模型外层的整套控制基础设施,包含工具权限管理、提示词模板、上下文策略、运行日志、自动化测试、重试机制、人工审批通道。

备注:Harness 无行业统一标准定义,不同开发者指代组件范围不同,沟通前需要确认对方定义边界。

4.13 Evals、Tracing、Observability 和 Human-in-the-loop

Evals 效果评估:标准化检测 AI 输出质量,量化指标包含事实正确率、格式合规率、任务完成度、人工打分,用来迭代提示词、优化 RAG 检索规则。

Tracing 链路追踪:完整记录单次任务全流程:调用模型版本、工具参数、循环轮次、检索文档、报错节点,快速定位故障源头。

Observability 可观测性:长期监控系统整体运行指标:响应延迟、调用成本、失败率、异常输出、资源消耗,用于长期运维优化。

Human-in-the-loop 人机介入机制:高风险节点强制人工审核,人类可修改内容、批准执行动作、终止 AI 自主流程。

落地建议:Agent 自主能力越强,评估、追踪、监控、人工审批四项机制越不能后置补做。

4.14 训练、微调、蒸馏和量化

面向模型底层优化的四类技术,普通使用者仅需了解概念,无需实操:

预训练:厂商用海量全网基础数据从零搭建大模型,成本极高。

微调 Fine-tune:基于现成大模型,导入企业专属小批量数据二次训练,适配行业话术、私有业务规则。

模型蒸馏:用庞大高性能大模型输出内容,训练小型轻量化模型,在降低算力成本的同时保留核心能力。

量化:降低模型计算精度,缩小内存占用,实现本地电脑、手机离线运行;过度压缩会大幅降低推理准确率。

5. 完整落地案例:一条任务走完整套 AI 七层架构

需求:基于会议记录、项目文档、业务数据表自动生成标准化项目决策简报

完整全链路拆解:

提示词层:编写基础 Prompt + 长期 System Prompt,明确阅读对象、输出格式、禁止编造信息规则;

知识库 & RAG 层:上传全部会议、项目文档构建知识库,通过 Embedding 向量检索匹配和简报相关内容,载入上下文;

输出规范层:开启 Structured Output,强制输出固定 JSON 字段(事项、负责人、风险、截止日期);

工具连接层:通过 MCP 协议连接数据表读取工具,使用 Function Calling 自动读取表格数据;

流程编排层:基础固定整理步骤放入 Workflow;核对资料完整性、补全缺失信息交给 Agent;Agent 依靠 Loop 循环校验内容,多分支异常处理使用 Graph 搭建;

监控管控层:全流程开启 Tracing 链路记录,Evals 检测简报事实准确率;涉及重要业务决策节点增加人工审核(Human-in-the-loop);

底层模型层:调用商用大模型 API 作为核心生成能力。

核心结论:大模型只是整套系统其中一个组件,最终输出质量由资料、检索、工具权限、流程规则、人工验收共同决定,不单单依赖模型本身强弱。

6. 高频学习误区(6 个最容易踩坑的认知偏差)

6.1 把模型版本当作永久固定知识

GPT-4、Gemini Advanced 这类版本名称持续迭代更新,白皮书仅记录 2026.8.9 时点参考,选型必须查阅厂商实时官方模型列表,不能依赖旧资料。

6.2 认为输出文字越长 = AI 能力更强

大篇幅文本不代表逻辑、事实准确。评估 AI 输出优先级:原文依据完整度、任务完成度、错误率,而非内容长度。

6.3 将 RAG 当作事实百分百保障

RAG 仅扩充 AI 可阅读的参考资料,无法消除资料本身错误、检索遗漏、模型理解失误,重要场景必须人工二次核验原文。

6.4 混淆 MCP 协议和自动化业务系统

MCP 只解决外部数据、工具的统一对接标准;任务编排、权限管控、结果校验、风险拦截需要额外搭建流程,协议本身不提供自动化能力。

6.5 盲目追求高自主度 Agent

AI 自主决策范围越大,运行结果不可控风险越高。财务、法务、对外发布等高权重任务,必须收紧权限、设置循环上限、增加人工确认节点。

6.6 认为行业热词有全球统一标准

Harness、Vibe Coding、GEO 等词汇无统一行业定义,不同团队释义差异较大。

补充 GEO(生成引擎优化 Generative Engine Optimization):优化素材、文档,提升 AI 检索引用自身资料的概率;当前技术体系尚未成熟,无标准化计算公式。

学术参考:

7. 小白分四轮循序渐进学习路线

零基础不用一次性啃完全部术语,分四阶段递进,落地效率最高:

第一轮:分清底层、产品、接口三者边界

能清晰回答两个问题就算通关:我现在用的是哪款用户产品?后台调用的是什么底层模型?

掌握名词:AI、深度学习、大模型、LLM、各类模型品牌、网页产品、API。

第二轮:掌握输入资料与提示管理(普通人最高频场景)

学会规范写提示词、管理上下文、理解 Token 计费、搭建私有知识库、使用 RAG 读取自有文件。

掌握名词:Prompt、System Prompt、Token、上下文窗口、Memory、知识库、Embedding、RAG。

第三轮:理解工具调用与自动化流程(进阶落地)

适合想搭建自动化 AI 工作流、自研内部 AI 工具的人群,掌握 AI 调用外部能力、编排任务。

掌握名词:Function Calling、结构化输出、MCP、Workflow、Agent、Loop、Graph、CLI、Coding Agent。

第四轮:质量管控、安全与运维(商用必备)

面向企业落地、生产环境使用,解决风险、质量、长期监控问题。

掌握名词:Evals、Tracing、可观测性、人机介入、Harness;选学:微调、蒸馏、量化等底层模型优化。

AI 任务自检清单(落地前逐项核对)

任务目标、输出格式是否写进 System Prompt

所需私有资料是否接入知识库 RAG 检索

是否开启结构化输出方便自动化读取

外部工具调用权限是否最小化管控

Agent 循环设置最大轮次、成本上限

高风险动作配置人工审批节点

开启链路追踪,留存完整运行日志

批量任务配套评估规则检测输出错误

8. 全场景风险边界(必须提前规避的 8 类隐患)

8.1 模型幻觉与事实失真

AI 会生成逻辑通顺但完全虚假的人名、合同条款、数据、法规。财务、医疗、法律、对外公开文案,全部必须核对原始权威文件。

8.2 Prompt Injection 提示注入攻击

外部上传文件、网页内容、第三方工具返回数据可能暗藏诱导指令,篡改 AI 原有系统规则。仅靠 System Prompt 无法完全防御,配套方案:输入内容隔离、参数过滤、最小工具权限、关键节点人工复核。

8.3 隐私与数据合规风险

上传企业合同、客户信息、身份证、商业机密前,确认模型服务商数据存储规则。能上传文件 ≠ 法律允许上传,涉密数据禁止接入公共大模型。

8.4 自动执行操作不可逆风险

AI 自动发送邮件、批量修改数据、支付、删除文件、公开发布内容,一旦执行无法撤回。高危操作强制人工二次确认,禁止 Agent 无权限自主执行。

8.5 无限循环带来高额成本失控

无退出条件的 Loop 循环、超长上下文、高等级推理模式会持续消耗 Token,产生高额账单。流程必须设置预算上限、最大循环次数自动终止。

8.6 版权与原创性纠纷

通用行业概念、客观事实不受版权保护;白皮书、案例、专属话术、原创模板、图表文案受著作权保护,商用场景需区分 AI 生成内容版权归属。

8.7 本地 / 离线模型量化精度损失

手机、本地电脑离线运行量化轻量化模型,复杂逻辑、长文本分析准确率明显下降,重要业务不建议纯离线量化模型。

8.8 第三方 MCP 数据源安全漏洞

接入外部 MCP 服务等于开放企业数据访问通道,第三方接口存在泄露、篡改风险,对接前需要校验服务商安全资质、数据传输加密方案。

结语

这份白皮书核心目标:零基础读者不用死记海量英文缩写,快速看懂整套 AI 系统完整运转逻辑。

长期核心能力不在于记住所有新词,而是看到任何 AI 术语,快速完成三层判断:

它属于 AI 系统哪一层(模型 / 资料 / 工具 / 流程 / 管控)

它核心解决哪一类具体痛点

它存在哪些天然局限性,无法解决什么问题

模型版本、行业名词会持续迭代更新,不必追逐每一轮新热点。长期稳定有用的三项核心能力:精准描述任务需求、完整管控全流程风险、持续复盘 AI 输出结果并迭代优化。

0

评论0

请先
显示验证码
没有账号?注册  忘记密码?