一文梳理清楚生成式 AI 与大模型的相关知识和概念
阅读对象:有一点“生成式 AI / 大模型 / AI 模型”概念的初学者,以及想理解 ChatGPT、Claude、GLM、OpenRouter、阿里云百炼、腾讯云 TokenHub、Ollama 本地模型、AI Agent、多模态和视频生成工具等服务区别的普通用户。
资料时间:截至 2026 年 6 月 25 日。生成式 AI 模型、芯片和云服务变化很快,具体模型规格、价格和可用地区应以官方页面为准。
0. 先给结论
这里说的“生成式 AI(Generative AI)与大模型(large model)”,主要指 ChatGPT、Claude、Gemini、GLM、Qwen、DeepSeek、Sora、Seedance、AI Agent 等这一代以基础模型(foundation model)为核心、能生成文字 / 图片 / 语音 / 视频 / 代码并调用工具的 AI 体系。它不同于更早的传统 AI 应用,比如单一分类、识别、推荐、搜索排序或规则系统。
日常使用的大多数生成式 AI / 大模型服务,本质上可以拆成三层;如果扩展到多模态(multimodal)和 AI Agent,还要分别关注“模型处理什么模态”和“谁负责把任务持续推进下去”:
第一层:模型从哪里来
也就是训练:谁训练了 GPT、Claude、GLM、Qwen、DeepSeek、Llama 等模型。
第二层:模型在哪里运行
也就是推理:你的问题发到哪里,由哪台机器、哪些芯片把答案算出来。
第三层:你通过什么产品或系统使用它
例如 ChatGPT、Claude、智谱开放平台、OpenRouter、阿里云百炼、腾讯云 TokenHub、Ollama、本地网页 UI、企业私有部署等。
多模态层:模型处理哪些输入和输出
例如文字、图片、语音、视频、音频、代码、PDF、屏幕截图等。
Agent 编排层(agent orchestration):谁来规划步骤、调用工具、读写记忆、处理失败、等待人工确认
例如代码 Agent、客服 Agent、办公自动化 Agent、企业流程 Agent、研究助理 Agent 等。
所以,OpenAI、Claude、GLM、Qwen、DeepSeek 这些名字,很多时候指的是“模型或模型厂商”;而 OpenRouter、阿里云百炼、腾讯云 TokenHub、AWS Bedrock、Google Vertex AI 这类平台,更多时候是“模型服务平台 / 云端推理(cloud inference)入口 / 模型聚合与托管平台”;Ollama、llama.cpp、LM Studio 则更偏“本地推理运行器(local inference runtime)”。AI Agent 不是和这些并列的新模型,而是把模型、工具、数据、权限和执行流程组织起来的一种应用形态。
一句话概括:
训练(training)是把模型造出来;推理(inference)是把已经造好的模型拿来回答问题;多模态只是把文字扩展到图片、语音、视频等输入输出;Agent 是把一次次推理和工具调用(tool calling)组织成可持续推进的任务流程。
1. 一个普通问题背后发生了什么?
假设你在 ChatGPT、Claude、GLM 或一个接入 OpenRouter 的代码助手里输入:
帮我分析这段代码哪里可能有 bug。
背后大致发生的是:
用户输入
↓
客户端 / 网页 / App / 插件
↓
API 网关:鉴权、计费、限流、安全检查
↓
模型服务层:选择模型、调度 GPU/NPU、加载上下文
↓
推理引擎:把文字切成 token,运行模型前向计算(forward pass)
↓
逐 token 生成答案
↓
返回给用户
这个过程通常不会重新训练模型。它是在调用已经训练好的模型权重,做一次或多次推理。
如果这个服务接了网页搜索、数据库、代码执行器、文件检索、企业知识库,那么中间还会多出一层:
模型判断需要工具
↓
系统调用搜索 / 数据库 / 代码执行 / 文件检索
↓
把工具结果再交给模型
↓
模型综合结果生成回答
这也是为什么现在的生成式 AI 服务看起来不只是“聊天模型”,而更像“模型 + 工具 + 数据 + 权限 + 云端调度系统”的组合。
如果产品进一步做成 AI Agent,流程会变成循环,而不只是一次问答:
用户给出目标
↓
Agent 理解任务、拆解步骤、判断风险
↓
模型生成计划或下一步动作
↓
系统按权限调用工具:搜索、数据库、代码仓库、浏览器、邮件、工单、终端等
↓
Agent 观察工具结果,更新上下文或记忆
↓
继续下一轮推理和工具调用
↓
完成任务,或在高风险步骤前请求人工确认
因此,Agent 的关键不只是“模型更聪明”,而是系统能否稳定地管理 目标、状态(state)、工具、权限、记忆(memory)、错误恢复和人工介入(human-in-the-loop)。同一个模型,放在普通聊天框里、代码编辑器里、企业工单系统里,能完成的任务会很不一样。
2. 大模型从哪里来:训练阶段
2.1 训练的含义
训练就是把模型参数(parameters)学出来。
LLM 可以粗略理解为一个巨大函数。输入一串 token,它输出下一个 token 的概率。这个函数内部有大量参数。训练阶段就是让模型看海量数据,通过不断预测、比较误差、反向传播(backpropagation)、更新参数,让它逐步学会语言、代码、知识结构、推理模式和任务习惯。
可以类比:
训练 = 培养一个学生
推理 = 让这个学生回答问题或完成任务
训练阶段通常包括:
| 阶段 | 含义 | 结果 |
|---|---|---|
| 预训练(Pretraining) | 用海量通用文本、代码、多模态数据学习基础能力 | 得到基础模型 |
| 后训练(Post-training) | 用指令、对话、偏好、强化学习(reinforcement learning)等方式让模型更会听指令 | 得到可聊天、可执行任务的模型 |
| 微调(Fine-tuning) | 针对某类行业或任务继续训练 | 得到领域模型或企业模型 |
| 对齐(Alignment) | 让模型更符合人类偏好、安全规范和产品要求 | 得到更稳定的服务模型 |
| 蒸馏(Distillation) | 让小模型学习大模型输出 | 得到更便宜、更快的小模型 |
2.2 谁在训练模型?
主要有几类:
| 类型 | 例子 | 特点 |
|---|---|---|
| 闭源模型厂商 | OpenAI、Anthropic、Google DeepMind、xAI 等 | 模型能力强,权重通常不公开,通过 API 或产品提供服务 |
| 中国大模型厂商 | 智谱 / Z.ai、DeepSeek、月之暗面、MiniMax 等 | 有自研模型,也可能开放部分权重或 API |
| 云厂商自研模型 | 阿里 Qwen / 通义千问、腾讯混元、火山豆包等 | 既有模型能力,也有云基础设施和企业服务入口 |
| 开源 / 开放权重模型生态 | Meta Llama、Qwen 开源系列、Mistral、DeepSeek 开源模型等 | 用户可以下载权重,在本地或私有服务器部署 |
模型厂商真正的核心资产通常包括:
- 训练数据和数据清洗体系;
- 模型结构和训练方法;
- 大规模算力集群;
- 训练稳定性工程;
- 后训练和对齐方法;
- 模型评测(evaluation)体系;
- 推理优化和产品化能力。
2.3 LLM、多模态、语音和视频模型的关系
LLM 是“生成式 AI / 大模型服务”的一种,但不是全部。多模态模型、语音模型、图像生成模型、视频生成模型,本质上仍然离不开训练和推理 ,只是输入输出不再只限于文字。
| 类型 | 主要处理什么 | 常见产品形态 | 和 LLM 的关系 |
|---|---|---|---|
| LLM | 文本、代码、结构化文本 | ChatGPT、Claude、GLM、Qwen、Llama 等 | 语言大模型,是很多 AI 产品的核心底座 |
| VLM / 多模态理解模型 | 文本 + 图片 / 截图 / 视频片段 | 读图、分析 PDF、看图表、理解 UI 截图 | 通常把视觉信息编码后交给语言模型或统一模型处理 |
| 语音模型 | 语音识别、语音合成、实时语音对话 | ASR、TTS、Realtime voice、语音助手 | 可以是“语音识别 + LLM + 语音合成”,也可以是原生语音多模态模型 |
| 图像生成模型 | 文生图、图生图、图片编辑 | DALL-E、Stable Diffusion、Midjourney 等 | 不一定是 LLM,常和语言理解模块配合 |
| 视频生成模型 | 文生视频、图生视频、音视频生成 | Sora、Veo、Runway、Seedance 等 | 通常是视频生成基础模型,也会结合语言和多模态理解能力 |
统一来看:
训练 = 用文字、图片、语音、视频等数据学习跨模态规律
推理 = 用户输入文字 / 图片 / 语音 / 视频,模型生成当前结果
所以,多模态和视频生成不是训练、推理之外的新阶段,而是 把同一套“训练权重 + 在线推理”的服务框架扩展到更多模态。
3. 服务如何提供:推理阶段
3.1 推理的含义
推理就是使用已经训练好的模型来生成结果。
模型收到输入后,会先把文字拆成 token,然后根据已有参数计算下一个 token 的概率,再按照一定策略选出下一个 token。生成一个 token 后,把它接到上下文后面,再继续生成下一个 token。
输入 prompt
↓
切成 token
↓
模型计算下一个 token 的概率
↓
选择一个 token 输出
↓
加入上下文
↓
继续生成,直到结束
所以 LLM 的生成常常是“逐字 / 逐 token”流式输出,而不是一次性把全文吐出来。
3.2 推理的两个关键阶段:Prefill 和 Decode
推理内部常被分成两个阶段:
| 阶段 | 做什么 | 主要压力 |
|---|---|---|
| Prefill | 处理用户输入的整段上下文,建立注意力缓存 | 计算量大,适合并行 |
| Decode | 一个 token 一个 token 生成输出 | 更容易被显存带宽、KV cache 和延迟限制 |
这就是为什么“长输入”和“长输出”的成本结构不同:
- 输入很长时,prefill 成本高;
- 输出很长时,decode 时间长;
- 多轮对话很长时,KV cache 占用显存会变大;
- 多用户并发时,调度和缓存管理会变得很重要。