AI 大模型技术知识点
更新时间:2026-08-12
这篇笔记按照当前主流大模型应用开发视角整理,重点覆盖模型选型、RAG、Agent、MCP、多模态、微调、部署、评估和安全。
一、大模型是什么
AI 大模型通常指基于海量数据训练、具备强泛化能力的深度学习模型。当前最常见的是大语言模型(LLM),但主流产品已经从“只会文本对话”发展到“文本、图像、音频、视频、代码、工具调用、文件处理、长期任务执行”并行的多模态智能系统。
大模型的核心价值不只是生成文本,而是把自然语言变成新的交互入口:用户用一句话描述目标,模型完成理解、规划、检索、调用工具、生成结果和迭代修正。
二、当前主流模型生态
1. 闭源前沿模型
| 厂商 | 代表模型 | 主要特点 |
|---|---|---|
| OpenAI | GPT-5、GPT-5.6 系列 | 推理、代码、工具调用、多模态、知识工作能力强,API 生态成熟 |
| Anthropic | Claude Sonnet 5、Claude Opus 4.8、Claude Fable 5 | 长文本、代码、Agent、安全对齐表现突出 |
| Google DeepMind | Gemini 3.5、Gemini 3.6 Flash、Gemini Omni | 多模态、长上下文、Google 生态集成、图像/音视频方向强 |
| xAI | Grok 4.5 | 面向编码、Agent 任务和知识工作,强调实时信息和工作流能力 |
2. 开源与开放权重模型
| 模型系列 | 主要特点 |
|---|---|
| Llama 4 | Meta 开放权重模型,强调原生多模态和可本地部署 |
| Qwen3 / Qwen3.8 | 中文、代码、数学、多模态和 Agent 能力强,支持“思考 / 非思考”模式 |
| DeepSeek V4 | 强调高性价比、长上下文、MoE 架构和代码能力 |
| Mistral 3 | 欧洲代表性开放模型,覆盖小模型、MoE 大模型、多模态和企业私有化场景 |
3. 选型思路
不要只看排行榜。真实项目选模型要看五件事:
- 任务类型:聊天、代码、文档、客服、搜索、图像、语音、自动化流程分别适合不同模型。
- 上下文长度:长文档、代码仓库、合同审查需要更长上下文,但长上下文不等于高质量检索。
- 工具调用能力:Agent、MCP、函数调用、浏览器和终端操作都依赖稳定的工具调用能力。
- 成本与延迟:生产系统常用“大模型处理难题,小模型处理高频简单任务”的组合。
- 部署方式:数据敏感场景优先考虑私有化、VPC、国产模型或开源模型。
三、核心架构知识
1. Transformer
Transformer 仍是大模型的基础架构,核心是 Self-Attention。它让模型在生成每个 token 时关注上下文中相关位置,从而理解句子关系、代码依赖、文档结构和多轮对话。
关键组件:
- Tokenization:把文本拆成 token,是模型计算的基本单位。
- Embedding:把 token 转成向量表示。
- Attention:计算上下文中不同 token 的相关性。
- Feed Forward Network:对注意力结果进行非线性变换。
- LayerNorm / RMSNorm:稳定训练和推理。
- 位置编码:让模型知道 token 的顺序,长上下文模型常用 RoPE 及其扩展方案。
2. MoE 架构
MoE(Mixture of Experts,混合专家)是当前很多高性能模型的重要方向。它会在模型内部准备多个专家网络,每次推理只激活部分专家。
优点:
- 总参数可以很大,但每次推理只用一部分参数。
- 在成本可控的情况下提升模型容量。
- 适合代码、数学、多语言、多模态等多任务场景。
注意点:
- MoE 对推理框架、显存、路由策略要求更高。
- 本地部署时不能只看总参数,也要看激活参数和显存占用。
3. 推理模型与 Thinking 模式
2025 年之后,大模型明显分成两类:
- 快速响应模型:适合客服、摘要、分类、改写、简单问答。
- 深度推理模型:适合数学、代码、复杂规划、多步骤工具调用。
很多模型开始提供 Thinking / Non-Thinking、Reasoning Effort、Fast / Pro 等模式。开发时要按任务动态选择,不要所有请求都开最高推理强度。
四、训练与对齐
1. 预训练
预训练阶段让模型从海量文本、代码、图像、音频、视频中学习通用能力。常见目标包括预测下一个 token、跨模态对齐、代码补全、图文匹配等。
2. 指令微调
指令微调让模型学会按照“用户指令 -> 期望回答”的方式工作。它决定了模型是否能听懂任务、遵循格式、处理多轮对话。
3. 偏好对齐
常见方式:
- RLHF:基于人类反馈训练奖励模型,再用强化学习优化。
- DPO / IPO / KTO:更轻量的偏好优化方法,常用于开源模型后训练。
- Constitutional AI:用规则和原则引导模型减少有害输出。
4. 合成数据
高质量合成数据已经成为模型训练和业务微调的重要来源。常见做法是用强模型生成题目、答案、推理过程、工具调用轨迹,再经过过滤、去重、人工抽检后用于训练。
五、Prompt 与上下文工程
Prompt 工程没有消失,而是升级成了上下文工程。
1. Prompt 基础结构
一个稳定的 Prompt 通常包含:
- 角色与目标:模型应该扮演什么角色,最终产出什么。
- 背景信息:业务规则、用户信息、知识片段。
- 约束条件:禁止事项、格式要求、边界条件。
- 输出格式:Markdown、JSON、表格、代码等。
- 示例:复杂任务建议提供少量高质量样例。
2. 上下文工程重点
- 上下文不是越多越好:冗余信息会降低注意力质量,增加成本。
- 结构化比堆材料更重要:标题、编号、字段、表格能提升模型理解。
- 把稳定规则放系统层:角色、边界、安全规则应放在更高优先级上下文。
- 把动态资料走检索:知识库、文件、数据库内容应按需召回。
- 让模型知道不确定性:要求引用来源、标注缺失信息、避免编造。
六、RAG 检索增强生成
RAG(Retrieval-Augmented Generation)是在生成前先从外部知识库检索相关资料,再让模型基于资料回答。它适合企业知识库、产品文档问答、合同制度查询、代码库问答和客服知识库。
1. 标准 RAG 流程
- 文档采集:PDF、Word、Markdown、网页、数据库。
- 文档清洗:去页眉页脚、去重复、保留标题层级。
- 切分 Chunk:按语义、标题、段落或 token 长度切分。
- 向量化 Embedding:把文本转成向量。
- 检索召回:根据用户问题召回相关片段。
- 重排序 Rerank:把最相关内容排到前面。
- 生成回答:把问题和资料交给模型。
- 引用与评估:输出来源,检查是否答非所问。
2. 2026 年常见 RAG 技术
- Hybrid Search:向量检索 + BM25 关键词检索,兼顾语义和精确词匹配。
- Rerank:用重排序模型筛掉弱相关片段。
- Query Rewrite:把口语问题改写成更适合检索的查询。
- Multi-Query Retrieval:从多个角度生成查询,提升召回率。
- Contextual Retrieval:切分时保留文档上下文,减少片段孤岛问题。
- GraphRAG:把实体和关系构造成图,适合组织架构、事件链、知识关系查询。
- Agentic RAG:让 Agent 自主判断是否需要多轮检索、换关键词、调用工具或回退。
- Adaptive RAG:简单问题走快速 RAG,复杂问题走 Agentic RAG 或 GraphRAG。
3. RAG 常见坑
- 文档切分太碎,导致上下文丢失。
- 只做向量检索,遇到专有名词、编号、字段名时召回差。
- 不做 Rerank,模型拿到很多弱相关资料。
- 把太多资料塞进上下文,反而让模型忽略关键证据。
- 没有评估集,无法判断检索质量是否真的变好。
七、Agent 与工具调用
Agent 是能围绕目标进行规划、调用工具、观察结果并继续执行的系统。它不等于“模型更聪明”,而是把模型放进一个可执行环境中。
1. Agent 基本循环
- 理解目标。
- 制定步骤。
- 选择工具。
- 调用工具。
- 观察结果。
- 修正计划。
- 输出结果或继续执行。
2. 常见工具
- 搜索:获取实时信息。
- 数据库:查询业务数据。
- 文件系统:读取、写入、整理文件。
- 浏览器:访问页面、点击、填写表单。
- 代码执行:计算、分析、生成图表。
- 企业应用:邮件、日历、Slack、Notion、GitHub、工单系统。
3. Agent 设计原则
- 权限最小化:只给任务需要的工具和数据。
- 关键操作需确认:删除、支付、发邮件、上线部署等操作需要审批。
- 可观测性:记录每次工具调用、输入、输出、耗时和错误。
- 可恢复:长任务要支持断点、重试和回滚。
- 人机协同:复杂任务保留人工介入点,而不是完全黑箱自动化。
八、MCP:模型上下文协议
MCP(Model Context Protocol)是连接大模型应用和外部工具 / 数据源的开放协议。它把“模型如何访问文件、数据库、API、企业系统”标准化,降低每个应用重复开发工具接入层的成本。
1. MCP 的角色
- MCP Host:承载模型的应用,例如 IDE、聊天工具、Agent 平台。
- MCP Client:Host 内部负责连接 MCP Server 的客户端。
- MCP Server:暴露工具、资源和提示模板的服务端。
2. MCP 能力
- Tools:让模型调用外部动作,如查询数据库、创建 issue、读取文件。
- Resources:提供可读取上下文,如文档、表结构、日志、配置。
- Prompts:提供可复用提示模板。
- Authorization:控制工具访问权限和用户授权。
3. 2026 年关注点
最新 MCP 规范强调无状态协议核心、多轮请求、授权加固、扩展框架和更成熟的 SDK。对开发者来说,MCP 正在成为 Agent 应用的“USB-C 接口”:工具可以被不同模型应用复用。
九、多模态大模型
多模态模型可以同时处理文本、图像、音频、视频、屏幕和文件。主流应用已经覆盖:
- 图像理解:看截图、识别 UI、分析图表、理解照片。
- 图像生成与编辑:海报、商品图、头像、插画、局部重绘。
- 语音输入输出:实时语音对话、会议转写、播客摘要。
- 视频生成与理解:视频脚本、分镜、短视频生成、视频内容问答。
- 文档理解:PDF、表格、发票、合同、PPT、扫描件。
- 屏幕操作:看见应用界面后点击、输入、完成任务。
开发时要区分两件事:
- 模型是否能看懂模态:例如图片、音频、视频输入。
- 模型是否能稳定操作工具:例如编辑图片、生成视频、控制浏览器、处理文件。
十、微调与模型定制
1. 什么时候需要微调
优先顺序通常是:
- 先优化 Prompt。
- 再做 RAG。
- 再做工具调用或工作流。
- 最后考虑微调。
适合微调的场景:
- 固定格式输出非常多。
- 行业术语、话术、风格高度统一。
- 分类、抽取、改写等任务有大量高质量样本。
- 希望小模型在特定任务上接近大模型效果。
不适合微调的场景:
- 只是缺少最新知识。
- 业务数据经常变化。
- 数据质量差、样本少。
- 希望模型“记住”数据库内容。
2. 常见微调方式
- LoRA / QLoRA:成本低,适合开源模型定制。
- 全参数微调:成本高,适合模型厂商或大规模团队。
- Embedding 微调:提升检索召回质量。
- 偏好微调:让模型更符合企业风格和安全边界。
- 蒸馏:用强模型生成数据,训练更便宜的小模型。
十一、部署与推理优化
1. API 调用
优点是接入快、能力强、运维成本低;缺点是成本、延迟、数据合规和供应商绑定需要评估。适合大多数早期产品和业务验证。
2. 私有化部署
适合数据敏感、成本可控、调用量大或需要离线运行的场景。常见方案包括 Ollama、vLLM、TensorRT-LLM、SGLang、LM Studio、Xinference 等。
3. 推理优化技术
- KV Cache:缓存历史上下文,加速自回归生成。
- Batching:多个请求合并推理,提高吞吐。
- Speculative Decoding:小模型草稿 + 大模型验证,降低延迟。
- Quantization:INT8、INT4、AWQ、GPTQ 等量化方式减少显存占用。
- Prefix Cache:复用系统提示和固定上下文。
- 模型路由:简单任务走便宜模型,复杂任务走强模型。
十二、应用开发框架
1. LangChain 与 LangGraph
LangChain 更适合快速构建 LLM 应用和标准 Agent 流程。LangGraph 更适合生产级 Agent,强调状态管理、图结构编排、持久化、人类介入和长任务控制。
选型建议:
- 简单聊天、RAG、工具调用:LangChain 足够。
- 多步骤、可恢复、需要审批、长时间运行的 Agent:优先 LangGraph。
2. Dify
Dify 是面向生产的可视化 LLM 应用平台,适合快速搭建 Agentic Workflow、RAG 管道、Prompt 管理、工具调用和 LLMOps。它适合内部工具、知识库问答、客服机器人和流程自动化。
3. 其他常见组件
- 向量数据库:Milvus、Qdrant、Weaviate、Chroma、pgvector、Elasticsearch。
- 模型网关:LiteLLM、OpenRouter、自建模型路由层。
- 观测评估:LangSmith、Arize Phoenix、Weights & Biases、Helicone。
- 工作流编排:Dify、LangGraph、Temporal、n8n。
十三、评估体系
上线大模型应用不能只靠“感觉还行”。至少要评估四层:
1. 模型能力评估
- 通用问答是否准确。
- 代码生成是否可运行。
- 推理题是否稳定。
- 多模态理解是否可靠。
2. RAG 评估
- Recall:正确资料有没有被召回。
- Precision:召回内容是否相关。
- Faithfulness:回答是否忠于资料。
- Citation:引用是否能对应到原文。
3. Agent 评估
- 工具是否选对。
- 参数是否填对。
- 失败后是否会重试。
- 是否会越权操作。
- 长任务是否能恢复。
4. 业务评估
- 用户满意度。
- 人工接管率。
- 平均响应时间。
- 单次任务成本。
- 错误率和投诉率。
十四、安全与合规
1. 常见风险
- 幻觉:模型编造事实、链接、法律条款、接口参数。
- 提示注入:用户或文档诱导模型忽略系统规则。
- 数据泄露:把隐私、密钥、内部文档发送到不该发送的模型。
- 工具滥用:Agent 调用危险工具,执行删除、转账、发信等操作。
- 版权与内容风险:生成内容可能涉及侵权或不当用途。
2. 防护措施
- 敏感数据脱敏和权限隔离。
- 工具白名单与参数校验。
- 高风险操作人工确认。
- RAG 文档来源可信度标记。
- 输出内容安全审核。
- 日志审计与异常告警。
- 对模型输出做事实校验和引用追踪。
十五、学习路线
1. 入门阶段
- 了解 Transformer、token、上下文窗口、Embedding。
- 学会调用一个主流模型 API。
- 掌握 Prompt 基础写法。
- 做一个简单聊天应用。
2. 应用阶段
- 搭建 RAG 知识库。
- 接入向量数据库和 Rerank。
- 使用 Function Calling / Tools。
- 做一个带文件、搜索或数据库能力的 Agent。
3. 工程阶段
- 做模型路由、缓存、限流和日志。
- 建立评估集和回归测试。
- 接入 LangGraph、Dify 或自研工作流。
- 处理权限、安全、成本和可观测性。
4. 进阶阶段
- 学习 LoRA / QLoRA 微调。
- 本地部署开源模型。
- 优化推理性能和 GPU 成本。
- 研究多模态、Agentic RAG、GraphRAG 和 MCP 生态。
十六、总结
当前大模型技术的重点,已经从“哪个模型更大”转向“如何把模型稳定接入真实业务”。真正有价值的能力通常来自模型、数据、工具、工作流、评估和安全机制的组合。
开发者需要重点掌握:
- 会选模型:理解闭源、开源、小模型、推理模型、多模态模型的差异。
- 会接知识:用 RAG、Hybrid Search、Rerank、GraphRAG 解决私有知识问题。
- 会做工具:用 Function Calling、Agent、MCP 把模型接入外部系统。
- 会做工程:控制成本、延迟、日志、权限、评估和回滚。
- 会做安全:防幻觉、防注入、防泄露、防越权。
大模型不是单个 API,而是一套新的软件工程范式。谁能把模型能力和业务流程稳定结合起来,谁就能真正把 AI 变成生产力。