Skip to content

AI 大模型技术知识点 ​

更新时间:2026-08-12
这篇笔记按照当前主流大模型应用开发视角整理,重点覆盖模型选型、RAG、Agent、MCP、多模态、微调、部署、评估和安全。

一、大模型是什么 ​

AI 大模型通常指基于海量数据训练、具备强泛化能力的深度学习模型。当前最常见的是大语言模型(LLM),但主流产品已经从“只会文本对话”发展到“文本、图像、音频、视频、代码、工具调用、文件处理、长期任务执行”并行的多模态智能系统。

大模型的核心价值不只是生成文本,而是把自然语言变成新的交互入口:用户用一句话描述目标,模型完成理解、规划、检索、调用工具、生成结果和迭代修正。

二、当前主流模型生态 ​

1. 闭源前沿模型 ​

厂商代表模型主要特点
OpenAIGPT-5、GPT-5.6 系列推理、代码、工具调用、多模态、知识工作能力强,API 生态成熟
AnthropicClaude Sonnet 5、Claude Opus 4.8、Claude Fable 5长文本、代码、Agent、安全对齐表现突出
Google DeepMindGemini 3.5、Gemini 3.6 Flash、Gemini Omni多模态、长上下文、Google 生态集成、图像/音视频方向强
xAIGrok 4.5面向编码、Agent 任务和知识工作,强调实时信息和工作流能力

2. 开源与开放权重模型 ​

模型系列主要特点
Llama 4Meta 开放权重模型,强调原生多模态和可本地部署
Qwen3 / Qwen3.8中文、代码、数学、多模态和 Agent 能力强,支持“思考 / 非思考”模式
DeepSeek V4强调高性价比、长上下文、MoE 架构和代码能力
Mistral 3欧洲代表性开放模型,覆盖小模型、MoE 大模型、多模态和企业私有化场景

3. 选型思路 ​

不要只看排行榜。真实项目选模型要看五件事:

  1. 任务类型:聊天、代码、文档、客服、搜索、图像、语音、自动化流程分别适合不同模型。
  2. 上下文长度:长文档、代码仓库、合同审查需要更长上下文,但长上下文不等于高质量检索。
  3. 工具调用能力:Agent、MCP、函数调用、浏览器和终端操作都依赖稳定的工具调用能力。
  4. 成本与延迟:生产系统常用“大模型处理难题,小模型处理高频简单任务”的组合。
  5. 部署方式:数据敏感场景优先考虑私有化、VPC、国产模型或开源模型。

三、核心架构知识 ​

1. Transformer ​

Transformer 仍是大模型的基础架构,核心是 Self-Attention。它让模型在生成每个 token 时关注上下文中相关位置,从而理解句子关系、代码依赖、文档结构和多轮对话。

关键组件:

  • Tokenization:把文本拆成 token,是模型计算的基本单位。
  • Embedding:把 token 转成向量表示。
  • Attention:计算上下文中不同 token 的相关性。
  • Feed Forward Network:对注意力结果进行非线性变换。
  • LayerNorm / RMSNorm:稳定训练和推理。
  • 位置编码:让模型知道 token 的顺序,长上下文模型常用 RoPE 及其扩展方案。

2. MoE 架构 ​

MoE(Mixture of Experts,混合专家)是当前很多高性能模型的重要方向。它会在模型内部准备多个专家网络,每次推理只激活部分专家。

优点:

  • 总参数可以很大,但每次推理只用一部分参数。
  • 在成本可控的情况下提升模型容量。
  • 适合代码、数学、多语言、多模态等多任务场景。

注意点:

  • MoE 对推理框架、显存、路由策略要求更高。
  • 本地部署时不能只看总参数,也要看激活参数和显存占用。

3. 推理模型与 Thinking 模式 ​

2025 年之后,大模型明显分成两类:

  • 快速响应模型:适合客服、摘要、分类、改写、简单问答。
  • 深度推理模型:适合数学、代码、复杂规划、多步骤工具调用。

很多模型开始提供 Thinking / Non-Thinking、Reasoning Effort、Fast / Pro 等模式。开发时要按任务动态选择,不要所有请求都开最高推理强度。

四、训练与对齐 ​

1. 预训练 ​

预训练阶段让模型从海量文本、代码、图像、音频、视频中学习通用能力。常见目标包括预测下一个 token、跨模态对齐、代码补全、图文匹配等。

2. 指令微调 ​

指令微调让模型学会按照“用户指令 -> 期望回答”的方式工作。它决定了模型是否能听懂任务、遵循格式、处理多轮对话。

3. 偏好对齐 ​

常见方式:

  • RLHF:基于人类反馈训练奖励模型,再用强化学习优化。
  • DPO / IPO / KTO:更轻量的偏好优化方法,常用于开源模型后训练。
  • Constitutional AI:用规则和原则引导模型减少有害输出。

4. 合成数据 ​

高质量合成数据已经成为模型训练和业务微调的重要来源。常见做法是用强模型生成题目、答案、推理过程、工具调用轨迹,再经过过滤、去重、人工抽检后用于训练。

五、Prompt 与上下文工程 ​

Prompt 工程没有消失,而是升级成了上下文工程。

1. Prompt 基础结构 ​

一个稳定的 Prompt 通常包含:

  1. 角色与目标:模型应该扮演什么角色,最终产出什么。
  2. 背景信息:业务规则、用户信息、知识片段。
  3. 约束条件:禁止事项、格式要求、边界条件。
  4. 输出格式:Markdown、JSON、表格、代码等。
  5. 示例:复杂任务建议提供少量高质量样例。

2. 上下文工程重点 ​

  • 上下文不是越多越好:冗余信息会降低注意力质量,增加成本。
  • 结构化比堆材料更重要:标题、编号、字段、表格能提升模型理解。
  • 把稳定规则放系统层:角色、边界、安全规则应放在更高优先级上下文。
  • 把动态资料走检索:知识库、文件、数据库内容应按需召回。
  • 让模型知道不确定性:要求引用来源、标注缺失信息、避免编造。

六、RAG 检索增强生成 ​

RAG(Retrieval-Augmented Generation)是在生成前先从外部知识库检索相关资料,再让模型基于资料回答。它适合企业知识库、产品文档问答、合同制度查询、代码库问答和客服知识库。

1. 标准 RAG 流程 ​

  1. 文档采集:PDF、Word、Markdown、网页、数据库。
  2. 文档清洗:去页眉页脚、去重复、保留标题层级。
  3. 切分 Chunk:按语义、标题、段落或 token 长度切分。
  4. 向量化 Embedding:把文本转成向量。
  5. 检索召回:根据用户问题召回相关片段。
  6. 重排序 Rerank:把最相关内容排到前面。
  7. 生成回答:把问题和资料交给模型。
  8. 引用与评估:输出来源,检查是否答非所问。

2. 2026 年常见 RAG 技术 ​

  • Hybrid Search:向量检索 + BM25 关键词检索,兼顾语义和精确词匹配。
  • Rerank:用重排序模型筛掉弱相关片段。
  • Query Rewrite:把口语问题改写成更适合检索的查询。
  • Multi-Query Retrieval:从多个角度生成查询,提升召回率。
  • Contextual Retrieval:切分时保留文档上下文,减少片段孤岛问题。
  • GraphRAG:把实体和关系构造成图,适合组织架构、事件链、知识关系查询。
  • Agentic RAG:让 Agent 自主判断是否需要多轮检索、换关键词、调用工具或回退。
  • Adaptive RAG:简单问题走快速 RAG,复杂问题走 Agentic RAG 或 GraphRAG。

3. RAG 常见坑 ​

  • 文档切分太碎,导致上下文丢失。
  • 只做向量检索,遇到专有名词、编号、字段名时召回差。
  • 不做 Rerank,模型拿到很多弱相关资料。
  • 把太多资料塞进上下文,反而让模型忽略关键证据。
  • 没有评估集,无法判断检索质量是否真的变好。

七、Agent 与工具调用 ​

Agent 是能围绕目标进行规划、调用工具、观察结果并继续执行的系统。它不等于“模型更聪明”,而是把模型放进一个可执行环境中。

1. Agent 基本循环 ​

  1. 理解目标。
  2. 制定步骤。
  3. 选择工具。
  4. 调用工具。
  5. 观察结果。
  6. 修正计划。
  7. 输出结果或继续执行。

2. 常见工具 ​

  • 搜索:获取实时信息。
  • 数据库:查询业务数据。
  • 文件系统:读取、写入、整理文件。
  • 浏览器:访问页面、点击、填写表单。
  • 代码执行:计算、分析、生成图表。
  • 企业应用:邮件、日历、Slack、Notion、GitHub、工单系统。

3. Agent 设计原则 ​

  • 权限最小化:只给任务需要的工具和数据。
  • 关键操作需确认:删除、支付、发邮件、上线部署等操作需要审批。
  • 可观测性:记录每次工具调用、输入、输出、耗时和错误。
  • 可恢复:长任务要支持断点、重试和回滚。
  • 人机协同:复杂任务保留人工介入点,而不是完全黑箱自动化。

八、MCP:模型上下文协议 ​

MCP(Model Context Protocol)是连接大模型应用和外部工具 / 数据源的开放协议。它把“模型如何访问文件、数据库、API、企业系统”标准化,降低每个应用重复开发工具接入层的成本。

1. MCP 的角色 ​

  • MCP Host:承载模型的应用,例如 IDE、聊天工具、Agent 平台。
  • MCP Client:Host 内部负责连接 MCP Server 的客户端。
  • MCP Server:暴露工具、资源和提示模板的服务端。

2. MCP 能力 ​

  • Tools:让模型调用外部动作,如查询数据库、创建 issue、读取文件。
  • Resources:提供可读取上下文,如文档、表结构、日志、配置。
  • Prompts:提供可复用提示模板。
  • Authorization:控制工具访问权限和用户授权。

3. 2026 年关注点 ​

最新 MCP 规范强调无状态协议核心、多轮请求、授权加固、扩展框架和更成熟的 SDK。对开发者来说,MCP 正在成为 Agent 应用的“USB-C 接口”:工具可以被不同模型应用复用。

九、多模态大模型 ​

多模态模型可以同时处理文本、图像、音频、视频、屏幕和文件。主流应用已经覆盖:

  • 图像理解:看截图、识别 UI、分析图表、理解照片。
  • 图像生成与编辑:海报、商品图、头像、插画、局部重绘。
  • 语音输入输出:实时语音对话、会议转写、播客摘要。
  • 视频生成与理解:视频脚本、分镜、短视频生成、视频内容问答。
  • 文档理解:PDF、表格、发票、合同、PPT、扫描件。
  • 屏幕操作:看见应用界面后点击、输入、完成任务。

开发时要区分两件事:

  1. 模型是否能看懂模态:例如图片、音频、视频输入。
  2. 模型是否能稳定操作工具:例如编辑图片、生成视频、控制浏览器、处理文件。

十、微调与模型定制 ​

1. 什么时候需要微调 ​

优先顺序通常是:

  1. 先优化 Prompt。
  2. 再做 RAG。
  3. 再做工具调用或工作流。
  4. 最后考虑微调。

适合微调的场景:

  • 固定格式输出非常多。
  • 行业术语、话术、风格高度统一。
  • 分类、抽取、改写等任务有大量高质量样本。
  • 希望小模型在特定任务上接近大模型效果。

不适合微调的场景:

  • 只是缺少最新知识。
  • 业务数据经常变化。
  • 数据质量差、样本少。
  • 希望模型“记住”数据库内容。

2. 常见微调方式 ​

  • LoRA / QLoRA:成本低,适合开源模型定制。
  • 全参数微调:成本高,适合模型厂商或大规模团队。
  • Embedding 微调:提升检索召回质量。
  • 偏好微调:让模型更符合企业风格和安全边界。
  • 蒸馏:用强模型生成数据,训练更便宜的小模型。

十一、部署与推理优化 ​

1. API 调用 ​

优点是接入快、能力强、运维成本低;缺点是成本、延迟、数据合规和供应商绑定需要评估。适合大多数早期产品和业务验证。

2. 私有化部署 ​

适合数据敏感、成本可控、调用量大或需要离线运行的场景。常见方案包括 Ollama、vLLM、TensorRT-LLM、SGLang、LM Studio、Xinference 等。

3. 推理优化技术 ​

  • KV Cache:缓存历史上下文,加速自回归生成。
  • Batching:多个请求合并推理,提高吞吐。
  • Speculative Decoding:小模型草稿 + 大模型验证,降低延迟。
  • Quantization:INT8、INT4、AWQ、GPTQ 等量化方式减少显存占用。
  • Prefix Cache:复用系统提示和固定上下文。
  • 模型路由:简单任务走便宜模型,复杂任务走强模型。

十二、应用开发框架 ​

1. LangChain 与 LangGraph ​

LangChain 更适合快速构建 LLM 应用和标准 Agent 流程。LangGraph 更适合生产级 Agent,强调状态管理、图结构编排、持久化、人类介入和长任务控制。

选型建议:

  • 简单聊天、RAG、工具调用:LangChain 足够。
  • 多步骤、可恢复、需要审批、长时间运行的 Agent:优先 LangGraph。

2. Dify ​

Dify 是面向生产的可视化 LLM 应用平台,适合快速搭建 Agentic Workflow、RAG 管道、Prompt 管理、工具调用和 LLMOps。它适合内部工具、知识库问答、客服机器人和流程自动化。

3. 其他常见组件 ​

  • 向量数据库:Milvus、Qdrant、Weaviate、Chroma、pgvector、Elasticsearch。
  • 模型网关:LiteLLM、OpenRouter、自建模型路由层。
  • 观测评估:LangSmith、Arize Phoenix、Weights & Biases、Helicone。
  • 工作流编排:Dify、LangGraph、Temporal、n8n。

十三、评估体系 ​

上线大模型应用不能只靠“感觉还行”。至少要评估四层:

1. 模型能力评估 ​

  • 通用问答是否准确。
  • 代码生成是否可运行。
  • 推理题是否稳定。
  • 多模态理解是否可靠。

2. RAG 评估 ​

  • Recall:正确资料有没有被召回。
  • Precision:召回内容是否相关。
  • Faithfulness:回答是否忠于资料。
  • Citation:引用是否能对应到原文。

3. Agent 评估 ​

  • 工具是否选对。
  • 参数是否填对。
  • 失败后是否会重试。
  • 是否会越权操作。
  • 长任务是否能恢复。

4. 业务评估 ​

  • 用户满意度。
  • 人工接管率。
  • 平均响应时间。
  • 单次任务成本。
  • 错误率和投诉率。

十四、安全与合规 ​

1. 常见风险 ​

  • 幻觉:模型编造事实、链接、法律条款、接口参数。
  • 提示注入:用户或文档诱导模型忽略系统规则。
  • 数据泄露:把隐私、密钥、内部文档发送到不该发送的模型。
  • 工具滥用:Agent 调用危险工具,执行删除、转账、发信等操作。
  • 版权与内容风险:生成内容可能涉及侵权或不当用途。

2. 防护措施 ​

  • 敏感数据脱敏和权限隔离。
  • 工具白名单与参数校验。
  • 高风险操作人工确认。
  • RAG 文档来源可信度标记。
  • 输出内容安全审核。
  • 日志审计与异常告警。
  • 对模型输出做事实校验和引用追踪。

十五、学习路线 ​

1. 入门阶段 ​

  1. 了解 Transformer、token、上下文窗口、Embedding。
  2. 学会调用一个主流模型 API。
  3. 掌握 Prompt 基础写法。
  4. 做一个简单聊天应用。

2. 应用阶段 ​

  1. 搭建 RAG 知识库。
  2. 接入向量数据库和 Rerank。
  3. 使用 Function Calling / Tools。
  4. 做一个带文件、搜索或数据库能力的 Agent。

3. 工程阶段 ​

  1. 做模型路由、缓存、限流和日志。
  2. 建立评估集和回归测试。
  3. 接入 LangGraph、Dify 或自研工作流。
  4. 处理权限、安全、成本和可观测性。

4. 进阶阶段 ​

  1. 学习 LoRA / QLoRA 微调。
  2. 本地部署开源模型。
  3. 优化推理性能和 GPU 成本。
  4. 研究多模态、Agentic RAG、GraphRAG 和 MCP 生态。

十六、总结 ​

当前大模型技术的重点,已经从“哪个模型更大”转向“如何把模型稳定接入真实业务”。真正有价值的能力通常来自模型、数据、工具、工作流、评估和安全机制的组合。

开发者需要重点掌握:

  1. 会选模型:理解闭源、开源、小模型、推理模型、多模态模型的差异。
  2. 会接知识:用 RAG、Hybrid Search、Rerank、GraphRAG 解决私有知识问题。
  3. 会做工具:用 Function Calling、Agent、MCP 把模型接入外部系统。
  4. 会做工程:控制成本、延迟、日志、权限、评估和回滚。
  5. 会做安全:防幻觉、防注入、防泄露、防越权。

大模型不是单个 API,而是一套新的软件工程范式。谁能把模型能力和业务流程稳定结合起来,谁就能真正把 AI 变成生产力。

参考资料 ​

Released under the MIT License.