本文档整理自对话内容,涵盖模型架构、训练对齐、推理应用、智能体工具及其他常见概念,共 30+ 个高频术语。
一、模型与架构#
| 术语 | 英文 | 含义 |
|---|
| 大语言模型 | LLM | 在海量文本上预训练的语言模型,能理解和生成自然语言,如 GPT-4、Claude、Gemini |
| 多模态模型 | Multimodal | 同时处理文字、图像、音频等多种输入类型的模型 |
| 基础模型 | Foundation Model | 经过大规模预训练、可迁移到各类下游任务的通用模型 |
| Transformer | Transformer | 当前主流神经网络架构,核心机制是自注意力(Self-Attention) |
| 注意力机制 | Attention | 模型在处理某个词时,动态关注输入中其他词的权重分配机制 |
| 上下文窗口 | Context Window | 模型一次能看到的最大 token 数量,决定了"记忆"长度 |
| Token | Token | 模型处理文本的最小单元,约等于半个到一个中文字或英文词片段 |
| 嵌入 | Embedding | 将词语/句子转化为数值向量,使模型能计算语义相似度 |
二、训练与对齐#
| 术语 | 英文 | 含义 |
|---|
| 预训练 | Pre-training | 在海量无标注数据上做自监督学习,让模型掌握语言知识 |
| 微调 | Fine-tuning | 在预训练基础上,用特定任务数据进一步训练,使模型专业化 |
| 指令微调 | Instruction Tuning | 用"指令→回答"格式的数据微调,让模型更好地遵循用户指令 |
| 人类反馈强化学习 | RLHF | 收集人类对模型输出的偏好排序,用于训练奖励模型,再优化 LLM |
| 对齐 | Alignment | 让 AI 行为符合人类意图和价值观的研究方向 |
| 幻觉 | Hallucination | 模型生成听起来可信但实际上不准确或虚构的内容 |
| 过拟合 | Overfitting | 模型在训练集上表现极好,但泛化到新数据时变差 |
三、推理与应用#
| 术语 | 英文 | 含义 |
|---|
| 推理 | Inference | 用训练好的模型对新输入进行预测/生成的过程(≠ 数学推理) |
| 提示词 | Prompt | 输入给模型的文本指令,是与 LLM 交互的核心方式 |
| 提示词工程 | Prompt Engineering | 设计和优化提示词以获得更好模型输出的技术 |
| 思维链 | Chain-of-Thought (CoT) | 让模型在回答前一步步展示推理过程,提升复杂问题准确率 |
| 零样本 / 少样本 | Zero-shot / Few-shot | 不提供示例(零样本)或提供少量示例(少样本)来引导模型 |
| RAG | 检索增强生成 | 先从外部知识库检索相关文档,再让 LLM 基于这些文档生成回答 |
| 温度 | Temperature | 控制生成随机性的参数,越高越"创意",越低越确定 |
四、智能体与工具#
| 术语 | 英文 | 含义 |
|---|
| 智能体 | Agent | 能感知环境、自主规划并采取行动以完成目标的 AI 系统 |
| 多智能体 | Multi-Agent | 多个 AI 智能体协作或竞争共同完成复杂任务 |
| 工具使用 | Tool Use / Function Calling | 模型能调用外部函数或 API(如搜索、代码执行、数据库查询) |
| MCP | 模型上下文协议 | 标准化 AI 模型与外部工具/数据源交互的开放协议 |
| 编排 | Orchestration | 协调多个 AI 组件或 Agent 按顺序/并行完成任务的框架层 |
| 记忆 | Memory | Agent 存储和检索过往对话或经验的机制,分短期/长期记忆 |
| 规划 | Planning | Agent 将目标分解为子任务并决定执行顺序的能力 |
五、其他常见概念#
| 术语 | 英文 | 含义 |
|---|
| 向量数据库 | Vector DB | 专门存储和检索嵌入向量的数据库,是 RAG 的核心组件 |
| 知识截止日期 | Knowledge Cutoff | 模型训练数据的时间上限,超过此日期的信息模型无法知晓 |
| 护栏 | Guardrails | 防止模型生成有害、违规内容的安全约束机制 |
| 系统提示 | System Prompt | 在对话前设置模型角色和行为规则的后台指令 |
| 涌现能力 | Emergent Ability | 模型规模扩大后突然显现出的、小模型不具备的能力 |
| 扩展定律 | Scaling Law | 模型性能随参数量、数据量、算力增加而规律性提升的规律 |
| 蒸馏 | Distillation | 用大模型(教师)的输出来训练小模型(学生),压缩能力到小模型中 |
生成日期:2026-03-14