本文档整理自对话内容,涵盖模型架构、训练对齐、推理应用、智能体工具及其他常见概念,共 30+ 个高频术语。


一、模型与架构

术语英文含义
大语言模型LLM在海量文本上预训练的语言模型,能理解和生成自然语言,如 GPT-4、Claude、Gemini
多模态模型Multimodal同时处理文字、图像、音频等多种输入类型的模型
基础模型Foundation Model经过大规模预训练、可迁移到各类下游任务的通用模型
TransformerTransformer当前主流神经网络架构,核心机制是自注意力(Self-Attention)
注意力机制Attention模型在处理某个词时,动态关注输入中其他词的权重分配机制
上下文窗口Context Window模型一次能看到的最大 token 数量,决定了"记忆"长度
TokenToken模型处理文本的最小单元,约等于半个到一个中文字或英文词片段
嵌入Embedding将词语/句子转化为数值向量,使模型能计算语义相似度

二、训练与对齐

术语英文含义
预训练Pre-training在海量无标注数据上做自监督学习,让模型掌握语言知识
微调Fine-tuning在预训练基础上,用特定任务数据进一步训练,使模型专业化
指令微调Instruction Tuning用"指令→回答"格式的数据微调,让模型更好地遵循用户指令
人类反馈强化学习RLHF收集人类对模型输出的偏好排序,用于训练奖励模型,再优化 LLM
对齐Alignment让 AI 行为符合人类意图和价值观的研究方向
幻觉Hallucination模型生成听起来可信但实际上不准确或虚构的内容
过拟合Overfitting模型在训练集上表现极好,但泛化到新数据时变差

三、推理与应用

术语英文含义
推理Inference用训练好的模型对新输入进行预测/生成的过程(≠ 数学推理)
提示词Prompt输入给模型的文本指令,是与 LLM 交互的核心方式
提示词工程Prompt Engineering设计和优化提示词以获得更好模型输出的技术
思维链Chain-of-Thought (CoT)让模型在回答前一步步展示推理过程,提升复杂问题准确率
零样本 / 少样本Zero-shot / Few-shot不提供示例(零样本)或提供少量示例(少样本)来引导模型
RAG检索增强生成先从外部知识库检索相关文档,再让 LLM 基于这些文档生成回答
温度Temperature控制生成随机性的参数,越高越"创意",越低越确定

四、智能体与工具

术语英文含义
智能体Agent能感知环境、自主规划并采取行动以完成目标的 AI 系统
多智能体Multi-Agent多个 AI 智能体协作或竞争共同完成复杂任务
工具使用Tool Use / Function Calling模型能调用外部函数或 API(如搜索、代码执行、数据库查询)
MCP模型上下文协议标准化 AI 模型与外部工具/数据源交互的开放协议
编排Orchestration协调多个 AI 组件或 Agent 按顺序/并行完成任务的框架层
记忆MemoryAgent 存储和检索过往对话或经验的机制,分短期/长期记忆
规划PlanningAgent 将目标分解为子任务并决定执行顺序的能力

五、其他常见概念

术语英文含义
向量数据库Vector DB专门存储和检索嵌入向量的数据库,是 RAG 的核心组件
知识截止日期Knowledge Cutoff模型训练数据的时间上限,超过此日期的信息模型无法知晓
护栏Guardrails防止模型生成有害、违规内容的安全约束机制
系统提示System Prompt在对话前设置模型角色和行为规则的后台指令
涌现能力Emergent Ability模型规模扩大后突然显现出的、小模型不具备的能力
扩展定律Scaling Law模型性能随参数量、数据量、算力增加而规律性提升的规律
蒸馏Distillation用大模型(教师)的输出来训练小模型(学生),压缩能力到小模型中

生成日期:2026-03-14