AI 相关术语归纳
核心概念:Agent / MCP / Skill
Agent(智能体)
指能够自主完成多步骤任务的AI系统,核心特征是:接收目标 → 自己规划步骤 → 调用工具 → 观察结果 → 调整下一步,如此循环,直到完成任务,而不是一问一答。
比如你让一个Agent"帮我调研一下某个市场",它可能会自己决定:先搜索几个关键词,再打开几个网页看详情,再整理成总结——这一串动作是它自己规划的,不需要你每一步都指挥。
普通对话式AI 和 Agent 的区别,主要在于有没有自主的多轮工具调用和决策能力。
MCP(Model Context Protocol)
这是Anthropic提出的一个开放协议,用来标准化AI模型如何连接外部数据源和工具(比如Google Drive、Slack、GitHub、数据库等)。
可以把它理解成"AI界的USB接口":以前每接入一个新工具都要单独写一套定制集成代码,MCP统一了这个接口规范,让工具开发者只需要按这个协议实现一次"MCP Server",任何支持MCP的AI客户端就都能调用它,不用重复造轮子。
在实际使用中你会看到"connector"(连接器)这种说法——那就是通过MCP接入的外部服务。
Skill
这个词现在有点overload,取决于语境:
- 在Anthropic的产品里:Skill 指一套打包好的"最佳实践文档+脚本",专门针对某类任务(比如生成docx、pptx文件),本质上是给模型的"操作手册",告诉它这类任务里有哪些环境限制、该怎么做才专业。
- 更泛化地说:也可以指Agent具备的某种"能力模块",比如"写代码的能力""调用某个API的能力",是可插拔、可复用的技能单元。
三者如何协同工作
一个典型场景:Agent 是大脑(负责决策和规划)→ MCP 是它接入外部世界的接口(负责连接工具/数据)→ Skill 是它执行某类具体任务时参考的操作规范(负责保证质量和方法正确)。
三者不是互相替代的关系,而是同一个系统里不同的组成部分。
与"输入/输出格式"相关
| 术语 | 说明 |
|---|
| Prompt(提示词) | 你给模型的输入指令 |
| System Prompt(系统提示词) | 对话开始前设定的"角色设定/行为规则",用户看不到但决定AI的行为边界 |
| Context Window(上下文窗口) | 模型一次能"记住"的信息量上限,通常以token数衡量 |
| Token | 文本被切分后的最小处理单元,大致是"一个词的一部分" |
与"模型能力增强"相关
| 术语 | 说明 |
|---|
| RAG(检索增强生成) | 让模型先去外部知识库/文档里检索相关信息,再结合检索结果生成回答,而不是完全依赖训练时记住的内容 |
| Fine-tuning(微调) | 用特定数据继续训练一个已有模型,让它更适应某个专用场景 |
| Embedding(嵌入向量) | 把文字/图片转成一串数字向量,用来做语义相似度搜索,是RAG的底层技术之一 |
| Vector Database(向量数据库) | 专门存储和检索embedding的数据库,比如Pinecone、Weaviate |
与"工具调用/多步骤任务"相关
| 术语 | 说明 |
|---|
| Function Calling / Tool Use | 模型判断需要调用某个外部函数/API来获取信息或执行操作,是Agent能力的基础机制 |
| Orchestration(编排) | 管理多个Agent或多个步骤之间协作顺序的机制 |
| Multi-agent System(多智能体系统) | 多个Agent分工协作完成一个复杂任务,比如一个负责搜索、一个负责写代码、一个负责审核 |
与"推理能力"相关
| 术语 | 说明 |
|---|
| Chain-of-Thought / CoT(思维链) | 让模型把中间推理步骤显式写出来,而不是直接跳到答案,通常能提升复杂问题的准确率 |
| Reasoning Model(推理模型) | 专门针对复杂推理任务优化过的模型(比如做更长时间的内部思考再回答) |
与"评估/对齐"相关
| 术语 | 说明 |
|---|
| Hallucination(幻觉) | 模型自信地编造不存在的事实 |
| Alignment(对齐) | 让模型的行为符合人类意图和价值观的技术和研究方向 |
| RLHF(人类反馈强化学习) | 用人类的偏好反馈来调整模型行为的训练方法 |
模型架构类
| 术语 | 说明 |
|---|
| Transformer | 目前主流大模型的底层网络架构,核心机制是Attention |
| Attention(注意力机制) | 让模型在处理某个词时,动态判断该"重点关注"输入中的哪些其他部分 |
| Parameters(参数量) | 模型内部可调整的数值总数,常用"7B""70B"表示,通常(但不绝对)参数越多能力越强 |
| MoE(混合专家模型) | 模型内部分成多个"专家"子网络,每次推理只激活其中一部分,兼顾大模型能力和推理效率 |
| Multimodal(多模态) | 能同时处理文本、图像、音频等多种类型输入/输出的模型 |
| Context Length(上下文长度) | 与Context Window类似,指模型能处理的最大输入长度 |
训练流程类
| 术语 | 说明 |
|---|
| Pretraining(预训练) | 用海量通用文本训练出基础模型的第一阶段 |
| SFT(监督微调) | 用人工标注的高质量问答对,教模型"该怎么回答" |
| Distillation(蒸馏) | 用一个大模型的输出去训练一个小模型,让小模型学到接近大模型的能力但更轻量 |
| Quantization(量化) | 把模型参数从高精度数值压缩成低精度,减少显存占用、提升推理速度,一定程度牺牲精度 |
| Synthetic Data(合成数据) | 由AI生成、而非人工采集的训练数据 |
推理/生成参数类
| 术语 | 说明 |
|---|
| Temperature(温度) | 控制生成内容随机性的参数,越高越"有创意"/不确定,越低越保守/确定 |
| Top-p / Top-k Sampling | 控制模型在生成每个词时从候选词里选择范围的采样策略 |
| Streaming(流式输出) | 模型边生成边返回内容,而不是等全部生成完再一次性返回 |
| Latency / Throughput(延迟/吞吐量) | 延迟指单次响应耗时,吞吐量指单位时间能处理的请求量,是部署时的关键性能指标 |
Agent 进阶概念
| 术语 | 说明 |
|---|
| ReAct(Reasoning + Acting) | 一种Agent工作模式:模型交替"推理"和"行动"(调用工具),是很多Agent框架的理论基础 |
| Planning(规划) | Agent在执行前先拆解任务为多个子步骤的能力 |
| Memory(记忆) | Agent保留跨会话/跨步骤信息的机制,分短期记忆(当前任务上下文)和长期记忆(跨对话持久化) |
| Sandbox(沙箱) | Agent执行代码/操作时的隔离环境,防止误操作影响真实系统 |
| Guardrails(护栏) | 限制模型输出范围、防止其做危险/越权操作的规则和机制 |
安全与对抗类
| 术语 | 说明 |
|---|
| Jailbreak(越狱) | 用特殊提示词绕过模型安全限制,诱导其输出本应拒绝的内容 |
| Prompt Injection(提示词注入) | 通过在输入内容(如网页、文档)中藏入恶意指令,劫持模型行为 |
| Red Teaming(红队测试) | 主动尝试攻击/诱导模型犯错,以发现并修补安全漏洞 |
| Constitutional AI | Anthropic提出的一种对齐方法,让模型根据一套"原则"自我批评和修正输出,减少对人工标注的依赖 |
Prompt Engineering 类
| 术语 | 说明 |
|---|
| Zero-shot / Few-shot | Zero-shot指不给示例直接让模型做任务;Few-shot指提示词里给几个示例帮模型理解任务模式 |
| In-context Learning(上下文学习) | 模型仅凭提示词里的信息/示例就"学会"当前任务,不需要重新训练 |
| Prompt Chaining(提示词链) | 把复杂任务拆成多步提示词,前一步的输出作为后一步的输入 |
| Structured Output(结构化输出) | 让模型按固定格式(如JSON)返回结果,方便程序直接解析使用 |
评估类
| 术语 | 说明 |
|---|
| Benchmark(基准测试) | 用标准化题目集测试和对比不同模型的能力,如MMLU、SWE-bench |
| Ground Truth(真实标签) | 用来核对模型输出是否正确的"标准答案" |
生态/产品类
| 术语 | 说明 |
|---|
| Open Weight / Closed Weight(开放权重/闭源权重) | 指模型参数文件是否公开可下载,如Llama、Qwen是开放权重,Claude、GPT是闭源权重(仅通过API访问) |
| Model Card(模型卡) | 模型发布方公布的说明文档,介绍能力、局限、训练数据、适用场景等 |
| SDK | 官方提供的编程库,方便开发者调用模型API |
国际闭源三强
- Claude(Anthropic):目前主线是Sonnet 5、Opus 4.8,以及定位更高的Fable 5(Mythos 5同级但仅限定机构使用)。口碑上偏向代码/Agent能力强、写作风格自然、长文档处理稳定,但多模态能力相对保守,价格在主流里偏高。适合:程序员、需要严谨长文本处理的场景、Agent自动化任务。
- GPT(OpenAI):主线是GPT-5.x系列,定位综合能力均衡、生态最完善(插件、GPTs、图像生成等)。适合:日常通用问答、需要丰富第三方生态的场景。
- Gemini(Google):主线是Gemini 3.x系列,核心优势是原生多模态(文本/图像/音频/视频同一架构处理)、超长上下文窗口、与Google生态(Drive、Workspace、安卓)深度绑定,价格也偏低。适合:多模态任务(视频/图片分析)、谷歌生态重度用户、需要超长上下文的场景。
国内代表
- DeepSeek:以极低成本和强数学/代码能力著称,是开源生态的重要力量,中文理解能力评价很高,适合预算有限或需要私有化部署的场景。
- 通义千问(Qwen)、Kimi、豆包(Doubao)、GLM 等:在中文长文档处理、垂直行业场景各有侧重,通常价格更低、访问更稳定。
一个务实的建议
这些模型不再比谁全面碾压谁,而是各自找到了最擅长的赛道。比较常见的实践是"组合使用"——比如用Claude做代码开发和复杂文档处理,用Gemini做多模态分析,用GPT做日常通用任务,用DeepSeek/Qwen处理中文场景或高频简单请求以控制成本。