找到
13
篇与
Net
相关的结果
-
AI 关键字 AI 相关术语归纳 核心概念:Agent / MCP / Skill Agent(智能体) 指能够自主完成多步骤任务的AI系统,核心特征是:接收目标 → 自己规划步骤 → 调用工具 → 观察结果 → 调整下一步,如此循环,直到完成任务,而不是一问一答。 比如你让一个Agent"帮我调研一下某个市场",它可能会自己决定:先搜索几个关键词,再打开几个网页看详情,再整理成总结——这一串动作是它自己规划的,不需要你每一步都指挥。 普通对话式AI 和 Agent 的区别,主要在于有没有自主的多轮工具调用和决策能力。 MCP(Model Context Protocol) 这是Anthropic提出的一个开放协议,用来标准化AI模型如何连接外部数据源和工具(比如Google Drive、Slack、GitHub、数据库等)。 可以把它理解成"AI界的USB接口":以前每接入一个新工具都要单独写一套定制集成代码,MCP统一了这个接口规范,让工具开发者只需要按这个协议实现一次"MCP Server",任何支持MCP的AI客户端就都能调用它,不用重复造轮子。 在实际使用中你会看到"connector"(连接器)这种说法——那就是通过MCP接入的外部服务。 Skill 这个词现在有点overload,取决于语境: 在Anthropic的产品里:Skill 指一套打包好的"最佳实践文档+脚本",专门针对某类任务(比如生成docx、pptx文件),本质上是给模型的"操作手册",告诉它这类任务里有哪些环境限制、该怎么做才专业。 更泛化地说:也可以指Agent具备的某种"能力模块",比如"写代码的能力""调用某个API的能力",是可插拔、可复用的技能单元。 三者如何协同工作 一个典型场景:Agent 是大脑(负责决策和规划)→ MCP 是它接入外部世界的接口(负责连接工具/数据)→ Skill 是它执行某类具体任务时参考的操作规范(负责保证质量和方法正确)。 三者不是互相替代的关系,而是同一个系统里不同的组成部分。 与"输入/输出格式"相关 术语说明Prompt(提示词)你给模型的输入指令System Prompt(系统提示词)对话开始前设定的"角色设定/行为规则",用户看不到但决定AI的行为边界Context Window(上下文窗口)模型一次能"记住"的信息量上限,通常以token数衡量Token文本被切分后的最小处理单元,大致是"一个词的一部分"与"模型能力增强"相关 术语说明RAG(检索增强生成)让模型先去外部知识库/文档里检索相关信息,再结合检索结果生成回答,而不是完全依赖训练时记住的内容Fine-tuning(微调)用特定数据继续训练一个已有模型,让它更适应某个专用场景Embedding(嵌入向量)把文字/图片转成一串数字向量,用来做语义相似度搜索,是RAG的底层技术之一Vector Database(向量数据库)专门存储和检索embedding的数据库,比如Pinecone、Weaviate与"工具调用/多步骤任务"相关 术语说明Function Calling / Tool Use模型判断需要调用某个外部函数/API来获取信息或执行操作,是Agent能力的基础机制Orchestration(编排)管理多个Agent或多个步骤之间协作顺序的机制Multi-agent System(多智能体系统)多个Agent分工协作完成一个复杂任务,比如一个负责搜索、一个负责写代码、一个负责审核与"推理能力"相关 术语说明Chain-of-Thought / CoT(思维链)让模型把中间推理步骤显式写出来,而不是直接跳到答案,通常能提升复杂问题的准确率Reasoning Model(推理模型)专门针对复杂推理任务优化过的模型(比如做更长时间的内部思考再回答)与"评估/对齐"相关 术语说明Hallucination(幻觉)模型自信地编造不存在的事实Alignment(对齐)让模型的行为符合人类意图和价值观的技术和研究方向RLHF(人类反馈强化学习)用人类的偏好反馈来调整模型行为的训练方法模型架构类 术语说明Transformer目前主流大模型的底层网络架构,核心机制是AttentionAttention(注意力机制)让模型在处理某个词时,动态判断该"重点关注"输入中的哪些其他部分Parameters(参数量)模型内部可调整的数值总数,常用"7B""70B"表示,通常(但不绝对)参数越多能力越强MoE(混合专家模型)模型内部分成多个"专家"子网络,每次推理只激活其中一部分,兼顾大模型能力和推理效率Multimodal(多模态)能同时处理文本、图像、音频等多种类型输入/输出的模型Context Length(上下文长度)与Context Window类似,指模型能处理的最大输入长度训练流程类 术语说明Pretraining(预训练)用海量通用文本训练出基础模型的第一阶段SFT(监督微调)用人工标注的高质量问答对,教模型"该怎么回答"Distillation(蒸馏)用一个大模型的输出去训练一个小模型,让小模型学到接近大模型的能力但更轻量Quantization(量化)把模型参数从高精度数值压缩成低精度,减少显存占用、提升推理速度,一定程度牺牲精度Synthetic Data(合成数据)由AI生成、而非人工采集的训练数据推理/生成参数类 术语说明Temperature(温度)控制生成内容随机性的参数,越高越"有创意"/不确定,越低越保守/确定Top-p / Top-k Sampling控制模型在生成每个词时从候选词里选择范围的采样策略Streaming(流式输出)模型边生成边返回内容,而不是等全部生成完再一次性返回Latency / Throughput(延迟/吞吐量)延迟指单次响应耗时,吞吐量指单位时间能处理的请求量,是部署时的关键性能指标Agent 进阶概念 术语说明ReAct(Reasoning + Acting)一种Agent工作模式:模型交替"推理"和"行动"(调用工具),是很多Agent框架的理论基础Planning(规划)Agent在执行前先拆解任务为多个子步骤的能力Memory(记忆)Agent保留跨会话/跨步骤信息的机制,分短期记忆(当前任务上下文)和长期记忆(跨对话持久化)Sandbox(沙箱)Agent执行代码/操作时的隔离环境,防止误操作影响真实系统Guardrails(护栏)限制模型输出范围、防止其做危险/越权操作的规则和机制安全与对抗类 术语说明Jailbreak(越狱)用特殊提示词绕过模型安全限制,诱导其输出本应拒绝的内容Prompt Injection(提示词注入)通过在输入内容(如网页、文档)中藏入恶意指令,劫持模型行为Red Teaming(红队测试)主动尝试攻击/诱导模型犯错,以发现并修补安全漏洞Constitutional AIAnthropic提出的一种对齐方法,让模型根据一套"原则"自我批评和修正输出,减少对人工标注的依赖Prompt Engineering 类 术语说明Zero-shot / Few-shotZero-shot指不给示例直接让模型做任务;Few-shot指提示词里给几个示例帮模型理解任务模式In-context Learning(上下文学习)模型仅凭提示词里的信息/示例就"学会"当前任务,不需要重新训练Prompt Chaining(提示词链)把复杂任务拆成多步提示词,前一步的输出作为后一步的输入Structured Output(结构化输出)让模型按固定格式(如JSON)返回结果,方便程序直接解析使用评估类 术语说明Benchmark(基准测试)用标准化题目集测试和对比不同模型的能力,如MMLU、SWE-benchGround Truth(真实标签)用来核对模型输出是否正确的"标准答案"生态/产品类 术语说明Open Weight / Closed Weight(开放权重/闭源权重)指模型参数文件是否公开可下载,如Llama、Qwen是开放权重,Claude、GPT是闭源权重(仅通过API访问)Model Card(模型卡)模型发布方公布的说明文档,介绍能力、局限、训练数据、适用场景等SDK官方提供的编程库,方便开发者调用模型API国际闭源三强 Claude(Anthropic):目前主线是Sonnet 5、Opus 4.8,以及定位更高的Fable 5(Mythos 5同级但仅限定机构使用)。口碑上偏向代码/Agent能力强、写作风格自然、长文档处理稳定,但多模态能力相对保守,价格在主流里偏高。适合:程序员、需要严谨长文本处理的场景、Agent自动化任务。 GPT(OpenAI):主线是GPT-5.x系列,定位综合能力均衡、生态最完善(插件、GPTs、图像生成等)。适合:日常通用问答、需要丰富第三方生态的场景。 Gemini(Google):主线是Gemini 3.x系列,核心优势是原生多模态(文本/图像/音频/视频同一架构处理)、超长上下文窗口、与Google生态(Drive、Workspace、安卓)深度绑定,价格也偏低。适合:多模态任务(视频/图片分析)、谷歌生态重度用户、需要超长上下文的场景。 国内代表 DeepSeek:以极低成本和强数学/代码能力著称,是开源生态的重要力量,中文理解能力评价很高,适合预算有限或需要私有化部署的场景。 通义千问(Qwen)、Kimi、豆包(Doubao)、GLM 等:在中文长文档处理、垂直行业场景各有侧重,通常价格更低、访问更稳定。 一个务实的建议 这些模型不再比谁全面碾压谁,而是各自找到了最擅长的赛道。比较常见的实践是"组合使用"——比如用Claude做代码开发和复杂文档处理,用Gemini做多模态分析,用GPT做日常通用任务,用DeepSeek/Qwen处理中文场景或高频简单请求以控制成本。