ChatGPT、Claude、DeepSeek 背后的语言模型。它从大量经过收集和处理的文字、代码等数据中学习语言规律,再根据当前上下文生成回答。
你可以把它想成一个读过大量材料、很会续写的助手。它能聊很多话题,但不是百科全书,也不保证记得的内容都正确。
不是搜索引擎(不给链接列表),不是数据库(不会精确查到某条记录),不是全知全能。
容易跟「模型版本」搞混——大模型是类别,模型版本是具体型号。
你打开任何 AI 工具的那一刻。
Glossary · 名词祛魅
你刚装好 AI,满屏的英文缩写——Token、Prompt、MCP、RAG、Hallucination……看着像天书。但其实它们每一个,都对应着你生活中已经熟悉的东西。
这一页就是一本「翻译手册」:不讲定义,只打比方。读完之后,这些词就不再是障碍,而是你理解 AI 的工具。
这些是你一打开任何 AI 工具,头五分钟就会撞上的词。先搞懂这几个,剩下的都不慌。
文字说明:AI 的核心是「大模型」——它由神经网络构成,用训练数据学习。不同「模型版本」能力不同。它通过 Token 来处理文字,用温度控制随机性。有时会产生幻觉。
ChatGPT、Claude、DeepSeek 背后的语言模型。它从大量经过收集和处理的文字、代码等数据中学习语言规律,再根据当前上下文生成回答。
你可以把它想成一个读过大量材料、很会续写的助手。它能聊很多话题,但不是百科全书,也不保证记得的内容都正确。
不是搜索引擎(不给链接列表),不是数据库(不会精确查到某条记录),不是全知全能。
容易跟「模型版本」搞混——大模型是类别,模型版本是具体型号。
你打开任何 AI 工具的那一刻。
你跟 AI 交流的方式——你打字,它回话,来回循环。跟微信聊天几乎一样,只是对面不是人。
跟给一个新同事发微信一样。你说一句,他回一句。区别是:这个同事什么领域都懂一点,但需要你把需求说清楚。
不是一次性问答。你可以在同一个对话里不断追问、补充、修改。
容易跟「Agent」搞混——Chat 是回答问题,Agent 是围绕目标持续执行。详见第五组。
打开 AI 工具的每时每刻。
AI 计算「工作量」的单位。一个 Token 大约等于半个汉字到一个汉字。你发一段话 + AI 回一段话 = 消耗若干 Token。
就像手机流量。你发文字、收回答都在用流量。流量用完了要么等下月、要么花钱买。
不等于一个字、一个词或一个标点。它的具体切分方式由模型决定,你不用纠结怎么算。
容易跟「上下文窗口」搞混——Token 是计量单位,上下文窗口是用 Token 衡量的容量上限。
免费额度用完时、或者用 API 按量付费时。
AI 大脑的具体版本。就像手机有 iPhone 15、iPhone 16 一样,AI 也有不同型号。不同型号能力不同——有的更聪明、有的更快、有的更便宜。
同一个品牌的车有不同排量。日常代步选小排量够用又省油,跑高速选大排量更稳。
不同版本不是「越新越好」——旗舰版更聪明但更慢更贵,轻量版更快更便宜。按需选择。
容易跟「大模型」搞混——大模型是类别(如 GPT 系列),模型版本是具体型号(如 GPT-4o)。
选 AI 工具或切换模型时。
AI 一本正经地编造了一个不存在的、不正确的事实,但说得非常自信、看起来完全像真的。这是目前所有大模型都有的现象,不是 bug。
一个考试时不会做但特别会编答案的学生。他写出来的答案逻辑通顺、格式工整,但完全是编的。
不是 AI「故意骗你」。它只是在续写最合理的内容,分不清自己是在编还是在陈述事实。
不等于所有「答错」。幻觉通常指模型生成了看似可信、实际没有依据的内容;它没有人的信念,也不是在故意撒谎。
涉及数字、人名、引用、法律条文时——一切需要精确的事实。
控制 AI 回答的「随机程度」。温度低 = 回答稳定、确定、保守;温度高 = 回答更有创意、更发散、更不可预测。
就像水温。低温像冷水——沉稳、规矩;高温像沸水——活跃、跳跃。
不是「越高越好」或「越低越好」。写报告要低温,写诗要高温,没有标准答案。
不等于「聪明程度」——温度只控制随机性,不影响模型的知识量。
你发现 AI 每次回答不一样、或者需要调整创造性时。
AI 不只能处理文字,还能看图片、听声音、看视频。多模态就是「多种信息形式都能理解」。
一个人原来只能读信(纯文字),现在能看图、听录音、看视频了——感官多了,理解就全面了。
不是所有 AI 都支持多模态。有些只能处理文字,有些能看图但听不了声音。
跟「大模型」不同——多模态是一种能力描述,大模型是技术类别。
你想让 AI 看图回答、听录音转文字、或者看视频总结时。
在通用 AI 的基础上,用你自己的数据再做一轮训练,让它在特定领域表现更好。普通用户基本用不到,但经常看到这个词。
一个医学院毕业生去医院实习。学校教的是通用医学知识(预训练),实习时在心内科跟了三个月(微调)。
不是普通用户需要操心的事。你现在用提示词和上下文就能定制 AI,不需要微调。
跟「提示词工程」完全不同——微调改的是模型内部参数,提示词只改输入文字。
大概率你不会直接遇到,但看技术文章时经常出现。
你问一个问题,它不是给你一堆链接让你自己找,而是直接给你答案,并附上出处。Perplexity 是最典型的答案引擎。
普通搜索引擎像图书管理员告诉你「答案可能在第三排第五本」;答案引擎直接把答案念给你听,还告诉你她在哪本书上看到的。
不等于聊天机器人——它优先搜实时信息,而不是凭记忆回答。
它和 Chat 的边界正在变模糊:不少聊天产品也能联网搜索。关键区别不是名字,而是这次回答有没有检索来源、出处是否能核对。
你需要查最新信息、核实事实、做研究时。
这些概念决定了 AI 能不能「懂你」。搞懂它们,你的 AI 使用水平会上一个台阶。
文字说明:你写的「提示词」进入「上下文」,上下文存在「上下文窗口」里。系统提示词提前设定人设。项目和知识文件帮你管理长期资料,记忆让 AI 跨对话记住你。RAG 则是先搜资料再回答。
你发给 AI 的那段话。你说的话就是 prompt,AI 回的话叫 response。prompt 不是什么特殊技术,就是「你输入的文字」。
你走进一家奶茶店对店员说「少冰半糖去冰」——这句话就是 prompt。说得越具体,做出来的越合你口味。
不是「咒语」或「秘籍」。没有哪句话能让 AI 万能——关键是把目标和情况讲清楚。
跟「系统提示词」不同——系统提示词是提前设定好的「人设」,提示词是每次对话你打的话。
每次跟 AI 对话。
AI 在当前这次对话中能记住的所有内容——包括你说的每一句、它回的每一句。只要在同一个对话窗口里,它就能联系上下文理解你。
你跟朋友聊天,先聊了电影,再说「那个演员叫什么来着」——朋友知道你说的是刚才聊的那部电影。但换了一个朋友(新开对话),就得从头说起。
上下文不是永久的记忆。新开一个对话,之前的上下文就没了。
跟「记忆」不同——上下文是当前对话的短期记忆,记忆是跨对话的长期记录。
你在同一个对话里追问、补充、修改时。
AI 一次对话能记住的最大字数。超过这个上限,最早的内容就会被「忘掉」。现在主流模型大概能记住几万到几十万字。
就像一个人的短期记忆容量。聊天太久,前面的内容就模糊了。
不是越小越好。窗口太小,聊几句 AI 就「忘了」你开头说的话。但现在主流模型的窗口已经很大了。
跟「上下文」不同——上下文是具体内容,上下文窗口是能装下多少内容的容量上限。
一个对话聊了很久后发现 AI「忘了」你最早说的话。
在你跟 AI 开始聊之前,提前给它设定好的「人设说明书」。它决定了 AI 用什么语气、什么身份、按什么规则来回答你。
你雇了一个新员工,第一天给他一份岗位职责说明书:「你是财务专员,涉及花钱必须先问领导。」之后他所有的行为都按这份说明书来。
不是普通用户在所有产品里都能直接看到或永久修改的设置。它可能由产品开发者设定,也可能只在某个项目、助手或会话范围内生效。
普通提示词是你这次发出的要求;系统提示词位于更高优先级。你在产品里看到的「自定义指令」或「项目指令」作用相近,但具体范围和优先级由产品决定。
你想让 AI 始终保持某种角色或风格时。
把不同工作分到不同的「房间」里,每个房间有独立的资料和指令。做营销的放一个项目,写论文的放另一个,互不干扰。
你在家有书桌(学习用)和饭桌(吃饭用)。项目就是 AI 世界里的「桌子」——每张桌子上的东西不混。
不是用了就一定更好。只有当资料和指令相关、清楚且没有过期时,项目空间才更容易产出稳定结果。
跟「知识文件」不同——项目是容器,知识文件是放进去的内容。
你用 AI 做多种不同类型的工作时。
你上传给 AI 的参考资料——文档、笔记、样例、模板。有了这些,AI 就能根据你的实际材料回答,而不是凭空编。
开卷考试时你带进考场的复习资料。AI 看了你的资料再答题,准确率比闭卷高得多。
不是越多越好。传太多反而干扰 AI。遵守最少必要原则——只传跟当前任务相关的。
跟「RAG」概念相通——知识文件是材料,RAG 是「先搜材料再回答」的技术方法。
你想让 AI 根据你特定的资料回答时。
让 AI 跨对话记住你的信息——你的偏好、习惯、正在进行的工作。不同 AI 工具的实现方式不同。
你常去一家理发店,理发师记得你「两边推短、上面留长」。换一家新店就得重新说。AI 的记忆就是那个记住你偏好的「理发师」。
不是万能的。有些 AI 的记忆是「黑箱」(你不知道它记了什么),有些需要你主动维护。
跟「上下文」不同——上下文是单次对话内的记忆,记忆是跨对话的持久记录。
你希望 AI 记住你的偏好、不用每次重复时。
跟 AI 对话最有效的框架:先说你要什么结果,再给必要的背景。比堆砌华丽提示词有效得多。
你去裁缝店,不会说「请施展你的缝纫技巧」——你会说「做一件黑色西装外套(结果),我下周三参加面试要穿(上下文)」。
不是什么高深技巧。它只是一个提醒:把目标和情况讲清楚,比想方设法写「完美提示词」有用。
跟「提示词技巧」不同——OC 框架强调信息质量,不是措辞花活。
每次跟 AI 开始一个新任务时。
让 AI 采访你来生成一份完整的角色档案——你是谁、你怎么工作、你用什么工具。它是关于你的全部信息。
新员工入职时你让他先问你 20 个问题(你的工作习惯、偏好、流程),答案汇总成一份「员工手册」。
不是一成不变的。你的工作变了,Master Prompt 也要更新。
跟「系统提示词」不同——Master Prompt 是「食材」(关于你的信息),System Prompt 是「菜谱」(怎么做事)。
你想让 AI 深度了解你、成为你的长期助手时。
你在设置里填好的长期指令,每次对话都自动生效。比如「回答用中文」「字数不超过 200 字」。
你跟理发师说「以后每次都按这个发型剪」——说一次,之后每次都照办,不用重复。
不是临时提示词。自定义指令是设定一次长期生效的,临时提示词是每次对话打的内容。
跟「系统提示词」概念相通——不同工具叫法不同,本质都是预设指令。
你有固定的回答偏好(语言、长度、格式等)时。
先从你给的资料里搜到相关内容,再让 AI 基于搜到的内容来回答。相当于先翻资料再答题。
开卷考试。闭卷考试靠记忆(容易记错 = 幻觉),开卷考试可以翻资料(准确率高)。
不是万能的——如果你的资料本身有错,RAG 也会基于错误回答。垃圾进、垃圾出。
跟「知识文件」不同——知识文件是材料,RAG 是使用材料的技术方法。
你想让 AI 只根据你的资料回答(不让它自由发挥)时。
一种结构清楚的纯文本排版格式。标题、列表和代码都有简单标记,通常比版式复杂或扫描生成的 PDF 更容易被稳定解析,但不代表内容一定更准确。
复杂 PDF 像排版精美的报纸,阅读顺序有时不好判断;Markdown 像层级清楚的提纲,标题和列表一眼能分清。
不是只有程序员才能用。Markdown 非常简单——用 # 表示标题,用 - 表示列表,几分钟就能学会。
不等于「纯文本」——Markdown 有简单的排版标记(加粗、链接、标题等),纯文本没有。
你要上传文档给 AI 处理时。
AI 不会一次性读完所有资料,而是先看标题和简介,需要时才深入读具体内容。这样节省上下文空间。
你去图书馆找书,不会把每本书都翻开读完——先看书架标签,再看书名,最后才翻开某一页。
不是 AI「偷懒」——这是一种智能的资源管理方式,确保 AI 在有限的上下文窗口里最高效地工作。
跟「按需加载」概念相近——都是「用到才加载」的意思。
你给 AI 很多资料/Skill,好奇它怎么管理时。
AI 不只能聊天——它可以连接工具、上网搜索、操作文件。这些概念解释了 AI 怎么「长出手脚」。
文字说明:AI 通过「插件/连接器」连接外部工具,用 API 和 API Key 进行身份验证,MCP 是统一连接标准。浏览器操作和本地文件操作让 AI 能直接动你的电脑。
AI 可以调用的外部能力——搜索网页、查天气、执行代码、画图。工具让 AI 从「只会说」变成「能做事」。
厨师有刀和锅才能做菜,只有嘴不行。工具就是 AI 的「刀和锅」——有了它才能实际操作。
不是 AI 自己就能用的。需要你或开发者配置好,AI 才知道什么时候、怎么调用。
跟「Skill」不同——工具是单次操作(搜一下、算一下),Skill 是一套完整的操作流程。
你让 AI 搜索最新信息、计算复杂数据、或生成图片时。
让 AI 能够连接外部工具和服务的桥梁。装了搜索插件它就能上网搜,装了日历插件它就能看你的日程。
就像给手机装 App。手机出厂只能打电话发短信,装了微信能聊天,装了地图能导航。
不是所有插件都安全。安装前看清权限——它能访问什么数据、能做什么操作。
跟「MCP」相关——MCP 是让插件标准化的协议。插件/连接器是具体产品,MCP 是连接标准。
你想让 AI 连接你的邮箱、日历、文档或其他服务时。
一种让程序之间互相通信的方式。有了 API,你的程序可以直接调用 AI 的能力,而不需要打开 AI 网页手动输入。
餐厅的点菜窗口。你不用进厨房,只需要在窗口递一张单子,厨房做好菜递出来。
不是普通用户日常需要用的。它是给开发者和程序用的接口。但你需要知道这个词是什么意思。
跟「API Key」不同——API 是接口(窗口),API Key 是你的身份凭证(饭卡)。
你使用需要 API 接入的工具时,或看技术教程时。
你的身份凭证,证明你是付费/注册用户。类似密码——千万不要泄露给别人,否则别人可以用你的额度。
你小区的门禁卡。有了它才能进大门,丢了要赶紧挂失。
不是用一次就换的。一个 API Key 长期有效,直到你手动重置。
跟「API」不同——API 是接口通道,API Key 是走这个通道需要的通行证。
你使用需要 API 接入的工具时。
一个统一标准,让 AI 能用同一种方式连接各种外部工具和数据源。有了它,开发者不用为每个工具单独写对接。
USB-C 接口。以前每个手机品牌用不同充电线,现在统一了。MCP 就是 AI 世界的 USB-C。
不是普通用户需要操心的事。你只需要知道「这个工具支持 MCP = 它能跟 AI 对接」。
跟「Skill」不同——MCP 是连接协议(让 AI 接上工具),Skill 是操作流程(教 AI 怎么做事)。有人说「Skill 会淘汰 MCP」——这是作者个人预测,不是事实。
你看工具说明时看到「支持 MCP」。
AI 可以直接打开浏览器,浏览网页、填表单、点按钮。不只是搜索,而是像人一样操作网页。
以前 AI 只能通过电话(API)问别人信息;有了浏览器操作,它能自己上网冲浪了。
不是无限制的。有些工具会限制 AI 能访问哪些网站、能执行哪些操作。
跟「搜索」不同——搜索只获取信息,浏览器操作能交互(点击、填写、提交)。
你让 AI 帮你填表、比价、或操作网页时。
AI 可以直接读写你电脑上的文件——打开文档、修改代码、整理文件夹。不需要你手动上传下载。
以前 AI 像电话客服——你说它听;有了本地文件操作,它像能直接走进你办公室翻你桌上的文件。
不是不受限制的。好的工具会要求你授权——哪些文件夹可以访问、哪些操作需要你批准。
跟「上传文件」不同——上传是一次性复制,本地操作是持续的读写权限。
你用 Claude Code、Hermes 等工具在你的电脑上工作时。
当你不想每次都手把手教 AI,而是让它自动重复执行任务时,这些概念就登场了。
文字说明:Skill 是 AI 版操作手册,多个 Skill 串起来叫技能链。Workflow 把步骤写死让 AI 照着做。自动化、计划任务和触发器让 AI 在特定条件下自动开始工作。
提前写好的一套说明书 + 工具,让 AI 在特定领域表现得像一个专业高手。本质上就是一个文件夹,里面放着指令和脚本。
你给实习生发了一份《公司报销流程手册》。他本来不懂报销,有了这份手册就能按流程操作了。也有人叫它「华夫饼机」:倒进面糊,出来的是完美的华夫饼。
不是装上就万能。Skill 有好坏之分——写得差的 Skill 效果还不如你自己直接跟 AI 说。
Skill 更像可复用的说明和工具;Workflow 更关注步骤怎样衔接。实际产品里两者可能重叠,不能只靠「AI 自己决定还是人写死」一刀切。
你发现某个任务经常重复做,想固化成标准流程时。
把一个复杂任务拆成可以衔接的步骤,让人、AI 或工具按顺序配合。很多工作流是固定的,也可以在部分步骤加入判断和动态分支。
做菜的菜谱。第一步切菜、第二步热油、第三步下锅——顺序写死了,照着做就行。
不一定是完全写死的流水线。现代工作流可以让 AI 在某一步分类、选择工具或决定下一条分支。
Workflow 强调任务步骤怎样衔接;Skill 强调可复用能力;Agent 强调在目标、权限和约束内自主选择下一步。三者经常组合使用。
你有一个固定的多步骤任务想让 AI 自动化时。
把多个 Skill 串联起来,一个的输出是另一个的输入。文案技能 → 被邮件技能调用 → 被收件箱自动化技能调用。
工厂流水线——每个工位负责一道工序,上一个人的半成品传给下一个人继续加工。
不是越多越好。链条太长,一个环节出错,后面全跟着错。
跟「Workflow」相似——都是串联步骤。区别是技能链的每环都是智能的(Skill),Workflow 的每环可能是机械的。
你想让 AI 完成一个需要多步骤、多技能配合的复杂任务时。
让 AI 或程序自动执行任务,不需要你每次手动触发。可以按时间定时,也可以按事件触发。
你家的定时电饭煲——设好时间,每天早上 7 点自动开始煮饭,你不用管。
不是「设了就不用管了」。自动化需要定期检查——AI 偶尔会出错,你不检查可能出大问题。
跟「Agent」不同——自动化是按规则执行预设流程,Agent 是围绕目标自主决策。
你有重复性任务想让 AI 自动处理时。
让 AI 在特定时间自动执行某个任务。比如每晚 8 点发第二天日程概要、每周一早生成本周计划。
手机闹钟——到点就响。只不过闹钟响的是铃声,计划任务执行的是 AI 任务。
不是 AI「主动」做的。是你设定了时间,到点触发。
跟「触发器」不同——计划任务是时间驱动(到点就做),触发器可以是事件驱动(收到邮件就做)。
你想让 AI 定期做某事时。
让 AI 在某个条件满足时自动启动。触发器分两种:时间触发(每天 8 点)和事件触发(收到邮件时)。
便利店的门铃——有人推门(事件),门铃就响。不是定时响的,是「有事才响」。
不是你手动点击的。触发器是自动检测条件、自动启动的。
跟「计划任务」不同——计划任务只看时间,触发器可以看任意条件。
你想让 AI 在特定事件发生时自动响应。
当你不满足于「问一句答一句」,而是想让 AI 帮你把一件事从头做到尾——这就需要 Agent。
文字说明:Agent 的核心是「观察→思考→行动」循环。它围绕你给的目标,反复执行这个循环,直到任务完成。Agent Harness 是它的载体,多智能体是多个 Agent 协作。
不只回答问题,还能在目标和权限范围内规划步骤、调用工具并执行操作。例如先查下周天气、整理航班选项,再把购买前的决定交给你确认。
普通的 AI 聊天像一个只回答问题的客服;Agent 像一个能帮你跑腿的助理——你说了目标,他自己安排怎么去办。
不是万能的。Agent 可能中途出错、走弯路、或者理解错你的目标。关键操作仍需你审批。
跟「Chat」最大的区别:Chat 是问→答,Agent 是目标→持续执行→交付结果。
你想让 AI 帮你完成一个多步骤的完整任务时。
Agent 的核心工作机制:观察当前状态 → 思考下一步该做什么 → 执行行动 → 再观察结果,反复循环直到任务完成。
你做一道没做过的菜:先看看冰箱有什么(观察),想想怎么搭配(思考),开始切菜炒菜(行动),尝一下味道(再观察),不够咸就加盐……直到做好。
不是机械地循环。Agent 在每一步都会根据新信息调整策略——它是智能的循环。
Workflow 更强调预先设计的步骤和分支;Agent Loop 会根据当前结果决定下一步。两者可以组合,并不是互斥的两类东西。
你想理解 Agent 是怎么一步步完成任务的。
不是所有自称 Agent 的工具都是真 Agent。真 Agent 能自己决定步骤、在出错时调整策略。假 Agent 只按预设流程跑,出了错不会调整。
真 Agent 像一个有经验的司机——遇到堵路会绕道;假 Agent 像导航软件——只会说「请掉头」,不管路通了没有。
不是越「自主」越好。Agent 越自主,越需要好的权限控制和安全边界。
判断标准不是「能不能自动执行」,而是「出了意外会不会自己调整」。
你选择 AI 工具、判断它是不是真的能帮你完成任务时。
Agent 适合帮普通人做的四类事:协调(安排日程)、创意(写文案)、理解(总结长文)、陪练(模拟面试)。
就像一个全能助理的四种工作模式:当秘书(协调)、当文案(创意)、当摘要员(理解)、当教练(陪练)。
不是只能做这四类。这只是一个帮你理解 Agent 能做什么的框架,不是限制。
不跟技术概念混淆——这是一个使用场景分类,不是技术架构。
你不知道 AI 能帮你做什么时,用 4C 框架找灵感。
给 Agent 下指令的结构:工作内容 → 可用工具 → 分类标准 → 产出格式 → 边界/限制。五部分写全,Agent 就不容易跑偏。
给新员工下任务:「做月报(工作),用 Excel(工具),按部门分类(标准),输出 PDF(格式),数据截止月底(边界)」。
不是每次都必须五部分齐全。简单任务两三部分够用,复杂任务才需要写全。
跟「OC 框架」不同——OC 是对话级框架,五部分骨架是 Agent 任务级框架。
你要给 Agent 下达一个复杂任务时。
Agent 运行所在的「外壳」或「底盘」——它提供了 Agent 需要的基础设施:上下文管理、工具调用、安全权限。
发动机(大模型)需要装在车架(Agent Harness)上才能跑。光有发动机不行,还需要轮子、方向盘、刹车。
不是 Agent 本身。Agent 是大脑 + 行为,Harness 是支撑它运行的平台。
跟「Agent」不同——Agent 是执行者,Harness 是执行者所在的平台。
你深入使用 Agent 工具、好奇它背后怎么运行时。
多个 Agent 分工协作,各管一摊。一个编排者分配任务,专门的子 Agent 各自执行,还有一个批评 Agent 负责检查质量。
一个公司:CEO(编排者)不做事,只指挥;各部门经理(子 Agent)各管一摊;审计部门(批评 Agent)查质量。
不是越多越好。Agent 多了,协调成本也高,出错排查更难。
跟单个 Agent 不同——单 Agent 是一个人干所有事,多 Agent 是团队分工。
你看到复杂的 AI 自动化系统介绍时。
多智能体系统中负责指挥的主 Agent——它自己不做事,只分配任务给专门的子 Agent,收集结果,保证最终产出质量。
交响乐团的指挥——他不弹琴不吹号,但整个乐团听他的指挥。没有指挥,每个人各自演奏就是噪音。
不是「管理者」的人类角色。编排者本身也是一个 AI Agent,只不过它的「技能」是分配和协调。
跟「子智能体」不同——编排者指挥,子智能体执行。
你了解多智能体系统时。
专门检查其他 Agent 工作质量的 Agent。在交付前,它列出改进清单,打回去重做,保证最佳产出。
出版社的责任编辑——作者写完稿子,编辑挑毛病、打回修改,直到质量达标才出版。
不是人类的审核。批评 Agent 本身也是 AI——它会用自己的判断标准来检查。
跟「人在回路」不同——批评 Agent 是 AI 检查 AI,人在回路是人检查 AI。
你了解高级 Agent 系统的质量控制机制时。
AI 越来越能干,但人不能完全放手。这些概念解释了你怎么安全地给 AI 授权、什么时候该审批、什么时候该放手。
文字说明:权限控制 AI 能做什么(读/写/执行),审批决定 AI 做的事要不要你确认。人在回路内每步审批,人在回路上只管方向。Plan Mode 让 AI 先出计划再执行。本地运行和云端运行影响安全和便利性。
控制 AI 能做什么、不能做什么的设置。常见的有三档:只读(只能看不能改)、需要批准(改之前先问你)、总是允许(完全信任,自动执行)。
你给家里保姆的钥匙——可以进厨房(总是允许),开你书房要先问(需要批准),保险柜不给钥匙(禁止)。
不是一次设定永远不变的。好的工具会根据任务调整权限——重要操作临时提权,完成后收回。
跟「审批」相关——权限是规则设定,审批是执行时的人确认。
你第一次用任何能操作文件或网络的 AI 工具时。
AI 执行任务时,关键步骤需要你点头才能继续。你不是旁观者,你是把关人——AI 提方案,你决定要不要做。
你让实习生写报告,他写完初稿先给你看,你说「可以」他才发给客户。不是他自己发了就完事。
不是每个小步骤都要你批准。好的 Agent 知道什么时候该问你(重要决定),什么时候可以自己来(常规操作)。
跟「人在回路上」不同——人在回路内是每步审批(执行者),人在回路上是只管方向(监督者)。
AI 帮你执行涉及花钱、发邮件、修改重要文件的操作时。
比「人在回路内」更放权——AI 自己执行,你只监督大方向,不审批每个具体操作。你定期检查结果,发现方向不对再纠正。
你当了经理——具体干活的事你不管了,只看周报和月度结果。方向偏了你纠正,不偏就让团队继续跑。
不是「不管了」。你仍然在看——只是从「每步审批」升级到「定期检查」。
跟「人在回路内」不同——回路内每步审批(你是执行者),回路上只管方向(你是监督者)。
你的 Agent 系统成熟稳定后,开始考虑放权时。
让 AI 先出一份完整计划给你看,你批准了再动手。不是直接让 AI 执行操作,而是先讨论清楚做什么、怎么做。
装修房子——你不让工人上来就砸墙,而是先要设计图,你看了同意了再开工。规划模式就是让 AI 先给「设计图」。
不是浪费时间。先规划再执行 = 省钱省力。不规划直接让 AI 做 = 大概率返工,烧钱。
跟「直接执行」不同——Plan Mode 先计划后执行(你批准才做),直接执行是 AI 上来就做(可能做错方向)。
你让 AI 做任何复杂任务(写代码、建网站、做分析)之前。
给 AI 授权不是一步到位的,而是分阶段渐进放权:先让工作可见 → 审批后执行 → 在限定范围内自动化 → 低风险任务可以更高程度委托。高影响决定始终保留人工关口。
教孩子做饭:先让他在旁边看你做(可见)→ 让他切菜你炒(高效)→ 让他自己炒你尝味道(自动化)→ 完全交给他做(委托)。不能跳级。
不是越快到「委托」越好。大部分日常任务停在「高效」或「自动化」就够了。
跟「权限」不同——权限是某一刻的设定,放权节奏是随时间推进的策略。
你在考虑该给 AI 多大自由度时。
本地运行只表示程序在你的电脑上执行;它仍可能调用云端模型并上传必要内容。只有模型推理也在本机、且没有外部联网请求时,数据才可能不离开设备。云端运行则主要在服务商服务器上完成。
本地应用像在自家厨房操作,但也可能把食材送去中央厨房加工;本地模型才更像食材和烹饪都留在家里。云端服务则像直接去餐馆。
不是二选一。很多工具同时支持两种模式——日常用云端,敏感数据用本地。
本地不自动等于安全,云端也不自动等于不安全。要看模型实际在哪里推理、是否联网、传了什么数据,以及服务商的权限和隐私设置。
你处理敏感数据(公司文件、个人隐私)时需要考虑。
这些概念经常被搞混。放在一起看,区别就清楚了。
你每次对话打给 AI 的话。临时、即时、随时改。
提前设定好的人设和规则。设一次,长期生效。
当前对话中 AI 能记住的所有内容。新开对话就没了。
AI 跨对话记住的你的信息。新开对话还在。
AI 版操作手册。教 AI 怎么做某类事,步骤半预设。
AI 能调用的单个外部能力。搜索、计算、画图。
你问一句,AI 答一句。一问一答的模式。
你给目标,AI 自己分步执行到完成。
程序之间通信的接口通道。你不用打开网页就能用 AI。
让各种工具用统一标准连上 AI 的协议。
AI 每个关键步骤都要你批准才能继续。你是执行者。
AI 自己执行,你只看大方向,定期检查。你是监督者。