前面几篇,我分别整理了大模型、工具、Agent 和 Skill 的基本含义。
到这里,我想把它们放回同一件事里。单独解释一个词,和看懂它们怎样一起完成任务,仍然有些距离。
我们继续使用同一个假设:安排三天两晚的家庭旅行,带老人和孩子,预算 6000 元,少走路,最后交付能够核对的方案。
这项任务从我提出目标开始。
日期、预算、同行人和活动偏好,都是后续判断的依据。如果预算已经很紧,我又要求住得远、玩得多,系统可能需要指出条件冲突,而不能默默替我放宽预算。
旅行 Agent 接到这些信息,开始组织工作。
模型分析要求,考虑还需要取得哪些资料;系统在需要时读取家庭旅行 Skill,把体力安排、休息时间、费用核对等方法提供给模型;查询工具取得酒店和交通信息,再把结果返回。
模型结合新结果继续判断。酒店满房,就考虑替代方案;酒店便宜但来回交通太远,就重新核算时间和体力负担。符合要求以后,再形成行程和费用说明。
这里的 Agent 包含模型调用、工具执行和任务接续这些环节。它不是与模型并排站着的另一个“大脑”。

我在学习时逐渐能把它们说清楚:
模型提供理解、分析和生成的能力;Skill 提供可以采用的方法;工具执行查询、读取、保存等操作;Agent 把这些环节组织成围绕目标持续推进的工作过程。
但只把四样东西列齐,还不能宣布任务一定做成。
AI 曾经给我一道题:
Agent 已经完整读取“查询实时房态”的 Skill,但没有联网能力,没有订房查询接口,用户也没有提供最新房态。它却说:“这家酒店今晚有房。”这句话有什么依据?
我当时回答,它缺少有效的工具,这句话来自模型的幻觉,不是一个真实状态。
这个回答找到了工具缺失的问题,但后半句还要修正。
我们不能因此断定现实中一定没有房。酒店可能有房,也可能没房。能确定的是,这个系统没有足够依据把“有房”当作已经确认的事实。
即使它碰巧猜对了,也不等于真的查询过。
“幻觉”在这里指的是生成了缺乏依据、却被当作事实表达的内容。检查任务时,指出“缺少实际查询结果”,往往比只说“它又幻觉了”更有帮助。
因为这样我们知道接下来该补什么。
而且,拥有查询工具,也不等于已经完成查询。还需要看是否实际执行,返回了什么,日期、房型和人数等条件是否对应得上。
这也是我为什么越来越关心依据。
另一个值得分清的地方,是方法和能力。
Skill 可以要求先查房态,但这段文字不会自动建立网络连接,也不会自动获得订房系统的访问权限。
就像员工读到一本工作手册,手册要求查询公司库存。员工还需要能够进入库存系统,才能完成这一步。
即使 Skill 附带了查询脚本,也要有相应的运行环境、连接条件和必要权限。说明、程序、运行条件,需要配合起来。
接着,把障碍换一种形式。
假设旅行助手有查询工具,但订房系统返回“登录状态已过期”。这时,说“工具不存在”就不准确了。工具存在,只是当前登录条件不满足。
这里沿用同样的判断方法:
| 实际反馈 | 可以作出的判断 |
|---|---|
| 没有对应查询能力 | 需要补上工具或改用其他可靠资料 |
| 登录状态已过期 | 需要恢复有效登录后再查询 |
| 权限不足 | 当前账号或操作权限不满足要求 |
| 连接失败,原因不明 | 需要核实原因,暂时不能确认房态 |
不能只看到“没做成”,就随便给它安上一个原因。
与此同时,已经完成的部分也有价值。假设景点、交通和候选酒店已经整理好,只有房态没有核实,助手可以把方案先交出来,同时明确标出酒店信息仍待确认。
这段旅行情境可以这样报告:
行程和费用估算已经整理好。酒店实时房态尚未确认,因为查询时返回登录过期。恢复有效登录并重新查询后,才能补上这项结果。
如果工具和平台允许,系统可以协助打开登录页面;需要扫码或其他身份确认时,就由用户按实际方式完成。不能在登录尚未恢复时,继续宣称已经查到结果。

还有一些看似相近、实际不同的状态:
查到某个时间点有房,不等于已经预订;生成了行程,不等于其中每项信息都经过核实;说“文件保存好了”,也需要有能够打开的文件作为交付。
我们这次假设的任务只要求提供方案,所以应当按照方案的要求检查,不能自己把目标扩大成代订和付款。
我觉得,学懂这些概念的一个实际价值,就是能把笼统的不满意变得具体。
方案不合适,可以检查它有没有理解我的目标;酒店信息过时,可以检查日期和来源;明明要求老人少走路,行程却很赶,可以检查它采用的方法是否落实;无法继续执行,则要看具体卡在哪个工具或运行条件上。
这些地方,也可能同时存在问题,需要结合实际过程判断。
把四个概念连起来以后,我对 AI 未来用途的理解,也比以前多了一层。
模型继续进步,当然重要。同时,工具能让系统接触更多真实信息、完成更多实际操作;好的方法能帮助它处理特定工作;合适的 Agent 程序能把原来需要人频繁接续的步骤组织起来。
因此,即使模型本身相同,整个系统能够完成的任务也可能不同。这是我从这次学习中形成的理解,并不意味着任何一项复杂工作都适合完全交给它。
我的目标和取舍,仍然需要我自己想清楚。结果是否有用,也要回到真实任务里检查。
这一轮问答,让我纠正了几处原本以为已经明白的地方:自动运行不等于模型在选择行动;读取 Skill 不等于重新训练;没有查询依据,也不等于现实一定相反。
它们都不是什么漂亮的大道理,但会影响我接下来怎样使用 AI。
我准备带着这些区分继续实践。让它做一件范围清楚的事情,看看材料怎样进入、操作怎样发生、结果怎样交到手里,再把真正遇到的问题记录下来。
这会是下一阶段学习的起点。