智能体(Agent)创建实战
从“会聊天的AI”到“会干活的AI”。本课程用真实业务场景手把手搭建可运行的智能体,并讲清何时该用单Agent、何时该用工作流、何时需要多Agent协作。
先判断:你是否需要学这一模块 SELF CHECK
命中 2 条以上,建议优先安排本模块;勾选可当作业前的需求确认表使用。
学习目标 OBJECTIVES
- 1理解Agent五要素:模型 + 记忆 + 工具 + 规划 + 目标,以及各要素的设计要点
- 2掌握单Agent、工作流编排、多Agent协作三种模式的适用边界与选择方法
- 3能独立完成一个业务Agent的搭建:目标定义、流程设计、知识与工具配置、测试上线
- 4掌握人工确认点、失败兜底与异常处理的工程化设计
- 5建立Agent效果评测与灰度上线机制
核心知识点 KEY POINTS
Agent五要素
模型(大脑,负责判断与生成)、记忆(短期对话记忆 + 长期业务记忆)、工具(手,负责执行外部动作)、规划(把目标拆成步骤)、目标(成功的判定标准)。缺任何一项,Agent都会退化为聊天机器人。
三种模式的适用边界
单Agent:任务边界清晰、步骤少(如制度问答)。工作流编排:步骤固定、需严格按序执行(如审批流、内容生产线)。多Agent协作:任务复杂、需要角色分工与交叉校验(如投研分析:检索Agent+分析Agent+审核Agent)。
工具设计与最小权限
工具是Agent的能力边界。只读工具可放开,写操作(发消息、改数据、下单)必须设人工确认;每个工具要有清晰的参数说明与失败返回。
记忆设计
短期记忆控制上下文成本(摘要压缩),长期记忆存业务事实(用户偏好、历史工单)。长期记忆需要去重与过期机制,否则会污染判断。
人工确认点与兜底
在不可逆动作前设确认;在模型不确定时转人工;在工具失败时有重试与降级。没有兜底的Agent无法上生产。
评测与灰度
建20-30个测试用例(含异常输入与越权尝试),统计任务完成率、工具调用准确率、转人工率;上线采用小范围灰度 + 按周评估。
方法论与操作步骤 METHOD & STEPS
第一步:定义目标与成功标准
用一句话说清:这个Agent在什么场景下、为谁、完成什么任务、做到什么算成功。写不出这句话,就先别搭。
第二步:设计对话与执行流程
画出流程图:入口 → 意图识别 → 信息收集 → 工具调用 → 结果确认 → 异常处理 → 结束。标出需要人工确认的节点。
第三步:配置知识与记忆
挂载该场景的知识库(参见M07),定义需要记住的长期信息(客户偏好、历史记录)与遗忘规则。
第四步:配置工具与权限
按最小权限原则接工具:能只读就不给写;写操作必须人工确认;为每个工具写清参数与失败处理。
第五步:写测试用例并调优
准备20-30个真实用例(含2-3个刁钻/越权用例),按任务完成率、准确率、转人工率三维调优。
第六步:灰度上线与观测
先小范围试用,埋点记录转人工原因与失败原因,按周迭代;稳定后逐步放量,并建立回滚机制。
真实落地场景案例 REAL CASES
14天上线“直播通”AI助手
业务场景
直播运营环节多、依赖资深运营,流程难以标准化与复制。
AI应用做法
把运营SOP拆成多个Agent协作:脚本生成Agent、话术优化Agent、数据复盘Agent,共用直播知识库,人工在发布前确认。
AI承担85%咨询
业务场景
门店线上咨询量大、人工响应不及时,夜间线索大量流失。
AI应用做法
搭建车型/报价/金融方案知识库驱动的客服Agent,识别购车意图后引导留资与预约试驾,高意向自动转人工。
涉及工具与产出物 TOOLS & DELIVERABLES
- WorkBuddy / 千问办公(Agent运行与工具调用环境)
- WorkBuddy / 千问办公
- Dify / 扣子(低代码Agent平台)
- 钉钉AI助理 / 企微机器人
- 工具API与权限配置
- 测试用例与灰度观测表
- 1个可运行Agent(含流程图)
- 工具清单与权限矩阵
- 20-30例测试集与通过率报告
- 灰度上线计划与回滚方案
- 观测看板(完成率/转人工率)
随堂练习与验收标准 PRACTICE & ACCEPTANCE
- 用一句话定义你要做的Agent:什么场景、为谁、做什么、做到什么算成功。
- 画出Agent流程图,标出意图识别、工具调用、人工确认与异常兜底节点。
- 准备20个测试用例(含3个越权/刁钻输入),跑出任务完成率与转人工率,写一份灰度上线计划。
- 提交1个可运行Agent + 流程图
- 测试用例≥20例,任务完成率≥85%,越权尝试全部拦截
- 灰度上线计划与回滚方案齐备,观测看板可查
常见误区 PITFALLS
一上来就做多Agent,复杂度失控
先用单Agent或固定工作流跑通,确有分工需求再拆多Agent
给Agent过高权限,能直接改数据发消息
最小权限 + 写操作人工确认,这是上生产的前提
只测正常路径,没测异常与越权
测试用例必须包含刁钻输入、越权尝试与工具失败场景
没有兜底,Agent一失败就卡死
设重试、降级与转人工三条兜底路径
上线即放量,出问题影响全量用户
小范围灰度 + 按周评估 + 保留回滚能力
建议课时 RECOMMENDED HOURS
| 适合人群 | 建议课时 | 建议形式 |
|---|---|---|
| 技术岗 | 6课时 | 技术实训 + 代码/平台实战 |
| 业务岗 | 6课时 | 低代码平台实操 |
| 管理者 | 2课时 | 侧重场景选择与ROI |
| 全员 | 1课时 | 认知版 |
721 时间分配(合计 6 课时 / 约 270 分钟)
| 环节 | 占比 | 课时 | 时长 | 内容说明 |
|---|---|---|---|---|
| 讲授 | 20% | 1.2 课时 | 约 54 分钟 | 讲概念、讲方法、拆解案例 |
| 实操演练 | 60% | 3.6 课时 | 约 162 分钟 | 随堂动手,产出真实业务成果 |
| 研讨点评 | 20% | 1.2 课时 | 约 54 分钟 | 方案互评、答疑与改进建议 |
按 721 法则设计:以实操为主、讲授为辅、研讨收口;1 课时按 45 分钟计,可按企业作息调整。