Glean 深度解析:构建高能效智能体系统的五大关键策略
随着企业级 AI 从简单的对话助手向多步骤智能体(Multi-step Agents)演进,Token 成本正以前所未有的速度累积。一个典型的智能体工作流可能包含规划、检索、工具调用、验证、重试及中间推理等多个环节。Glean 团队在最新的技术洞察中指出,Token 效率优化的核心在于将问题从“提示词编辑”转向“工作流设计”。
什么是智能体系统中的 Token 效率?
Token 效率并非单纯追求最少的 Token 消耗,而是指在产生准确、 grounded(有据可依)且有用的结果时,使用最小必要的上下文和计算资源。
如果系统虽然减少了 Token 使用,但存在以下情况,则仍被视为低效:
- 遗漏关键证据
- 需要重复重试
- 产生额外的人工清理工作
- 随着工作流复杂化而速度变慢
在生产环境中,高效的 Token 利用通常意味着:更低的单次任务成本、更快的完成速度、更少的幻觉、更可预测的扩展性以及更少的无关上下文。
为什么提示词修剪不再是主要杠杆?
在单轮对话场景中,缩短指令确实能节省少量费用。但在智能体工作流中,最大的成本往往来自包裹在提示词之外的环节:
- 检索了过多的数据
- 仅需要少量段落却传入了整份文档
- 在每个步骤都重放完整的对话历史
- 运行过多的审查或反思循环
- 将简单任务路由到昂贵的推理路径
Glean 强调,优秀的团队正从单一的提示词优化,转向全 Token 生命周期优化。
Token 浪费的五大源头
在成熟的智能体系统中,Token 浪费通常集中在以下五个方面:
- 检索噪声 (Retrieval Noise):返回过多文档、排名靠后的结果或过大的文本块,迫使模型在寻找信号前先处理大量噪声。
- 膨胀的工作上下文 (Bloated Working Context):将对话历史、工具输出、笔记等所有可用信息都塞入每个步骤的上下文中,导致模型处理无关材料。
- 非结构化记忆 (Unstructured Memory):携带完整的消息历史记录是昂贵的,且随着时间推移会降低系统的可靠性。
- 过度编排 (Over-orchestration):简单的事实查询不应触发重型的多步骤管道、子智能体或深度推理。
- 无界循环 (Unbounded Loops):审查、反思和重试循环如果重新摄入先前的上下文,成本会呈指数级增长。
提升 Token 效率的实战策略
Glean 建议按照 Token 累积的顺序来优化工作流,具体包括:
1. 按工作流阶段计量 Token 使用
不要只看单次请求的总 Token 数,而应拆解到:规划、检索、工具调用、执行、审查、重试及记忆更新。结合任务成功率、落地性(groundedness)、延迟和人工修正率等指标,精准定位是提示词、检索、循环还是路由问题。
2. 在模型接收前减少上下文
最大的节省发生在生成之前。设计工作流时,应仅传递下一步决策所需的证据。
- 使用渐进式检索而非一次性倾倒文档
- 在插入提示词前对证据进行排序和重排序
- 传递段落而非整份文档
- 去重重叠结果
- 丢弃不再需要的上下文
- 利用权限感知检索缩小搜索空间
3. 用结构化状态替代原始转录
长对话转录是智能体系统中最常见的隐藏成本之一。应摒弃重放每条消息的做法,转而存储结构化的状态信息,仅传递必要的上下文片段,从而显著降低 Token 消耗并提升系统稳定性。
“我们的目标不是以牺牲质量为代价换取最少的 Token,而是追求最佳的产出比。” —— Glean 团队
通过上述架构层面的优化,企业不仅能大幅降低 AI 应用的成本,还能提升智能体的响应速度和决策准确性,真正实现规模化部署。