Glean 深度解析:构建高能效智能体系统的五大关键策略

ADK Glean官方 / ADK编译 2026-07-23 5 分钟 165 次浏览
速览导读 / Summary

Glean 发布最新技术文章,指出智能体(Agent)系统的 Token 效率优化不应仅停留在提示词精简,而应转向工作流架构设计。文章深入剖析了检索噪声、上下文膨胀、非结构化记忆等五大 Token 浪费源头,并提出了通过分阶段计量、前置上下文控制、结构化状态存储等策略,实现从‘减少 Token 数’到‘提升单位 Token 产出比’的范式转变。

优化方向 架构重构 从 Prompt 优化转向 Workflow 设计
核心策略 上下文工程 Selective context control before generation
成本指标 Cost per task 降低单次任务完成成本

Key Insights / 核心看点

  • 1 Token 效率优化应从提示词编辑转向工作流架构设计,关注全生命周期成本。
  • 2 识别并解决检索噪声、上下文膨胀、非结构化记忆等五大 Token 浪费源头。
  • 3 实施分阶段 Token 计量,精准定位规划、检索、循环等环节的瓶颈。
  • 4 采用上下文工程(Context Engineering),在模型接收前过滤和精简无关信息。
  • 5 用结构化状态存储替代原始对话转录,降低长期运行的记忆成本。

Glean 深度解析:构建高能效智能体系统的五大关键策略

随着企业级 AI 从简单的对话助手向多步骤智能体(Multi-step Agents)演进,Token 成本正以前所未有的速度累积。一个典型的智能体工作流可能包含规划、检索、工具调用、验证、重试及中间推理等多个环节。Glean 团队在最新的技术洞察中指出,Token 效率优化的核心在于将问题从“提示词编辑”转向“工作流设计”

什么是智能体系统中的 Token 效率?

Token 效率并非单纯追求最少的 Token 消耗,而是指在产生准确、 grounded(有据可依)且有用的结果时,使用最小必要的上下文和计算资源。

如果系统虽然减少了 Token 使用,但存在以下情况,则仍被视为低效:

  • 遗漏关键证据
  • 需要重复重试
  • 产生额外的人工清理工作
  • 随着工作流复杂化而速度变慢

在生产环境中,高效的 Token 利用通常意味着:更低的单次任务成本、更快的完成速度、更少的幻觉、更可预测的扩展性以及更少的无关上下文。

为什么提示词修剪不再是主要杠杆?

在单轮对话场景中,缩短指令确实能节省少量费用。但在智能体工作流中,最大的成本往往来自包裹在提示词之外的环节:

  • 检索了过多的数据
  • 仅需要少量段落却传入了整份文档
  • 在每个步骤都重放完整的对话历史
  • 运行过多的审查或反思循环
  • 将简单任务路由到昂贵的推理路径

Glean 强调,优秀的团队正从单一的提示词优化,转向全 Token 生命周期优化

Token 浪费的五大源头

在成熟的智能体系统中,Token 浪费通常集中在以下五个方面:

  1. 检索噪声 (Retrieval Noise):返回过多文档、排名靠后的结果或过大的文本块,迫使模型在寻找信号前先处理大量噪声。
  2. 膨胀的工作上下文 (Bloated Working Context):将对话历史、工具输出、笔记等所有可用信息都塞入每个步骤的上下文中,导致模型处理无关材料。
  3. 非结构化记忆 (Unstructured Memory):携带完整的消息历史记录是昂贵的,且随着时间推移会降低系统的可靠性。
  4. 过度编排 (Over-orchestration):简单的事实查询不应触发重型的多步骤管道、子智能体或深度推理。
  5. 无界循环 (Unbounded Loops):审查、反思和重试循环如果重新摄入先前的上下文,成本会呈指数级增长。

提升 Token 效率的实战策略

Glean 建议按照 Token 累积的顺序来优化工作流,具体包括:

1. 按工作流阶段计量 Token 使用

不要只看单次请求的总 Token 数,而应拆解到:规划、检索、工具调用、执行、审查、重试及记忆更新。结合任务成功率、落地性(groundedness)、延迟和人工修正率等指标,精准定位是提示词、检索、循环还是路由问题。

2. 在模型接收前减少上下文

最大的节省发生在生成之前。设计工作流时,应仅传递下一步决策所需的证据。

  • 使用渐进式检索而非一次性倾倒文档
  • 在插入提示词前对证据进行排序和重排序
  • 传递段落而非整份文档
  • 去重重叠结果
  • 丢弃不再需要的上下文
  • 利用权限感知检索缩小搜索空间

3. 用结构化状态替代原始转录

长对话转录是智能体系统中最常见的隐藏成本之一。应摒弃重放每条消息的做法,转而存储结构化的状态信息,仅传递必要的上下文片段,从而显著降低 Token 消耗并提升系统稳定性。

“我们的目标不是以牺牲质量为代价换取最少的 Token,而是追求最佳的产出比。” —— Glean 团队

通过上述架构层面的优化,企业不仅能大幅降低 AI 应用的成本,还能提升智能体的响应速度和决策准确性,真正实现规模化部署。

Token efficiency in agentic systems improves when teams stop treating cost as a prompt-editing problem and start treating it as a workflow-design problem.

Glean PMM, Julie Mills

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
AI 工具 2026-09-07

WatermarkRemover 上线 InShot 水印移除指南:AI 驱动的去水印新实践

WatermarkRemover 发布针对 InShot 视频水印的移除指南,展示了 AI 技术在数字内容去标识化中的应用。文章详细解析了水印检测、背景重构及色彩分析的核心算法流程,并对比了传统付费升级与 AI 工具移除的优劣。该指南不仅为开发者提供了理解 AI 图像修复逻辑的参考,也为用户提供了高效处理社交媒体素材的解决方案。

WatermarkRemover官方 / ADK编译 4 分钟
AI 工具 2026-09-07

Alive Movie Maker 水印移除指南:iOS 与 Android 端操作详解及替代方案

针对短视频创作者在跨平台分发时面临的 Alive Movie Maker 水印困扰,本文详细解析了官方提供的原生移除功能及替代方案。文章重点梳理了 iOS 与 Android 端的操作步骤,并探讨了通过专业剪辑软件或代码修改等进阶手段去除水印的可能性,旨在帮助开发者与用户高效处理视频版权与分发问题。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

Luma AI 发布 20 个 AI 修图提示词:重塑产品摄影与营销素材生产流

Luma AI 近日发布了一份包含 20 个实战场景的 AI 修图提示词指南,旨在解决传统摄影后期中“重拍成本高、修改周期长”的痛点。该指南强调利用 Uni-1 等模型理解图像构建逻辑,通过“保留主体、仅修改局部”的编辑型提示词(Editing Prompt),实现产品换色、背景替换、尺寸调整等任务。这不仅降低了营销素材的生产成本,更让创意团队能够灵活应对市场变化,从单张精修图快速生成多平台的营销变体。

Luma AI官方 / ADK编译 4 分钟