Nexu 发布多 Token 生成技术:重塑 LLM Agent 吞吐效率与交互体验
在 AI Agent 领域,大多数团队追求的是更‘聪明’的代理,但用户真正迫切的需求往往是让 Agent 在真实工作流中‘不再显得缓慢’。Nexu 近期在其技术博客中深入探讨了这一痛点,并提出了以多 Token 生成(Multi-Token Generation)为核心的架构优化方案,旨在彻底改变 LLM Agent 的吞吐量(Throughput)现状。
痛点:自回归延迟如何破坏工作流
尽管许多 Agent 产品已具备明确的功能,但用户往往因等待时间过长而失去信任。这种延迟并非总是由单一巨大的卡顿引起,而是源于多个微小暂停的累积:
- 草稿生成阶段:用户在等待回复时可能离开对话线程。
- 链式推理:每一步额外的操作都增加了摩擦感。
- 工具编排:上下文切换变得明显,导致体验割裂。
- 高并发聊天运营:吞吐量在准确性下降之前就已崩溃。
在即时通讯环境(如 Slack、飞书、WeChat)中,响应节奏是产品质量的一部分。用户能容忍慢速的分析仪表盘,却难以容忍慢速的聊天 Agent。
核心突破:从‘智能’转向‘吞吐量’
Nexu 指出,许多团队错误地将智能与延迟视为独立层级。实际上,优化生成速度往往比边际基准分数的提升更具商业价值。
1. 技术原理:多 Token 生成
通过优化解码过程,使模型能够以多 Token 步骤(Multi-Token Steps)返回输出,而非传统的逐个 Token 生成。这种架构重构允许 Agent 在保持同等回答质量的同时,大幅缩短解码时间。
2. 商业价值场景
- 聊天原生运营:响应节奏直接决定产品留存率。
- 支持与内部帮助中心:吞吐量提升 1.5 倍可显著增加单部署服务的用户量,延缓成本上升。
- 人机协作链:在需要人类审批的 Agent 工作流中,更低的延迟缩短了从机器输出到人类决策的循环时间,解决了真正的瓶颈。
实际应用与行动指南
Nexu 建议开发者重新定义产品指标,不再仅关注原始模型延迟,而是测量端到端的真实等待时间(包括推理、工具调用、格式化及人工审批延迟)。
行动路线图:
- 今日:测量真实 Agent 工作流的端到端等待时间。
- 本周:将工作流分为‘质量受限’和‘延迟受限’两类,识别主要增长瓶颈。
- 本月:将模型吞吐量作为核心产品指标,对比不同模型变体在关闭真实对话循环的速度。
“用户购买的不是‘每秒 Token 数’,而是那些不会让人觉得卡住的流畅工作流。” —— Nexu 技术团队
对于已经具备可接受回答质量的产品而言,速度提升是驱动采用率的关键特征,而非锦上添花的优化。Nexu 正致力于让 Agent 系统不仅更智能,而且更‘好用’,通过基础设施的改进直接提升用户体验。
关键指标与亮点
- 架构优化:引入多 Token 生成机制,重构解码流程。
- 吞吐量提升:目标实现 1.5 倍以上的并发处理能力。
- 体验指标:显著降低用户中途放弃对话(Abandonment)的概率。
- 适用场景:高并发聊天运营、人机协作审批流、嵌入式即时通讯 Agent。