Glean 发布 Jev:零样本分类器的回归与系统一模型架构解析
在 AI 应用开发中,当系统需要做出明确的标签、评分或二元判断时,开发者往往面临一个经典的技术权衡:是调用通用大语言模型(LLM)进行灵活但昂贵的推理,还是部署专门的分类模型以换取效率和稳定性?
针对这一痛点,Glean 工程团队近日发布了 Jev,一款旨在解决‘系统一’(System One)决策场景的新型模型。Jev 的核心价值在于它提供了一种无需收集新训练数据、无需微调即可通过 API 获取结构化输出(包括选择、分数及概率)的解决方案。
为什么需要 Jev?
分类任务并非新鲜事,从传统的开源分类器到微调后的专用模型,生态中已存在多种方案。然而,通用 LLM 在处理此类任务时存在明显的‘性能 - 成本’劣势:
- 通用 LLM:具备零样本(Zero-shot)灵活性和生成解释的能力,但需为微小的决策支付昂贵的自回归延迟和计算成本。
- 微调分类器:在稳定高并发任务中表现最佳,但面临数据收集、训练周期长、类别体系僵化等维护成本。
- 开源零样本模型:成本低且可控,但质量参差不齐,且需要开发者自行解决模型部署和推理优化的难题。
Jev 试图填补这一空白,它结合了零样本的灵活性与托管 API 的便捷性,让团队能够动态调整问题与选项,而无需重新训练模型。
实测数据:超越开源,挑战微调
Glean 团队在内部测试了四个受约束的决策场景,重点对比了 Jev 与开源模型 Laya(及其微调版本)以及基于 LLM 的基线系统。实验结果显示,Jev 在成本降低和延迟优化上取得了显著成果。
在查询分类(Query Classification)实验中,Jev 展现了强大的竞争力:
| 实验模型 | 任务一致性 (Broad Task Agreement) | 性能 (Perf) |
|---|---|---|
| Jev (零样本) | 66.8% | ~12 分钟 (并发 4) |
| Base Laya (开源) | 35.9% | ~90 秒 (本地开发机) |
| Fine-tuned Laya (微调) | 74.5% | ~90 秒 (本地开发机) |
注:性能单位为完成特定测试集所需的预估时间,数值越小代表吞吐量越高。
尽管微调后的 Laya 在准确率上略胜一筹,但 Jev 以极低的成本提供了接近的零样本性能,且其吞吐量优势巨大。对于大多数企业级应用而言,这种‘无需训练即可上线’的能力极具吸引力。
核心亮点与技术指标
- 系统一架构设计:Jev 专为结构化决策设计,输出包含选择、分数和概率,完全摒弃了不必要的文本生成过程。
- 零样本灵活性:无需微调即可适应新的分类任务,仅需更新 API 中的问题与选项定义。
- 性能与成本双重优化:相比通用 LLM,在特定决策任务上实现了数量级级的成本降低和延迟提升。
关键指标 (Metrics):
- 版本/指标: Jev v1.0
- 描述: 引入零样本分类 API,支持结构化输出
- 版本/指标: 66.8% 任务一致性
- 描述: 在查询分类任务中超越开源基线模型
- 版本/指标: ~12 分钟 (并发 4)
- 描述: 相比本地微调模型实现吞吐量级提升
结语
Jev 的发布标志着 AI 工具在‘分类’这一基础能力上的回归与进化。正如 Glean 团队所言,"我们无需为微小的决策支付昂贵的自回归成本"。对于追求高效、稳定且灵活的企业级 AI 应用开发者而言,Jev 无疑是一个值得关注的架构级工具。