Genspark 发布 Gen-1 Slides:首个专为知识工作者优化的后训练模型
过去两年,Genspark 一直构建在全球最好的通用 AI 模型之上。今天,公司宣布发布自己的首个模型:Gen-1 Slides。这是 Genspark 面向知识工作者的后训练模型家族中的第一个里程碑。
核心突破:从通用能力到垂直领域的质变
Gen-1 Slides 的核心使命是将一句简单的请求转化为一份可直接投入会议室的演示文稿。与通用大模型不同,Gen-1 Slides 专为幻灯片生成任务训练,解决了通用模型在版式、视觉设计和事实准确性上的固有短板。
1. 极致的性价比
Gen-1 Slides 与开源权重的 MiniMax M3 为起点,由 Fireworks AI 联合训练。在保持与 Claude Opus 5 相当甚至更优的质量前提下,其输入 token 价格仅为 Opus 5 的 1/17。
- 成本对比:Gen-1 Slides 约为 $0.30/百万 token,而 Claude Opus 5 高达 $5.00/百万 token。
- 团队效益:对于每月生成 1,000 份幻灯片的团队,成本可从约 4,200 美元降至约 440 美元,预算足以服务十位用户。
2. 行业领先的基准表现
在内部评分器及多个公开基准测试中,Gen-1 Slides 表现强劲:
- 内部评分:在 200 个真实任务上,综合得分 0.821,视觉设计得分 0.737,均高于 Claude Opus 5。
- 公开基准:在 UltraPresent 和 UniPPTBench 等数据集上,Gen-1 Slides 在 9 项评估中 8 项排名第一,平均排名仅为 1.11,显著优于 Kimi K3 (2.44) 和 Claude Opus 5 (2.56)。
3. 解决通用模型的痛点
通用模型(如 GPT-5.6 Sol 或 Kimi K3)往往在内容质量上尚可,但在工程化落地时存在明显缺陷:
- 版式缺陷:通用模型生成的幻灯片常出现肉眼可见的排版错误。
- 事实捏造:在忠于源材料方面,Gen-1 Slides 的捏造率(13.3%)显著低于 Claude Opus 5(17.7%)。
- 视觉设计:Gen-1 Slides 在视觉设计维度上全面超越其他通用模型。
技术架构与评估方法
Gen-1 Slides 的成功源于其独特的训练策略和严谨的评估体系。
训练策略
- 基座模型:开源的 MiniMax M3。
- 联合训练:与 Fireworks AI 合作,利用 Genspark 内部生成真实演示文稿的系统数据进行训练。
- 强化学习:利用内部智能体评分器(由 Claude Fable 5 驱动)提供奖励信号,涵盖任务完成度、内容质量、视觉设计和过程质量四个维度。
评估体系
Genspark 构建了“三重验证”机制以确保模型质量:
- 内部评分器:基于真实业务场景,由多模态大模型驱动,提供细粒度的反馈。
- 公开基准:使用 UltraPresent 和 UniPPTBench 数据集及官方评分器,验证泛化能力。
- 人工标注:产品经理和设计师对 77 个任务进行了 4,063 页的人工标注,确认评分器与人类判断高度一致(88% 的页面级判定保留率)。
应用价值与未来展望
Gen-1 Slides 的上线标志着 AI 应用从“能用”向“好用”和“便宜好用”的转变。对于知识工作者而言,这意味着不再需要为通用模型的高昂价格买单,同时获得接近前沿实验室水平的交付质量。
Genspark 表示,Gen-1 Slides 只是其模型家族的开始。未来,同样的方法将应用于电子表格、文档生成和研究分析等场景,让前沿级的 AI 能力成为所有交付物的底线,而非需要额外付费的高级选项。
Gen-1 Slides 现已作为 Genspark AI Slides Standard 模式的默认模型上线,开发者可通过 gsk CLI 或即将开放的 OpenRouter 接口使用。