Glif 2.0 重磅更新:原生多模态工具集与智能消息队列全面上线
自 Glif 2.0 发布以来,团队持续加速迭代,于 2026 年 4 月 17 日带来了涵盖图像、视频、音频及交互体验的全面升级。此次更新不仅大幅扩充了 Agent 的原生工具库,更通过智能消息队列与媒体库重构,重新定义了人机协作的交互范式。
核心突破:原生多模态工具矩阵
Glif 此次引入了超过 10 款经过深度调优的原生工具,旨在解决从创意生成到落地执行的全链路需求:
🖼️ 图像生成与渲染
- Z Image:一款性能卓越的文生图模型,原生支持 LoRA 微调与 ControlNet 控制。其优势在于极高的性价比与速度,支持文本转图像、图像转图像及精确控制模式。
- Quiver:专为矢量图设计,能够根据文本或参考图生成真实可用的 SVG 代码。输出无限缩放且无失真,是制作 Logo、图标及插画的首选工具。
- HTML to Image:Agent 可直接编写 HTML+CSS 代码并渲染为像素级精准的 PNG 图片,适用于社交媒体卡片、海报及信息图的快速原型制作。
🎬 视频生成与处理
- PixVerse V6:字节跳动推出的强有力视频模型,擅长动作场景。支持图像转视频及原生音频(背景音乐与音效,非语音),并提供动漫、3D 粘土、赛博朋克等多种风格预设。
- Seedance 2.0:ByteDance 最新发布的文本/图像转视频模型,提供标准、极速、参考图及极速参考图四种变体,同样具备原生音频能力。
- Remotion:程序化视频生成利器。Agent 编写 React 组件即可输出完整渲染视频,具备极高的可重复性与可控性。
- Fabric 1.0 LipSync:基于肖像图与音频片段进行快速、清晰的唇形同步。
- Remove Video Watermark:利用 WaveSpeed 技术去除视频水印,按时长计费(支持 10 分钟以内剪辑)。
🎙️ 音频合成
- Google Gemini TTS:基于 Gemini 3.1 Flash 引擎,提供 30 种音色、70 多种语言(自动检测)。支持
[whispers]、[laughs]等表情指令,实现极具表现力的语音合成。
交互升级:消息队列与媒体库重构
⚡ 消息队列(Message Queue)
用户不再需要等待 Agent 完成当前任务才能输入新指令。在任务进行中按下回车,消息将进入队列,待 Agent 空闲时立即执行。用户可在队列中编辑或取消消息,并在编辑器上方获得实时指示,极大提升了连续对话的流畅度。
📚 智能媒体库
- 按聊天分组:默认将媒体按生成它的聊天会话分组,方便回溯源对话。
- 一键收藏:支持在聊天或库中点击心形图标收藏内容,并提供“仅显示收藏”筛选模式。
🎨 UI/UX 全面焕新
- 刷新深色模式配色,提供更清爽的深色体验。
- 修复视频播放器可靠性问题,画廊中视频以真实比例显示。
- 优化聊天布局,任务组、代码块及工具任务缩略图渲染更整洁。
- 改进 Markdown 渲染,支持表格、引用块及工具缩略图。
总结
Glif 2.0 通过整合顶尖的开源与闭源模型,构建了一个从创意构思到最终交付的闭环工作流。无论是需要快速生成高质量图像视频,还是追求程序化可控的内容生产,Glif 都提供了强大的原生支持。配合消息队列与媒体库的优化,开发者与创作者的协作效率将得到显著提升。
"We've been heads-down shipping a bunch of new native tools, a smarter media library, and general polish." —— Glif Team
更多更新请持续关注 Glif 官方动态及 Discord 社区。