小红书发布 UniNote:统一多模态嵌入,重构搜索与推荐架构

ADK APIMart官方 / ADK编译 2024-11-01 5 分钟 72 次浏览
速览导读 / Summary

小红书推出 UniNote 模型,旨在打破文本、图像、音频和视频的模态壁垒,将各类内容映射至单一共享向量空间。通过两阶段训练策略(InfoNCE 损失与 Hard Negative Mining)及检索 - 排名统一框架,UniNote 在跨模态检索任务中实现了高达 26 个百分点的 NDCG@10 提升。该方案致力于简化系统架构,减少因模型分裂导致的语义漂移,为构建高效的多模态搜索与推荐系统提供了新范式。

NDCG@10 提升幅度 26% 相比标准 CLIP 模型在共享空间中的表现
视频上下文窗口 3-25 秒 当前支持的视频时间片段限制
训练阶段 2 阶段 包含对比学习与相关性优化

Key Insights / 核心看点

  • 1 构建单一共享向量空间,实现文本、图像、音频、视频的统一检索与排名。
  • 2 采用两阶段训练策略,结合 InfoNCE 损失与 Hard Negative Mining 提升排序精度。
  • 3 在跨模态检索任务中实现 NDCG@10 高达 26 个百分点的性能提升。
  • 4 通过检索与排名模型统一,消除语义漂移,简化系统架构设计。
  • 5 支持可变长度嵌入,平衡存储成本与检索效率。

UniNote:小红书统一多模态嵌入架构深度解析

在 AI 应用日益复杂的今天,如何高效处理文本、图像、音频和视频的混合内容,一直是搜索与推荐系统的核心挑战。近日,小红书(Xiaohongshu)发布了其最新的多模态模型 UniNote,提出了一种革命性的思路:“一个笔记,一个嵌入,一条搜索路径”

核心突破:从“分治”到“统一”

传统多模态系统通常将不同模态内容分别处理,导致检索(Retrieval)与排名(Ranking)阶段往往依赖不同的模型或索引,这不仅增加了系统复杂度,还容易引发语义漂移(Drift)。

UniNote 的核心创新在于构建单一的共享向量空间

  1. 统一表示:利用 ASR(语音识别)、OCR(光学字符识别)和 VLM(视觉语言模型)将音频、图像、视频转化为统一的笔记格式,最终映射到同一个高维向量空间中。
  2. 检索与排名一体化:摒弃了传统的双模型架构,UniNote 使用同一套嵌入系统同时服务于候选检索和最终排名,确保两个阶段对“相关性”的理解完全一致。

关键技术架构

UniNote 的成功依赖于严谨的训练策略与架构设计:

1. 两阶段训练策略

  • 第一阶段:对比学习 采用 InfoNCE loss 进行训练,迫使模型将同一笔记的不同模态表示拉近,即使它们来自不同的数据源。
  • 第二阶段:相关性优化 引入 Hard Negative Mining(困难负样本挖掘)。模型不仅学习匹配内容,更要学会区分“看似相关实则不相关”的干扰项。这种机制显著提升了排序的锐度。

2. 可变长度嵌入

系统支持根据任务需求动态调整嵌入长度,在保留精度的同时优化存储成本与检索速度,实现了效率与效果的平衡。

3. 跨模态检索增益

在 Item-to-Item 检索任务中,UniNote 展现了惊人的性能提升。通过共享空间对齐,其 NDCG@10 指标相比标准 CLIP 模型提升了高达 26 个百分点。这意味着在匹配图片与商品详情页、视频片段与文本描述等场景下,系统能更精准地找到用户意图。

局限性与未来展望

尽管 UniNote 在架构简化与检索性能上取得了显著成果,但也存在一些当前限制:

  • 细粒度匹配挑战:当视觉与文本信号冲突时,仍可能出现排名错误或幻觉。
  • 视频时间窗口限制:目前主要支持 3 到 25 秒 的时间上下文,对于长视频的深度序列理解仍有待突破。

对开发者的价值

对于致力于构建搜索、发现或推荐系统的开发者,UniNote 的启示在于:统一的嵌入空间可以大幅降低系统维护成本,减少因多模型协同带来的不一致性。 虽然对齐质量仍是决定用户体验的关键,但 UniNote 证明了通过架构层面的统一设计,可以在不增加额外模型负担的前提下,显著提升跨模态交互的流畅度与准确性。

UniNote 的核心思想很简单:一个笔记,一个嵌入,一条搜索路径。我们不再将文本、图像、视频和音频视为孤立的系统,而是将它们放入同一个共享向量空间,用于检索和排名。

小红书技术团队

同主题深度资讯

查看更多 →
AI 工具 2026-09-07

WatermarkRemover 发布全新 AI 去水印工具:一键清除多水印,保留原图画质

WatermarkRemover 正式推出基于先进 AI 技术的免费图像去水印解决方案。该工具通过自动检测与智能修复技术,支持批量移除多色水印,同时保留图像原始质量。无需专业修图技能,用户即可在数秒内完成去水印操作,并支持批量处理,极大提升了内容创作者与商业用户的效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 发布:AI 驱动的高效去水印工具,重塑图像版权与分享体验

WatermarkRemover 推出全新 AI 驱动的去水印解决方案,旨在解决传统裁剪法无法保留原图质量及水印影响专业度的痛点。该工具无需安装,支持一键上传与自动检测,承诺在去除水印的同时完美保留图像分辨率与细节。文章强调,去除水印不仅是技术操作,更是保护摄影师声誉、提升社交媒体互动率及避免版权纠纷的关键策略。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 2025 版上线:AI 驱动一键去除 TikTok 水印,助力创作者跨平台分发

WatermarkRemover 于 2025 年推出全新 TikTok 水印去除功能,利用先进的 AI 图像修复与视频处理技术,帮助用户轻松移除嵌入的视频水印。该工具支持直接粘贴 URL 即可一键处理,解决了创作者在 Instagram Reels 等平台上分发内容时的合规与美观难题。核心亮点包括智能背景重构、无损画质保留及极速处理速度,显著提升了内容再创作效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 上线:AI 驱动一键清除截图水印,重塑图像纯净度

WatermarkRemover 正式推出全新 AI 驱动的水印移除功能,专为处理截图与照片设计。通过先进的图像分析与内容重构算法,用户无需专业修图技能即可一键清除复杂水印。该工具主打免费、高效与高保真输出,显著降低了图像去水印的技术门槛,为内容创作者与开发者提供了便捷的图像净化方案。

WatermarkRemover官方 / ADK编译 3 分钟
code · 免费
★ 5.0 · 120评测
A

APIMart

一站式 AI API 平台,多主流模型统一访问

APIMart是一站式 AI API 平台,提供对 500 多个主流 AI 模型的统一访问,涵盖聊天、视频生成、图像生成等多类 AI 能力。与 OpenAI 的 API 格式完全兼容,用户只需修改一行代码即可从 OpenAI 迁移到 APIMart,享受更低的成本和更高的性能。APIMart核心优势在于高性价比,相比竞品可节省 30% 至 70% 的成本,同时提供 99.9% 的高可用性。智能路由技术确保低延迟响应,支持超高并发,适合大规模应用场景。APIMart提供详细的用量分析和成本跟踪,帮助用户优化费用。

查看 APIMart 使用教程与功能