Kimi 发布 WorldVQA:首个聚焦原子级视觉世界知识的 MLLM 评测基准

ADK Kimi智能助手官方 / ADK编译 2026-02-13 4 分钟 48 次浏览
速览导读 / Summary

Kimi 团队正式发布 WorldVQA,这是一个旨在衡量多模态大语言模型(MLLMs)原子级视觉世界知识事实正确性的全新基准。该数据集包含 3500 个高质量图文对,覆盖自然、地理、文化等 9 大类,并严格区分长尾知识。评测显示,即便是顶尖模型在长尾知识上的准确率也常低于 50%,且普遍存在过度自信(Overconfidence)问题。Kimi-K2.5 在该基准上表现最佳,ECE 为 37.9%,Slope 为 0.550,但仍需大幅提升自我认知能力。

数据集规模 3,500 个图文对 经过多阶段人工验证的高质量数据
覆盖类别 9 大类 自然、地理、文化、体育等全方位知识
Kimi-K2.5 ECE 37.9% 预期校准误差,数值越低越准确
Kimi-K2.5 Slope 0.550 自信度与准确度的相关性,理想值为 1.0
长尾知识准确率 < 50% 顶尖模型在罕见知识上的表现瓶颈

Key Insights / 核心看点

  • 1 发布 WorldVQA 基准,首个聚焦原子级视觉世界知识事实正确性的评测标准。
  • 2 数据集包含 3500 个高质量图文对,覆盖 9 大类,严格区分常识与长尾知识。
  • 3 揭示顶尖模型普遍存在过度自信问题,长尾知识准确率常低于 50%。
  • 4 Kimi-K2.5 表现最佳(ECE 37.9%, Slope 0.550),但仍需提升自我认知能力。
  • 5 开源数据集与评估脚本,推动社区共建更可靠的多模态 AI。

Kimi 发布 WorldVQA:重塑多模态 AI 的“事实可靠性”标准

在视觉理解领域,多模态大语言模型(MLLMs)虽然展现了惊人的描述与推理能力,但其对视觉世界知识的“事实可靠性”却备受质疑。Kimi 团队近日正式推出了 WorldVQA,这是一个专门用于评估 MLLMs 原子级视觉世界知识事实正确性的全新基准。

核心挑战:区分“看见”与“幻觉”

WorldVQA 的核心设计初衷在于回答一个关键问题:模型是真正识别了它看到的特定实体,还是仅仅基于视觉模式进行了幻觉(Hallucination)?

评测结果令人警醒:即使是当前最先进的模型,在面对长尾视觉知识时,准确率也往往低于 50%。这一基准旨在推动多模态 AI 向更事实可靠、知识更渊博的方向发展。

数据集设计:严苛的“黄金标准”

WorldVQA 数据集由 3,500 个 高质量图像 - 问题对组成,经过多阶段人工验证,确保无噪音与歧义。其设计遵循三大核心原则:

  1. 事实性与无歧义性:每个问题都有单一、可验证的正确答案,排除主观或模糊场景。
  2. 丰富分类体系:覆盖 9 个 类别,确保世界知识广度的测试,包括:
    • 自然与环境(如:栗短翅鸫、扶桑花)
    • 地理与建筑(如:善化寺遗址、好望角)
    • 文化与工艺(如:《天鹅湖》、战国水晶杯)
    • 物体与产品(如:贝壳包、iPhone 17 Pro)
    • 交通与工艺(如:歼 -20 战斗机、防滚架)
    • 娱乐与媒体(如:《你的名字。》中的角色)
    • 品牌与标志(如:埃及航空)
    • 体育与场馆(如:上海体育场、跳马项目)
  3. 头尾分布分离:明确将数据分为 Head(常识)Tail(长尾/罕见知识),以量化模型性能随知识隐蔽度增加而下降的趋势。

关键发现:过度自信是普遍顽疾

在对比模型自信度与实际准确性的实验中,团队采用了两个关键指标:

  • ECE (Expected Calibration Error):衡量主观自信与客观准确之间的平均差距,理想值为 0。
  • Slope (加权平均斜率):衡量准确率与自信度之间的相关性,理想值为 1.0。

分析显示,所有被评估的模型均表现出严重的过度自信(Overconfidence)趋势,预测集中在 90%-100% 的高置信区间。

尽管 Kimi-K2.5 在两项指标上均取得最佳成绩(ECE: 37.9%,Slope: 0.550),但距离理想的“诚实”与“对齐”仍有巨大差距。提升多模态模型的自我认知边界,是未来探索的关键方向。

开源社区共建

Kimi 团队已开源 WorldVQA 数据集及评估脚本,旨在帮助整个社区共同解决多模态模型在事实可靠性上的痛点,推动下一代 AI Agent 的进化。

“WorldVQA 是一个简单但极具挑战性的基准,它是下一代 AI Agent 进化所必须跨越的一步。” —— Kimi 团队

WorldVQA is a simple but challenging benchmark for evaluating the atomic visual knowledge of frontier models. Improving performance on WorldVQA is a necessary step for the next generation of AI agents.

Kimi Team

同主题深度资讯

查看更多 →
AI 工具 2026-09-07

WatermarkRemover 发布全新 AI 去水印工具:一键清除多水印,保留原图画质

WatermarkRemover 正式推出基于先进 AI 技术的免费图像去水印解决方案。该工具通过自动检测与智能修复技术,支持批量移除多色水印,同时保留图像原始质量。无需专业修图技能,用户即可在数秒内完成去水印操作,并支持批量处理,极大提升了内容创作者与商业用户的效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 发布:AI 驱动的高效去水印工具,重塑图像版权与分享体验

WatermarkRemover 推出全新 AI 驱动的去水印解决方案,旨在解决传统裁剪法无法保留原图质量及水印影响专业度的痛点。该工具无需安装,支持一键上传与自动检测,承诺在去除水印的同时完美保留图像分辨率与细节。文章强调,去除水印不仅是技术操作,更是保护摄影师声誉、提升社交媒体互动率及避免版权纠纷的关键策略。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 2025 版上线:AI 驱动一键去除 TikTok 水印,助力创作者跨平台分发

WatermarkRemover 于 2025 年推出全新 TikTok 水印去除功能,利用先进的 AI 图像修复与视频处理技术,帮助用户轻松移除嵌入的视频水印。该工具支持直接粘贴 URL 即可一键处理,解决了创作者在 Instagram Reels 等平台上分发内容时的合规与美观难题。核心亮点包括智能背景重构、无损画质保留及极速处理速度,显著提升了内容再创作效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 上线:AI 驱动一键清除截图水印,重塑图像纯净度

WatermarkRemover 正式推出全新 AI 驱动的水印移除功能,专为处理截图与照片设计。通过先进的图像分析与内容重构算法,用户无需专业修图技能即可一键清除复杂水印。该工具主打免费、高效与高保真输出,显著降低了图像去水印的技术门槛,为内容创作者与开发者提供了便捷的图像净化方案。

WatermarkRemover官方 / ADK编译 3 分钟
chat · 免费+付费
★ 5.0 · 120评测
K

Kimi智能助手

月之暗面推出的AI智能助手

Kimi智能助手是北京月之暗面推出的AI智能助手,支持联网搜索能力,可实时获取最新信息结合搜索结果为用户提供准确且详细的回答。支持多种文件格式(如PDF、Word、Excel、PPT等),能帮助用户快速整理和提取关键信息。Kimi智能助手具备长文本处理能力,最高支持200万字的输入和输出,适合处理复杂的长篇内容。 k2.5:月之暗面开源的全新一代全能旗舰模型,具备顶尖的代码生成、视觉理解能力,支持自主 Agent 集群协作 k2:月之暗面Kimi推出的具备超强代码和 Agent 能力的 MoE 架构基础模型,发布即开源。 k1.5:月之暗面Kimi推出的多模态思考模型,具备强大的推理和多模态处理能力。 用户可以通过网页端、手机端APP或浏览器插件使用Kimi智能助手。具备Kimi探索版和Kimi+等特色功能,能满足用户在不同场景下的多样化需求。

查看 Kimi智能助手 使用教程与功能