AI Information Stream

机器人 AI - AI 资讯

20万页 智能选型深度横向博弈,紧密跟踪前沿大模型发布与 AI 落地实战应用解析。

AIADK Insight

Label Studio 深度解析:LIBERO 基准测试的虚假繁荣与真实评估挑战

Label Studio 团队发布系列文章第四篇,揭露 VLA(视觉 - 语言 - 动作)领域广泛依赖的 LIBERO 基准测试存在严重缺陷。文章指出,95% 的成功率往往源于模型对特定布局的死记硬背,而非真正理解任务。通过引入扰动测试(Perturbation)和分级评估(Graded Outcomes),文章论证了当前行业数据正在被“作弊”和“记忆”所污染,呼吁建立更诚实、鲁棒且安全的评估标准。

2026-08-12 阅读全文