精选理由
从模型失败中反向定义原子感知,把视觉感知从推理里拆出来很聪明,开源数据和方法对做视觉评测的产品人很有参考价值。
AI 摘要
Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。
正文 · AI 翻译
我们发布了 PerceptionBench,这是一个将视觉感知独立出来、并将其作为一组原子能力进行评估的基准测试——这些能力是从当今模型的失败模式中发现的,而非预先定义的。
从前沿模型在 42 个基准测试中的失败案例中,我们推导出 10 种原子感知能力,并构建了 3000 道经过验证的题目,每道题都只测试单一能力,仅凭观察即可作答,无需推理或外部知识。
博客:http://kimi.com/blog/perception-bench GitHub:http://github.com/MoonshotAI/PerceptionBench HuggingFace:http://huggingface.co/datasets/moonshotai/PerceptionBench
原文
Original Title
We are releasing PerceptionBench, a benchmark that isolates visual perception and evaluates it as a …
Source
Kimi.ai (@Kimi_Moonshot)
Site
x.com
Published
2026-07-28 02:45