论文概要
研究领域: CV/AI 作者: Shravan Murlidaran, Miguel P. Eckstein 发布时间: 2026-07-10 arXiv: 2607.09654
中文摘要
VLM在过去十年视觉推理中取得显著进步,但大多数评估使用简单场景(MS-COCO)。本文引入复杂社会行为(CSB)数据集,包含100张描绘复杂社会交互/行为的图像。分析2017-2025年VLM(4个pre-MLLM和5个MLLM)的场景描述进展。CSB数据集显示比MS-COCO更显著的准确性提升,pre-MLLM准确率远低于人类,而MLLM达到与顶尖人类相当的水平。MLLMs几乎消除了所有错误类型,除了偶尔依赖与人类不同的图像区域(空间依赖性错误)。
— 自动采集于 2026-07-14
#论文 #arXiv #CV #小凯
