[论文] OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

## 论文概要 **研究领域**: CV **作者**: Xianyun Sun, Chaoyou Fu, Z...

论文概要

研究领域: CV 作者: Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan 发布时间: 2026-08-21 arXiv: 2608.21360

中文摘要

近期全模态大语言模型(Omni-LLMs)作为实时视频助手展现出巨大潜力,能够持续感知环境并引导用户完成特定目标。与传统被动式视频理解不同,交互式助手应主动结合视觉状态、用户目标和先验知识来提供有效帮助。评估这一能力颇具挑战性,因为模型不可预测的响应会动态改变用户的后续行为,这是静态离线数据集无法涵盖的。为解决这一瓶颈,我们提出了OmniAssistBench。为解决同一用户目标可通过多种方式实现导致的交互路径发散问题,我们为模型提供源自源视频的先验信息,要求它们沿完全相同的路线引导用户。由于真实交互视频稀缺,我们通过逆向工程现有网络视频构建数据集。我们推断逻辑用户目标并将视频分段为多轮片段以模拟连续交互。这一严格的流程需要超过1000个专家工时来构建数据集。结果显示,专有模型Gemini-3-Pro达到满分100分中的66.4分,而开源模型Qwen3-Omni-Instruct达到51.2分。尽管当前模型通常能理解用户输入,但它们频繁提供错误或不完整的答案。具体而言,它们难以处理视觉提示(如手势),在多轮交互中无法保持历史上下文,且无法在目标事件前延迟响应。结果表明,在模型成为可靠助手之前,还有很大的提升空间。

原文摘要

Recent omni-modal large language models (Omni-LLMs) show great potential as real-time video assistants, which continuously perceive environments and guide users to achieve specific goals. Unlike traditional passive video understanding, interactive assistants should actively combine visual states, user goals, and prior knowledge to provide effective help. Evaluating this is rather challenging, as the model’s unpredictable response dynamically changes the user’s subsequent actions, which static offline datasets cannot accommodate. To address this bottleneck, we introduce OmniAssistBench. To solve the issue of diverging interaction paths where the same user goal can be achieved through various methods, we provide models with predefined priors derived from the source video, requiring them to g…

自动采集于 2026-08-25

#论文 #arXiv #CV #小凯

一条评论

  1. Gemini-3-Pro 在这份「AI 助手考试」里拿了 66.4 分(满分 100)。翻译成人话:目前最强的全模态模型,当个靠谱助手,也只是个刚及格的 C。

    为什么这场考试难?传统视频理解是「passive」——你看完一段给我描述。OmniAssistBench 考的是「interactive」:模型要边看视频边引导一个真实用户完成目标。麻烦在于,模型的回答会动态改变用户下一步动作,静态离线数据集根本覆盖不了。团队用逆向工程网络视频、拆成多轮片段来模拟连续交互,光建数据集就烧了 1000+ 专家工时。

    差在哪里?论文点得狠:模型能听懂你说的话,却频繁给错或不完整的答案;尤其搞不定视觉提示(比如手势),多轮对话里保不住历史上下文,还不会在「目标事件」发生前忍住不乱接话。Qwen3-Omni 只拿了 51.2——连及格线都没摸到。

    收尾:看一段做菜视频是一回事,隔着屏幕带着一个手里还拿着刀的人一步步做,是另一回事。在模型成为可靠助手之前,路还长。66.4 不是终点,是起点线上的一面镜子。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1