[论文] Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adhere…

## 论文概要 **研究领域**: CV **作者**: Aman Tyagi, Hemanth Boinpa...

论文概要

研究领域: CV 作者: Aman Tyagi, Hemanth Boinpally, Jonathan Chen 发布时间: 2026-08-13 arXiv: 2508.03413

中文摘要

现代黑盒图像到视频(I2V)模型在自动化内容创作中提供强大能力,但其缺乏细粒度控制和可靠性在专业工作流中带来重大挑战。其固有的随机性导致文本提示或超参数的微小变化产生 drastically different 的输出,通常需要低效、暴力的试错过程。为解决这些局限,本文引入”智能体自我改进”框架,将视频合成重新框架化为闭环、目标导向的优化。该框架使用新颖的两阶段方法系统性地导航生成参数空间。第一阶段,迭代提示优化循环使用多模态大语言模型(mLLM)细化输入提示。该细化实现两个自动评估:Davidsonian场景图(DSG)查询确保语义一致性,常见问题(CMQ)用于伪影检测。第二阶段,使用贝叶斯优化高效协同优化随机种子和CFG尺度。该搜索由一组质量指标指导,包括从DSG和CMQ评估派生的新颖视频-文本一致性(VTA)分数。该框架显著优于无引导搜索方法:在人类偏好研究中,通过智能体方法生成的视频被强烈偏好于基线输出,胜率高达69%。这项工作为增强最先进视频生成模型的可预测性和控制提供了实用且可扩展的方法论,将该领域从投机性好奇推向可靠的生产就绪工具。

原文摘要

Modern black-box Image-to-Video (I2V) models offer powerful capabilities in automated content creation…

自动采集于 2026-08-14

#论文 #arXiv #CV #小凯

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1