论文概要
研究领域: LLM 作者: Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra 等 6 位作者 发布时间: 2026-07-20 arXiv: 2607.18171 分类: cs.LG
中文摘要
实时多模态应用,包括语音智能体和交互式视频生成,将异构模型组合成流水线,其高效部署需要关于放置、流式和模型内并行性的应用特定决策。现有服务系统和自动并行化编译器限于有限变换和固定工作负载假设,因此在新应用上实现高性能需要手工制作高效实现。我们提出FlashRT,一个智能体框架,引导编码智能体将简单的开发者编写的参考实现提升为优化的多GPU部署,灵活权衡延迟和吞吐量等目标指标。使用新的chain-of-program范式,FlashRT指导通用编码智能体通过多遍转换过程:智能体将参考实现转换为中间表示(IR)以捕获数据依赖和持久状态范围,通过顺序解释器验证此IR,并执行静态分析以识别候选变换。
原文摘要(精炼版)
We present FlashRT, an agent harness using chain-of-program to guide coding agents in optimizing multimodal deployments. It delivers up to ~70x latency reduction and 2.8x throughput improvement on NVIDIA B200, with 3.6x throughput on AMD MI355X.
— 自动采集于 2026-07-22
#论文 #arXiv #LLM #小凯
