Models · Research
VISA:一种用于多模态指令跟随的智能体自进化数据合成框架
VISA 是一种智能体自进化数据合成框架,用于多模态指令跟随,在 MM-IFEval 上一致提升性能,同时保持七个公开基准上的通用多模态能力。
阅读 arXiv 原文为什么重要
该框架通过自进化循环合成高质量指令数据,为多模态模型的指令跟随能力提升提供了可扩展的方法。
关键事实
事实 1
VISA将多模态指令合成重新表述为自进化循环。
来源与依据
an agentic framework that reformulates multimodal instruction synthesis as a self-evolving loop
事实 2
实验表明VISA在MM-IFEval上一致地提升了多模态指令跟随性能。
来源与依据
Experiments on MM-IFEval show that VISA consistently improves multimodal instruction following over strong baselines
事实 3
VISA在七个公开基准上保持了通用多模态能力。
来源与依据
while preserving general multimodal capability across seven public benchmarks