Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders
Vision Language Models (VLMs) are increasingly utilized as the conditioning backbone for diffusion based image editing due to their remarkable multimodal reasoning capabilities. While standalone VLMs demonstrate strong localization capabilities, editing pipelines frequently struggle to maintain this accuracy, particularly in complex, multi entity scenes. In this work, we investigate this performance gap, hypothesi...