Magnitude Invariant Multimodal Agent for Efficient Image-Text Interface Automation
A multimodal agent architecture for automating image-text interfaces whose behaviour is invariant to input magnitude/resolution, enabling efficient UI automation by a vision-language model.