Cost-efficient Active Learning for Referring Image Segmentation and Grounding

By Junbeom Hong · Paper · cs.CV

Collecting natural-language referring expressions along with region annotations, such as masks or boxes, is a major bottleneck in visual grounding (VG), as annotators must write descriptions that distinguish target regions from visually similar ones. We tackle this by formulating

Cs.cv

View original

HomeResourceLoading…