Открыл для себя новый интересный подход к верстке.
Допустим у вас есть картинка или скриншот. В принципе можно просто сказать агенту - верстай, пока не добьешься полного попадания.
Но это не очень эффективно, особенно если интерфейс богат на картинки и представляет собой нагромождение слоев.
Как поступить иначе? А вот так — ставим себе локально
sam3 и делаем скилл по классификации объектов сцены. Далее автоматически извлекаем bbox'ы этих объектов.
Дальше с этим можно делать что угодно, например перетекстурировать на хромакей с помощью image-gen, сделать прозрачный задник и получить финальный набор ассетов для реконструирования страницы.
Чем это лучше локации с помощью LLM? Тем, что LLM гораздо сильнее ошибается в выдаче итоговых координат. Как следствие, извлечение проходит криво и в много стадий/тратя ваши лимиты почем зря. А вот гибридный подход работает практически с первого раза.