Skip to main content

Открыл для себя новый интересный подход к верстке. Допустим у вас есть картинка или скриншот. В принципе можно просто сказать агенту - верстай, пока не добьешься полного попадания. Но это не очень эффективно, особенно если интерфейс богат на картинки и представляет собой нагромождение слоев. Как поступить иначе? А вот так — ставим себе локально sam3 и делаем скилл по классификации объектов сцены. Далее автоматически извлекаем bbox'ы этих объектов. Дальше с этим можно делать что угодно, например перетекстурировать на хромакей с помощью image-gen, сделать прозрачный задник и получить финальный набор ассетов для реконструирования страницы.Чем это лучше локации с помощью LLM? Тем, что LLM гораздо сильнее ошибается в выдаче итоговых координат. Как следствие, извлечение проходит криво и в много стадий/тратя ваши лимиты почем зря. А вот гибридный подход работает практически с первого раза.Открыл для себя новый интересный подход к верстке. Допустим у вас есть картинка или скриншот. В принципе можно просто сказать агенту - верстай, пока не добьешься полного попадания. Но это не очень эффективно, особенно если интерфейс богат на картинки и представляет собой нагромождение слоев. Как поступить иначе? А вот так — ставим себе локально sam3 и делаем скилл по классификации объектов сцены. Далее автоматически извлекаем bbox'ы этих объектов. Дальше с этим можно делать что угодно, например перетекстурировать на хромакей с помощью image-gen, сделать прозрачный задник и получить финальный набор ассетов для реконструирования страницы.Чем это лучше локации с помощью LLM? Тем, что LLM гораздо сильнее ошибается в выдаче итоговых координат. Как следствие, извлечение проходит криво и в много стадий/тратя ваши лимиты почем зря. А вот гибридный подход работает практически с первого раза.

  1. @gleb_pro_ai TG

    Открыл для себя новый интересный подход к верстке.

    Допустим у вас есть картинка или скриншот. В принципе можно просто сказать агенту - верстай, пока не добьешься полного попадания.

    Но это не очень эффективно, особенно если интерфейс богат на картинки и представляет собой нагромождение слоев.

    Как поступить иначе? А вот так — ставим себе локально sam3 и делаем скилл по классификации объектов сцены. Далее автоматически извлекаем bbox'ы этих объектов.

    Дальше с этим можно делать что угодно, например перетекстурировать на хромакей с помощью image-gen, сделать прозрачный задник и получить финальный набор ассетов для реконструирования страницы.

    Чем это лучше локации с помощью LLM? Тем, что LLM гораздо сильнее ошибается в выдаче итоговых координат. Как следствие, извлечение проходит криво и в много стадий/тратя ваши лимиты почем зря. А вот гибридный подход работает практически с первого раза.
    ⭐ 1 🔥 63 ❤️ 5 👍 3 🤔 3