Skip to main content

Мысли CEO: что дальше в LTXЗив, CEO LTX, на связи. Хотел немного приоткрыть завесу над техническими ставками, которые мы делаем, и тем, куда они ведут. Готов подробно обсудить детали в комментариях.Последнее время мы глубоко работали над следующим поколением LTX, и я хочу поделиться тем, что нас ждёт. Это не пост о долгосрочном видении — он выйдет отдельно, — а конкретный взгляд на то, что мы строим прямо сейчас и что вы скоро увидите.Следующий релиз LTX-2 сфокусирован на качестве генерации во всех направлениях. Как обычно: больше данных, больше вычислительных мощностей, а в этот раз ещё и две архитектурные версии: dense-модель и mixture-of-experts, чтобы предложить разные компромиссы между скоростью и качеством.Mixture-of-experts, или MoE, — это фундаментальный архитектурный сдвиг, при котором модель активирует только те свои части, которые нужны для конкретной генерации. Это позволяет масштабировать возможности и качество без линейного роста затрат на вычисления. Такой тип изменений не всегда заметен в одном демо, но он фундаментально меняет то, что модель способна делать при заданной стоимости.И в dense-версии, и в MoE-версии мы собираемся выпустить значительно более мощный text encoder. В результате модель будет лучше понимать то, что вы написали, включая сложные промпты с несколькими сценами, которые более старые архитектуры часто упрощали или игнорировали. Мы также серьёзно инвестируем в производительность и память: новые attention kernels и улучшенная поддержка low-precision вычислений означают, что последняя модель будет хорошо работать на более широком спектре железа.Теперь та часть, которая, как мне кажется, тоже особенно важна для этого сообщества. Мы открываем больше нашей тренировочной инфраструктуры: новые trainer-рецепты и инструменты для обучения LoRA, чтобы вы могли создавать доменно-специфичные варианты моделей поверх LTX, а не просто использовать базовые веса как есть. Представьте специализированные версии для задач вроде человеческого движения, визуализации продуктов и архитектурных пространств — каждая дообучена на одной и той же основе, но оптимизирована под конкретную область. На enterprise-стороне это расширяется до слоя кастомизации после обучения, который позволяет командам дообучать модель на собственных закрытых данных без необходимости переобучать её с нуля. Полная картина состоит из трёх уровней: базовая foundation-модель, доменно-специфичные trainer-конфигурации и слой кастомизации для клиентов сверху.Чтобы было ясно: мы намерены сохранять веса открытыми. Базовую модель, производные модели, инструменты. Это не bait-and-switch, где мы сначала открываем исходники, а потом закрываем всё, как только модель становится достаточно хорошей для монетизации. Открытость — это то, как мы строим, и сообщество, которое создаёт что-то поверх наших моделей, всегда сможет зайти дальше, чем любая отдельная команда в одиночку.Ещё одна вещь, которую мы исследуем и которая, как мы считаем, может стать настоящим скачком в качестве результата: diffusion-based decoder, который заменяет традиционный VAE при преобразовании латентов обратно в пиксели. Потенциал здесь — более чёткий вывод в более высоком разрешении, объединяющий декодирование и апскейлинг в один шаг. Мы активно экспериментируем с этим в нашем latent space. Это как раз та архитектурная ставка, которая может изменить стандарт генерации видео, и мы надеемся, что открытые модели будут в этом лидировать.Мы также понимаем, что модель — это только половина истории. Всё ещё существует реальный разрыв между “модель работает” и “я могу выпустить на её основе готовый продукт”, и закрыть этот разрыв для нас так же важно, как и улучшать саму модель. Мы полностью перерабатываем документацию и запускаем reference implementations, чтобы показать, как на практике выглядит хорошее внедрение.Скоро будет больше новостей. Сорс@cgevent

  1. @cgevent TG

    Мысли CEO: что дальше в LTX

    Зив, CEO LTX, на связи. Хотел немного приоткрыть завесу над техническими ставками, которые мы делаем, и тем, куда они ведут. Готов подробно обсудить детали в комментариях.

    Последнее время мы глубоко работали над следующим поколением LTX, и я хочу поделиться тем, что нас ждёт. Это не пост о долгосрочном видении — он выйдет отдельно, — а конкретный взгляд на то, что мы строим прямо сейчас и что вы скоро увидите.

    Следующий релиз LTX-2 сфокусирован на качестве генерации во всех направлениях. Как обычно: больше данных, больше вычислительных мощностей, а в этот раз ещё и две архитектурные версии: dense-модель и mixture-of-experts, чтобы предложить разные компромиссы между скоростью и качеством.

    Mixture-of-experts, или MoE, — это фундаментальный архитектурный сдвиг, при котором модель активирует только те свои части, которые нужны для конкретной генерации. Это позволяет масштабировать возможности и качество без линейного роста затрат на вычисления. Такой тип изменений не всегда заметен в одном демо, но он фундаментально меняет то, что модель способна делать при заданной стоимости.

    И в dense-версии, и в MoE-версии мы собираемся выпустить значительно более мощный text encoder. В результате модель будет лучше понимать то, что вы написали, включая сложные промпты с несколькими сценами, которые более старые архитектуры часто упрощали или игнорировали. Мы также серьёзно инвестируем в производительность и память: новые attention kernels и улучшенная поддержка low-precision вычислений означают, что последняя модель будет хорошо работать на более широком спектре железа.

    Теперь та часть, которая, как мне кажется, тоже особенно важна для этого сообщества. Мы открываем больше нашей тренировочной инфраструктуры: новые trainer-рецепты и инструменты для обучения LoRA, чтобы вы могли создавать доменно-специфичные варианты моделей поверх LTX, а не просто использовать базовые веса как есть. Представьте специализированные версии для задач вроде человеческого движения, визуализации продуктов и архитектурных пространств — каждая дообучена на одной и той же основе, но оптимизирована под конкретную область. На enterprise-стороне это расширяется до слоя кастомизации после обучения, который позволяет командам дообучать модель на собственных закрытых данных без необходимости переобучать её с нуля. Полная картина состоит из трёх уровней: базовая foundation-модель, доменно-специфичные trainer-конфигурации и слой кастомизации для клиентов сверху.

    Чтобы было ясно: мы намерены сохранять веса открытыми. Базовую модель, производные модели, инструменты. Это не bait-and-switch, где мы сначала открываем исходники, а потом закрываем всё, как только модель становится достаточно хорошей для монетизации. Открытость — это то, как мы строим, и сообщество, которое создаёт что-то поверх наших моделей, всегда сможет зайти дальше, чем любая отдельная команда в одиночку.

    Ещё одна вещь, которую мы исследуем и которая, как мы считаем, может стать настоящим скачком в качестве результата: diffusion-based decoder, который заменяет традиционный VAE при преобразовании латентов обратно в пиксели. Потенциал здесь — более чёткий вывод в более высоком разрешении, объединяющий декодирование и апскейлинг в один шаг. Мы активно экспериментируем с этим в нашем latent space. Это как раз та архитектурная ставка, которая может изменить стандарт генерации видео, и мы надеемся, что открытые модели будут в этом лидировать.

    Мы также понимаем, что модель — это только половина истории. Всё ещё существует реальный разрыв между “модель работает” и “я могу выпустить на её основе готовый продукт”, и закрыть этот разрыв для нас так же важно, как и улучшать саму модель. Мы полностью перерабатываем документацию и запускаем reference implementations, чтобы показать, как на практике выглядит хорошее внедрение.

    Скоро будет больше новостей.

    Сорс

    @cgevent
    ⭐ 1 ❤️ 53 🔥 16 😁 4 👎 2 👍 1