Step-Video-T2V Step-Video-T2V — это усовершенствованная текст-видео модель с 30 миллиардами параметров, способная генерировать видео до 204 кадров. Модель Step-Video-T2V позволяет создавать видео по текстовым описаниям, длиной до 10 секунд, в том числе с изображениями известных личностей. Для достижения наилучшего качества рекомендуется использовать GPU с 80 гигабайтами памяти. Успех генерации видео также зависит от оптимизации параметров вывода.

GitHub: https://github.com/stepfun-ai/Step-Video-T2V

Дата: 23.05.2026