Три режима
Режим определяет, что вы отдаёте модели на входе, и он же определяет, насколько предсказуем результат. Менять его посреди работы нельзя — придётся перезапускать генерацию.
Текст в видео
На входе только описание. Модель сама собирает композицию, свет и героя. В открытой ветке за этот режим отвечает T2V-A14B, а в лёгкой TI2V-5B он совмещён с работой по картинке.
Изображение в видео
На входе кадр, который вы подготовили заранее. Модель оживляет именно его: композиция и внешность героя зафиксированы. Открытая модель для этого режима — I2V-A14B.
Речь в видео
На входе звук. Модель S2V-14B строит ролик по речи — это путь к говорящему персонажу. В примерах разработчиков это пятисекундное видео в 720p.
Отдельно стоит Animate-14B: она не генерирует сцену с нуля, а анимирует и заменяет персонажа, выдавая 30 кадров в секунду. Полный разбор Wan 2.2 — с требованиями к железу по каждому чекпойнту.