Multi Modal Starter Kit Позволяет озвучивать видео или сцены с помощью искусственного интеллекта используя за основу несколько взятых из него кадров Работает с такими моделями как LLaVa LLaVa-vicuna BakLLaVA GPT-4v ElevenLabs используется для генерации голоса Пример — видео выше☝🏻
GitHub: https://github.com/tigrisdata-community/multi-modal-starter-kit