LLaVA-Mini LLaVA-Mini – это усовершенствованная мультимодальная ИИ-модель, способная эффективно обрабатывать изображения и видео, требующая всего 1 токен для представления каждого изображения. Это значительно повышает эффективность обработки визуальных данных, снижая вычислительные затраты на 77%, задержку ответа с 100 до 40 миллисекунд и использование VRAM с 360 МБ до 0.6 МБ на изображение, что позволяет обрабатывать видео продолжительностью до 3 часов.

GitHub: https://github.com/ictnlp/LLaVA-Mini

Дата: 23.05.2026