AQLM Репозиторий AQLM представляет собой реализацию на PyTorch для экстремального сжатия крупных языковых моделей с использованием аддитивной квантизации В репозитории представлены различные предварительно квантизированные модели из семейств LLaMA Mistral и Mixtral каждая из которых настроена для выполнения определенных задач и оценена по таким показателям производительности как перплексия Методы сжимают LLM в 8 раз сохраняют качество на 95 % Для использования этих моделей необходимо установить библиотеку для инференса AQLM и загрузить модели с использованием стандартных методов PyTorch В репозитории содержатся подробные инструкции по квантизации моделей их тонкой настройке и инференсу при этом подчеркивается необходимость значительных вычислительных ресурсов таких как несколько GPU A100 для эффективного выполнения процессов
GitHub: https://github.com/Vahe1994/AQLM