Сбер выпустил первую в России диффузионную языковую модель GFusion — она пишет текст до 45% быстрее GigaChat

Сбер выпустил первую в России диффузионную языковую модель GFusion — она пишет текст до 45% быстрее GigaChat

Сбер объявил о выпуске первой в России диффузионной языковой модели GFusion. Это экспериментальный проект, построенный на основе GigaChat. Главное отличие: модель не выдает текст последовательно слово за словом, а создает черновой вариант целиком, после чего итеративно улучшает его. Такой подход напоминает генерацию изображений, где нейросеть сначала рисует размытую картинку, а потом детализирует.

Благодаря параллельной обработке GFusion работает быстрее классических языковых моделей. По данным Сбера, в тестах скорость генерации оказалась до 45% выше, чем у GigaChat 3, на базе которого обучалась новинка. Кроме того, диффузионные модели гибче: текст не обязан писаться строго слева направо — алгоритм сам решает, какую часть ответа улучшить на текущем шаге.

Еще одно преимущество — эффективность обучения. GFusion может извлекать больше информации из того же объема данных, проходя по датасету несколько раз. Разработчики подчеркивают, что диффузионные языковые модели — одно из самых перспективных и сложных направлений в генеративном ИИ.

Сбер выложил GFusion в открытый доступ (опенсорс), а также опубликовал инструменты, ускоряющие обучение подобных моделей. По заявлению компании, это первая диффузионная модель для генерации текста такого масштаба, выпущенная в России.

Для пользователей это означает, что в будущем нейросети смогут быстрее обрабатывать запросы и давать более качественные ответы. Пока же GFusion — экспериментальный проект, который поможет исследователям и разработчикам лучше понять возможности новой архитектуры.