Что вышло

Сбер выпустил GigaChat 3.5 Ultra - крупнейшую флагманскую модель своей линейки. Архитектура - Mixture-of-Experts (MoE), с 432 миллиардами параметров всего и 28 миллиардами активных на каждый обрабатываемый токен, что держит вычислительную стоимость запроса заметно ниже, чем у плотной модели того же полного размера.

Гибридное внимание

Модель построена на гибридной архитектуре внимания, которая объединяет Multi-head Latent Attention со слоями линейного внимания GatedDeltaNet - такое сочетание позволяет держать эффективность на длинном контексте лучше, чем классическое полное внимание при сопоставимом размере модели.

Открытые веса под MIT-лицензией

Веса модели опубликованы на Hugging Face и GitVerse под лицензией MIT. Это одна из самых разрешительных лицензий с открытым исходным кодом - она допускает практически любое использование, включая коммерческое, для разработчиков в любой точке мира, без необходимости запрашивать отдельное разрешение.

Компактнее и быстрее предыдущего флагмана

По сравнению с прошлым флагманом GigaChat 3.1 Ultra на 700 миллиардов параметров, версия 3.5 примерно на 40% компактнее, но при этом сильнее в коде, математике и агентных сценариях. Модель расходует примерно в 4 раза меньше KV-кэша на токен, вмещает более чем в 2 раза больше контекста в тот же объём памяти и увеличивает пропускную способность генерации примерно на 20%.

Цифры по бенчмаркам

На бенчмарке математических рассуждений MATH Minerva базовая версия модели показала результат 61.7 против 55.78 у предыдущей версии. На бенчмарке программирования HumanEval - 80.49 против 70.12 у предшественника. Средний результат instruct-версии (дообученной для диалога) вырос до 60.1 против 46.2 у предыдущего флагмана - заметный скачок по всем трём метрикам.

Что это значит на практике

Открытая лицензия MIT означает, что модель можно скачать, дообучить под свою задачу и развернуть на собственной инфраструктуре, не завися от доступности облачного API и не оплачивая обращения к нему построчно - для организаций, для которых важна независимость от внешних сервисов, это прямой практический аргумент в пользу такого развёртывания.

Чек-лист

Перед развёртыванием GigaChat 3.5 Ultra у себя
  1. Проверены условия лицензии MIT под свой конкретный сценарий использования
  2. Посчитаны требования к инфраструктуре под MoE-модель на 432 млрд параметров (28 млрд активных)
  3. Учтена экономия KV-кэша и возможность увеличенного контекста при планировании памяти
  4. Сверены бенчмарки под свою задачу - код, математика или агентные сценарии, а не общий средний балл
  5. Проверена доступность модели напрямую на Hugging Face или GitVerse перед началом работы
Сколько параметров у GigaChat 3.5 Ultra?
432 миллиарда параметров всего и 28 миллиардов активных на каждый обрабатываемый токен - это архитектура Mixture-of-Experts.
Под какой лицензией опубликованы веса модели?
Под лицензией MIT - одной из самых разрешительных, допускающей практически любое использование, включая коммерческое.
Где можно скачать веса модели?
На Hugging Face и GitVerse.
Насколько GigaChat 3.5 Ultra компактнее предыдущего флагмана?
Примерно на 40% компактнее прошлого флагмана GigaChat 3.1 Ultra на 700 миллиардов параметров, при этом сильнее в коде, математике и агентных сценариях.
Какая архитектура внимания используется в модели?
Гибридная - Multi-head Latent Attention в сочетании со слоями линейного внимания GatedDeltaNet.
Насколько выросли результаты на бенчмарках по сравнению с предыдущей версией?
На MATH Minerva - с 55.78 до 61.7, на HumanEval - с 70.12 до 80.49, средний результат instruct-версии - с 46.2 до 60.1.
← Все статьи блога