Что вышло
Сбер выпустил GigaChat 3.5 Ultra - крупнейшую флагманскую модель своей линейки. Архитектура - Mixture-of-Experts (MoE), с 432 миллиардами параметров всего и 28 миллиардами активных на каждый обрабатываемый токен, что держит вычислительную стоимость запроса заметно ниже, чем у плотной модели того же полного размера.
Гибридное внимание
Модель построена на гибридной архитектуре внимания, которая объединяет Multi-head Latent Attention со слоями линейного внимания GatedDeltaNet - такое сочетание позволяет держать эффективность на длинном контексте лучше, чем классическое полное внимание при сопоставимом размере модели.
Открытые веса под MIT-лицензией
Веса модели опубликованы на Hugging Face и GitVerse под лицензией MIT. Это одна из самых разрешительных лицензий с открытым исходным кодом - она допускает практически любое использование, включая коммерческое, для разработчиков в любой точке мира, без необходимости запрашивать отдельное разрешение.
Компактнее и быстрее предыдущего флагмана
По сравнению с прошлым флагманом GigaChat 3.1 Ultra на 700 миллиардов параметров, версия 3.5 примерно на 40% компактнее, но при этом сильнее в коде, математике и агентных сценариях. Модель расходует примерно в 4 раза меньше KV-кэша на токен, вмещает более чем в 2 раза больше контекста в тот же объём памяти и увеличивает пропускную способность генерации примерно на 20%.
Цифры по бенчмаркам
На бенчмарке математических рассуждений MATH Minerva базовая версия модели показала результат 61.7 против 55.78 у предыдущей версии. На бенчмарке программирования HumanEval - 80.49 против 70.12 у предшественника. Средний результат instruct-версии (дообученной для диалога) вырос до 60.1 против 46.2 у предыдущего флагмана - заметный скачок по всем трём метрикам.
Что это значит на практике
Открытая лицензия MIT означает, что модель можно скачать, дообучить под свою задачу и развернуть на собственной инфраструктуре, не завися от доступности облачного API и не оплачивая обращения к нему построчно - для организаций, для которых важна независимость от внешних сервисов, это прямой практический аргумент в пользу такого развёртывания.
Чек-лист
- Проверены условия лицензии MIT под свой конкретный сценарий использования
- Посчитаны требования к инфраструктуре под MoE-модель на 432 млрд параметров (28 млрд активных)
- Учтена экономия KV-кэша и возможность увеличенного контекста при планировании памяти
- Сверены бенчмарки под свою задачу - код, математика или агентные сценарии, а не общий средний балл
- Проверена доступность модели напрямую на Hugging Face или GitVerse перед началом работы