Что такое GigaChat 3.5 Ultra и чем он лучше предыдущих версий?
GigaChat 3.5 Ultra: меньше, быстрее, сильнее
Сбер выкатил в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который был собран больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra.
Что внутри:
• Собственная гибридная архитектура MLA + GatedDeltaNet с уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается;
• Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя;
• GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Команда Сбера выкладывает подобную стабилизирующую оптимизацию в опенсорс первыми в мире;
• Примерно в 4 раза меньше KV-кеша на токен, в ту же память помещается в 2,14 раза больше контекста, throughput под нагрузкой +20%;
• Две MTP-головы и ускорение генерации до 2,2 раза;
• FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра;
• Новый этап online RL после SFT и DPO.
Результаты:
- GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье);
- GigaChat-3.5-Ultra-Instruct сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше;
- По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%.
Весь стек — данные (свой LLM-парсинг веба, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан командой Сбера end-to-end. Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr.
HuggingFace | GitVerse
Сбер выкатил в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который был собран больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra.
Что внутри:
• Собственная гибридная архитектура MLA + GatedDeltaNet с уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается;
• Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя;
• GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Команда Сбера выкладывает подобную стабилизирующую оптимизацию в опенсорс первыми в мире;
• Примерно в 4 раза меньше KV-кеша на токен, в ту же память помещается в 2,14 раза больше контекста, throughput под нагрузкой +20%;
• Две MTP-головы и ускорение генерации до 2,2 раза;
• FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра;
• Новый этап online RL после SFT и DPO.
Результаты:
- GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье);
- GigaChat-3.5-Ultra-Instruct сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше;
- По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%.
Весь стек — данные (свой LLM-парсинг веба, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан командой Сбера end-to-end. Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr.
HuggingFace | GitVerse
GPT/ChatGPT/AI Central Александра Горного
769 публикаций на visbl.me
Авторский взгляд на новости технологий Реклама: https://docs.google.com/presentation/d/1glQMXYyKAYpzNP8VXzM4gl2YkEgLjkeD_Fxvzbu5QUE/edit РКН: https://clck.ru/3FPkup Личный аккаунт: @gornal О рекламе: @Vzuhcha ВП нет
Связанные темы
Читать далее
Как использовать Claude Code для базового монтажа видео?
GPT/ChatGPT/AI Central Александра Горного·
Apple подала в суд на OpenAI из-за кражи коммерческих секретов
GPT/ChatGPT/AI Central Александра Горного·
Мелкие шаги прогресса
Стартап дня. Александр Горный.·
Meta* хотят оштрафовать на 1.4 триллиона долларов за вред подросткам
GPT/ChatGPT/AI Central Александра Горного·
Как проверить текст на наличие AI с помощью детекторов?
GPT/ChatGPT/AI Central Александра Горного·
Гайд по работе с ChatGPT Work от OpenAI
GPT/ChatGPT/AI Central Александра Горного·
💬Discussion (7)
Да, не топ, но уже неплохо 😉