GigaChat 3.5 Reasoning: как работает новая нейросеть Сбера с режимом рассуждений
По сообщению ITweek, Сбер выкатил GigaChat 3.5 Reasoning — мультимодальную модель с режимом рассуждений, которая не лупит ответом сразу, а сначала раскладывает задачу на шаги, планирует, лезет в…

По сообщению ITweek, Сбер выкатил GigaChat 3.5 Reasoning — мультимодальную модель с режимом рассуждений, которая не лупит ответом сразу, а сначала раскладывает задачу на шаги, планирует, лезет в поиск за недостающими данными и проверяет собственные промежуточные выводы. Разработчикам открыли бесплатный доступ под MIT, бизнесу обещают API в ближайшее время. Звучит как очередной пресс-релиз про «убийцу GPT», но цифры по бенчмаркам и открытая лицензия — повод потрогать модель руками, а не просто почитать.
Под капотом рассуждений
Reasoning включается отдельной кнопкой. На простом вопросе модель отвечает как обычный чат — без накладных расходов. На сложной задаче может сжечь десятки тысяч токенов на размышления. По заявлению Сбера, ключевые бенчмарки заметно подскочили относительно базовой GigaChat 3.5 Ultra: IFBench — с 44 до 77, Natural Plan — с 64 до 80, Live Code Bench v6 — с 56 до 85. До побитого мирового SOTA это не дотягивает, но прогресс по сравнению с версией без режима рассуждений виден без лупы.
Отдельно отмечают экономию токенов: на математических задачах модель в среднем тратит на 37% меньше токенов, чем DeepSeek V4 Flash Preview при сопоставимом качестве. Для тех, кто считает бюджет на API, это не абстрактная цифра, а прямой повод сравнить.
Антон Фролов, старший вице-президент Сбербанка по генеративному ИИ, заявил, что GigaChat — единственная российская модель с режимом рассуждений, и подчеркнул, что новая версия сильнее в агентских сценариях, программировании и работе с инструментами.
Прежде чем тащить в прод
Лицензия MIT для разработчиков — не маркетинговая шелуха, а реальный кейс для интеграции в свои продукты без юридических костылей. Бесплатный доступ есть у пользователей ГигаЧата, API для бизнеса обещан в ближайшее время. Перед тем как катить модель в продакшен, имеет смысл прогнать её на собственных задачах, а не на маркетинговых демках.
Сценарии, на которых модель обещают сильнее всего: разбор сложных ошибок в коде, поиск противоречий в договорах, агентские задачи вроде организации поездки — уточнение параметров, подбор рейса и отеля, проверка бюджета, перестроение плана при обнаруженном противоречии.
Пара вещей, которые стоит проверить руками, а не верить пресс-релизу:
- Латенси с включённым reasoning. Десятки тысяч токенов на одну задачу — это не «быстрый» ответ, а секунды и десятки секунд ожидания.
- Реальный расход токенов на ваших сценариях, а не на синтетике. Цифры про экономию относительно DeepSeek — ориентир, а не гарантия.
- Поведение на длинном контексте и галлюцинации на граничных кейсах.
- Лимиты бесплатного доступа и условия перехода на платный API, когда его откроют.
Модель пока позиционируется как рассуждающая надстройка над GigaChat 3.5 Ultra. Если GigaChat уже крутится в стейбле или в проде, имеет смысл поднять обе версии параллельно и сравнивать ответы на одной и той же выборке задач. Бэкапы конфигов и промптов, как обычно, обязательны — рассуждающая модель меняет поведение между релизами ощутимо.