«Сбер» представил новую версию своей мультимодальной нейросети GigaChat — GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL. Компания позиционирует GigaChat 3.5 Reasoning как единственную российскую открытую модель, которая последовательно рассуждает перед ответом, работает с цепочками задач и способна исправлять собственные ошибки.

Режим рассуждений может использоваться в задачах, где недостаточно одного действия или простого поиска информации. Например, он будет полезен при анализе договоров, когда модель может найти противоречия между их отдельными пунктами, для финансовых расчётов, при поиске ошибок в программном коде и планирования поездок с учётом нескольких ограничений. В последнем случае модель может уточнить недостающие параметры, подобрать рейс и отель, проверить соответствие маршрута запланированному бюджету, а при обнаружении противоречия — изменить план. При необходимости пользователь может сам включить режим отдельной кнопкой.

Новая версия повысила качество результатов GigaChat, особенно в агентских задачах, работе с функциями и инструментами, программировании и задачах со сложной логикой. Как сообщает «Сбер», по ключевым направлениям — следованию сложным инструкциям, планированию и написанию кода — GigaChat 3.5 Reasoning вплотную приблизилась к лучшим мировым моделям. Например, в бенчмарке IFBench результат вырос с 44 до 77 баллов, в Natural Plan — с 64 до 80 баллов, в Live Code Bench v6 — с 56 до 85 баллов, что значительно лучше по сравнению с версией без режима рассуждений.

Модель GigaChat 3.5 Reasoning сначала разбирает задачу на этапы, проверяет промежуточные выводы и только потом отвечает. Она уже доступна пользователям ГигаЧата, а разработчикам — бесплатно по лицензии MIT. Об этом сообщает «Хайтек».

Новая версия работает иначе, чем обычные чат-боты. Вместо мгновенного ответа она строит план, при необходимости обращается к поиску и другим инструментам, ищет ошибки в собственных шагах и перестраивает решение, если находит противоречие. Пользователь сам решает, когда включать режим рассуждений: на простой вопрос модель отвечает сразу, а на сложный может потратить десятки тысяч токенов.

Старший вице-президент Сбербанка Антон Фролов назвал такой подход важным для агентных сценариев, программирования и аналитики. По его словам, GigaChat — единственная российская модель с режимом рассуждений.

По словам разработчиков, режим рассуждений рассчитан на задачи, которые требуют нескольких последовательных действий. Среди возможных сценариев в компании называют анализ договоров, финансовые расчёты, поиск ошибок в программном коде и планирование поездок с учётом нескольких ограничений.

Режим рассуждений пользователь может включить самостоятельно. На простые запросы модель отвечает без него, а при решении сложных задач может задействовать значительно больше вычислительных ресурсов. В «Сбере» отметили, что новая версия улучшила результаты в программировании, работе с инструментами и функциями, планировании и задачах со сложной логикой.

Компания приводит результаты собственных тестов: в бенчмарке IFBench показатель вырос с 44 до 77 баллов, в Natural Plan — с 64 до 80, а в LiveCodeBench v6 — с 56 до 85. При этом «Сбер» сравнивает эффективность модели по числу использованных токенов: по его данным, при решении математических задач GigaChat 3.5 Reasoning использует в среднем на 37% меньше токенов, чем DeepSeek V4 Flash Preview при сопоставимом качестве ответов.

Что пишут другие издания

  • Хайтек: Сбер выпустил GigaChat с режимом рассуждений и открыл код для разработчиков
  • Хабр: «Сбер» представил GigaChat 3.5 Reasoning с режимом рассуждений
  • iXBT: Российский ответ на DeepSeek R1 и OpenAI o4-mini: Сбер представил GigaChat 3.5 Reasoning — новая флагманская нейросеть с режимом рассуждений