Сбер опубликовал на Hugging Face новую модель ГигаЧата — 3.5 Reasoning. Сообщается, что в некоторых задачах она уже обгоняет DeepSeek V4 Flash Preview, а на математических задачах тратит в среднем на 37% меньше токенов рассуждения. Новинка позиционируется как первая модель ГигаЧата с полноценным режимом рассуждений, передает ТАСС.
|
Что нового |
Новая модель ГигаЧата — 3.5 Reasoning |
|
В чем особенности новой модели |
Модель использует технологию Mixture-of-Experts (MoE). При задании промпта она сначала «размышляет»: разбивает задачу на шаги, составляет план, проверяет себя |
|
Что умеет ГигаЧат 3.5 Reasoning |
|
|
Открыт ли доступ |
Нейросеть доступна в ГигаЧате и в репозитории huggingface.co |
|
Предыдущая новость |
Что нового в ГигаЧате — модели 3.5 Reasoning
Новая модель ГигаЧата позиционируется как первая российская открытая модель, обученная работать по принципу цепочки рассуждений:
Перед выдачей ответа нейросеть разбивает задачу на подпункты.
-
Перед выдачей ответа нейросеть разбивает задачу на подпункты.
-
После составляет план ответа.
-
Проверяет промежуточные выводы и корректирует логические ошибки.
-
Выдает ответ.
Источник: скриншот интерфейса ГигаЧата
Как работает новая модель ГигаЧата — 3.5 Reasoning
Модель использует технологию Mixture-of-Experts (MoE) — «смесь экспертов». Благодаря этому на каждый вопрос отвечает не вся нейросеть, а только нужные «эксперты». При вводе промпта задействуются только 28 млрд параметров из 432 млрд.
Такая работа «экспертов» стала возможна благодаря инженерному решению — гибридное внимание: классический механизм Multi-head Latent Attention (MLA) объединили со слоями линейного внимания GatedDeltaNet.
Что умеет рассуждающая модель ГигаЧата
Нейросеть уже способна:
-
решать математические задачи, включая олимпиадные;
-
писать код;
-
следовать сложным инструкциям;
-
давать структурированные ответы в таблицах;
-
работать с длинными текстами;
-
вести диалог и вызывать функции.
Источник: скриншот из Hugging Face
Флагманская модель уже доступна всем пользователям ГигаЧата.
Насколько хороша рассуждающая модель ГигаЧата
Разработчики проверяли модель на бенчмарках — это стандартные наборы задач для нейросетей.
Помимо этого, по словам разработчиков, рассуждающий ГигаЧат на математических задачах тратит в среднем на 37% меньше токенов на рассуждения, чем DeepSeek V4 Flash Preview. На некоторых задачах экономия достигает 41%.
Кастомизация новой модели ГигаЧата
Модель открыта для разработчиков на Hugging Face под лицензией MIT, поэтому ее можно свободно интегрировать в свои продукты.
Ранее OpenAI выпустила обновленную модель генерации изображений ChatGPT Images 2.5 и представила новую флагманскую модель GPT-6 Astra.
Возможно, вам будет интересно:
Источники: Hugging Face и ТАСС
Комментарии 0
Авторизуйтесь, чтобы оставить комментарий.