В ГигаЧате появилась генерация видео со звуком
new

Полный курс по Яндекс Директу Пройти бесплатно

6199 https://ppc.world/build/resources/img/logo-v2.png Создать ролик с речью, музыкой и звуками окружения можно в новой модели Kandinsky 6.0 Wed, 07 Oct 2026 10:30:00 +0300 ppc.world 160 31 Новость 1

ГигаЧат от Сбера научился создавать видео со звуком в Full HD — бесплатно

Сбер выкатил новую модель Kandinsky 6.0 Video: она умеет создавать видео с синхронным звуком в Full HD-качестве. Чтобы получить ролик, достаточно описать сцену текстом или загрузить первый кадр и рассказать, какие звуки добавить. Максимальная длительность видео со звуком — пять секунд. Создать ролик можно бесплатно в ГигаЧате, сообщили в компании.

Что нового

Генерация видео с синхронным звуком в ГигаЧате от Сбера

Модель

Kandinsky 6.0 Video

Какие звуки можно добавить

Речь персонажей, диалоги, музыка и звуки окружения

Качество ролика

Full HD

Длительность ролика со звуком

До пяти секунд

Предыдущая новость

Сбер выпустил первую модель ГигаЧата с полноценным логическим мышлением

Что умеет Kandinsky 6.0 Video в ГигаЧате

Kandinsky 6.0 Video — новая мультимодальная модель Сбера, доступная в ГигаЧате. Она создает видео со звуком в качестве до Full HD. С ее помощью в одном ролике можно совместить:

  • речь и диалоги персонажей;

  • фоновую музыку — например, гитарную мелодию или саундтрек к погоне;

  • звуки окружения — шаги, ветер, шум проезжающего автомобиля;

  • звуковые эффекты.

Если озвучка не нужна, модель можно попросить создать видео без нее.

Сбер заявляет:

«Kandinsky стала первой российской нейросетью, способной генерировать видео с синхронным звуком».

Также сообщается, что новая модель лучше передает физику реального мира: движения людей, животных и предметов выглядят естественнее. Разница особенно заметна в сценах с быстрым движением и сменой ракурса.

Звук создается с частотой 44 кГц. Компания заявляет, что модель генерирует его без шипения и потери качества.

Как создать видео со звуком в ГигаЧате: инструкция

Для генерации не нужны специальные навыки. Пользователю доступны два способа:

  1. Описать сцену текстом и указать, что должно происходить в ролике и какие звуки нужны.

  2. Загрузить первый кадр и дополнить его описанием звукового ряда.

Перед отправкой запроса в окне ввода можно выбрать качество видео.

Качество

Для чего предусмотрено

SD

Более быстрая генерация

HD

Более четкая картинка

Full HD

Более детализированное изображение

Максимальная длительность видео со звуком — пять секунд. Разработчики планируют увеличить ее, но сроки в сообщении не указаны.

Чтобы создать видео со звуком в ГигаЧате:

  1. Откройте ГигаЧат, в левом боковом меню выберите раздел «Видео».

    Источник: ГигаЧат
  2. Нажмите «Создать».

    Источник: ГигаЧат
  3. Выберите способ подготовки сценария:

    1. либо нажмите на любую картинку из примеров ниже — нейросеть сама напишет сценарий;

    2. либо загрузите свое изображение и опишите сценарий самостоятельно, указав нужную речь, музыку или звуки.

      Источник: ГигаЧат
  1. Запустите генерацию и дождитесь результата. Создание ролика занимает около восьми минут.

    Источник: ГигаЧат

Как бизнес может использовать генерацию видео со звуком

Сбер предлагает использовать модель для профессиональных и личных проектов:

  • короткие рекламные ролики;

  • тестирование идей;

  • подготовка материалов для соцсетей.

Кому подойдет

Что можно создать

Бизнесу

Короткий рекламный ролик с голосом о товаре или услуге

Маркетологам и SMM-специалистам

Тестовое видео с диалогом, музыкой и звуками окружения

Авторам контента

Ролик с озвученной репликой персонажа или фоновым звуком

Дизайнерам

Черновое видео со звуком для презентации идеи

Преподавателям

Оживленный архивный снимок или портрет с озвученной репликой

Обычным пользователям

Создание видеооткрыток, оживление семейных фотографий и создание ASMR-роликов — например, с шелестом бумаги или потрескиванием дров

«Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона», — отметил старший вице-президент Сбербанка, руководитель блока «Развитие генеративного ИИ» Антон Фролов

Как обучали Kandinsky 6.0 Video и с чем сравнивали

Модель состоит из двух связанных модулей — для видео и звука. Звуковой модуль обучали более чем на 20 млн видео. Команда отбирала:

  • ролики с чистым качественным звуком;

  • крупные планы говорящих людей — для точной синхронизации речи и мимики.

Отдельно Сбер приводит результаты Kandinsky 6.0 Video Pro. По оценке компании, эта версия:

  • превосходит Kandinsky 5.0 в среднем в 71% случаев по совокупности критериев;

  • опережает открытую модель LTX 2.5;

  • в задаче оживления изображения превосходит Veo 3.1 Fast по визуальному качеству, соответствию исходной картинке и движению камеры.

Это результаты сравнения, приведенные разработчиком. В исходном сообщении подробная методика оценки не раскрывается.

Как разработчики могут использовать Kandinsky 6.0 Video

Модель доступна в открытом доступе под лицензией MIT. Разработчики могут бесплатно интегрировать ее в собственные продукты.

Сбер также анонсировал доступность модели в инструментах для запуска и интеграции нейросетей:

  • FAL;

  • Diffusers;

  • FastVideo;

  • ComfyUI;

  • SGLang;

  • vLLM-omni.

Такие подключения должны позволить использовать Kandinsky 6.0 Video в существующих продуктах без разработки интеграции с нуля.

Ранее Сбер выкатил новую модель ГигаЧата — 3.5 Reasoning. Сообщается, что в некоторых задачах она уже обгоняет DeepSeek V4 Flash Preview, а на математических задачах тратит в среднем на 37% меньше токенов рассуждения.

Возможно, вам будет интересно:

Источник: блог Сбера

Сообщить об опечатке

Текст, который будет отправлен нашим редакторам: