Corpis
Загрузка

Голос агента: распознаёт речь и озвучивает ответ

Обновлено: 24.07.2026

Голос у агента Corpis — это две независимые способности: распознавание речи на входе (вы наговариваете сообщение вместо набора) и озвучка ответа на выходе (агент проговаривает реплику голосом с настраиваемым характером). Обе работают в чате на платформе. Важно честно: в подключённом Telegram-боте агент отвечает текстом — голосовые возможности живут в чате на платформе.

Пошагово

  1. Создайте агента. Откройте создание агента и задайте имя, характер и приветствие — или опишите нужное словами, ИИ-ассистент заполнит форму.

  2. Откройте вкладку «Голос». В настройках агента перейдите в «Голос» — здесь живёт профиль его звучания.

  3. Выберите пресет и тембр. Возьмите готовый пресет (нейтральный, грозный, милый, детский, робот и другие) и послушайте тембры кнопкой — выберите подходящий.

  4. Донастройте характер. Подвиньте оси — тон, темп, живость, энергию, придыхание — или опишите голос словами, и ассистент вкладки подберёт и сохранит профиль.

  5. Включите озвучку в чате. В чате агента включите тумблер-динамик в поле ввода — каждый новый ответ агента будет проговариваться голосом.

  6. Наговорите сообщение. Нажмите кнопку диктовки и произнесите реплику вслух — речь распознается в текст, и агент ответит на неё.

Две стороны голоса: слышать и говорить

Распознавание речи (вход) превращает надиктованное сообщение в текст: вы говорите, агент получает расшифровку и отвечает как на обычное сообщение. Работает нейросеть Whisper прямо на сервере, без облака и без ключей.

Озвучка ответа (выход) — обратное направление: текст ответа синтезируется в голос, и вы слышите реплику. Синтез тоже локальный (движок Vosk-TTS), голос звучит с тем характером, который вы задали агенту. Это два разных механизма, включаются они отдельно.

Где голос работает, а где пока текст

Голос — и распознавание, и озвучка — работает в чате на платформе: там есть кнопка диктовки и тумблер-динамик, который проговаривает каждый новый ответ агента.

В Telegram-боте озвучки пока нет: агент отвечает текстом, как обычный бот. Это честное текущее ограничение, а не недосмотр настройки — озвучка в Telegram стоит в планах, но ещё не сделана. Поэтому голосового «звонка» боту в Telegram ждать не стоит; голос сейчас живёт в чате платформы.

Характер голоса настраивается

Голос задаётся на каждого агента отдельно, на вкладке «Голос». Есть готовые пресеты — нейтральный, грозный, милый, детский, радостный, деловой, дружелюбный, спокойный, робот — и тонкая настройка осями: тон (выше — моложе, ниже — крупнее), темп, живость, энергия, придыхание.

Без облака, ключей и оплаты за голос

И распознавание, и озвучка — нейросети, работающие на сервере Corpis, а не внешние платные API. Отдельного тарифа за голос нет: способность доступна и на бесплатном тарифе, расход считается общими кредитами мозга агента, как за обычный ответ.

Честная рамка возможностей

«Детский» и «великанский» голос — это приближение через тон, а не отдельно записанные детские голоса (нативных детских у движков нет). Скопировать голос конкретного человека по образцу голоса сейчас нельзя — это класс тяжёлых GPU-моделей, будущий уровень; сегодня характер задаётся пресетами и осями. При сбое синтеза реплика просто остаётся текстом в треде — робо-голос на подмену намеренно не включается.

Частые вопросы

Будет ли бот в Telegram отвечать голосом?

Нет: в Telegram агент отвечает текстом. И распознавание речи, и озвучка ответа работают в чате на платформе, а не в Telegram-боте.

Нужны ли API-ключи или облако для голоса?

Нет. Распознавание речи и озвучка — нейросети, работающие прямо на сервере Corpis, без внешних платных API и ключей. Ключ нужен только по желанию, если вы захотите подключить Yandex SpeechKit ради актёрских эмоций.

Можно ли настроить характер голоса?

Да. У каждого агента свой профиль голоса на вкладке «Голос»: девять пресетов (нейтральный, грозный, милый, детский, робот и другие), пять тембров, оси тона/темпа/живости и эффекты «робот» и «из рации». Профиль можно собрать и словами через ИИ-ассистента.

Можно ли сделать голос конкретного человека по образцу?

Нет, копирование голоса по референсу сейчас недоступно — это класс тяжёлых GPU-моделей и будущий уровень. Характер голоса задаётся пресетами и осями настройки, а «детский» голос — это приближение через тон, а не отдельная запись.

Материалы по теме

Создать агента с голосом