Перейти к основному содержимому

Речевые сервисы

Elftia интегрирует два вида речевых сервисов — распознавание речи (ASR, Automatic Speech Recognition) и синтез речи (TTS, Text-to-Speech) — позволяя свободно переключаться между голосом и текстом в диалогах и при создании контента.

Сценарии использования

  • Автоматическая транскрипция голосовых сообщений или записей аудиофайлов в текст
  • Преобразование ответов AI или пользовательского текста в речь для воспроизведения
  • Голосовой ввод, когда печатать неудобно
  • Озвучивание созданного контента

Распознавание речи (ASR)

Функция распознавания речи транскрибирует речь из аудиофайлов в текст.

Поддерживаемые провайдеры

ПровайдерИдентификатор типаОписание
OpenAI Whisperopenai-whisperAPI распознавания речи Whisper от OpenAI; поддерживает несколько языков
ElevenLabs Scribeelevenlabs-sttСервис преобразования речи в текст от ElevenLabs
Fish Audiofishaudio-asrСервис распознавания речи Fish Audio

Шаги настройки

  1. Откройте Настройки > Медиапровайдеры > Распознавание речи
  2. Выберите провайдер ASR
  3. Введите API-ключ
  4. Выберите модель по умолчанию (например, whisper-1)
  5. Сохраните и включите
  6. (Опционально) Установите его как провайдер по умолчанию

Параметры настройки

ПараметрОписаниеОбязателен
API-ключAPI-ключ провайдераДа
Модель по умолчаниюМодель, используемая для транскрипцииНет (используется умолчание провайдера)
Провайдер по умолчаниюУстановить ли этот провайдер ASR по умолчаниюНет

Как использовать

  1. Выберите или запишите фрагмент аудио
  2. Система автоматически отправит аудио настроенному провайдеру ASR
  3. Результат транскрипции возвращается в виде текста

Автоматическое преобразование форматов

Сервис ASR имеет встроенное автоматическое преобразование форматов. Если загружаемый аудиофайл не входит в число нативно поддерживаемых форматов Whisper API, система попытается автоматически преобразовать его в WAV с помощью ffmpeg перед транскрипцией.

Нативно поддерживаемые аудиоформаты

ФорматРасширение
FLAC.flac
M4A.m4a
MP3.mp3
MP4.mp4
MPEG.mpeg, .mpga
OGG.oga, .ogg
WAV.wav
WebM.webm

Другие форматы (например, .amr или .silk) автоматически преобразуются в WAV перед обработкой.

:::info Зависимость от ffmpeg Функция автоматического преобразования форматов требует установленного в системе ffmpeg. Если ffmpeg не установлен, неподдерживаемые форматы будут отправлены напрямую в API (и API может отказать в их обработке). :::

Параметры транскрипции

ПараметрОписание
providerIdУказывает используемый провайдер ASR (опционально; по умолчанию используется провайдер по умолчанию)
modelIdУказывает используемую модель (опционально)
languageУказывает язык аудио (опционально; определяется автоматически, если не задан)

Синтез речи (TTS)

Функция синтеза речи преобразует текстовое содержимое в естественно звучащую речь.

Поддерживаемые провайдеры

ПровайдерИдентификатор типаОписание
ElevenLabselevenlabs-ttsВысококачественный многоязычный синтез речи с богатым выбором голосов
Fish Audiofishaudio-ttsСервис синтеза речи Fish Audio

Шаги настройки

  1. Откройте Настройки > Медиапровайдеры > Синтез речи
  2. Выберите провайдер TTS
  3. Введите API-ключ
  4. Выберите модель по умолчанию
  5. Выберите голос по умолчанию
  6. Сохраните и включите
  7. (Опционально) Установите его как провайдер по умолчанию

Параметры настройки

ПараметрОписаниеОбязателен
API-ключAPI-ключ провайдераДа
Модель по умолчаниюМодель, используемая для синтеза речиНет
Голос по умолчаниюID голоса по умолчаниюНет
Провайдер по умолчаниюУстановить ли этот провайдер TTS по умолчаниюНет

Как использовать

  1. Выберите текстовое содержимое для преобразования
  2. Выберите голос
  3. Система отправляет текст провайдеру TTS
  4. Сгенерированное аудио можно воспроизвести напрямую или сохранить

Выбор голоса

Каждый провайдер TTS предлагает несколько голосов на выбор. Вы можете:

  1. Просмотреть список доступных голосов в настройках TTS
  2. Предварительно прослушать различные голоса
  3. Выбрать один голос по умолчанию

Список голосов получается динамически через API и будет меняться по мере обновлений провайдера.

Форматы вывода

ФорматОписание
mp3Универсальный аудиоформат (по умолчанию)
wavАудиоформат без потерь
oggСжатый формат с открытым исходным кодом
opusЭффективный сжатый формат
pcmНеобработанные аудиоданные

Параметры синтеза

ПараметрОписание
providerIdУказывает используемый провайдер TTS (опционально)
modelIdУказывает используемую модель (опционально)
voiceIdУказывает используемый голос (опционально)
outputFormatФормат выходного аудио (опционально; по умолчанию mp3)
outputDirКаталог сохранения (опционально)

Часто задаваемые вопросы

ВопросРешение
Транскрипция ASR пустаяУбедитесь, что аудиофайл содержит допустимую речь и не повреждён
Неподдерживаемый аудиоформатУстановите ffmpeg для включения автоматического преобразования форматов
Синтезированная TTS речь звучит неестественноПопробуйте переключиться на другой голос или модель; некоторые голоса лучше работают с определёнными языками
Список голосов пустУбедитесь, что API-ключ действителен и сервис провайдера работает нормально
Результат транскрипции неточныйПопробуйте указать правильный параметр языка или выберите более подходящую модель
TTS не производит звуковой выводПроверьте громкость системы и устройство вывода звука; убедитесь, что сгенерированный файл не пустой

Связанные ссылки