Elftia интегрирует два вида речевых сервисов — распознавание речи (ASR, Automatic Speech Recognition) и синтез речи (TTS, Text-to-Speech) — позволяя свободно переключаться между голосом и текстом в диалогах и при создании контента.
Сценарии использования
- Автоматическая транскрипция голосовых сообщений или записей аудиофайлов в текст
- Преобразование ответов AI или пользовательского текста в речь для воспроизведения
- Голосовой ввод, когда печатать неудобно
- Озвучивание созданного контента
Распознавание речи (ASR)
Функция распознавания речи транскрибирует речь из аудиофайлов в текст.
Поддерживаемые провайдеры
| Провайдер | Идентификатор типа | Описание |
|---|
| OpenAI Whisper | openai-whisper | API распознавания речи Whisper от OpenAI; поддерживает несколько языков |
| ElevenLabs Scribe | elevenlabs-stt | Сервис преобразования речи в текст от ElevenLabs |
| Fish Audio | fishaudio-asr | Сервис распознавания речи Fish Audio |
Шаги настройки
- Откройте Настройки > Медиапровайдеры > Распознавание речи
- Выберите провайдер ASR
- Введите API-ключ
- Выберите модель по умолчанию (например,
whisper-1)
- Сохраните и включите
- (Опционально) Установите его как провайдер по умолчанию
Параметры настройки
| Параметр | Описание | Обязателен |
|---|
| API-ключ | API-ключ провайдера | Да |
| Модель по умолчанию | Модель, используемая для транскрипции | Нет (используется умолчание провайдера) |
| Провайдер по умолчанию | Установить ли этот провайдер ASR по умолчанию | Нет |
Как использовать
- Выберите или запишите фрагмент аудио
- Система автоматически отправит аудио настроенному провайдеру ASR
- Результат транскрипции возвращается в виде текста
Автоматическое преобразование форматов
Сервис ASR имеет встроенное автоматическое преобразование форматов. Если загружаемый аудиофайл не входит в число нативно поддерживаемых форматов Whisper API, система попытается автоматически преобразовать его в WAV с помощью ffmpeg перед транскрипцией.
Нативно поддерживаемые аудиоформаты
| Формат | Расширение |
|---|
| FLAC | .flac |
| M4A | .m4a |
| MP3 | .mp3 |
| MP4 | .mp4 |
| MPEG | .mpeg, .mpga |
| OGG | .oga, .ogg |
| WAV | .wav |
| WebM | .webm |
Другие форматы (например, .amr или .silk) автоматически преобразуются в WAV перед обработкой.
:::info Зависимость от ffmpeg
Функция автоматического преобразования форматов требует установленного в системе ffmpeg. Если ffmpeg не установлен, неподдерживаемые форматы будут отправлены напрямую в API (и API может отказать в их обработке).
:::
Параметры транскрипции
| Параметр | Описание |
|---|
providerId | Указывает используемый провайдер ASR (опционально; по умолчанию используется провайдер по умолчанию) |
modelId | Указывает используемую модель (опционально) |
language | Указывает язык аудио (опционально; определяется автоматически, если не задан) |
Синтез речи (TTS)
Функция синтеза речи преобразует текстовое содержимое в естественно звучащую речь.
Поддерживаемые провайдеры
| Провайдер | Идентификатор типа | Описание |
|---|
| ElevenLabs | elevenlabs-tts | Высококачественный многоязычный синтез речи с богатым выбором голосов |
| Fish Audio | fishaudio-tts | Сервис синтеза речи Fish Audio |
Шаги настройки
- Откройте Настройки > Медиапровайдеры > Синтез речи
- Выберите провайдер TTS
- Введите API-ключ
- Выберите модель по умолчанию
- Выберите голос по умолчанию
- Сохраните и включите
- (Опционально) Установите его как провайдер по умолчанию
Параметры настройки
| Параметр | Описание | Обязателен |
|---|
| API-ключ | API-ключ провайдера | Да |
| Модель по умолчанию | Модель, используемая для синтеза речи | Нет |
| Голос по умолчанию | ID голоса по умолчанию | Нет |
| Провайдер по умолчанию | Установить ли этот провайдер TTS по умолчанию | Нет |
Как использовать
- Выберите текстовое содержимое для преобразования
- Выберите голос
- Система отправляет текст провайдеру TTS
- Сгенерированное аудио можно воспроизвести напрямую или сохранить
Выбор голоса
Каждый провайдер TTS предлагает несколько голосов на выбор. Вы можете:
- Просмотреть список доступных голосов в настройках TTS
- Предварительно прослушать различные голоса
- Выбрать один голос по умолчанию
Список голосов получается динамически через API и будет меняться по мере обновлений провайдера.
Форматы вывода
| Формат | Описание |
|---|
mp3 | Универсальный аудиоформат (по умолчанию) |
wav | Аудиоформат без потерь |
ogg | Сжатый формат с открытым исходным кодом |
opus | Эффективный сжатый формат |
pcm | Необработанные аудиоданные |
Параметры синтеза
| Параметр | Описание |
|---|
providerId | Указывает используемый провайдер TTS (опционально) |
modelId | Указывает используемую модель (опционально) |
voiceId | Указывает используемый голос (опционально) |
outputFormat | Формат выходного аудио (опционально; по умолчанию mp3) |
outputDir | Каталог сохранения (опционально) |
Часто задаваемые вопросы
| Вопрос | Решение |
|---|
| Транскрипция ASR пустая | Убедитесь, что аудиофайл содержит допустимую речь и не повреждён |
| Неподдерживаемый аудиоформат | Установите ffmpeg для включения автоматического преобразования форматов |
| Синтезированная TTS речь звучит неестественно | Попробуйте переключиться на другой голос или модель; некоторые голоса лучше работают с определёнными языками |
| Список голосов пуст | Убедитесь, что API-ключ действителен и сервис провайдера работает нормально |
| Результат транскрипции неточный | Попробуйте указать правильный параметр языка или выберите более подходящую модель |
| TTS не производит звуковой вывод | Проверьте громкость системы и устройство вывода звука; убедитесь, что сгенерированный файл не пустой |
Связанные ссылки