Elftia는 음성 인식(ASR, Automatic Speech Recognition)과 음성 합성(TTS, Text-to-Speech)의 두 가지 음성 서비스를 통합하여, 대화 및 콘텐츠 제작 시 음성과 텍스트를 자유롭게 전환할 수 있습니다.
사용 사례
- 음성 메시지나 녹음된 오디오 파일을 자동으로 텍스트로 변환
- AI 답변이나 사용자 정의 텍스트를 음성으로 변환하여 재생
- 타이핑이 불편할 때 음성 입력 사용
- 생성된 콘텐츠에 내레이션 추가
음성 인식 (ASR)
음성 인식 기능은 오디오 파일의 음성 내용을 텍스트로 변환합니다.
지원 제공업체
| 제공업체 | 유형 식별자 | 설명 |
|---|
| OpenAI Whisper | openai-whisper | OpenAI의 Whisper 음성 인식 API; 여러 언어 지원 |
| ElevenLabs Scribe | elevenlabs-stt | ElevenLabs의 음성-텍스트 변환 서비스 |
| Fish Audio | fishaudio-asr | Fish Audio의 음성 인식 서비스 |
구성 단계
- 설정 > 미디어 제공업체 > 음성 인식 열기
- ASR 제공업체 선택
- API 키 입력
- 기본 모델 선택 (예:
whisper-1)
- 저장 후 활성화
- (선택 사항) 기본 제공업체로 설정
구성 파라미터
| 설정 | 설명 | 필수 여부 |
|---|
| API 키 | 제공업체의 API 키 | 예 |
| 기본 모델 | 변환에 사용할 모델 | 아니요 (제공업체 기본값 사용) |
| 기본 제공업체 | 이 제공업체를 기본 ASR 제공업체로 설정할지 여부 | 아니요 |
사용 방법
- 오디오 클립을 선택하거나 녹음
- 시스템이 자동으로 오디오를 구성된 ASR 제공업체에 전송
- 변환 결과가 텍스트로 반환
자동 형식 변환
ASR 서비스에는 자동 형식 변환이 내장되어 있습니다. 업로드된 오디오 파일 형식이 Whisper API가 기본적으로 지원하지 않는 경우, 시스템은 변환 전에 ffmpeg을 사용하여 자동으로 WAV로 변환을 시도합니다.
기본 지원 오디오 형식
| 형식 | 확장자 |
|---|
| FLAC | .flac |
| M4A | .m4a |
| MP3 | .mp3 |
| MP4 | .mp4 |
| MPEG | .mpeg, .mpga |
| OGG | .oga, .ogg |
| WAV | .wav |
| WebM | .webm |
다른 형식 (예: .amr 또는 .silk)은 처리 전에 자동으로 WAV로 변환됩니다.
:::info ffmpeg 의존성
자동 형식 변환 기능은 시스템에 ffmpeg이 설치되어 있어야 합니다. ffmpeg이 설치되어 있지 않으면 지원되지 않는 형식이 API에 직접 전송됩니다 (API가 처리를 거부할 수 있음).
:::
변환 파라미터
| 파라미터 | 설명 |
|---|
providerId | 사용할 ASR 제공업체 지정 (선택 사항; 기본 제공업체 사용) |
modelId | 사용할 모델 지정 (선택 사항) |
language | 오디오 언어 지정 (선택 사항; 설정하지 않으면 자동 감지) |
음성 합성 (TTS)
음성 합성 기능은 텍스트 콘텐츠를 자연스러운 음성으로 변환합니다.
지원 제공업체
| 제공업체 | 유형 식별자 | 설명 |
|---|
| ElevenLabs | elevenlabs-tts | 다양한 음성 선택지를 갖춘 고품질 다국어 음성 합성 |
| Fish Audio | fishaudio-tts | Fish Audio의 음성 합성 서비스 |
구성 단계
- 설정 > 미디어 제공업체 > 음성 합성 열기
- TTS 제공업체 선택
- API 키 입력
- 기본 모델 선택
- 기본 음성 선택
- 저장 후 활성화
- (선택 사항) 기본 제공업체로 설정
구성 파라미터
| 설정 | 설명 | 필수 여부 |
|---|
| API 키 | 제공업체의 API 키 | 예 |
| 기본 모델 | 음성 합성에 사용할 모델 | 아니요 |
| 기본 음성 | 사용할 기본 음성 ID | 아니요 |
| 기본 제공업체 | 이 제공업체를 기본 TTS 제공업체로 설정할지 여부 | 아니요 |
사용 방법
- 변환할 텍스트 콘텐츠 선택
- 음성 선택
- 시스템이 텍스트를 TTS 제공업체에 전송
- 생성된 오디오를 바로 재생하거나 저장
음성 선택
각 TTS 제공업체는 선택할 수 있는 여러 음성을 제공합니다:
- TTS 설정에서 사용 가능한 음성 목록 확인
- 다양한 음성의 효과 미리 듣기
- 기본값으로 사용할 음성 선택
음성 목록은 API를 통해 동적으로 가져오며 제공업체가 업데이트할 때 변경됩니다.
출력 형식
| 형식 | 설명 |
|---|
mp3 | 범용 오디오 형식 (기본값) |
wav | 무손실 오디오 형식 |
ogg | 오픈소스 압축 형식 |
opus | 효율적인 압축 형식 |
pcm | 원시 오디오 데이터 |
합성 파라미터
| 파라미터 | 설명 |
|---|
providerId | 사용할 TTS 제공업체 지정 (선택 사항) |
modelId | 사용할 모델 지정 (선택 사항) |
voiceId | 사용할 음성 지정 (선택 사항) |
outputFormat | 출력 오디오 형식 (선택 사항; 기본값 mp3) |
outputDir | 저장 디렉토리 (선택 사항) |
자주 묻는 질문
| 질문 | 해결 방법 |
|---|
| ASR 변환 결과가 비어 있음 | 오디오 파일에 유효한 음성이 포함되어 있는지, 파일이 손상되지 않았는지 확인 |
| 지원되지 않는 오디오 형식 | ffmpeg을 설치하여 자동 형식 변환 활성화 |
| TTS 생성 음성이 부자연스러움 | 다른 음성이나 모델로 전환 시도; 일부 음성은 특정 언어에서 더 좋은 성능을 보임 |
| 음성 목록이 비어 있음 | API 키가 유효하고 제공업체 서비스가 정상 작동하는지 확인 |
| 변환 결과가 부정확함 | 올바른 언어 파라미터를 지정하거나 더 적합한 모델 선택 시도 |
| TTS 오디오 출력 없음 | 시스템 볼륨 및 오디오 출력 장치 확인; 생성된 파일이 비어 있지 않은지 확인 |
관련 링크