본문으로 건너뛰기

음성 서비스

Elftia는 음성 인식(ASR, Automatic Speech Recognition)과 음성 합성(TTS, Text-to-Speech)의 두 가지 음성 서비스를 통합하여, 대화 및 콘텐츠 제작 시 음성과 텍스트를 자유롭게 전환할 수 있습니다.

사용 사례

  • 음성 메시지나 녹음된 오디오 파일을 자동으로 텍스트로 변환
  • AI 답변이나 사용자 정의 텍스트를 음성으로 변환하여 재생
  • 타이핑이 불편할 때 음성 입력 사용
  • 생성된 콘텐츠에 내레이션 추가

음성 인식 (ASR)

음성 인식 기능은 오디오 파일의 음성 내용을 텍스트로 변환합니다.

지원 제공업체

제공업체유형 식별자설명
OpenAI Whisperopenai-whisperOpenAI의 Whisper 음성 인식 API; 여러 언어 지원
ElevenLabs Scribeelevenlabs-sttElevenLabs의 음성-텍스트 변환 서비스
Fish Audiofishaudio-asrFish Audio의 음성 인식 서비스

구성 단계

  1. 설정 > 미디어 제공업체 > 음성 인식 열기
  2. ASR 제공업체 선택
  3. API 키 입력
  4. 기본 모델 선택 (예: whisper-1)
  5. 저장 후 활성화
  6. (선택 사항) 기본 제공업체로 설정

구성 파라미터

설정설명필수 여부
API 키제공업체의 API 키
기본 모델변환에 사용할 모델아니요 (제공업체 기본값 사용)
기본 제공업체이 제공업체를 기본 ASR 제공업체로 설정할지 여부아니요

사용 방법

  1. 오디오 클립을 선택하거나 녹음
  2. 시스템이 자동으로 오디오를 구성된 ASR 제공업체에 전송
  3. 변환 결과가 텍스트로 반환

자동 형식 변환

ASR 서비스에는 자동 형식 변환이 내장되어 있습니다. 업로드된 오디오 파일 형식이 Whisper API가 기본적으로 지원하지 않는 경우, 시스템은 변환 전에 ffmpeg을 사용하여 자동으로 WAV로 변환을 시도합니다.

기본 지원 오디오 형식

형식확장자
FLAC.flac
M4A.m4a
MP3.mp3
MP4.mp4
MPEG.mpeg, .mpga
OGG.oga, .ogg
WAV.wav
WebM.webm

다른 형식 (예: .amr 또는 .silk)은 처리 전에 자동으로 WAV로 변환됩니다.

:::info ffmpeg 의존성 자동 형식 변환 기능은 시스템에 ffmpeg이 설치되어 있어야 합니다. ffmpeg이 설치되어 있지 않으면 지원되지 않는 형식이 API에 직접 전송됩니다 (API가 처리를 거부할 수 있음). :::

변환 파라미터

파라미터설명
providerId사용할 ASR 제공업체 지정 (선택 사항; 기본 제공업체 사용)
modelId사용할 모델 지정 (선택 사항)
language오디오 언어 지정 (선택 사항; 설정하지 않으면 자동 감지)

음성 합성 (TTS)

음성 합성 기능은 텍스트 콘텐츠를 자연스러운 음성으로 변환합니다.

지원 제공업체

제공업체유형 식별자설명
ElevenLabselevenlabs-tts다양한 음성 선택지를 갖춘 고품질 다국어 음성 합성
Fish Audiofishaudio-ttsFish Audio의 음성 합성 서비스

구성 단계

  1. 설정 > 미디어 제공업체 > 음성 합성 열기
  2. TTS 제공업체 선택
  3. API 키 입력
  4. 기본 모델 선택
  5. 기본 음성 선택
  6. 저장 후 활성화
  7. (선택 사항) 기본 제공업체로 설정

구성 파라미터

설정설명필수 여부
API 키제공업체의 API 키
기본 모델음성 합성에 사용할 모델아니요
기본 음성사용할 기본 음성 ID아니요
기본 제공업체이 제공업체를 기본 TTS 제공업체로 설정할지 여부아니요

사용 방법

  1. 변환할 텍스트 콘텐츠 선택
  2. 음성 선택
  3. 시스템이 텍스트를 TTS 제공업체에 전송
  4. 생성된 오디오를 바로 재생하거나 저장

음성 선택

각 TTS 제공업체는 선택할 수 있는 여러 음성을 제공합니다:

  1. TTS 설정에서 사용 가능한 음성 목록 확인
  2. 다양한 음성의 효과 미리 듣기
  3. 기본값으로 사용할 음성 선택

음성 목록은 API를 통해 동적으로 가져오며 제공업체가 업데이트할 때 변경됩니다.

출력 형식

형식설명
mp3범용 오디오 형식 (기본값)
wav무손실 오디오 형식
ogg오픈소스 압축 형식
opus효율적인 압축 형식
pcm원시 오디오 데이터

합성 파라미터

파라미터설명
providerId사용할 TTS 제공업체 지정 (선택 사항)
modelId사용할 모델 지정 (선택 사항)
voiceId사용할 음성 지정 (선택 사항)
outputFormat출력 오디오 형식 (선택 사항; 기본값 mp3)
outputDir저장 디렉토리 (선택 사항)

자주 묻는 질문

질문해결 방법
ASR 변환 결과가 비어 있음오디오 파일에 유효한 음성이 포함되어 있는지, 파일이 손상되지 않았는지 확인
지원되지 않는 오디오 형식ffmpeg을 설치하여 자동 형식 변환 활성화
TTS 생성 음성이 부자연스러움다른 음성이나 모델로 전환 시도; 일부 음성은 특정 언어에서 더 좋은 성능을 보임
음성 목록이 비어 있음API 키가 유효하고 제공업체 서비스가 정상 작동하는지 확인
변환 결과가 부정확함올바른 언어 파라미터를 지정하거나 더 적합한 모델 선택 시도
TTS 오디오 출력 없음시스템 볼륨 및 오디오 출력 장치 확인; 생성된 파일이 비어 있지 않은지 확인

관련 링크