Skip to main content
이 문서는 영어 원문을 기반으로 자동 번역되었습니다. 표현이 어색하거나 모호한 부분이 있을 수 있으니, 정확한 내용은 영어 원문을 함께 확인해 주세요.
create_speech는 텍스트를 완성된 오디오 파일로 변환합니다. 전체 오디오가 응답 본문으로 반환되어 곧바로 저장하거나 재생할 수 있습니다. 생성이 끝나기 전에 재생을 시작하는 등, 합성되는 즉시 오디오 청크를 스트리밍해야 하는 경우에는 Stream speech를 참고해 주십시오.

기본 사용법

요청 필드

전체 스키마는 Create speech (API reference)를 참고해 주십시오.

출력 포맷

output_format을 생략하면 API는 기본값으로 wav를 사용합니다. 동일한 옵션이 Stream speech에도 적용되며, 청크는 요청한 포맷의 바이너리로 반환됩니다.

응답

기본적으로 API는 응답 본문에 바이너리 오디오를 반환합니다. 응답에는 다음 두 가지 유용한 헤더가 포함됩니다.

include_phonemes=true인 경우

음소 타임스탬프를 사용하도록 설정하면 응답이 JSON으로 전환되며, base64로 인코딩된 오디오 페이로드와 함께 음소 배열이 포함됩니다.
전체 구조는 Pronunciation and phonemes를 참고해 주십시오.

결과 저장

  • 스타일이 중요합니다. 보이스마다 기본 스타일이 다를 수 있습니다. style을 명시적으로 지정하거나, 시작 시 Get voice를 한 번 호출하여 해당 보이스의 기본값을 확인해 주십시오.
  • 생성 전에 예측하기. predict_duration은 크레딧을 소모하지 않고 예상 오디오 길이를 반환합니다. UI 힌트나 비용 예측에 유용합니다.
  • 긴 텍스트. Raw API는 text를 300자로 제한합니다. Python 및 TypeScript SDK는 자동으로 분할, 생성, 병합을 수행합니다. Long text를 참고해 주십시오.
  • 빈 입력이나 매우 짧은 입력은 부자연스러운 결과를 만들 수 있습니다. 최소한 짧은 완전한 문장 한 개 이상을 입력해 주십시오.

관련 문서

모델 선택

빠른 모델과 고품질 TTS 모델 중에서 선택할 수 있습니다.

긴 텍스트

300자를 초과하는 텍스트로부터 오디오를 생성합니다.

보이스 설정

피치, 억양, 속도를 조정합니다.

API 레퍼런스

전체 요청 및 응답 스키마입니다.