이 문서는 영어 원문을 기반으로 자동 번역되었습니다. 표현이 어색하거나 모호한 부분이 있을 수 있으니, 정확한 내용은 영어 원문을 함께 확인해 주세요.
include_phonemes: true를 설정해 주십시오.
sona_speech_2, sona_speech_2_flash, sona_speech_1에서 지원됩니다. supertonic_api_3 및 supertonic_api_1에서는 지원되지 않습니다.사용법
- Python
- TypeScript
- cURL
응답 구조
세 개의 음소 배열은 정렬되어 있습니다.
symbols[i], start_times_seconds[i], durations_seconds[i]는 동일한 음소를 가리킵니다.
음소와 함께 스트리밍하기
stream_speech를 include_phonemes: true로 호출하면 응답이 NDJSON(줄바꿈으로 구분되는 JSON)으로 전환됩니다. 각 줄은 자체 audio_base64와 phonemes 데이터를 포함하는 청크입니다.
활용 사례
- 게임 및 애니메이션의 립싱크. 각 음소를 비짐(viseme, 입 모양)에 매핑하고 오디오에 맞춰 비짐을 재생합니다. 대부분의 엔진은 기본 음소-비짐 매핑 테이블을 제공하며, Supertone의 심볼은 표준 IPA 스타일이므로 대부분의 리그와 호환됩니다.
- 가라오케 / 단어 하이라이팅. 음소 시작 시간을 이용해 발화되는 순간에 맞춰 단어를 강조 표시할 수 있습니다.
- 발음 분석. 실제 음소와 예상 시퀀스를 비교하여 어학 학습 앱에서 발음을 검사할 수 있습니다.
관련 문서
립싱크 예제
음소에서 비짐으로 이어지는 파이프라인을 구축합니다.
노말라이즈드 텍스트
모호한 입력의 발음을 개선합니다.