AI / 음성

TTS(Text-to-Speech)

TTS는 텍스트를 입력받아 읽어 주는 음성을 생성하는 기술입니다.

쉬운 설명

TTS는 Text-to-Speech의 줄임말이에요. 스터디 발표 대본을 내레이션으로 만들거나 앱의 안내 문구를 읽어 줄 때 사용할 수 있어요. 보통 읽을 문장과 목소리·언어 등의 조건을 정해 음성을 만들어요. 말투가 자연스러워도 내용이나 발음이 정확하다는 뜻은 아니므로 실제로 들어 보고 확인해야 해요.

이런 상황에서 만나요

발표 영상에 “API 키를 입력하고 다음으로 이동하세요”라는 안내를 넣으려고 한다고 해 볼게요. 생성한 음성에서 약어 발음이나 끊어 읽기가 의도와 다를 수 있어요.

화면의 약어가 원하는 발음으로 읽히는지 확인해요

설명용 화면
1화면 안내

API 키를 입력하세요.

2음성용 대본 예시

에이피아이 키를 입력하세요.

3생성 후 확인

목소리·발음·끊어 읽기 확인

화면의 안내와 의미가 같은지 대조

  1. 1사용자에게 보여 주는 문장이에요.
  2. 2의도한 발음을 전달할 수 있도록 대본을 조정할 수 있어요.
  3. 3대본을 바꾼 뒤에도 실제 음성을 들어 봐야 해요.
발음 확인 과정을 설명하는 가상 대본입니다. 실제 음성을 생성·재생한 결과나 특정 서비스의 발음 보장을 뜻하지 않습니다.

먼저 짧은 문장으로 생성해 약어·제품명·숫자가 어떻게 읽히는지 들어요. 필요한 경우 음성용 대본을 읽기 쉬운 표기로 바꾸거나 서비스가 지원하는 발음·쉼 설정을 사용해요. 최종 영상에 넣기 전에 문장이 잘리거나 잘못된 안내가 없는지도 확인해요.

헷갈리기 쉬운 점

텍스트를 넣으면 모든 목소리와 언어로 읽을 수 있나요?

지원하는 목소리와 언어, 조절 옵션은 서비스와 모델마다 달라요. 같은 언어라도 고유명사나 약어를 원하는 방식으로 읽지 못할 수 있어요. 실제 사용할 설정으로 짧게 확인해요.

음성만 고치면서 화면의 안내 문구와 의미가 달라지지 않도록 해요. 특정인의 목소리를 재현하는 기능은 일반적인 문장 읽기와 별도로 조건을 확인해야 해요.

왜 알아야 할까요?

AI에게 “내레이션 만들어 줘”라고 요청할 때 읽을 대본, 원하는 발음과 쉼, 사용할 언어를 구체적으로 전달할 수 있어요. 영상이나 앱에서 화면 문구와 음성이 일치하는지도 점검할 수 있어요.

조금 더 자세히

TTS 서비스는 입력 문장을 분석하고 음성 데이터를 생성합니다. 파일로 저장하거나 재생할 수 있는 형태로 받을 수 있으며, 출력 형식과 스트리밍 지원 여부는 서비스에 따라 다릅니다.

SSML(Speech Synthesis Markup Language)은 일부 음성 합성 서비스에서 쉼이나 읽는 방식 등을 지정할 때 사용하는 마크업입니다. 모든 서비스가 같은 태그나 기능을 지원하지 않으므로 해당 문서를 확인합니다.

직접 사용할 때 확인해 보세요

  • 읽을 내용과 사용할 언어·목소리를 정한다
  • 약어·숫자·고유명사를 직접 들어 본다
  • 화면 안내와 음성 대본의 의미를 맞춘다

관계 지도

TTS(Text-to-Speech) 중심으로 관련 개념의 정의와 관계를 한눈에 정리했습니다.
TTS(Text-to-Speech)의 정의와 관련 개념 간 관계를 설명한 계층형 그래프