← 블로그로 돌아가기
방법론6분 분량 · Jul 19, 2026

게시해도 될 만큼 자연스러운, 실제로 쓸 수 있는 AI 목소리

대부분의 AI 목소리는 10초짜리 데모에서는 훌륭하게 들리다가 20분이 지나면 무너집니다. 우리가 자연스러움을 어떻게 측정하는지, 그리고 당신의 이름을 걸 수 있는 클론 목소리를 내놓으려면 무엇이 필요한지 이야기합니다.

Minhyeok Kang & Vocast Team음성 AI 엔지니어

거의 모든 음성 AI는 10초짜리 데모는 통과합니다. 클립은 깔끔하게 들리고, 단어는 또렷하고, 두어 문장 정도는 믿음이 갑니다. 그러다 실제 대본, 한 챕터, 강의 한 모듈, 20분짜리 영상을 낭독시켜 보면 그 착각은 무너집니다. 문장 끝이 밋밋해지고, 모든 문장이 똑같은 모양으로 떨어지며, 3분쯤 지나면 귀는 더 이상 사람이 아니라 기계가 읽는 소리를 듣기 시작합니다.

좋은 데모와 실제로 게시할 수 있는 낭독 사이의 그 간극이 유일하게 중요한 것입니다. Vocast는 그 간극을 메우기 위해, 그리고 형용사가 아니라 수치로 메웠음을 증명하기 위해 만들어졌습니다.

“자연스러움”은 또렷함이 아닙니다. 운율입니다.

사람들이 AI 목소리가 로봇 같다고 말할 때, 알아듣기 어렵다는 뜻인 경우는 드뭅니다. 요즘 텍스트 음성 변환은 거의 언제나 알아들을 수 있습니다. 사람들이 반응하는 것은 운율입니다. 즉 음높이의 오르내림, 숨이 어디에서 들어가는지, 문장이 마지막 단어로 어떻게 느려지는지, 어떤 음절이 밀리고 어떤 음절이 삼켜지는지입니다. 운율은 목소리가 낭독이 아니라 생각하는 것처럼 들리게 하는 요소입니다.

그래서 Vocast가 가장 먼저 측정하는 것이 바로 그것입니다. 북극성 지표는 운율 자연스러움 점수(PNS), 즉 실제 사람이 같은 문장을 읽었을 때를 기준으로 벤치마크한 하나의 숫자입니다.

왼쪽: 렌더링마다 표시되는 품질 리포트. 오른쪽: 문장별 운율 분석.

목소리가 실제로 무너지는 지점

긴 낭독의 실패는 하나의 버그가 아니라 넷이며, 어느 것도 짧은 클립에서는 보이지 않습니다. 목소리가 계속 이어가야 할 때 비로소 드러납니다.

  • 음높이 붕괴. 멜로디가 문단을 거듭할수록 좁아져서 결국 목소리가 평평한 선 위에서 읽게 됩니다. 첫 문장에는 폭이 있지만, 마흔 번째 문장에는 없습니다.
  • 메트로놈 같은 박자. 쉼이 의미가 아니라 타이머에 맞춰 떨어지기 시작해서, 모든 문장이 같은 박자를 차지하고 리듬이 기계적으로 변합니다.
  • 경계 호흡. 문장 사이의 작은 숨과 가라앉음이 사라져서, 절과 절이 생각할 틈 없이 서로 붙어 버립니다.
  • 잘린 끝맺음. 마지막 단어가 사람이 잦아들 듯이 사그라지는 대신, 똑같은 딱딱한 정지로 잘리거나 떨어져 나갑니다.

이 각각은 Vocast 안에서 고유한 이름의 지표와 고유한 게이트를 가집니다. 그래서 렌더가 평균적으로 괜찮으면서 그중 하나를 조용히 실패하는 방식으로는 통과할 수 없습니다.

분위기가 아니라 수치

Vocast는 모든 렌더를 네 가지 축으로 채점하고, 그 전부에 게이트를 겁니다.

  • 화자 유사도(SIM): 우리의 최적 구성은 0.917에서 0.945 사이에 자리합니다. 같은 실제 사람의 두 녹음은 서로에 대해 약 0.909를 기록하므로, 클론은 다른 두 날에 녹음한 당신 자신의 목소리 범위 안에 들어갑니다.
  • 단어 정확도(CER): 오디오를 다시 전사해 대본과 비교합니다. 숫자와 외래어가 섞인 대본에서 글자 오류율은 0%입니다.
  • 자연스러움(MOS): 무참조 모델이 클론을 3.50으로 평가하는데, 이는 클론의 원본이 된 3.24 기준보다 약간 높습니다.
  • 운율(PNS): 북극성 지표로, 모든 테이크에서 사람 기준선 게이트를 유지합니다.

이 중 어느 것도 유리한 것만 골라낸 값이 아닙니다. 지속적 통합(CI)에서 강제되며, 게이트를 놓친 렌더는 배포되지 않고 거부됩니다. 에이전트에서 목소리를 호출하는 모습은 clone_voice(text, profile_id="MyVoice")처럼 생겼고, 오디오와 함께 점수를 반환합니다.

“자연스럽게 들린다”의 정직한 버전은 이렇습니다: 우리는 자연스러움을 측정 가능한 속성의 집합으로 정의했고, 그중 하나라도 놓친 것은 배포하기를 거부했습니다.
가라오케 검수: 각 단어가 재생될 때 색이 입혀집니다. 아무 단어나 클릭하면 그 지점으로 이동합니다.

그래서, 실제로 쓸 수 있나요?

생성은 Apple Silicon Mac에서 대략 4× 실시간으로, 전적으로 기기 안에서 돌아갑니다. 업로드도, 대기열도, 분당 계량기도 없습니다. 가라오케 뷰가 재생되는 각 단어에 색을 입혀서, 긴 낭독을 눈과 귀로 동시에 검수할 수 있습니다. 그리고 한 문단이 밋밋하게 나오면, 전체 테이크를 다시 렌더링하는 대신 그 블록만 재생성합니다.

같은 엔진을 MCP를 통해 에이전트도 쓸 수 있어서, 한 도구에서 쓴 대본을 책상을 떠나지 않고 낭독하고 채점하고 돌려받을 수 있습니다. 10초 동안 당신을 속이는 목소리가 아닙니다. 당신의 이름을 걸고 20분짜리 영상에 올릴 수 있는 목소리입니다.

Minhyeok Kang크리에이터를 위한 로컬 온디바이스 음성 스튜디오를 만드는 음성 AI 엔지니어. 보이스 클로닝, 운율 지표, 온디바이스 AI 출시에 대해 씁니다.