유튜브에 올라온 한 영상이 온라인 커뮤니티에서 화제가 되고 있다. 자신의 목소리로 노래를 부르는 AI 가수의 영상 말인 것으로 보인다. 처음 보는 사람이라면 '전문적인 음성 제작 지식이 있어야 가능하겠거니' 생각할 수 있다. 하지만 사실 일반인이 집에서도 이런 결과물을 만들 수 있다는 점이 사람들의 놀라움을 사고 있다.

이를 가능케 하는 도구는 UTAU(우타우)라 불리는 무료 음성 합성 소프트웨어다. 기본 원리는 생각보다 단순하다. 자신의 목소리를 여러 번 녹음해 '보이스뱅크'라는 음성 라이브러리를 만들고, 이를 통해 원하는 가사로 노래를 합성해내는 방식인 것으로 보인다. 마치 자신의 성대를 디지털화한 뒤 컴퓨터가 그것을 조종하는 느낌이라 할 수 있다. 원래 일본에서 만들어진 음성 합성 소프트웨어인데, 최근 국내 온라인 커뮤니티에서 '생각보다 접근 가능하다'는 평가가 점점 늘어나고 있는 상황인 것으로 보인다.

준비 과정부터 시작해야 한다. 먼저 UTAU 공식 사이트에서 소프트웨어를 내려받는 것이 첫 단계다. 인스톨 직후에는 각종 초기 설정을 해야 하는데, 원문 작성자가 제시한 소셜 미디어 링크들을 따라가면 이 과정을 단계별로 배울 수 있다는 평이 있다. 초기 설정이 완료되면 '원음 설정'이라는 단계로 넘어간다. 소프트웨어가 자신의 목소리를 정확히 인식하고 분석하도록 조정하는 과정이 바로 이것으로 보인다. 원음을 제대로 설정하지 않으면 나중에 합성된 노래의 품질이 떨어질 수 있다는 점이 중요하다.

다행히 이 원음 설정에 대한 설명은 여러 온라인 사용자들이 올려놨다. 특정 소셜 미디어 계정에서 찾은 스레드나 개인 커뮤니티의 가이드를 참고하면, 처음 시도하는 사람도 각 단계를 진행할 수 있다는 평인 것으로 보인다. 실제로 원문 작성자가 언급한 자료들 대부분은 유료가 아닌 무료로 공개돼 있어, 경제적 부담 없이 시작할 수 있다는 점이 관심층을 계속 늘리고 있는 것 같다.

녹음 단계에 들어가면 본격적인 작업이 시작되는 구조다. 원문 작성자가 제시한 '단독음 녹음용 텍스트 파일'과 '연속음 녹음용 텍스트 파일'이 바로 이때 쓰인다. 이 파일들은 어떤 음절들을 어떤 순서로 반복해서 녹음해야 하는지 안내하는 일종의 '녹음 스크립트'인 셈인 것으로 보인다. 파일에 나열된 글자나 음절들을 마이크 앞에서 하나하나 읽거나 노래하듯이 녹음하면, 소프트웨어가 각 음절의 특성을 학습하고 음성 라이브러리에 저장하는 구조다.

이 과정이 모두 기계적으로 느껴질 수 있지만, 원문 작성자는 "가이드 BGM"이라는 배경음을 함께 제공한다고 한 것으로 전해진다. 녹음할 때 음악을 틀어놓고 진행하면 단조로움을 덜 수 있다는 뜻인 것으로 보인다. 또한 발음을 정리한 별도의 파일도 있어, 자신의 목소리가 어떤 음정과 톤으로 녹음되는지 더 세밀하게 조정할 수 있는 여유가 있다는 평인 것으로 보인다. 이런 보조 자료들이 준비돼 있다는 것 자체가 '생각보다 쉽다'는 주장을 뒷받침하는 근거가 되는 셈인 것으로 보인다.

더 정교한 결과물을 원한다면 추가 도구들도 있다. '모리샘'이나 '팁스', '하이파이샘플러' 같은 프로그램들이 음성 품질을 향상시키거나 세부 설정을 조정하는 데 도움을 줄 수 있다는 평가가 있다. 필수 프로그램은 아니지만, 전문성을 더 높이고 싶거나 음질에 까다롭다면 알아두면 좋을 선택지들이라 할 수 있다. 이들도 대부분 온라인 커뮤니티나 개발자 페이지에서 무료로 다운로드할 수 있다는 점이 장점인 것으로 보인다.

이 과정을 모두 거치면 결과물의 완성도가 높다고 평가된다. 원문 작성자가 강조한 부분도 여기다. 자신의 목소리 톤을 기반으로 소프트웨어가 생성한 노래가 재생되는 경험인데, 전문 스튜디오 수준의 음성 합성이라는 반응이 커뮤니티에 많다. 게다가 생각보다 과정이 복잡하지 않다는 평가도 나온다. 온라인에 무수히 많은 튜토리얼과 커뮤니티가 있어 막히는 부분을 쉽게 찾을 수 있고, 각 단계마다 필요한 파일들이 이미 정리돼 공유되고 있기 때문인 것으로 보인다.

원문 작성자는 최종적으로 "연휴 동안 할 거 없다면 도전해봐도 좋다"며 권유한다. 취미로 시작해 나만의 AI 가수를 만드는 경험이 그리 부담스럽지 않을 수 있다는 뜻인 것 같다. 실제로 이 글에 달린 댓글들에서도 호기심을 드러내거나 직접 시도해볼 계획을 밝히는 이들이 있는 것으로 전해진다. 기술 진입장벽이 낮고, 결과물이 신기하고, 취미로 삼기 충분하다는 요소들이 맞아떨어지면서 관심층이 점점 늘어나는 중이라는 평가가 많다.


📌 원문 발췌

저렇게 하면 내 목소리를 기반으로 이렇게 막 노래 부르게 할 수 있음. 생각보다 쉽고 재밌으니까 연휴 동안 할 거 없는 덬들 해봤으면!

원본 출처: 더쿠 핫