
서울교통공사 성우 목소리 논란부터 일레븐랩스 15조원 기업가치까지, 저작도구 AI 보이스오버의 학습효과·저작권 데이터를 검증한다.
🔍 "성우 목소리를 동의 없이 AI에 학습시켰다"는 의혹, 그리고 부인
얼마 전 서울교통공사가 운영하는 지하철 안내방송을 두고 논란이 일었다. 오랫동안 지하철 안내 목소리를 맡아온 성우가 투병 중인 사이, 자신의 목소리가 동의 없이 AI 학습에 쓰인 것 아니냐는 의혹이 제기된 것이다. 서울교통공사는 "사실이 아니다"라고 즉각 해명했지만, 이 소동 자체가 상징하는 바는 명확했다 — 이제 대중은 익숙한 목소리를 들을 때마다 "이거 혹시 AI 아닐까"를 먼저 의심하는 시대에 들어섰다는 것이다. 비슷한 시기 일본에서도 성우들이 자신의 목소리가 동의 없이 AI 학습에 쓰였다며 저작권 침해를 주장하는 논란이 불거졌고, 미국에서는 2025년 7월 성우 베브 스탠딩과 리니아 세이지가 자신들의 목소리로 학습된 합성 음성 모델을 제3자에게 판매한 AI 스타트업을 상대로 뉴욕 법원에 소송을 제기했다.
그런데 같은 시기 다른 한쪽에서는 정반대의 흐름이 거세게 진행 중이다. 음성 AI 스타트업 일레븐랩스(ElevenLabs)는 2026년 2월 111억 달러(약 15조원) 기업가치로 5억 달러를 추가 유치했고, 연환산매출(ARR)은 같은 해 4월 기준 5억 달러를 돌파했다 — 불과 1년 전 3억 3천만 달러였던 것과 비교하면 폭발적인 성장이다. 포춘 500대 기업 중 41%가 이미 이 회사의 서비스를 쓰고 있고, 그중에서도 기업교육·이러닝 내레이션은 핵심 사용처 중 하나로 꼽힌다. 성우들은 소송을 제기하고, 기업은 AI 목소리에 15조원 가치를 매긴다 — 저작도구로 강의 콘텐츠를 만드는 교육 담당자라면 이 모순된 두 흐름 사이에서 실용적인 판단을 내려야 하는 상황에 놓여 있다.
이 글은 그 판단을 위해 세 가지 축을 검증한다. 첫째는 기술적 완성도 — AI 보이스오버가 실제로 사람 성우와 구분이 안 될 만큼 좋아졌는지를 학습 효과 데이터로 확인한다. 둘째는 법적·윤리적 리스크 — 목소리를 둘러싼 저작권·초상권 제도가 한국과 해외에서 각각 어떻게 재정비되고 있는지를 살펴본다. 셋째는 실무적 판단 기준 — 결국 교육 콘텐츠 제작 현장에서 AI 음성과 사람 음성 중 무엇을, 언제, 어떻게 써야 하는지에 대한 구체적 가이드를 제시한다.
🕰️ TTS 내레이션 기술은 어떻게 여기까지 왔나
합성음성(TTS, Text-to-Speech) 기술 자체는 새로운 것이 아니다. 기계적인 로봇 음성으로 시작해 2010년대 딥러닝 기반 음성합성이 등장하면서 억양·감정 표현이 크게 개선됐고, 2020년대 들어 소량의 샘플만으로 특정인의 목소리를 복제하는 '음성 클로닝(voice cloning)' 기술이 상용화됐다. 이 흐름의 정점에 있는 것이 일레븐랩스 같은 최신 생성형 음성 AI로, 200개 이상의 목소리·35개 언어를 지원하는 머프(Murf), 500개 이상의 목소리·100개 이상 언어를 지원하는 로보(LOVO) 같은 경쟁 서비스도 기업교육 시장을 정조준하고 있다. 업계 평가로는 2026년 현재 튜토리얼·강의·워크스루·설명 영상 같은 이러닝 콘텐츠의 90%에서 AI TTS가 전문 성우 내레이션과 기능적으로 동등한 수준에 도달했다는 분석까지 나온다. 기술적 완성도가 임계점을 넘어서면서 논쟁의 초점도 "AI 목소리가 쓸 만한가"에서 "AI 목소리를 누구의 동의 아래, 어떤 방식으로 쓸 것인가"로 옮겨간 것이다.
💻 왜 지금 이러닝 저작도구의 핵심 기능이 됐는가 — 원인 분석
저작도구(오소링툴) 시장에서 AI 보이스오버가 필수 기능으로 자리 잡은 데는 세 가지 구조적 요인이 겹쳐 있다.
첫째는 압도적인 비용 격차다. 전문 성우를 섭외해 스튜디오에서 녹음하면 분당 수만 원 단위의 비용이 들고, 대본 수정이 생길 때마다 재녹음 일정을 다시 잡아야 한다. 반면 AI TTS 서비스는 월 몇 천 원대의 구독 요금으로 시작할 수 있고, 대본을 고치면 몇 초 만에 새 오디오가 나온다. 둘째는 다국어 대응이다. 한 대형 기술기업 사례에서는 AI 기반 영상 로컬라이제이션으로 비용을 최대 86% 절감했고, 다른 워크플로 전환 사례에서는 40~60%의 비용 절감이 보고됐다. 신용카드사의 한 사례는 이러닝 콘텐츠를 2개 언어에서 13개 언어로 확장하면서도 제작 기간을 단축했다. 성우를 언어별로 각각 섭외하는 대신, 같은 대본을 여러 언어의 TTS 목소리로 즉시 변환할 수 있기 때문이다. 셋째는 일관성이다. 여러 모듈에 걸쳐 여러 성우가 녹음하면 톤이 미묘하게 달라지지만, AI 목소리는 수백 개 모듈에 걸쳐 동일한 톤·발음·속도를 유지한다 — 특히 규정·컴플라이언스 교육처럼 방대한 분량을 일관되게 제작해야 하는 콘텐츠에서 이 특성이 두드러진 장점으로 꼽힌다. 넷째는 반복 수정에 대한 내성이다. 강의 콘텐츠는 법·제도 변경, 제품 스펙 업데이트 등으로 대본이 자주 바뀌는데, 성우 녹음 방식에서는 한 문장만 바뀌어도 스튜디오 일정을 다시 잡아야 하는 반면 AI TTS는 해당 문장만 즉시 재생성하면 끝난다. 이 네 가지 요인이 겹치면서, 과거에는 "예산이 부족할 때 쓰는 대체재"로 여겨지던 AI 보이스오버가 이제는 저작도구의 1급 시민 기능으로 격상된 것이다.
📊 학습 효과, 데이터로는 어떻게 나오는가
그렇다면 학습자 입장에서 AI 목소리와 사람 목소리는 실제로 얼마나 다르게 받아들여질까. 연구 결과는 단순하지 않다. 한 실험 연구는 AI 생성 강사와 실제 강사, 인간 음성과 합성 음성을 비교했을 때 동기부여나 지식 습득에 직접적인 차이는 발견하지 못했지만, AI 강사가 인간 강사보다 '인간다움'이 낮게 지각된다는 매개 효과는 확인했다. 반면 다른 분석에 따르면 사람이 내레이션한 콘텐츠는 최대 30% 높은 정보 유지율을 보였고, 강사의 목소리에 열정이 담겨 있을 때 학습자는 사회적 유대감을 더 높게 평가하고 전이 학습 평가에서도 더 나은 성과를 냈다. 브랜드 광고 영역에서도 사람이 내레이션한 광고가 AI 음성 광고보다 회상률이 22% 높다는 조사가 있다.
| 비교 항목 | AI TTS 내레이션 | 사람 성우 내레이션 |
|---|---|---|
| 제작 비용 | 월 구독료 수준(수천~수만 원) | 분당 단가 + 스튜디오 대관 비용 |
| 수정 대응 속도 | 대본 수정 즉시 재생성(초 단위) | 재녹음 일정 재조율 필요(일 단위 이상) |
| 다국어 확장 | 언어별 목소리 즉시 전환 | 언어별 성우 개별 섭외 필요 |
| 정보 유지율(감성 콘텐츠 기준) | 기준 대비 최대 30% 낮음(연구에 따라 편차) | 상대적으로 높음(리더십·스토리텔링 교육 등) |
| 일관성(대규모 모듈) | 수백 모듈에서도 동일 톤 유지 | 성우·세션에 따라 미묘한 편차 발생 가능 |
결국 연구를 종합하면 "고품질 AI 음성이 자연스럽게 들릴 정도라면 정보 전달 자체는 사람 목소리와 큰 차이가 없지만, 저품질 합성 음성은 티가 나고 주의를 분산시킨다"는 결론과 "감성적 유대·열정이 중요한 콘텐츠에서는 여전히 사람 목소리가 우위"라는 결론이 공존한다. 즉 콘텐츠의 성격(사실 전달형 vs 동기부여형)에 따라 최적의 선택이 달라진다는 뜻이다.
이 수치를 절차·컴플라이언스 교육에 그대로 대입해서는 안 된다. 위 연구들은 대체로 리더십·스토리텔링처럼 정서적 몰입이 필요한 콘텐츠를 대상으로 했고, 매뉴얼을 읽어주는 수준의 절차 교육에서는 격차가 훨씬 좁혀지거나 거의 사라진다는 점이 함께 보고된다. 다시 말해 "AI 음성이 열등하다"는 단순한 결론이 아니라, "콘텐츠 유형에 따라 격차의 크기 자체가 달라진다"는 것이 데이터가 보여주는 실제 그림이다.
🔍 국내외 실무 사례 — 성우 소송부터 노조 협상까지
사례 1 — 서울교통공사 지하철 안내방송 논란 (한국, 의혹·해명). 투병 중인 성우의 목소리가 동의 없이 AI 학습에 쓰였다는 의혹이 제기됐고, 공사 측은 사실이 아니라고 공식 해명했다. 진위와 별개로, 대중이 익숙한 공공 음성에서까지 AI 도용 가능성을 의심하게 됐다는 점 자체가 신뢰의 문제로 번진 사례다.
사례 2 — 일본 성우 저작권 침해 논란 (일본, 진행 중). 일본 성우들이 자신의 목소리가 동의 없이 AI 학습에 활용됐다며 저작권 침해를 주장하고 나섰다. 성우의 목소리가 오랜 경력을 통해 쌓은 '자산'이라는 인식이 국경을 넘어 공통적으로 확산되고 있음을 보여준다.
사례 3 — 베브 스탠딩·리니아 세이지 소송 (미국, 법정 다툼). 2025년 7월 두 전문 성우가 자신들의 목소리 샘플로 학습된 합성 음성 모델을 제3자에게 판매한 AI 스타트업을 상대로 뉴욕에서 소송을 제기했다. 정체성·동의·통제권이라는 새로운 법적 쟁점을 정면으로 제기한 사건으로 꼽힌다.
사례 4 — SAG-AFTRA와 포트나이트 제작사 분쟁 (미국, 노동쟁의). 2025년 5월 미국 배우·방송인 노조 SAG-AFTRA는 포트나이트 제작사가 노조와 사전 협의 없이 AI 다스베이더 음성을 도입했다며 부당노동행위 구제 신청을 냈다 — 유족 측이 이미 목소리 사용권을 라이선스했음에도 불구하고, 노조와의 사전 협상 절차 자체가 문제로 지적됐다.
사례 5 — SAG-AFTRA·니켈로디언 합의 (미국, 협상 타결). 반대로 2025년 5월 SAG-AFTRA는 니켈로디언과 AI 관련 보호 조항을 대폭 강화한 잠정 합의를 이끌어냈다. 대립만이 아니라 협상을 통한 절충 모델도 함께 존재한다는 점을 보여주는 사례다.
다섯 사례를 나란히 놓고 보면 공통된 패턴이 드러난다. 분쟁이 격화된 경우는 예외 없이 '사전 동의·사전 협의 절차의 부재'가 발단이었고, 반대로 협상이 타결된 경우는 '노조·권리자와의 사전 협의'가 있었던 경우다. 즉 AI 보이스오버 자체가 갈등의 근본 원인이라기보다, 그것을 도입하는 절차의 투명성이 갈등 여부를 가르는 결정적 변수였다는 뜻이다.
⚖️ 저작권법은 어떻게 대응하고 있나 — 한국 vs 미국
기술이 앞서가는 사이 법 제도도 빠르게 움직이고 있다. 한국은 2026년 3월 개정 저작권법을 통해 성우의 동의 없이 목소리를 AI 학습에 사용하거나 상업적으로 활용하는 행위를 금지했고, 위반 시 최대 3년 이하 징역 또는 3천만 원 이하 벌금이라는 형사처벌 조항까지 뒀다. 미국에서는 접근 방식이 조금 다르다. 테네시주는 2024년 'ELVIS 법(Ensuring Likeness Voice and Image Security Act)'을 시행해 목소리 자체를 법적 보호 대상에 포함시켰고, 캘리포니아는 AB 2602 등 일련의 법안으로 AI 목소리 배우의 권리를 규정해 모델 학습이나 합성 음성 출시 전 명시적이고 사전 고지된 서면 동의를 요구한다. 두 나라 모두 방향은 같다 — "목소리도 초상권·저작권에 준하는 보호를 받아야 한다"는 원칙이 국경을 넘어 빠르게 표준화되고 있는 것이다.
| 구분 | 한국(2026년 개정 저작권법) | 미국(ELVIS 법 + 노조 협약) |
|---|---|---|
| 보호 대상 | 성우 등 개인의 목소리 | 목소리·초상 등 퍼블리시티권 전반 |
| 핵심 요건 | AI 학습·상업적 이용 시 동의 필수 | 모델 학습·합성 음성 출시 전 서면 동의 |
| 위반 시 제재 | 최대 징역 3년 또는 벌금 3천만원 | 주(州)별 민사소송·노조 협약 위반 제재 |
| 적용 범위 | 전 국민 목소리(성우 한정 아님) | 주로 배우·성우 등 직업적 목소리 |
🧭 전문가·업계의 시각은 어떻게 갈리는가
💡 업계·투자자의 시각 — 일레븐랩스는 기업 매출이 전년 대비 200% 성장했고, 2025년 12월 기준 매출의 절반이 이미 기업(엔터프라이즈) 수요에서 나온다고 밝혔다. 콜센터·마케팅·교육 등 전방위로 확산되는 이 흐름을 두고 업계는 "품질이 사람 목소리와 구분이 안 될 만큼 좋아졌다"는 점을 핵심 근거로 내세운다.
💡 성우·노조의 시각 — SAG-AFTRA는 포트나이트 사례에서 "이미 라이선스를 받은 목소리라도 노조와의 사전 협의 없이 AI로 대체하는 것은 부당노동행위"라고 규정했다. 목소리는 단순한 오디오 데이터가 아니라 배우 개인의 정체성이자 생계 수단이라는 게 이들의 핵심 논리다.
💡 연구자의 시각 — 실험 연구는 "AI 강사가 인간 강사보다 인간다움이 낮게 지각된다"는 결과와 "동기부여·지식습득에는 직접적 차이가 없다"는 결과를 동시에 제시한다. 즉 연구자들은 "AI 음성 자체가 학습을 방해하지는 않지만, 사회적 유대라는 별도 차원에서는 여전히 차이가 존재한다"는 절충적 결론에 무게를 둔다.
세 시각의 공통분모는 "품질은 이미 임계점을 넘었다"는 사실 인정이다. 차이는 그 다음 지점에서 갈린다 — 업계는 비용·속도라는 효율을, 노조는 동의·생계라는 권리를, 연구자는 유대감이라는 정성적 학습 효과를 각각 최우선 순위에 둔다.
⚠️ "결국 저품질이면 학습을 방해한다" — 반론과 한계
AI 보이스오버 옹호론에 대한 가장 실질적인 반박은 품질 문제다. 연구에 따르면 저품질 합성 음성은 누구나 즉시 알아채고, 그 어색함 자체가 콘텐츠 몰입을 방해해 오히려 학습 효과를 떨어뜨린다. 이는 "AI TTS가 무조건 저렴하고 효율적"이라는 단순화된 주장에 중요한 단서를 붙인다 — 저렴한 저품질 TTS를 쓰면 비용은 아끼지만 학습 효과라는 더 중요한 목표를 놓칠 수 있다는 뜻이다.
두 번째 한계는 콘텐츠 유형의 문제다. 사실 전달이 핵심인 절차 교육·컴플라이언스 교육에서는 AI 음성의 약점이 두드러지지 않지만, 리더십 교육이나 동기부여가 필요한 스토리텔링형 콘텐츠에서는 인간 내레이션이 여전히 우위를 보인다는 연구 결과가 있다. 셋째, 법적 리스크도 완전히 해소된 게 아니다. 한국의 2026년 개정 저작권법처럼 목소리 보호가 강화되는 흐름 속에서, 동의 절차를 소홀히 한 채 특정인의 목소리를 복제해 쓰다가는 형사처벌까지 받을 수 있다는 점은 "비용 절감"이라는 장점을 상쇄할 수 있는 실질적 리스크다. 넷째, "인간 내레이션이 30% 더 효과적"이라는 수치를 모든 콘텐츠에 일괄 적용하는 것도 또 다른 형태의 과장이다. 앞서 데이터 섹션에서 확인했듯 이 격차는 감성적 몰입이 필요한 콘텐츠에 국한된 결과이며, 절차형 교육에까지 기계적으로 적용하면 오히려 불필요하게 비용만 늘리는 결과를 낳는다.
🗺️ 저작도구 담당자를 위한 실전 가이드
- 1. 콘텐츠 성격별로 내레이션 방식을 나눈다. 절차·규정·컴플라이언스처럼 사실 전달이 핵심인 모듈은 AI TTS를, 리더십·조직문화처럼 감성적 공감이 필요한 모듈은 사람 내레이션을 우선 배치한다.
- 2. 품질 검수 없이 저품질 TTS를 그대로 배포하지 않는다. 저품질 합성 음성이 오히려 학습을 방해한다는 연구 결과를 감안해, 최소 한 차례 사람이 직접 듣고 자연스러움을 확인하는 절차를 둔다.
- 3. 다국어 확장이 필요한 콘텐츠부터 AI TTS를 우선 적용한다. 언어별 성우 섭외 부담이 가장 큰 영역에서 비용·시간 효율이 가장 크게 나타난다.
- 4. 특정 성우의 목소리를 복제한 커스텀 보이스를 쓰려면 동의 범위를 문서로 남긴다. "AI 학습·재사용까지 포함한 동의인지"를 계약서에 명시해 법적 분쟁 소지를 없앤다.
- 5. 저작권법 개정 동향을 주기적으로 확인한다. 한국의 2026년 개정처럼 목소리 보호 범위가 계속 넓어지는 추세이므로, 도입 시점의 법 조항만 보고 안심하지 않는다.
🤖 TTS 저작도구 선택 시 체크리스트
- 이 서비스의 목소리가 특정 실존 인물의 동의를 받아 만들어졌는지, 라이선스 조건은 무엇인지.
- 지원 언어·목소리 수가 실제로 필요한 다국어 확장 범위를 충족하는지.
- 대본 수정 시 재생성 속도와 발음·억양 커스터마이징(용어 사전 등록 등) 기능을 제공하는지.
- 기업(엔터프라이즈) 데이터 처리 정책 — 업로드한 대본·음성 샘플이 다른 목적으로 재학습되지 않는지.
- 저품질 구간을 걸러낼 수 있는 미리듣기·검수 워크플로가 저작도구 내에 통합돼 있는지.
❓ 자주 묻는 질문
Q1. AI 목소리가 성우를 완전히 대체하게 될까?
현재 데이터로는 "완전 대체"보다 "역할 분화"에 가깝다. 사실 전달형 콘텐츠는 AI TTS로, 감성적 유대가 중요한 콘텐츠는 사람 내레이션으로 나뉘는 흐름이 뚜렷하다.
Q2. 우리 회사 저작도구에 AI TTS를 쓰면 저작권 문제가 생기나?
범용 AI 목소리(특정인을 복제하지 않은 목소리)를 쓰는 경우는 법적 리스크가 낮다. 다만 특정 성우·인물의 목소리를 복제한 커스텀 보이스를 쓸 경우, 한국 2026년 개정 저작권법상 해당 인물의 명시적 동의가 필요하다.
Q3. AI 음성으로 만든 콘텐츠가 학습 효과 면에서 사람 목소리보다 떨어지나?
품질에 따라 다르다. 고품질 AI 음성은 사람 목소리와 정보 전달 면에서 큰 차이가 없지만, 감성적 유대·동기부여가 중요한 콘텐츠에서는 사람 내레이션이 최대 30% 높은 정보 유지율을 보인다는 연구가 있다.
Q4. 다국어 교육 콘텐츠를 만들 때 AI TTS가 특히 유리한 이유는?
언어별로 성우를 개별 섭외할 필요 없이 같은 대본을 여러 언어 목소리로 즉시 전환할 수 있어, 실제 사례에서 40~86%의 비용 절감이 보고됐다.
Q5. 성우들은 왜 AI 보이스오버 확산에 반발하는가?
목소리를 개인의 정체성이자 생계 수단으로 보기 때문이다. 미국 SAG-AFTRA의 부당노동행위 신청 사례처럼, 이미 합법적으로 라이선스된 목소리라 해도 노조와의 사전 협의 절차 없이 AI로 대체하는 관행 자체를 문제 삼는 경우도 있다.
Q6. 국가별로 목소리 보호 법이 어떻게 다른가?
한국은 2026년 개정 저작권법으로 전 국민의 목소리를 AI 무단 학습·상업적 이용으로부터 보호하며 형사처벌까지 규정한다. 미국은 테네시주 ELVIS 법처럼 주(州) 단위 입법과 SAG-AFTRA 같은 노조 협약이 함께 작동하는 구조다.
Q7. 저작도구에서 AI TTS를 도입할 때 가장 먼저 무엇을 정해야 하나?
전체 콘텐츠를 AI로 일괄 전환하기보다, 콘텐츠 성격별(사실 전달 vs 감성·동기부여)로 내레이션 방식을 구분하는 기준부터 세우는 것이 우선이다.
💡 결론 — AI 보이스오버는 '전면 대체'가 아니라 '용도별 선택'의 문제다
지금까지 살펴본 데이터는 하나의 원칙으로 수렴한다 — AI 보이스오버는 비용·속도·다국어 확장성에서 이미 성우를 압도하는 영역이 명확히 존재하지만, 감성적 유대와 동기부여가 중요한 콘텐츠에서는 사람의 목소리가 여전히 우위를 갖는다. 여기에 목소리 보호를 위한 법 제도가 빠르게 강화되고 있다는 변수까지 더해지면서, 교육 담당자에게 필요한 것은 "AI냐 사람이냐"라는 양자택일이 아니라 콘텐츠 목적에 맞춰 두 방식을 조합하는 설계 역량이다.
NUGUNA의 저작도구는 이런 관점에서, 콘텐츠 제작자가 필요에 따라 내레이션 방식을 유연하게 선택할 수 있는 구조를 지향한다. 자체 콘텐츠에 AI 보이스오버를 어떻게 적용할 수 있을지 궁금하다면 저작도구 소개와 체험판을 먼저 살펴보고, 구체적인 도입 방안이 필요하다면 상담을 신청해보길 권한다.
📎 출처
- Voiceovernews.com, "Voice Actors Sue Over AI Clones in Landmark Lawsuit" (2025)
- SAG-AFTRA, Artificial Intelligence 공식 자료
- 서울경제, "투병 성우 목소리, 동의 없이 AI 학습?…서울교통공사 '사실 아냐' 해명"
- 이데일리 마켓인, "AI가 내 목소리 무단 복제…日성우들 저작권 침해 논란"
- 이코리아, "'AI 목소리 도용'에 뿔난 게임 성우들, 법적 문제는?"
- TechCrunch, "ElevenLabs raises $500M from Sequoia at a $11 billion valuation" (2026)
- Welocalize, "AI-Powered Localization for Cost-Effective Global E-Learning"
- LanguageLine, "Case Study: A Major Credit Card Company Scaled eLearning 6x with Machine Translation and Post Editing"
- Academia.edu, "Real versus AI-generated instructors and human versus synthetic voices in educational videos" (연구 논문)


