일레븐랩스 새 음성 AI, 감정 담아 말하고 0.1초 만에 응답한다

영어의 결과와 한국어의 결과가 달라서... 테스트를 좀 해봐야겠습니다.

쉬운 설명

음성 AI 전문 기업 일레븐랩스가 글자를 사람 목소리로 바꿔주는 새로운 AI 모델, '일레븐 v4'와 속도를 크게 높인 '일레븐 v4 터보'를 선보였습니다. 이전 모델이 문장을 또박또박 읽는 수준에 가까웠다면, 이번 모델은 대화의 앞뒤 맥락을 이해하고 웃거나 속삭이며 풍부한 감정을 담아 이야기할 수 있어요. 게다가 사용자의 말에 실시간으로 훨씬 빠르게 반응하는데요. 한마디로 로봇 목소리가 한층 더 '사람처럼 자연스러워지고', 대답도 '훨씬 빨라졌다'고 보시면 됩니다.

요약

일레븐랩스가 현지시간 28일, 차세대 음성 생성 모델인 '일레븐 v4'와 '일레븐 v4 터보'를 공식 발표했습니다. 이번 업그레이드의 핵심은 모델의 기본 뼈대(아키텍처)를 완전히 새롭게 설계했다는 점인데요. 기존 모델이 눈앞의 문장 하나를 읽는 데 집중했다면, 새 모델은 대화 전체의 흐름을 파악해 감정과 억양, 말하는 속도까지 스스로 조절합니다. 대본에 웃음, 속삭임, 문 닫히는 효과음 같은 연출 지시어를 넣을 수도 있고, 최대 1만 자에 달하는 긴 글을 읽을 때도 끝까지 목소리 톤이 흔들리지 않도록 다듬었어요. 목소리 복제 기능도 한 단계 발전해 단 10초짜리 짧은 녹음 파일만 있어도 목소리를 바로 복제할 수 있습니다.

특히 실시간 대화에 맞춰 개발된 '일레븐 v4 터보'의 반응 속도가 무척 인상적인데요. 평균 지연 시간이 약 100밀리초(ms), 첫 음성이 출력되기까지 걸리는 시간도 약 150밀리초에 불과합니다. 이는 경쟁 모델인 카르테시아의 '소닉 3.6'(262ms)이나 오픈AI의 'GPT-4o 미니 TTS'(814ms)보다 훨씬 빠른 수준이에요. 실제로 인공지능 평가 기관인 아티피셜 애널리시스의 TTS 아레나 평가에서 1319점을 받으며 전체 1위에 올랐고, 고객 서비스, AI 비서, 지식 전달, 엔터테인먼트 등 4개 전 부문에서 정상을 휩쓸며 음성 AI 기술의 새로운 기준을 세웠습니다.

활용 포인트

콘텐츠를 만드는 분들이라면 유튜브 내레이션, 오디오북, 팟캐스트를 제작할 때 큰 도움을 받을 수 있습니다. 대본 중간중간에 웃음이나 속삭임 같은 연출 태그를 넣어 훨씬 실감 나는 음성을 연출할 수 있거든요. 특히 최대 1만 자에 이르는 긴 분량에서도 화자의 목소리 톤이 유지되니, 여러 장으로 나뉜 긴 콘텐츠도 일관된 느낌으로 완성하기 좋습니다.

개발자나 서비스 기획자에게는 '일레븐 v4 터보'가 매력적인 선택지가 될 텐데요. API나 일레븐에이전트(ElevenAgents)를 활용해 실시간 음성 상담 봇, AI 비서, 콜센터 자동응답 시스템을 구축하면 응답 대기 시간을 획기적으로 줄일 수 있습니다. 거대언어모델(LLM)이 답변 텍스트를 완성하기 전부터 음성을 바로 내보내는 양방향 스트리밍 기술을 지원하기 때문에, 사용자가 느낄 수 있는 답답한 딜레이를 말끔히 없앨 수 있는 거죠.

학습자나 개인 창작자 입장에서는 10초 분량의 음성 샘플만으로 목소리를 복제하는 기능이 무척 흥미로울 텐데요. 본인 목소리를 짧게 녹음해 등록한 뒤, 한국어를 포함한 90개 이상의 다양한 언어로 내 목소리 콘텐츠를 만들어보는 색다른 실험도 가능합니다. 다만 목소리 복제 기술은 도용이나 초상권 침해 같은 문제가 생길 수 있으니, 반드시 본인 목소리나 정당하게 허락을 받은 음성으로만 안전하게 활용하시길 권해드립니다.

주의 사항

본문에 소개된 순위와 점수(TTS 아레나 1위, 1319점 등)는 평가 기관인 아티피셜 애널리시스가 발표 당시 측정한 결과입니다. 향후 다른 모델이 업데이트되거나 평가 기준이 바뀌면 순위가 달라질 수 있다는 점을 참고해 주세요. 또한 기존에 만들어둔 인스턴트나 프로페셔널 음성 복제 모델을 새 버전에서 쓰려면 다시 학습을 진행해야 하며, 가격이 텍스트 100만 자당 80달러로 경쟁 모델 대비 다소 높은 편이라는 점도 미리 고려하셔야 합니다. 요금제나 무료 체험 혜택 등은 언제든 달라질 수 있으니, 도입 전에는 꼭 일레븐랩스 공식 웹사이트에서 최신 정보를 확인해 보시는 게 좋습니다.

자체 검증

원문 기사와 대조해 검증한 결과, 본문에 담긴 핵심 수치들—일레븐 v4 터보의 평균 지연 시간 약 100ms, 첫 음성 출력 시간 약 150ms, 카르테시아 소닉 3.6의 262ms, GPT-4o 미니 TTS의 814ms, TTS 아레나 1위 1319점, 발음 견고성 91.7%, 가격 100만 자당 80달러, 생성 속도 초당 73.4자, 한국어를 포함한 90개 이상 언어 지원 등—은 원문에 적힌 사실과 정확히 일치하며 임의의 과장이나 왜곡 없이 작성했습니다. 아울러 원문에는 공개 날짜가 몇 월인지 없이 "28일(현지시간)"로만 나와 있어, 원문 표현을 그대로 살려 전달해 드립니다.

태그

#AI #음성AI #TTS #일레븐랩스 #텍스트음성변환 #AI음성복제 #생성형AI

원문

https://www.aitimes.com/news/articleView.html?idxno=215762

참고자료

일레븐랩스 공식 사이트

일레븐랩스 개발자 API 문서

← 새정보 전체 보기