기사를 읽어드립니다.
스페이스XAI는 18일(현지시간) 음성을 텍스트로 변환하는 새로운 음성 전사 모델 ‘그록 보이스 트랜스크라이브 2.0(Grok Voice Transcribe 2.0)’을 공개했다.
이를 두고 "현재 사용 가능한 변환 모델 중 가장 정확한 모델 중 하나"라고 강조했다. 실제 환경에서 수집한 다양한 음성 데이터를 바탕으로 전사 정확도를 크게 높였다는 설명이다.
그록 보이스 트랜스크라이브 2.0은 그록 음성 기능에 사용되는 오디오 기반 모델을 바탕으로 개발됐다. 기존 '그록 보이스'는 하루 수만건의 고객지원 통화를 처리하고, 수백만 시간에 달하는 영상 내레이션을 전사하는 데 활용되고 있다. 테슬라 차량의 그록 음성 비서와 같은 실제 제품의 음성 에이전트에도 적용되고 있다.
이번 모델은 깨끗한 음성 녹음뿐 아니라 실제 생활에서 발생하는 복잡한 음성 환경을 주요 대상으로 개발됐다. 전화 통화처럼 음질이 불안정한 환경이나 여러 사람이 동시에 말하는 상황, 지역별 억양, 전화번호와 이메일 주소를 읽는 음성 등을 학습했다.
특히 다국어 음성 전사 능력이 크게 향상됐다. 수십개 언어를 지원하며 음성을 분석하면서 언어를 자동으로 식별하고, 한 번의 처리 과정에서 대화 중 언어가 바뀌는 상황에도 대응한다.
짧은 차량 내 음성 명령처럼 언어를 판단할 수 있는 문맥이 부족한 환경에서는 단어 오류율(WER)이 기존 20.6%에서 6.8%로 낮아졌다.
기능도 다양하다. 녹음 파일이나 URL을 이용한 배치 전사(Batch Transcription)와 실시간 스트리밍 전사를 모두 지원하며, 각 단어의 시작과 종료 시점을 표시하는 단어 단위 타임스탬프와 신뢰도 점수를 제공한다. 여러 사람이 대화할 때는 화자를 구분하는 기능도 제공하며, 최대 8개 오디오 채널을 독립적으로 전사할 수 있다.
특정 제품명이나 전문용어처럼 정확하게 인식해야 하는 단어를 미리 입력하는 ‘핵심 용어 편향’ 기능도 제공한다. 숫자와 날짜, 통화, 전화번호, 이메일 주소 등을 읽기 편한 문자 형태로 변환할 수 있으며, ‘음’, ‘어’와 같은 불필요한 추임새를 제거하거나 음성 에이전트가 화자의 발언 종료 시점을 자동으로 판단하는 기능도 지원한다.
아티피셜 애널리시스 평가에서 32개 스트리밍 음성 전사 모델 가운데 정확도 기준 1위를 기록했다. 자체적으로 진행한 평가에서도 기존 '그록 보이스 트랜스크라이브 1.0'보다 고객지원 전화, 그록과의 대화, 계정 코드와 이메일 주소 등 음성으로 전달되는 정보, 짧은 다국어 음성 명령 등 4개 테스트 영역에서 모두 성능이 개선됐다.
실제 기업 활용 사례도 공개됐다. 영상 녹화·공유 서비스인 아틀라시안의 '룸(Loom)'에서는 기존 전사 솔루션보다 더 높은 정확도를 확인했다고 밝혔다. 이처럼 정확한 음성 전사가 확보되면 영상 속 음성을 코드 작업과 연결하는 등 새로운 AI 작업 흐름도 만들 수 있다. 예를 들어 룸으로 작업 계획을 음성으로 설명하면, 전사 결과를 코딩 에이전트에 전달해 실제 코드 수정으로 이어지게 할 수 있다는 것이다.
가격은 기존 모델과 동일하다. 배치 전사는 오디오 1시간당 0.10달러, 실시간 스트리밍 전사는 1시간당 0.20달러이며 화자 구분, 타임스탬프, 핵심 용어 기능이 추가 비용 없이 포함된다.
그록 보이스 트랜스크라이브 2.0은 앞으로 음성 전사 API의 기본 모델로 적용될 예정이다. 기존 그록 보이스 트랜스크라이브 1.0은 몇 주 안에 지원이 종료될 예정이며, 계속 사용하려는 개발자는 API에서 grok-voice-transcribe-1.0 모델을 직접 지정해야 한다.
박찬 기자 cpark@aitimes.com