구글이 음성 기반 AI의 실용성을 한 단계 끌어올린다. 새로운 음성 인식 모델을 통해 소음과 전문용어가 섞인 환경에서도 정확도를 높이는 동시에, 사용자의 말실수와 자체 수정까지 이해해 자연스럽게 정리된 텍스트로 변환하는 기능을 선보였다.
구글은 26일(현지시간) 실시간 음성 인식과 지능형 음성 상호작용에 특화된 AI 모델 ‘제미나이 3.5 트랜스크라이브(Gemini 3.5 Transcribe)’를 공개했다.
단순히 음성을 텍스트로 변환하는 것을 넘어 사용자의 자연스러운 말투와 문맥을 이해하고, 말실수와 자기수정, 추임새까지 자동으로 정리해 바로 활용할 수 있는 형태의 텍스트로 변환하는 것이 핵심이다.
기존 음성인식 모델이 취약했던 배경 소음과 전문 용어, 불완전한 문장, 반복적인 자체 수정 등을 정교하게 처리하도록 설계됐다. 사용자가 “화요일에 만나자, 아니 수요일”이라고 말하면, 최종 의도를 반영해 자연스러운 문장으로 정리한다. ‘음’, ‘아’와 같은 추임새를 제거하고 문장부호와 서식도 자동으로 적용해 별도의 편집 없이 사용할 수 있도록 했다.
정확도도 크게 향상됐다. 아티피셜 애널리시스 측정에서 제미나이 3.5 트랜스크라이브는 스트리밍 환경에서 4.0%의 단어 오류율(WER), 비스트리밍 환경에서는 2.6%를 기록했다. 이전 음성인식 모델인 ‘처프 3(Chirp 3)’과 비교하면 최종 텍스트가 완성되는 시간도 약 70% 단축됐다. 우편번호나 주문번호처럼 숫자와 문자가 섞인 정보도 실제 소음 환경에서 정확하게 인식할 수 있도록 개선됐다.
언어 지원 범위도 넓혔다. 85개 이상의 언어와 다양한 지역 억양 및 방언을 자동으로 인식하며, 사용자가 고유명사나 기술 전문용어 등 특정 어휘를 직접 추가할 수 있는 사용자 지정 어휘 기능도 제공한다. 사전 녹음된 음성에서는 최대 3명의 화자를 구분하고 발화 시간 정보까지 표시할 수 있어 회의록이나 통화 분석 등에 활용할 수 있다.
개발자는 두 가지 방식으로 모델을 이용할 수 있다. ‘gemini-3.5-transcribe-live’를 사용하는 실시간 스트리밍 API는 양방향 음성 데이터를 1초 미만의 지연으로 처리해 음성 에이전트나 실시간 자막 서비스 구축에 적합하다. 녹음된 회의나 통화 데이터를 처리하는 API는 화자 구분과 단어 단위 타임스탬프를 지원한다.
구글은 이미 제미나이 3.5 트랜스크라이브를 서비스 곳곳에 적용하고 있다. 안드로이드용 지보드의 ‘램블러’ 기능에서는 사용자가 생각을 말하면 추임새를 제거하고 정돈된 텍스트로 변환하며, 음성만으로 오탈자를 수정하거나 문체를 변경할 수 있다. 구글 AI 스튜디오에서는 음성으로 애플리케이션을 개발할 수 있고, 맥OS용 제미나이 앱에서는 화면과 대화 맥락을 함께 이해해 파일 요약, 텍스트 재작성, 이미지 생성 등의 작업을 음성 명령으로 실행할 수 있다.
앞으로 크롬에서도 웹페이지의 입력창에 음성으로 글을 입력하는 기능이 제공될 예정이다.
구글은 음성 인식 기술을 제미나이 라이브의 에이전트 기능과 결합하는 데에도 힘을 싣고 있다. '제미나이 라이브'에는 복잡한 작업을 자동으로 수행하는 에이전트 ‘스파크(Spark)’가 통합돼 사용자가 자연어로 여러 단계의 작업을 지시할 수 있다. 이동 중 떠오른 아이디어를 말하면, 스파크가 이를 정리해 구글 문서에 개요를 작성하거나 가족 식단을 계획하고 관련 장보기 목록을 만드는 작업을 백그라운드에서 처리할 수 있다.
‘데일리 브리프(Daily Brief)’도 제미나이 라이브에 통합됐다. 사용자가 “오늘 일정이 어떻게 돼”라고 물으면 지메일과 캘린더의 정보를 바탕으로 당일 주요 일정을 음성으로 요약해 준다. 이메일도 음성만으로 검색·요약하고 중요 표시, 보관, 삭제 등을 수행할 수 있다.
여기에 ‘퍼스널 인텔리전스(Personal Intelligence)’를 통해 과거 대화와 지메일, 사진, 검색, 유튜브 등 구글 서비스의 데이터를 연결할 수 있도록 했다. 이에 따라 사용자가 이전 대화에서 언급한 정보나 과거에 찾았던 자료를 다시 묻더라도 별도의 설명 없이 맥락을 이어받아 답변하고 작업을 수행할 수 있다.
다만 구글이 ‘스파크’, ‘데일리 브리프’ 등 AI 기능을 각각 별도의 브랜드와 화면으로 구분한 점은 사용자 경험 측면에서 복잡성을 키울 수 있다는 지적도 나온다. 사용자가 어떤 기능을 선택해야 하는지 고민하기보다 하나의 대화창에서 요청하면 AI가 적절한 도구와 에이전트를 자동으로 선택하는 방식이 더 직관적이라는 분석이다.
박찬 기자 cpark@aitimes.com