기사를 읽어드립니다.

(사진=구글)
(사진=구글)

구글이 실시간 음성 대화 중에도 추론과 도구 실행을 이어갈 수 있는 새로운 음성 AI 모델 2종을 공개했다. 음성 입력에 답하는 수준을 넘어 시각적 맥락을 이해하고 복잡한 작업을 수행하면서도 대화의 흐름을 유지하는 것이 핵심이다. 

구글은 15일(현지시간) 실시간 추론 기능을 강화한 음성 대화형 AI 모델 ‘제미나이 3.8 라이브(Gemini 3.8 Live)’와 ‘제미나이 3.8 라이브 익스텐디드 싱킹(Gemini 3.8 Live Extended Thinking)’을 공개했다.

두 모델을 지금까지 선보인 실시간 대화형 AI 가운데 가장 진보된 제품군으로 소개하며, 음성 대화와 추론, 도구 실행을 하나의 흐름으로 결합했다고 밝혔다.

제미나이 3.8 라이브는 대규모 서비스와 비용 효율성에 초점을 맞춘 모델이다. 사용자의 음성뿐 아니라 카메라나 화면 등을 통해 전달되는 시각적 정보를 거의 실시간으로 처리해 대화에 반영한다. 또 API와 도구 호출을 백그라운드에서 실행하면서 작업이 끝날 때까지 사용자와 대화를 계속할 수 있다.

특히 97개 언어를 자동으로 감지하고 대화 도중 언어를 전환할 수 있다. 음성 기반 AI에서 자주 발생하는 인증번호나 청구번호 등 문자·숫자 정보 처리 능력도 강화했다. 사용자 선호도 평가인 ‘스피치 에이전트 아레나(Speech Agent Arena)’에서 2위를 기록했다.

고난도 작업에는 제미나이 3.8 라이브 익스텐디드 싱킹이 활용된다. 이 모델은 대화와 추론을 동시에 수행하면서 다단계 작업을 처리한다.

사용자가 요청하면 “확인해 볼게요”와 같은 음성으로 즉시 반응한 뒤 백그라운드에서 작업을 진행하고, 처리 과정도 음성으로 설명한다.

성능 평가에서는 아티피셜 애널리시스의 '음성 대 음성 품질 지수(Speech to Speech Quality Index)'에서 82.6점을 받아 전체 1위를 기록했다. 에이전트 작업 수행 능력을 평가하는 '타우(τ)-보이스'에서는 68.6%, 시에라의 '타우-보이스-뱅킹 벤치마크'에서는 35.1%를 기록했으며, 음성 기반 추론 평가인 '빅 벤치 오디오'에서는 97.7%의 점수를 받았다.

음성 대 음성 품질 지수 (사진=아티피셜 애널리시스)
음성 대 음성 품질 지수 (사진=아티피셜 애널리시스)

두 모델은 구글의 음성 AI를 실제 업무용 에이전트로 확대하는 데도 초점이 맞춰졌다. 개발자는 제미나이 API와 구글 AI 스튜디오를 통해 모델을 사용할 수 있으며, 기업용 서비스에서는 제미나이 엔터프라이즈 등에 적용된다. 서치 라이브(Search Live)와 제미나이 라이브(Gemini Live), 지메일·독스·킵 등에서도 음성 중심 기능을 확대할 예정이다.

개발자 생태계에서는 아고라, 피시잼, 랭체인, 라이브킷, 파이프캣, 버셀, 비전 에이전트 등이 제미나이 라이브 API를 지원한다. 세일즈포스, 겐스파크, 루메리스 등과도 협력해 음성 기반 업무 자동화와 에이전트 개발을 추진한다.

구글은 두 모델에서 생성되는 음성에 보이지 않는 ‘신스ID(SynthID)’ 워터마크를 적용해 AI 생성 음성을 식별할 수 있도록 했다. 이를 통해 음성 AI가 확대되는 과정에서 발생할 수 있는 허위정보 문제에 대응한다는 방침이다.

박찬 기자 cpark@aitimes.com