확산 언어모델(Diffusion LLM)로 유명한 인셉션 랩스(Inception Labs) 기존 LLM의 약점으로 꼽혀온 느린 응답 속도와 높은 비용 문제를 개선한 새 모델을 선보였다.

인셉션은 8일(현지시간) 생성 품질을 크게 높이면서도 초저지연·저비용 특성을 유지한 ‘머큐리 2.5(Mercury 2.5)’를 공개했다.

머큐리 2.5가 현재까지 출시된 가장 뛰어나며 가장 큰 규모의 확산 LLM이라는 점을 강조했다. 이전 버전인 머큐리 2보다 지능 성능이 40% 향상됐다. 비용 효율성이 중요한 경량급 프론티어 모델 'GPT-5.6 루나' '제미나이 3.5 플래시 라이트' '클로드 하이쿠 4.5' 등과 비교할 수 있는 수준이라는 설명이다.

또 널리 사용되는 엔비디아 GPU에서 초당 1107토큰을 생성할 수 있으며, 최대 26만 토큰의 컨텍스트를 지원해 실시간 대화나 대용량 데이터 처리에 최적화돼 있다.

가격 경쟁력도 강조했다. 정식 가격은 입력 토큰 100만개당 0.20달러, 출력 토큰 100만개당 0.75달러다. 출시 초기에는 80% 할인된 입력 0.04달러, 출력 0.15달러에 제공된다. 조절 가능한 추론 기능과 병렬 도구 호출, 스키마에 맞춘 JSON 출력도 지원한다.

머큐리 2 출시 이후 수천명의 개발자가 모델을 활용했으며 수십개 기업이 실제 서비스에 적용했다고 밝혔다. 검색, 음성, 코딩 등 지연시간에 민감한 작업에서 얻은 실제 사용 데이터와 고객 피드백, 서비스 장애 사례를 모델 평가와 학습에 반영한 것이 머큐리 2.5의 핵심 개발 과정이었다는 설명이다.

특히 검색 서비스에서는 한 번의 검색 요청을 처리하기 위해 검색 계획 수립, 질의 재작성, 결과 재순위화, 정보 구조화, 출처 요약, 답변 검증 등 수십 차례의 모델 호출이 발생할 수 있다. 머큐리 2.5는 이러한 반복 호출을 하나의 사용자 상호작용 안에서 처리할 수 있을 정도로 빠른 응답 속도를 제공한다.

음성 분야에서는 지연시간이 더 중요하다. 실시간 고객 통화를 처리하는 AI 전화 에이전트 업체 오픈콜(OpenCall)은 실제 운영 환경에서 머큐리를 사용한 결과 모델 응답 지연시간의 중앙값을 약 170밀리초(ms)까지 낮췄다고 밝혔다. 코딩 에이전트 분야에서도 여러 모델이 계획 수립, 코드 작성, 도구 검색, 상태 요약 등의 작업을 분담하기 때문에 호출 횟수가 많아질수록 속도와 비용 차이가 누적된다.

코딩 플랫폼 어그먼트 코드(Augment Code)는 머큐리를 컨텍스트 압축과 모델 라우팅, MCP 도구 검색 등에 활용하고 있다. 컨텍스트 압축 작업을 머큐리로 전환하면서 처리 지연시간을 약 150초에서 27초로 82% 줄였고, 품질을 유지하면서 비용도 90% 절감했다고 소개했다.

머큐리 2.5와 함께 음성 에이전트에 최적화한 ‘머큐리 보이스(Mercury Voice)’와 여러 AI 모델 가운데 품질·속도·비용 조합이 가장 적합한 모델로 요청을 자동 배분하는 ‘머큐리 라우터(Mercury Router)’의 프리뷰도 공개했다.

머큐리 모델은 인셉션 API와 베이스텐(Baseten), 오픈라우터(OpenRouter)를 통해 이용할 수 있다. 기업용 배포에는 전용 용량, 자동 확장, 규정 준수 제어, 데이터 보존 기간 설정 등의 기능이 제공된다.

박찬 기자 cpark@aitimes.com