기사를 읽어드립니다.

앤트로픽이 차세대 모델 라인업의 두 번째 주자인 '클로드 소네트 5.5(Claude Sonnet 5.5)'를 출시했다. 상장(IPO)을 준비 중인 앤트로픽이 기업용 시장에서의 주도권을 확고히 하기 위해 성능은 물론 효율성을 대폭 끌어올린 실용형 모델이라는 점이 특징이다.

28일(현지시간) 발표에 따르면, 소네트 5.5는 이전 세대인 '소네트 5' 대비 출력이 30% 이상 빨라졌으며, 압도적인 작업 처리 효율성 덕분에 동일 작업당 비용을 최대 30% 절감했다.

입력 토큰당 2달러, 출력 토큰당 10달러, 캐시 읽기 토큰당 0.2달러라는 기존 가격 정책을 유지하면서도, 작업을 완료하는 데 필요한 토큰 수와 도구 호출 횟수를 대폭 줄여 실질 단가를 크게 떨어뜨렸다.

하지만 성능은 최고 수준으로 끌어 올렸다. 가장 눈에 띄는 기술적 도약은 에이전트 코딩 능력이다.

터미널 환경의 복잡한 작업을 평가하는 '터미널벤치 4.0'에서 70.6%의 점수를 기록했다. 이는 전작인 소네트 5가 기록했던 10.3%를 무려 7배 이상 뛰어넘는 수치이며, 최상위 모델인 '오퍼스 5.5(66.4%)'마저 제친 기록이다. 

실제 에이전틱 개발 환경인 '커서벤치 4.0'에서도 55.5%를 달성해 플래그십 모델에 근접한 정교한 코드 생성 역량을 입증했다.

실무 지식 노동 및 이미지 이해 분야에서도 압도적인 성능을 드러냈다. 44개 직종의 업무 수행 능력을 측정하는 'GDPval-AA' 테스트에서 1844점을 기록해 소네트 5(1449점)를 약 400점 차이로 따돌렸고 오퍼스 5.5(1846점)와 대등한 수준에 도달했다. 

장기적인 작업 지점 추적과 시각 지능도 대폭 개선돼, 스크린샷 이미지 분석만으로 프롬프트 입력 없이 '포켓몬 레드' 게임을 끝까지 클리어한 최초의 소네트 모델이라는 타이틀도 얻었다.

아티피셜 애널리시스(Artificial Analysis)의 지능 종합 순위에서도 오퍼스 5.5(58점)에 이어 종합 2위(56점)에 올랐다. 이는 페이블 5.1과 'GPT-6 아스트라'(이상 53점)를 넘는 점수다. 

또 속도 및 비용 대비 지능 지수에서도 우수한 성적을 거두며, 동급 대비 최상위권의 가성비 지표를 기록했다. 특히 여러 도구 호출을 하나로 묶어 처리하는 방식으로 불필요한 검색이나 중간 질문을 대폭 줄였다는 평이다.

기업 현장의 초기 반응은 뜨겁다. 에픽게임즈의 다니엘 보겔 최고 운영책임자(COO)는 "소네트 5.5는 더 상위 모델에 기대할 만한 수준의 품질 기준을 충족하며, 시스템 설계 감사와 멀티아워 단위의 복잡한 게임플레이 아키텍처 작업을 완벽히 처리했다"고 밝혔으며, 베이스44의 가브리엘 그린버그 AI 엔지니어링 리드는 "118개 실제 앱 구축 테스트에서 기존 오퍼스 5 수준의 앱을 절반 수준의 반복 횟수(평균 3.6회)만으로 만들어냈다"고 평가했다.

안전성 면에서도 플래그십급 보호 조치가 적용됐다. 최고 수준의 사이버 보안 방어 및 탈옥 방지 시스템인 '보존된 사고(Preserved Thinking)' 기술이 소네트 라인업 최초로 탑재돼 모델 추론 방식의 무단 추출을 차단한다. 또 개발자 API 환경에서는 기존의 '생각 끄기' 설정이 폐지되고 도구 사용 간 추론을 유지하는 '비트윈 툴스(between_tools)' 모드가 새로 도입됐다.

소네트 5.5는 현재 클로드 플랫폼을 비롯해 아마존웹서비스(AWS) 베드록, 구글 클라우드, 마이크로소프트 애저에서 즉시 사용할 수 있다.

한편, 앤트로픽은 초고속·저비용 모델인 '클로드 하이쿠 5.5'도 몇주 안으로 출시해 5.5 제품군 라인업을 완성할 계획이다.

임대준 기자 ydj@aitimes.com