기사를 읽어드립니다.
같은 날 공개된 '클로드 오퍼스 5.5'와 'GPT-6 솔' 간의 3D 웹 연출 비교 결과가 등장했다.
AI 모델 라우팅 전문 AI/ML은 23일 앤트로픽과 오픈AI의 API를 통해 두 모델에 같은 프롬프트를 입력한 결과를 비교했다. 여기에는 움직이는 물고기 떼(Fish School), 소용돌이(Maelstrom), 폭풍 속의 배(Ship in a storm), 쓰나미(Tsunami) 등 4가지 프롬프트로 작성된 3D 애니메이션 생성 결과물이 포함됐다.
그 결과, 결과물의 퀄리티와 비용은 엇갈렸다. 단 한 단어의 간결한 지시문 환경에서, 오퍼스 5.5는 추가 프롬프트 없이도 코드 오류를 자체 수정하며 상대적으로 정교한 세부 연출과 그래픽 디테일을 구현했다.
반면 GPT-5.6 솔은 3D 알고리즘을 확장하거나 세부 그래픽 요소를 완성하는 성능 면에서는 상대 모델에 미치지 못하는 모습을 보였다.
하지만 저렴한 토큰 단가를 바탕으로 압도적인 비용 효율성을 보였다. 4가지 장면을 얻는 데 들어간 비용은 오퍼스 5.5가 총 4.37달러, GPT-6 솔은 0.34달러가 들어, 가격 차는 12.8배에 달한다.
또 테크 미디어 하이프닷뉴스가 같은 날 실시한 10만 토큰 분량의 웹 3D 그래픽 라이브러리(Three.js) 기반 연출 벤치마크 실험에서도 모델별 작업 특성이 뚜렷하게 갈렸다. 여기에서는 오퍼스 5.5가 'GPT-6 아스트라'와 '페이블 5.1' 등 기존 모델과 비교됐다.
외부 라이브러리를 연결한 단일 코드 파일 환경에서 포스트 아포칼립스 테마(놀이공원, 고스트 타운, 원자력 발전소) 장면 3가지를 코드로만 구현하는 고난도 과제에서, GPT-6 아스트라는 단 한 번의 단일 프롬프트 입력만으로 즉시 작동하는 기초 코드를 뽑아내며 제로샷 속도와 단일 작업 토큰 절감 면에서 압도적인 효율을 보여줬다.
그러나 최종 결과물의 시각적 깊이와 세부 연출 퀄리티에서는 오퍼스 5.5가 종합적인 완성도를 끌어올리며 우위를 점했다.
X 댓글에서도 GPT-6 아스트라는 단번에 생성됐음에도 프레임워크 구조가 깔끔해 초기 틀을 잡는 데 최적이라는 평을 받았다. 하지만 세부적인 카메라 앵글, 노을빛 안개 표현, 관람차 및 제어실 장면의 텍스트 레이아웃 배치 등 완성도 높은 연출 디테일에서는 클로드 코드 환경에서 브라우저를 직접 확인하며 수정을 거친 오퍼스 5.5의 에이전트 루프 출력이 뛰어났다는 게 지배적인 분위기다.
반면 페이블 5.1은 토큰을 지나치게 소모하며 가성비가 떨어졌을 뿐만 아니라 최종 연출의 정교함에서도 오퍼스 5.5에 미치지 못했다.
앤트로픽이 공개한 기술 사양도 이를 뒷받침한다. 오퍼스 5.5는 페이블 5.1 수준의 정교한 에이전트 제어력을 유지하면서도 기존 오퍼스 5 대비 실무 작업 비용을 40%가량 절감하고 출력 속도를 30% 이상 끌어올렸다. 20만 줄 규모의 코드베이스를 분석하고 수정하는 감사 작업에서 기존 오퍼스 5가 20시간 이상을 소모했던 과정을 3시간 미만으로 단축했으며, 필요한 토큰 소모량도 2.5배 감소해 장시간 에이전트를 가동해도 부담이 적은 실무 환경을 구현했다.
또 아티피셜 애널리시스의 평가에서도 오퍼스 5.5는 종합 1위의 성능을 기록했지만, GPT-6 솔은 에이전틱 워크플로우와 코딩에서 집중했을 뿐 전반적인 성능은 떨어지는 편이었다.
이 같은 실험 데이터가 공개되자 레딧과 X 등 개발자 커뮤니티에서는 작업 스타일과 목적에 따라 모델별 활용도가 갈린다는 평가가 나왔다. 단 한 번의 요청으로 빠르게 틀을 짜거나 저렴한 비용으로 기초 코드를 얻으려면 GPT-6 아스트라나 GPT-5.6 솔이 유용한 선택지로 꼽혔다.
그러나 실제 서비스에 투입될 수준의 디테일한 3D 그래픽을 구현하고 복잡한 버그를 수정해 최종 완성도를 확보해야 하는 실무 환경에서는 오퍼스 5.5가 비용 대비 퀄리티 측면에서 최고의 종합적 성능을 제공한다는 평이다.
다만 모델이 출시된 지 반나절도 지나지 않은 시점인 만큼, 앞으로 실무자들의 검증과 추가 벤치마크에 따라 모델 간 평가와 활용 양상이 어떻게 변화할지 지켜볼 필요가 있다.
임대준 기자 ydj@aitimes.com