지니젠AI(대표 최선영)가 글로벌 AI 모델 중개 플랫폼 오픈라우터의 모델 426종을 분석, 한국어 품질 평가 결과를 담은 리더보드를 허깅페이스에 공개했다고 17일 밝혔다.
오픈라우터는 앤트로픽, 구글, 오픈AI, xAI, 딥시크 등 다양한 AI 모델을 단일 API로 제공하는 플랫폼이다. 2026년 8월 기준 이용자 1000만명, 일 처리량 10조 토큰을 돌파했다.
지니젠AI는 이 중 330종을 대상으로 높임말 정확도, 한국 제도 지식, 전문 용어, 지시 준수, 요약, 번역투 배제, 문체 일관성 등 7개 항목을 평가했다. 평가 결과 종합 A등급 이상은 7.6%(25종)에 불과했으며, F등급이 33.6%(111종)를 차지했다.
특히 자연스러운 문장이라도 존칭이나 연차·세목 안내 등 업무 정확도에서 오답이 빈번했다. 만점 5개 모델에는 2023년 출시 모델도 포함돼 출시 시점이나 영어권 벤치마크 점수만으로는 한국어 능력을 판단하기 어렵다는 지적이다.
동일한 모델이라도 107개 제공 사업자에 따라 가격 차이가 중앙값 기준 1.87배, 최대 14.47배까지 발생했으며 정밀도와 가동률도 상이했다. 모델 성능과 함께 이용 사업자 비교가 필수적인 이유다.
평가의 공정성을 위해 평가 주체와 대상을 은폐하는 방식을 도입했으며, 응답 속도는 유료 API 직접 호출로 실측했다. 미측정 데이터는 추정치 없이 공란 처리했다.
지니젠AI는 AI 모델 개발사 비드래프트(VIDRAFT)와 전략적 협력을 맺고 평가 영역을 분담한다. 비드래프트는 글로벌 다운로드 리더보드를, 지니젠AI는 한국어 품질 평가를 담당한다.
9월17일 기준 국내 모델 다운로드 1위는 비드래프트의 ‘포켓-35B’(82만5835회)로 국내 상위 30개 모델 중 38.1% 점유율을 기록했다. 지니젠AI은 협력사 모델에도 동일한 객관적 평가 기준을 적용한다고 강조했다.
리더보드는 매일 오전 8시 자동 갱신되며, 한국어·영어·중국어 및 원화·달러·위안 통화를 지원한다. 용도별 비교 및 최대 4개 모델의 상세 항목 비교 기능을 제공하며, 데이터를 공개 API로 내려받을 수 있다.
임대준 기자 ydj@aitimes.com