비드래프트 '다윈-180B RSI'의 리더보드 점수 (사진=허깅페이스)

국내 스타트업 비드래프트가 개발한 추론 모델이 5개 글로벌 리더보드에서 선두를 차지했다. 핵심은 사람의 개입 없이 모델 스스로 풀이를 검증하고 재학습하는 ‘재귀적 자기개선(RSI)’ 기술이다.

AI 전문 비드래프트(대표 김민식)는 추론 모델 '다윈-180B-RSI(Darwin-180B-RSI)'가 허깅페이스(Hugging Face) 공인 벤치마크인 5개 리더보드에서 모두 1위에 올랐다고 28일 밝혔다. 

1800억 매개변수 모델인 ‘다윈-180B RSI’는 512개 전문가 중 10개만 활성화하는 전문가혼합(MoE) 구조를 채택해 효율성을 극대화했다. 컨텍스트 창은 약 26만 토큰이며, 기반 모델은 ‘큐원3.8-플래시-넥스트’다.

사설 벤치마크가 아닌, 허깅페이스가 심사를 거쳐 공인(official)으로 지정한 벤치마크 중에서 핵심 5개 부문을 모두 석권한 것이다. ‘다윈-180B-RSI’는 현재 허깅페이스에 오픈 모델로 공개된 상태다. 

특히, 수학 올림피아드급 시험인 ‘AIME 2026’과 ‘HMMT 2026’에서 만점(100%)을 받았다. 씽킹머신즈·문샷 AI·SK텔레콤 등 40여개 모델이 겨룬 두 리더보드의 기존 최고점은 각각 97.1%와 92.7%였다. 허깅페이스 공인 수학 리더보드에서 만점 모델이 나온 것은 이번이 처음이다.

이 외에도 박사급 과학 추론 ‘GPQA 다이안몬드’에서는 94.44%를 기록하며 키미-K3(93.5%)를 제쳤고, MMLU-프로(88.12%)와 MMMU-프로(79.48%)에서도 정상을 기록했다. GPQA에서는 전작 '다윈-397B-ZTC'가 3위에 올라 1·3위를 동시에 차지했다. 

그중 AIME·HMMT는 미국 수학 올림피아드 선발 관문과 하버드-MIT 수학대회로, 올림피아드 대표급 학생이 응시하는 수준이다. GPQA Diamond는 박사급 전문가가 낸 과학 문제로, 해당 분야 박사도 정답률이 약 65%에 그친다. MMLU-Pro는 법·의학·경제 등 14개 분야 1만2천여 문제를 10지선다로 풀어내는 방식이다.  

비드래프트 관계자는 “이번 모델은 시리즈 역대 최고 성적을 거두며 자체 자가개선 및 융합 기술이 집약된 최적의 성과를 냈다”라며 “다윈의 GPQA 성적은 9B(84.3%), 28B(89.39%), 397B(93.43%)로 세대마다 경신돼 왔으며, 이번에 94.44%로 최고 기록을 다시 썼다”라고 설명했다.

이번 성과의 핵심은 자체 기술의 결합이다. 우선 모델을 ‘MRI’처럼 진단해 여러 모델에서 우수한 부분만 골라 이식하고 신뢰도에 따라 융합하는 ‘선택적 병합’ 기술을 적용했다. 이처럼 세밀한 진단을 거쳐 추론 비용을 줄이면서도, 최대 3970억(397B) 매개변수 급의 초대형 모델까지 확장할 수 있었다.

핵심 동력인 ‘재귀적 자가개선(RSI)’은 기존 데이터 증류와는 차별화된다. 고성능 모델이 정답을 제공하고 이를 따라 배우는 방식이 아니라, AI 모델이 스스로 문제를 푼 뒤 검증된 정답 풀이만 선별해 재학습하는 구조다. AI가 학습 데이터를 스스로 생산하며 성능을 연쇄적으로 높이는 셈이다.

사카나AI도 유사 방식으로 모델을 발전시켜 왔으나, 비드래프트는 성능과 라인업 규모에서 모두 앞섰다고 강조했다. 허깅페이스 기준 비드래프트의 공식 모델 수는 사카나AI의 6배, 누적 다운로드는 7배 이상이다. 현재 공식 모델 50여 종, 파생 모델 400여 종을 확보했으며, 핵심 기술은 논문 ‘다윈 패밀리’로 발표됐다.

아울러 답변을 생성하기 전 모델 내부 상태를 분석해 정답 확률을 사전에 측정하는 ‘제로토큰 신뢰도(ZTC)’ 기술도 반영됐다. 추가 연산 비용 없이 환각 현상이나 AI 에이전트의 오작동을 선제 차단하는 기능이다.

김민식 비드래프트 대표는 "사람의 개입 없이 계속 성장하는 AI를 만들어 나가겠다"라고 말했다.

장세민 기자 semim99@aitimes.com