기사를 읽어드립니다.

(사진=X, OrcaRouter)
(사진=X, OrcaRouter)

스페이스XAI가 차세대 AI 모델 ‘그록 4.8’의 사전 학습을 이번 주 안에 마치고 강화학습(RL)에 돌입할 전망이다. 2조5000억개 매개변수 규모로, 스페이스XAI가 새롭게 개발한 C++ 기반 소프트웨어 스택을 적용한 것으로 알려졌다. 

일론 머스크 CEO는 13일(현지시간) X를 통해 그록 4.8이 2조5000억개 매개변수를 갖춘 모델이며, 스페이스XAI의 새로운 C++ 소프트웨어 스택을 이용해 학습하고 있다고 밝혔다.

"사전 학습이 이번 주에 완료되고 곧바로 강화학습을 시작할 것"이라고 설명했다. 다음 날에는 그록 4.8이 아직 출시되지 않은 그록 4.7보다 “눈에 띄는 개선”을 보여줄 것이라고 자신했다.

그록 4.8의 매개변수 규모는 '그록 4.6'의 1조5000억개보다 크게 늘어난 수준이다.물론 공식적인 기술 사양이나 모델 카드를 공개한 것은 아니어서 실제 규모와 성능은 독립적인 검증이 필요하다. 모델 ID와 가격, 컨텍스트 윈도우, 벤치마크 결과 등도 공개되지 않았다.

특히 주목되는 부분은 C++ 기반 소프트웨어 스택이다. 머스크 CEO는 스페이스XAI가 AI 학습 및 추론을 위한 자체 C/C++ 기반 스택을 개발하고 있다고 밝혀왔다.

새로운 스택은 엔비디아의 최신 데이터센터용 GPU인 'GB300' 하드웨어에 맞춰 소프트웨어를 최적화하는 데 초점을 맞춘 것으로 전해졌다. 이를 통해 모델 학습과 추론 효율을 높이고 더 빠른 AI 개발 주기를 확보하려는 것으로 풀이된다.

그록 4.8은 그록 4.7의 개발이 마무리되지 않은 상황에서 공개적으로 언급됐다는 점에서도 이례적이다. 그록 4.7은 당초 예상보다 출시가 늦어지고 있는데, 머스크 CEO는 강화학습 과정에서 응답 길이에 대한 페널티가 지나치게 높게 설정됐을 가능성을 이유로 들었다. 이 때문에 모델이 실제로 수행할 수 있는 어려운 작업을 너무 일찍 포기하거나 자신의 답변을 충분히 엄격하게 검증하지 못하는 문제가 나타났다는 설명이다.

스페이스XAI는 현재 그록 4.7의 강화학습 보상 함수와 검증 체계를 수정하는 동시에 그록 4.8을 새로운 학습 단계에 진입할 것으로 보인다. 이는 단순히 매개변수를 늘리는 것뿐 아니라 강화학습을 통한 모델의 추론 및 작업 수행 능력 개선과 학습 인프라 효율성을 동시에 강화하려는 전략으로 해석된다.

그록 4.8의 출시 시점은 아직 확정되지 않았다. 과거 사례에서도 사전 학습 완료 발표와 실제 서비스 출시 사이에 몇주가 걸린 만큼, 이번 주 학습 완료가 곧바로 제품 출시를 의미하는 것은 아니다. 

박찬 기자 cpark@aitimes.com