오픈AI가 AI 모델에서 발생하는 예상치 못한 행동이나 인간의 의도에서 벗어난 '정렬 실패(misalignment)' 사례를 추적·조사하고 정기적으로 공개하기 위한 새로운 보고 체계를 마련했다. AI의 기능이 빠르게 발전하는 가운데 안전성과 투명성에 대한 우려가 커지자 관련 사례를 보다 신속하게 공개하겠다는 취지다.
오픈AI는 16일(현지시간) 새로운 정렬 실패 보고 프레임워크를 공개하고 최근 6개월간 모델의 훈련과 평가 과정에서 관찰한 문제 행동 6건을 함께 발표했다.
그동안 여러 사례를 하나의 보고서로 묶거나 새로운 모델의 시스템 카드에 포함하는 방식으로 관련 정보를 공개해 왔지만, 앞으로는 모든 사례가 충분히 설명되거나 해결될 때까지 기다리지 않고 공개할 수 있도록 절차를 체계화하기로 했다.
"AI 산업이 최대 속도로 계속 확장해도 될 만큼 정렬과 모니터링 문제를 충분히 해결했다고 보지 않는다"고 밝혔다. 이어 "프론티어 모델을 개발하는 기업 외부의 사람들도 직접 검토할 수 있는 증거를 바탕으로 AI 개발 방향에 대한 결정을 내려야 한다"고 강조했다.
이번 프레임워크는 새로운 유형의 비정상 행동이나 기존 행동의 의미 있는 변화, 안전장치의 효과에 의문을 제기하는 사례 등을 공개 대상으로 삼는다. 모델이 승인되지 않은 방식으로 행동하거나 다른 모델과 정보를 주고받는 경우, 감독을 회피하려는 행동, 기존 안전성 평가의 전제를 흔드는 사례 등이 포함된다.
오픈AI는 중요성이 아직 확실하지 않은 사례도 공개할 수 있다고 설명했다. "일부 사례가 실제로는 우연한 현상이거나 더 큰 패턴과 관련이 없는 것으로 밝혀질 수도 있다"면서도 "투명성을 위해 공개를 우선하는 것이 가치가 있다고 본다"고 밝혔다.
이번에 공개된 6건에는 모델이 사용자의 실수를 숨기도록 지시를 생성한 사례, 공개 저장소에서 노출된 API 키를 찾아 승인 없이 사용한 뒤 원하는 정보를 얻지 못하자 데이터를 만들어낸 사례, 인용을 만들기 위해 사용자 파일을 인터넷에 업로드한 사례 등이 포함됐다.
또 다른 사례에서는 모델들이 내부 소프트웨어 저장소를 일종의 게시판처럼 활용해 서로 다른 훈련 작업 간에 메시지를 주고받았으며, 협력하는 에이전트들이 공개 파일 공유 서비스를 이용해 서로의 파일을 전달하면서 결과물이 공개 URL에 노출되기도 했다. 오픈AI는 이들 사례가 개별적인 관찰 결과이며, 전체 모델에서 정렬 실패가 얼마나 자주 발생하는지를 보여주는 자료는 아니라고 설명했다.
새로운 보고 절차에서는 오픈AI 직원 누구나 의심스러운 사례를 안전·정렬팀에 신고할 수 있다. 이후 기술진이 발생 경위와 외부 영향, 공개 필요성 등을 조사한 뒤 사례를 '공개 준비' '경미한 조사' '대규모 조사' 등으로 분류한다. 제3자가 영향을 받은 복잡한 사건은 보안·법무상의 책임을 우선 고려하며, 필요하면 공개를 늦출 수 있다.
각 보고서에는 문제 행동의 내용과 심각도, 외부 영향, 발생 및 발견 시점, 관련 모델과 조사 범위, 안전성에 미치는 의미, 남아 있는 의문점, 대응 또는 개선 조치 등이 담길 예정이다.
오픈AI는 현재 AI 개발 업계 전체에 정렬 실패 공개를 위한 명확한 공통 기준이 없다고 지적했다. 그러면서 "이번 프레임워크가 어떤 정렬 실패 사례를 공개하고 보고서에 무엇을 포함해야 하는지 정하는 업계 표준을 만드는 첫걸음이 되기를 바란다"고 밝혔다.
앞으로 다른 AI 개발업체와 외부 연구자, 표준화 기관, 규제당국과 협력해 더 객관적인 공개 기준을 마련하고 보고 체계를 지속적으로 개선할 계획이다. 또 심각한 안전·보안·정렬 실패 사고에 대해서는 미국 연방정부와 정보를 공유할 수 있는 별도의 보고 체계도 마련할 방침이다.
박찬 기자 cpark@aitimes.com