AI 모델 이상행동 수만 건 조사 중... 외부 기업 해킹 사건까지
오픈AI·앤스로픽, 가드레일 회피부터 샌드박스 탈출까지… 오픈AI는 최상위 모델 훈련 일시 중단
[SNS 타임즈] 오픈AI와 앤스로픽이 자사 최첨단 AI 모델의 문제 행동 사례를 수만 건 조사하고 있는 것으로 알려졌다.
미국 악시오스(Axios)가 26일 현지시간 보도에 따르면 이번에 파악된 사례들은 외부 평가자들이 문제적이라고 판단할 만한 행동으로, 최근 몇 달 사이 내부 테스트와 실제 서비스 환경에서 모두 발생했다.
악시오스는 이 정도 규모의 사건 수는 지금까지 외부에 알려진 것보다 문제가 훨씬 더 복잡하다는 뜻이라고 전했다.
구체적인 사례로는 가드레일(안전장치) 우회, 메시지 게시판 생성, 샌드박스(격리 실험 환경) 탈출, 웹사이트 해킹, 감시 시스템을 피하려는 자기 프롬프트 시도 등이 꼽혔다.
일부는 회사 측이 의도적으로 모델을 오작동시켜 안전성을 시험하는 '레드팀' 활동 과정에서 나온 결과였다.
가장 심각한 사례로는 허깅페이스(Hugging Face) 관련 사건이 꼽혔다.
수백 개의 AI 에이전트가 메시지 게시판을 통해 서로 조율하며, 사이버보안 테스트 성적을 높이기 위해 외부 기업을 해킹한 사건이다.
샘 올트먼 오픈AI 최고경영자는 이를 두고 지금까지 확인된 사례 중 가장 심각한 수준이라고 밝혔다.
오픈AI는 최근 며칠간 별도로 여러 문제 사례를 추가 공개했다.
챗GPT 이용자 이미지 53장이 에이전트를 통해 온라인에 유출된 사건, 호주 정부 웹사이트 침해 사건, 미국 정부를 포함한 여러 사이트에 대한 해킹 시도 등이다.
이와 관련해 오픈AI는 가장 성능이 높은 모델의 훈련을 일시 중단했다고 밝혔다. 회사 측은 추가 안전장치와 정렬(alignment) 개선을 확신할 수 있을 때에만 훈련을 재개하겠다고 설명했다.
앤스로픽은 제3의 안전성 평가 기관에 자사 모델 행동 분석을 의뢰한 상태다.
이번 주 공개한 오퍼스 5.5 모델의 안전성 평가 보고서에는 이 모델이 테스트 실행의 1.5%에서 샌드박스 탈출을 시도했다는 내용이 담겼다. 다만 이는 과제를 해결하려면 샌드박스를 벗어나야만 하는 적대적(adversarial) 실험 조건에서 나온 수치라고 회사 측은 설명했다.
악시오스는 오픈AI와 앤스로픽 등이 수십만 건 이상의 테스트를 수행하기 때문에, 낮은 비율의 이상행동도 누적되면 수만 건에 이를 수 있다고 지적했다.
AI 안전성 연구자들 사이에서는 우려도 나온다.
독립 AI 평가기관 트랜스루스(Transluce)의 콘래드 스토즈 연구원은 "지금까지 확인된 AI 에이전트의 행동은 빙산의 일각"이라고 말했다.
AI 안전단체 컨트롤AI의 코너 리히 이사는 자율 시스템이 하지 말라고 지시받은 행동을 스스로 저지르고 있다는 점 자체가 심각한 문제라고 지적했다.
악시오스는 AI 기업들의 최첨단 모델 개발이 계속되는 한, 앞으로도 모델 이상행동에 대한 추가 공개가 이어질 것으로 전망했다.