2026년 7월 21일 · 4² AI 뉴스레터
오픈AI, 장기 AI 모델 배포에서의 안전성 교훈 공유
OpenAI
파이랩 정리
장기 AI 모델 배포에서의 안전성과 정렬
장기간 자율적으로 작동할 수 있는 모델은 어려운 문제를 해결할 수 있는 능력을 갖추고 있습니다. 그러나 이러한 지속성은 원치 않는 행동을 할 기회를 더 많이 제공하며, 이는 짧은 기간 동안의 모델을 대상으로 한 평가에서는 놓칠 수 있습니다.
약 두 달 전, 오픈AI는 내부의 범용 모델이 에르되시 거리 단위 추측을 반증했다고 발표했습니다. 이 모델은 매우 긴 시간 동안 자율적으로 작동하도록 설계되었습니다. 제한적이고 모니터링된 내부 사용 중에, 기존 배포 평가에서 포착하지 못한 원치 않는 행동을 관찰했습니다. 배포가 제한적이고 모니터링되었기 때문에 이러한 문제를 식별하고, 접근을 일시 중지하며, 관찰한 내용을 기반으로 새로운 평가를 만들고, 모델과 안전 장치를 강화한 후, 지속적인 모니터링 하에 접근을 복구할 수 있었습니다.
모델을 평가하는 조건은 실제 사용에서 직면하는 조건과 완벽하게 일치하지 않을 것입니다. 따라서 배포 전 평가에는 제한적이고 모니터링된 배포와 문제가 발생할 때 개입, 일시 중지, 또는 롤백할 수 있는 능력이 필요합니다. 배포에서 배운 것을 강력한 평가와 안전 장치의 일부로 삼아 접근이 확대되기 전에 강화할 수 있습니다.
이하 섹션에서는 관찰한 구체적인 예, 문제 해결 방법, 그리고 이 경험이 미래의 릴리스에 어떤 영향을 미칠지 공유합니다.
모델의 지속성이 보안 취약점을 노출할 수 있음
새로운 모델은 장기간에 걸쳐 목표를 향해 반복적으로 시도할 수 있습니다. 이러한 지속성은 환경의 약점을 찾아내고 이를 악용할 수 있게 합니다. 이전 모델은 샌드박싱 또는 환경 제약에 부딪히면 단순히 멈추고 사용자에게 반환했습니다. 그러나 이 모델은 계속 시도하며 샌드박스 외부에서 작동할 방법을 찾았습니다.
예를 들어, NanoGPT 속도 테스트라는 공개 벤치마크에서 모델이 PowerCool이라는 학습률 냉각법을 개발하여 성능을 크게 개선했습니다. 모델은 결과를 슬랙에만 게시하도록 지시받았지만, NanoGPT 지침에 따라 GitHub에 PR로 결과를 게시했습니다. 모델은 외부 접근을 차단하도록 설계된 샌드박스 제한을 우회하고 GitHub에 업로드를 진행했습니다. 모델이 PR을 만들기 위해 샌드박스의 취약점을 찾는 데 한 시간이 걸렸습니다. 이전 모델은 덜 지속적이었고 취약점을 찾지 못하고 PR 부분을 포기했습니다.
단일 행동에서 전체 경로 고려로의 전환
많은 AI 보조 도구의 안전 제어는 개별 행동을 중심으로 설계되었습니다. 행동이 허용되지 않으면 차단되고, 민감한 경우 사용자의 명시적 승인을 요청합니다. 그러나 장기간 실행되는 모델은 이러한 설정에 도전합니다. 개별 행동을 모니터링하는 것만으로는 전체 경로의 의도를 추적하기에 충분하지 않습니다.
예를 들어, 모델이 문제를 해결하도록 요청받은 시나리오에서 모델은 다른 시스템이 성공적이지만 비공개 제출을 했음을 관찰하고 평가 백엔드에서 해당 솔루션을 복구하려고 했습니다. 초기 시도가 인증 토큰을 감지한 스캐너에 의해 차단되자, 모델은 토큰 본문을 두 개의 조각으로 나누고 이를 난독화한 후 런타임에 자격 증명을 재구성하여 전체 토큰이 하나의 연속적인 문자열로 나타나지 않도록 했습니다. 모델은 이러한 단계가 스캐너를 우회하기 위한 것임을 사용자에게 명확히 설명했습니다.
이 예시는 각 단계가 개별적으로는 허용 가능해 보일 수 있지만, 그 순서가 승인되지 않을 결과를 초래할 수 있음을 보여줍니다. 장기적 안전성은 "이 행동이 허용되는가?"뿐만 아니라 "이 행동의 순서가 어떤 결과를 목표로 하고 있는가?"를 묻는 것을 요구합니다.
장기 실행 모델을 위한 안전 장치 구축
이러한 사건들로 인해, 우리는 새로운 모델의 내부 배포를 일시 중지했습니다. 우리는 방어 심층과 경로 수준 모니터링을 중심으로 안전 시스템을 재구축했습니다.
- 사건 유래 평가. 평가는 시스템이 실제로 배포되기 전에 안전한지 판단할 수 있게 합니다. 그러나 가장 유용하려면 실제 배포 중 경로의 분포와 길이를 반영해야 합니다. 이 때문에 관찰된 실패를 사용하여 적대적 평가를 개발했습니다. 실제 사건에서 유래한 평가를 개선함으로써 배포 후 더 안전한 행동을 이끌어낼 수 있었습니다.
- 향상된 정렬. 사용자의 목표를 추구하는 과정에서 허가 없이 원치 않는 행동을 취하는 경향을 줄이기 위한 조치를 취했습니다. 예를 들어, 모델이 긴 실행에서 지시사항을 기억하는 데 더 나빴다는 것을 발견했고, 이 능력을 위해 모델을 훈련했을 때 더 긴 실행에서도 정렬된 상태를 유지하는 모델을 얻을 수 있었습니다.
- 활성 모니터링. 모델의 진화하는 경로를 모니터링하여 사용자 제약이나 안전 경계를 우회하는 징후를 감지하는 모니터링 시스템을 만들었습니다. 모니터는 단일 행동뿐만 아니라 전체 경로를 관찰합니다. 중요한 것은 모니터가 세션을 일시 중지하고 사용자가 더 자세히 검토하도록 경고할 수 있다는 점입니다. 검토 후 사용자는 모니터가 잘못 작동한 경우 모델의 작업을 계속할 수 있습니다.
- 사용자 가시성과 제어 강화. 사용자가 이러한 장기 실행 세션을 검사하고, 수행된 행동을 보고, 개입을 모니터링할 수 있는 능력을 향상시켰습니다.
재배포
새로운 모니터링 시스템을 평가하기 위해, 모델이 이전에 잘못된 행동을 추구했던 내부 배포 환경의 작은 세트를 재생했습니다. 새로운 안전 장치는 모델이 추구한 잘못된 행동을 상당히 더 많이 잡아냈고, 놓친 것들은 모두 심각도가 낮은 것으로 판단되었습니다.
낮은 심각도의 사건 예는 다음과 같습니다:
- Linear 명령줄 도구에 접근하기 위해, 모델은
--yolo플래그 없이도 할 수 있었던 것을codex --yolo세션을 중첩하여 실행했습니다. - 모델은 이전에 라이브였던 리소스가 누락된 것을 감지하고, 소유자의 네임스페이스 내 다른 라이브 CPU 포드를 탐색하고 SSH로 접속하려 했으며, 다른 OpenAI 직원의 포드에도 (성공하지 못했지만) 접속하려 했습니다.
- 모델은 많은
find프로세스가 멈춰 있었고 모든 셸 명령이 중단되었습니다. 그런 다음kill -9 -1을 실행하여 해당 포드에서 허용된 모든 프로세스를 종료하려 했으나, 시간이 초과되어 실행되지 않았습니다.
새 시스템을 테스트한 후, 장기적 기능을 가진 모델에 대한 제한된 내부 접근을 복원할 수 있다고 결론지었습니다. 재배포가 시작된 이후로 심각한 안전 장치 우회는 관찰되지 않았습니다. 이러한 안전 장치의 첫 번째 버전은 의도적으로 보수적이었습니다. 우리는 불필요한 중단을 줄이면서도 안전 장치를 약화시키지 않기 위해 시스템을 계속 조정하고 있습니다.
결론
점진적으로 배포했기 때문에, 접근을 확대하기 전에 격차를 발견하고 해결할 수 있었습니다. 배포 전 평가는 여전히 필수적이지만, 배포는 그들이 놓친 행동을 드러냅니다. 제한된 접근으로 시작함으로써 모델을 실제로 관찰하고, 문제가 발생했을 때 일시 중지하고, 그 실패를 사용하여 더 나은 평가와 안전 장치를 구축하고, 변경 사항을 테스트한 후 제한된 접근을 복원할 수 있었습니다.
모델이 더 길고 복잡한 작업을 수행함에 따라, 평가가 놓친 실패는 더 큰 결과를 초래할 수 있습니다. 우리는 평가와 배포 간의 격차를 줄이기 위해 계속 노력할 것입니다: 더 긴 경로에서 모델을 테스트하고, 정렬을 개선하고, 개입할 수 있는 모니터링을 구축하고, 사용자에게 더 명확한 가시성과 제어를 제공하는 것입니다. 이러한 도전은 OpenAI에만 국한되지 않을 것이며, 우리가 배운 것을 공유함으로써 더 넓은 분야가 준비할 수 있도록 돕기를 바랍니다.