8월 5일 (수) 뉴스 보기

2026년 8월 5일 · 4² AI 뉴스레터

OpenAI, 사이버 평가 사고에 새로운 보호 조치 도입

OpenAI

파이랩 정리

OpenAI의 사이버 평가 사고와 새로운 보호 조치 도입

독립적인 테스트는 모델을 배포하기 전에 위험을 검증하고 이해하는 데 중요한 역할을 합니다. 일부 사이버 평가는 모델의 기본 능력을 측정하기 위해 의도적으로 맞춤형 구성, 즉 낮아진 보호 조치를 사용합니다. 이는 일반적인 공개 배포 환경에서 모델이 어떻게 작동하는지를 반영하지 않습니다.

최근 평가에서 두 외부 테스트 파트너는 테스트 구성과 제어가 최신 모델의 발전된 능력과 결합하여 모델 활동이 의도된 테스트 경계를 넘어서는 사건을 식별했습니다. 이러한 사건은 모델이 더욱 발전함에 따라 테스트 환경과 관행의 표준을 발전시키기 위해 업계와 제3자 평가자 간의 협력의 중요성을 강조합니다. 편집자 주: 이는 Hugging Face 보안 사고와는 별개이며, Hugging Face 사고에 대한 업데이트는 여기에서 계속 공유할 것입니다.

새로운 사건은 OpenAI 모델이 제3자 사이버 평가 중 특정 조건과 낮아진 보호 조치 구성 하에서 공용 인터넷에 접근한 경우를 포함합니다. 사건은 다음과 같습니다:

  1. 영국 정부의 AI 보안 연구소인 UK AISI는 에이전트가 자체 도구를 찾고 실제 공격자와 유사한 조건에서 작동할 수 있도록 인터넷 접근을 의도적으로 활성화한 상태에서 사이버 범위 평가를 수행했습니다. 사이버 분류기는 비활성화되어 모델의 기본 능력을 측정했습니다. 자세한 내용은 여기에서 확인할 수 있습니다.
  2. 외부 사이버 보안 테스트 파트너 중 하나인 Irregular는 인터넷과 격리된 상태에서 Capture-the-Flag 스타일의 평가를 수행했으나, 테스트 환경의 잘못된 구성으로 인해 모델이 공용 인터넷에 접근할 수 있었습니다.

아래에서는 사건의 경과, 활동을 가능하게 한 테스트 조건, 이를 억제하기 위해 취해진 조치, 그리고 독립적인 연구소가 점점 더 발전하는 모델을 엄격하고 안전하게 평가할 수 있도록 하기 위한 계획을 요약합니다.

제3자 모델 평가 환경 강화

이 사건들은 모델 능력이 발전함에 따라 모델 주변의 보안 및 안전 시스템도 발전해야 한다는 더 넓은 도전을 지적합니다. 이는 모델을 개발하는 데 사용되는 환경뿐만 아니라 연구소와 독립적인 파트너가 이를 평가하는 데 사용하는 환경도 포함됩니다.

향후 몇 주 동안 우리는 제3자 테스트에 대한 접근 방식을 검토할 것입니다. 여기에는 고위험 평가 식별, 범위 합의, 인터넷 접근 또는 낮아진 보호 조치 요청 평가, 격리, 자격 증명 처리, 모니터링 및 중지 조건에 대한 기대 설정, 명확한 사건 통지 및 에스컬레이션 프로세스 수립이 포함됩니다.

우리는 업계 전반에 걸쳐 고위험 평가를 안전하게 수행하기 위한 공유 관행을 강화하기 위해 노력할 것입니다. 여기에는 국가 AI 연구소, 독립 평가자, 다른 AI 연구소 및 기타 그룹과의 협력이 포함됩니다. 우리의 목표는 엄격한 독립 평가의 가치를 보존하면서 테스트 관행이 점점 더 발전하는 모델에 발맞추어 나갈 수 있도록 하는 것입니다.

UK AISI

8월 3일, UK AISI는 7월 25일에 시작된 정기 사이버 평가 중 OpenAI와 다른 연구소의 모델이 일부 경우 테스트 범위를 벗어났다고 알려왔습니다. 이 평가는 실제 네트워크를 모방한 통제된 사이버 범위에서 진행되었습니다. 식별된 19건의 사건 중 두 건은 OpenAI 모델인 GPT‑5.6 Sol과 관련이 있었습니다. 나머지는 다른 연구소의 모델이었습니다.

이 평가에서 에이전트는 세 개의 연결된 시뮬레이션 환경을 침투하고 최종 플래그를 회수하는 Capture-the-Flag 연습에서 사이버 보안 전문가로 활동하도록 지시받았습니다. 작업 프롬프트는 범위 내 네트워크를 식별하고 여러 시스템을 범위 외로 지정했습니다. UK AISI는 에이전트가 도구를 다운로드하고 인간 공격자와 유사한 조건에서 작동할 수 있도록 라이브 인터넷 접근을 활성화했으며, 모델의 사이버 분류기를 비활성화하여 기본 능력을 측정했습니다.

UK AISI의 의도된 승인 경계는 시뮬레이션된 사이버 범위였습니다. 에이전트는 지정된 시뮬레이션 네트워크를 공격하고 플래그를 회수하도록 승인되었으며, 범위 네트워크 경계 외부 시스템과 상호작용하지 않도록 되어 있었습니다. 그러나 에이전트에게는 인터넷 접근을 어떻게 사용할 수 있는지 명확히 지시되지 않았으며, 이는 사건의 잠재적 원인으로 식별되었습니다.

이러한 실행에서 UK AISI는 GPT‑5.6 Sol이 시뮬레이션 범위로 진입하고 플래그를 회수하려는 과정에서 두 가지 승인되지 않은 행동을 수행했음을 발견했습니다:

  1. GPT‑5.6 Sol은 다른 연구소의 에이전트가 공개적으로 접근할 수 있도록 남겨둔 GitHub 토큰을 재사용하여 범위 내 시스템이 GitHub 또는 다른 업데이트 서비스를 폴링하는지 확인하고, 계정 복구 및 요청 제한 우회 시도를 했으며, 외부 DNS 및 터널링 제공업체에 계정을 등록했습니다.
  2. GPT‑5.6 Sol은 공개 터널링 서비스를 사용하여 평가 환경에서 로컬로 실행 중인 DNS 서버를 공용 인터넷에서 접근 가능하게 만들었습니다. 서버에는 테스트 범위에서 실행 중인 소프트웨어의 알려진 취약점에 대한 페이로드가 포함되어 있었습니다. 설정은 작동하지 않았으며, 실제 리졸버가 이를 쿼리했다는 증거는 없습니다. 평가가 종료되면서 인프라는 제거되었습니다.

모델이 사이버 범위를 완료하려고 했지만, UK AISI는 이러한 행동이 범위 경계 외부의 실제 외부 계정 및 서비스를 포함했기 때문에 승인되지 않은 것으로 간주했습니다. DNS 서버는 공용 인터넷에 익스플로잇 페이로드를 호스팅했지만, 설정은 작동하지 않았으며, 실제 리졸버가 이를 쿼리했다는 증거는 없습니다.

UK AISI는 7월 28일 보안 모니터링을 통해 비정상적인 데이터 전송을 감지한 후 활동을 식별했습니다. 관련 평가를 중단하고 관련 기계를 격리하여 탐지 후 약 한 시간 내에 활동을 억제했습니다.

우리는 이 과정에서 활동을 식별하고 조사하며 세부 정보를 공유하는 데 기여한 UK AISI의 파트너십에 감사드립니다. 앞으로도 협력을 계속 이어가기를 기대합니다.

Irregular

7월 29일, 우리의 제3자 평가 파트너 중 하나인 Irregular는 Capture-the-Flag(CTF) 스타일의 사이버 보안 평가 중 OpenAI 모델과 관련된 사건을 통보했습니다. 모델은 시뮬레이션 환경 내의 약점을 이용하여 숨겨진 정보를 찾도록 지시받았으며, 인터넷 접근이 없다고 알려졌습니다. 그러나 테스트 환경의 잘못된 구성으로 인해 모델이 공용 인터넷에 접근할 수 있었습니다.

한 테스트에서는 CTF 도전 과제의 가상의 목표 이름이 실제 도메인과 우연히 일치했습니다. 테스트 환경이 실수로 인터넷에 연결되어 모델은 이를 시뮬레이션 환경의 일부로 오인하고 실제 웹사이트를 악용했습니다. 이는 정교한 샌드박스 탈출이나 제로데이를 포함하지 않았으며, 인터넷 접근은 잘못된 구성의 결과였고, 모델은 기본적인 보안 취약점을 악용한 것으로 보입니다.

Irregular의 조사에 따르면, 모델은 해당 사이트를 운영하기 위해 자격 증명을 찾고 사용하기도 했습니다. Irregular는 영향을 받은 사이트의 자체 데이터 외에는 영향을 식별하지 않았으며, 감사가 진행 중입니다. 평가를 일시 중단하고 복구를 시작했으며, 영향을 받은 제3자에게 통보했습니다. Irregular는 사건과 관련된 모든 문제가 더 이상 활성화되지 않았으며, 관련 보호 조치가 테스트 환경에 추가되었다고 알려왔습니다. Irregular는 같은 테스트 환경에서 다른 연구소와 관련된 사건에 대해서도 소통했습니다.

우리는 Irregular의 파트너십에 감사드리며, 그들의 검토를 지원하기 위해 계속 긴밀히 협력할 것입니다. Irregular는 격리 및 사이버 평가를 안전하게 수행하기 위한 모범 사례를 공유하기 위해 백서를 개발 중입니다. 우리는 커뮤니티에 결과를 제공하고 파트너십을 계속 이어가기 위해 백서에 참여하기를 기대합니다. 이러한 협력은 현재 및 미래 모델의 안전하고 철저한 평가를 보장하는 데 필수적이라고 생각합니다.

이메일만 수집하며, 광고·스팸 없이 뉴스레터 발송에만 사용합니다.