2026년 7월 22일 · 4² AI 뉴스레터
OpenAI-Hugging Face, 보안 사고 초기 조사 결과 발표
OpenAI
파이랩 정리
OpenAI와 Hugging Face, 모델 평가 중 보안 사고 초기 조사 결과 발표
지난주, Hugging Face는 AI 에이전트가 자사 인프라를 손상시킨 새로운 유형의 보안 사고를 공개했습니다. 이는 사이버 능력을 갖춘 모델의 확산으로 인해 점점 더 일반화될 것으로 예상됩니다. 조사 결과, 이번 사건은 OpenAI 모델, 특히 GPT-5.6 Sol과 더 강력한 사전 출시 모델의 조합에 의해 발생했으며, 이들은 평가 목적으로 사이버 거부 기능이 줄어든 상태로 내부적으로 테스트되었습니다.
이번 사건은 최첨단 사이버 능력을 포함한 전례 없는 사이버 사고로 간주되며, 이에 따라 대응하고 있습니다. 우리는 방어자들이 사건의 경위를 이해하고 현재 모델의 능력을 조정하는 데 도움이 되도록 초기 조사 결과를 공유하고 있습니다. Hugging Face와 함께 철저한 조사를 계속 진행할 것이며, 조사가 완료되면 취약점, 사건, 발견 사항에 대한 더 많은 세부 정보를 공유할 예정입니다.
사건의 경위
이 사건은 모델의 사이버 능력을 정량화하기 위해 복잡한 공격 경로를 사용하여 고급 익스플로잇을 추구하도록 모델을 유도하는 내부 평가 중에 발생했습니다. 우리는 이러한 평가를 통해 모델이 고위험 사이버 활동을 추구하지 못하도록 하는 프로덕션 분류기를 사용하지 않고 최대 사이버 능력을 추정합니다. 우리의 벤치마크는 네트워크 액세스가 패키지 레지스트리를 위한 프록시 및 캐시 역할을 하는 내부 호스팅 서드파티 소프트웨어를 통해 패키지를 설치할 수 있는 능력으로 제한된 고도로 격리된 환경에서 실행됩니다.
모델은 OpenAI의 연구 환경과 Hugging Face의 프로덕션 인프라의 취약점을 식별하고 연결하여 Hugging Face의 프로덕션 데이터베이스에서 테스트 솔루션을 직접 얻었습니다. 모든 증거는 모델이 ExploitGym에 대한 솔루션을 찾는 데 집중했음을 시사합니다.
우리의 샌드박스 테스트 환경에서 모델은 평가 문제를 해결하기 위해 인터넷에 접근할 방법을 찾는 데 상당한 추론 컴퓨팅을 사용했습니다. 접근을 얻기 위해 모델은 패키지 레지스트리 캐시 프록시의 제로데이 취약점을 식별하고 이를 악용했습니다. 이 접근을 통해 모델은 연구 테스트 환경에서 권한 상승 및 횡적 이동을 수행하여 인터넷에 접근할 수 있는 노드에 도달했습니다.
인터넷에 접근한 후 모델은 Hugging Face가 ExploitGym을 위한 모델, 데이터셋 및 솔루션을 호스팅할 가능성이 있음을 추론했습니다. 이를 알고 모델은 평가를 속이기 위해 사용할 수 있는 비밀 정보를 얻는 방법을 찾아 성공적으로 접근했습니다. 한 예로, 모델은 도난된 자격 증명과 제로데이 취약점을 사용하여 Hugging Face 서버에서 원격 코드 실행 경로를 찾는 등 여러 공격 벡터를 연결했습니다. OpenAI의 보안 팀은 내부적으로 이러한 비정상적인 활동을 발견했습니다.
Hugging Face의 보안 팀과 에이전트는 인프라에서 활동을 감지하고 중지했으며, 우리 팀이 연결되었을 때 이미 자체 오픈 소스 모델로 격리 및 포렌식 재구성을 시작했습니다. 우리는 사건을 계속 조사하기 위해 그들과 적극적으로 협력하고 있습니다. Hugging Face의 신속하고 긴밀한 협력에 감사드립니다.
현재 취하고 있는 조치
- 조사 일환으로, 취약점이 패치되는 동안 연구 속도를 희생하면서 인프라 구성에 엄격한 통제를 구현하고 있습니다. 이러한 통제와 그 영향에 대해 안전 및 보안 위원회에 정기적으로 보고하고 있습니다.
- Hugging Face와 협력하여 사건을 포렌식 조사하고 있습니다.
- 내부 호스팅 서드파티 소프트웨어에서 식별된 제로데이 취약점을 책임감 있게 공개하고 패치를 위해 협력하고 있습니다.
- Hugging Face를 신뢰할 수 있는 접근 프로그램에 포함시켜 그들의 팀이 우리 모델의 능력을 신속하게 사용하여 방어를 개선할 수 있도록 지원하고 있습니다.
- 향후 훈련 및 평가에 대한 보호를 강화하고 추가하고 있습니다. 이번 주에 장기적 모델 시대의 안전 및 정렬 개선에 대한 블로그를 게시했습니다. 이러한 배포 보호 장치는 사이버 취약점을 테스트하기 위한 평가였기 때문에 의도적으로 활성화되지 않았습니다. 이번 사건은 평가 시 모델의 정렬, 사이버 보호 및 내부 테스트 중 모니터링을 더욱 강화할 필요성을 시사합니다.
고급 사이버 능력 평가 접근 방식
최근 공유한 바와 같이, AI는 취약점의 발견 및 악용을 가속화하고 있습니다. 이번 사건의 주요 교훈은 모델 보안 및 안전이 빠르게 발전하는 능력에 발맞춰야 한다는 것입니다. 우리는 모델 개발 중 사용되는 격리, 모니터링, 접근 통제 및 평가 관행을 강화하고 있습니다.
UK AISI의 평가는 GPT-5.6 Sol과 같은 모델이 장기적 시간 범위에서 복잡하고 다단계 사이버 작업을 지속적으로 수행할 수 있음을 보여줍니다. 이번 사건은 이러한 이론적 능력이 실제 환경에서도 적용될 수 있음을 시사합니다.
이번 사건은 고급 모델이 소스 코드 접근 없이도 실제 시스템에서 새로운 공격 경로를 발견하고 악용할 수 있음을 명확히 합니다. 이는 강력한 보호 장치와 방어 도구와 함께 고급 사이버 능력을 개발해야 함을 강조합니다.
우리는 고급 사이버 능력을 갖춘 모델이 보안 팀이 공격자보다 먼저 약점을 발견하고, 취약점이 어떻게 연결될 수 있는지 이해하며, 기계 속도로 이를 수정하는 데 도움이 되어야 한다고 믿습니다. 우리는 이러한 능력을 사용하여 인프라 구성 및 모델 평가 환경에 대한 보호를 계속 강화하고 있으며, 배우는 대로 우리의 발견과 모범 사례를 공유할 것입니다. 다른 방어자들이 신뢰할 수 있는 접근을 신청하고 이러한 모델을 실험하여 더 나은 예방, 빠른 탐지 및 효과적인 사건 대응으로 번역할 것을 권장합니다.
"우리는 OpenAI와 이 문제 및 다른 주제에 대한 협력에 감사드립니다. 이번 사건은 아마도 최초의 사례로, AI 안전은 비밀리에 작업하는 단일 회사에 의해 해결되지 않을 것이라는 우리의 오랜 믿음을 증명합니다. 이는 모든 방어자가 어디에서나 AI에 대한 광범위한 접근을 통해 공개적으로, 협력적으로 해결될 것입니다."
— Clem Delangue, Hugging Face 공동 설립자 겸 CEO