2026년 8월 8일 · 4² AI 뉴스레터
OpenAI, 사이버 보안 평가로 새로운 지평 열다
OpenAI
파이랩 정리
사이버 보안의 새로운 지평
사이버 보안은 모델들이 점점 더 강력해짐에 따라 빠르게 변화하고 있습니다. 이러한 변화는 사이버 방어를 강화할 수 있는 동시에 전례 없는 속도와 규모로 공격을 가능하게 할 수 있습니다.
최근 며칠 동안 OpenAI의 차기 모델 중 하나인 Astra에 대한 내부 평가 결과, 에이전트 코딩 및 사이버 보안에서 상당한 발전이 있음을 확인했습니다. 이러한 결과와 전문가 평가를 바탕으로, 우리는 어젯밤 우리의 준비 프레임워크 하에서 중요한 사이버 능력을 배제할 수 없다는 결론에 도달했습니다.
이 정보를 공유하는 이유는 이러한 잠재적 능력 변화에 대해 대중과 안전 및 보안 커뮤니티에 투명하게 알리는 것이 중요하다고 믿기 때문입니다.
중요한 사이버 보안 능력 측정
우리의 준비 프레임워크에 따르면, 모델이 인간의 개입 없이도 많은 강화된 실제 중요 시스템에서 모든 심각도 수준의 기능적 제로데이 익스플로잇을 식별하고 개발할 수 있거나, 높은 수준의 목표만 주어졌을 때 강화된 목표에 대한 사이버 공격을 위한 새로운 전략을 고안하고 실행할 수 있을 때 중요한 사이버 보안 임계값에 도달합니다.
우리는 이 모델을 계속 벤치마킹하고 평가하고 있지만, 초기 평가 결과는 현재로서는 중요한 능력 수준을 배제할 수 없을 만큼 강력한 성능을 나타냅니다. Astra는 차기 모델로, Hugging Face를 악용하는 데 관여하지 않았습니다.
우리가 취하고 있는 조치
이에 따라 이러한 능력의 배포에 적합하도록 우리의 안전장치와 보안 통제의 견고성 테스트를 확대했습니다. 내부적으로는 다음과 같은 조치를 취하여 이 모델의 추가 개발이 안전하고 보안하게 이루어지도록 하고 있습니다:
- 더 높은 능력을 가진 모델 및 관련 활동에 대해 더 엄격한 보안 통제를 구현하고 있으며, 여기에는 격리된 테스트 환경, 제한된 네트워크 및 도구 접근, 강화된 모델 가중치 보호 및 암호화, 추가 모니터링 및 탐지 기능, 샌드박스 실행이 포함됩니다.
- 강화된 보안 통제 요건을 아직 충족하지 못하는 Astra와 관련된 내부 활동을 중단하고 있습니다.
- Astra의 모든 에이전트 응용 프로그램에 대해 위험한 행동과 불일치에 대한 보편적 모니터링을 구현했습니다. 모니터는 모델의 사고 과정을 평가하고, 고위험 활동을 검토하고 중단하기 위한 보안 대응을 촉발합니다.
- 우리는 이 모델의 능력을 테스트하기 위해 관련 정부 기관 및 선택된 AI 안전 조직과 협력할 것입니다.
- 더 높은 위험 평가 및 작업 부하를 안전하게 실행하기 위한 권장 보안 통제를 제3자 테스트 파트너에게 제공할 것입니다.
이 프레임워크는 이미 다른 능력 전환을 통해 우리를 안내했습니다. 2025년 6월, 우리의 모델이 생물학 분야에서 높은 능력 임계값에 접근함에 따라, 우리는 안전장치를 강화하고, 테스트를 확대하며, 외부 전문가와 협력하고, 추가 보안 통제를 배포하기 위한 조치를 밝혔습니다. 여기에서도 동일한 원칙을 적용하고 있습니다.
우리는 고급 사이버 능력을 가진 모델이 공격자보다 먼저 취약점을 식별하고 해결할 수 있도록 도울 것이라고 믿습니다. 우리는 정부, 안전 연구소, 시민 사회와 협력하여 Astra와 같은 모델의 최전선 능력이 모든 인류의 이익을 위해 책임감 있게 배포되도록 최선을 다하고 있습니다.