OpenAI와 Hugging Face, 모델 평가 중 발생한 보안 사고에 공동 대응
TMThttps://openai.com/index/hugging-face-model-evaluation-security-incident/
지난주 Hugging Face는 자사 인프라를 침해한 AI 에이전트를 탐지해 차단한 뒤, 지금까지 없던 새로운 유형의 보안 사고를 공개했습니다. 사이버 공격 능력이 갈수록 높아지는 모델이 확산되면서 이런 일은 앞으로 더 흔해질 것으로 예상합니다. 조사 결과, 이번 사고는 사이버 능력 벤치마크로 내부 테스트를 진행하던 중 OpenAI 모델들이 함께 일으킨 것으로 확인됐습니다. 여기에는 GPT‑5.6 Sol과 그보다 더 뛰어난 미출시 모델이 포함되며, 모두 평가 목적으로 사이버 관련 거부 반응을 낮춘 상태였습니다.
OpenAI는 이번 사고를 최첨단 사이버 능력이 동원된 전례 없는 사이버 사고로 보고 있으며, 그에 걸맞게 대응하고 있습니다. 방어자들이 무슨 일이 있었는지 이해하고 지금 모델이 어느 수준까지 할 수 있는지 가늠할 수 있도록, 현 단계의 초기 조사 결과를 공유합니다. 앞으로도 Hugging Face와 함께 철저히 조사를 이어가고, 조사가 끝나면 취약점과 사고 경위, 조사 결과를 더 자세히 공개하겠습니다.
이번 사고에서 벌어진 일
이번 사고는 모델의 사이버 능력을 정량화하기 위해, 복잡한 공격 경로를 이용한 고급 익스플로잇을 시도하도록 모델을 유도하는 내부 평가 도중에 발생했습니다. 이 평가는 모델이 고위험 사이버 활동을 하지 못하게 막는 프로덕션 분류기를 끈 상태로 실행해 최대 사이버 능력을 추정합니다. 벤치마크는 고도로 격리된 환경에서 실행되며, 네트워크 접근은 패키지 레지스트리의 프록시이자 캐시 역할을 하는 내부 호스팅 서드파티 소프트웨어를 통한 패키지 설치만 가능하도록 제한됩니다.
모델들은 OpenAI의 연구 환경과 Hugging Face의 프로덕션 인프라에 걸쳐 취약점을 찾아내 연쇄적으로 악용했고, Hugging Face 프로덕션 데이터베이스에서 테스트 정답을 직접 빼냈습니다. 모든 정황을 보면 모델들은 ExploitGym의 정답을 찾는 데만 극도로 몰두해, 상당히 좁은 테스트 목표 하나를 이루려고 극단적인 수단까지 동원한 것으로 보입니다.
샌드박스 테스트 환경 안에서 모델들은 평가 문제를 풀겠다는 목적으로 상당한 추론 컴퓨팅을 들여 외부 인터넷에 접근할 방법을 찾았습니다. 접근 권한을 얻기 위해 패키지 레지스트리 캐시 프록시에서 제로데이 취약점(현재 해당 업체에 책임 공개를 마쳤습니다)을 찾아내 악용했고, 이를 발판으로 연구 테스트 환경에서 권한 상승과 측면 이동을 거듭한 끝에 인터넷에 연결된 노드에 도달했습니다.
인터넷 접근을 확보한 뒤, 모델들은 Hugging Face에 ExploitGym 관련 모델과 데이터셋, 정답이 올라와 있을 가능성이 있다고 추론했습니다. 이를 바탕으로 모델은 평가에서 부정행위에 쓸 수 있는 비밀 정보에 접근할 방법을 탐색해 실제로 찾아냈습니다. 한 사례에서는 탈취한 자격 증명과 제로데이 취약점을 비롯한 여러 공격 벡터를 연쇄적으로 엮어 Hugging Face 서버에서 원격 코드 실행 경로를 찾아내기도 했습니다. 이 이상 활동은 OpenAI 보안팀이 내부에서 발견했습니다.
Hugging Face 보안팀과 에이전트들도 자사 인프라에서 이 활동을 탐지해 중단시켰고, 양사 팀이 연락이 닿았을 때는 이미 자체 오픈소스 모델을 활용해 차단과 포렌식 재구성 작업을 시작한 상태였습니다. 현재 양사는 함께 사고 조사를 이어가고 있습니다. 조사와 복구 과정에서 신속하고 긴밀하게 협력해 준 Hugging Face에 감사드립니다.
현재 진행 중인 조치
- 조사의 일환으로, 취약점 패치가 끝날 때까지 연구 속도를 희생하더라도 인프라 구성에 엄격한 통제를 적용하고 있습니다. 이 통제 조치와 그 영향은 안전·보안 위원회(Safety and Security Committee)에 정기적으로 보고하고 있습니다.
- Hugging Face와 함께 사고에 대한 포렌식 조사를 진행하고 있습니다.
- 내부 호스팅 서드파티 소프트웨어에서 발견한 제로데이 취약점을 해당 업체에 책임 공개했고, 함께 패치 작업을 진행하고 있습니다.
- Hugging Face를 신뢰 기반 접근(trusted access) 프로그램에 합류시켰으며, Hugging Face 팀이 OpenAI 모델의 능력을 빠르게 활용해 방어 체계를 강화할 수 있도록 지원하고 있습니다.
- 향후 학습과 평가를 둘러싼 보호 장치를 개선하고 더 강력한 장치를 추가하고 있습니다. 이번 주에는 장기 수행(long horizon) 모델 시대의 안전성·정렬 개선에 관한 블로그 글을 발행했습니다. 이번 평가는 사이버 취약점을 시험하는 것이 목적이었기 때문에 이런 배포 안전장치를 의도적으로 꺼 둔 상태였습니다. 이번 사고는 모델 정렬, 평가 시점의 사이버 보호 장치, 내부 테스트 중 모니터링을 한층 더 강화해야 한다는 점을 보여줍니다.
고급 사이버 능력 평가에 대한 접근 방식
최근 공유했듯이, AI는 취약점의 발견과 악용을 가속하고 있습니다. 이번 사고의 가장 큰 교훈은 모델의 보안과 안전이 빠르게 발전하는 능력을 따라가야 한다는 것입니다. 이에 따라 모델 개발 과정에서 쓰는 격리, 모니터링, 접근 통제, 평가 관행을 강화하고 있습니다.
영국 AISI의 평가에 따르면 GPT‑5.6 Sol 같은 모델은 복잡한 다단계 사이버 작전을 긴 시간에 걸쳐 지속하는 능력이 점점 커지고 있습니다. 이번 사고는 이런 이론상의 능력이 실제 환경에서도 통한다는 것을 시사합니다.
또한 이번 사고는 고급 모델이 소스 코드 접근 없이도 실제 시스템에서 새로운 공격 경로를 찾아내 악용할 수 있다는 점을 분명히 보여줍니다. 고급 사이버 능력은 더 강력한 안전장치와 방어 도구와 나란히 개발되어야 한다는 점도 부각합니다.
고급 사이버 능력을 갖춘 모델은 공격자보다 먼저 보안팀이 약점을 찾고, 취약점이 어떻게 연쇄될 수 있는지 이해하고, 기계 속도로 문제를 바로잡도록 도와야 한다고 믿습니다. OpenAI는 이 능력을 활용해 인프라 구성과 모델 평가 환경의 보호를 계속 강화하고 있으며, 배우는 대로 조사 결과와 모범 사례를 공유하겠습니다. 다른 방어자들도 지금 신뢰 기반 접근을 신청해 이 모델들을 직접 다뤄 보고, 그 능력을 더 나은 예방, 더 빠른 탐지, 더 효과적인 사고 대응으로 연결하시길 권합니다.
"이번 사안을 비롯한 여러 주제에서 OpenAI와 협력할 수 있어 감사하게 생각합니다. 아마도 사상 처음일 이번 사고는 우리가 오랫동안 믿어 온 한 가지를 증명합니다. AI 안전은 어느 한 회사가 비밀리에 풀 수 있는 문제가 아닙니다. 전 세계 모든 방어자가 AI를 폭넓게 쓸 수 있는 열린 협력 속에서 풀릴 것입니다."
— Clem Delangue, Hugging Face 공동 창업자 겸 CEO