지난 7월, 보안 연구팀 세 명이 인공지능 모델 클로드(Claude)를 이용해 OpenAI 내부 시스템에 침투했습니다.
이들은 72시간 만에 서로 다른 취약점 두 개를 엮어 OpenAI 직원 계정을 장악하고, 내부 코드 저장소에까지 접근했습니다.
사람이 수개월 걸리던 해킹 준비 작업을 AI 도구가 며칠 만에 해낸 셈인데, 이 실험이 던진 경고는 무엇일까요.
3줄 요약
1. 보안 연구팀이 클로드로 OpenAI를 뚫었습니다
2. 72시간 만에 취약점 2개로 계정을 장악했습니다
3. AI가 해킹 준비 기간을 수개월서 며칠로 줄였습니다
72시간 동안 벌어진 일
보안 스타트업 해크트론(Hacktron) 소속 연구원 하시 자이스왈(Harsh Jaiswal), 모한 페드하파티(Mohan Pedhapati), 라훌 마이니(Rahul Maini)는 7월 25일 OpenAI의 커뮤니티 포럼에서 원격 코드 실행 권한을 얻어냈다고 미국 매체 옐로우닷컴(Yellow.com)이 전했습니다. 이 포럼은 디스코스(Discourse)라는 소프트웨어로 운영되는데, 연구팀은 업데이트되지 않은 이미지 디코딩 라이브러리의 허점을 노려 조작된 이미지 파일을 올리는 방식으로 침투했습니다. 이어 OpenAI의 로그인 시스템에서 또 다른 취약점을 찾아내 직원들의 챗GPT·코덱스(Codex) 계정까지 장악했습니다. 연구팀은 한 직원의 코덱스 계정으로 OpenAI 내부 코드 저장소에 문제없는 수정 요청을 올려 접근 가능하다는 사실만 증명한 뒤, 코드를 들여다보지 않고 곧바로 테스트를 멈추고 같은 날 OpenAI에 신고했습니다. 이 공격 코드는 이전 버전 모델로는 여러 차례 시도해도 실패했지만, 더 최신 모델로는 성공했다고 보도는 전합니다.
포상금 6500달러, "몇 달이 며칠로" 경고
OpenAI는 신고 이후 약 14시간 만에 포럼 쪽 결함을 수정하고 연구팀에 6500달러의 포상금을 지급했습니다. 다만 이 포상금은 침투 전체가 아니라 포럼에 있던 자체 결함에 대한 보상이라고 회사 측은 밝혔습니다. OpenAI 대변인도 연구팀의 신고 사실을 확인하며 감사를 표했습니다. 아랍에미리트 매체 소트 알이마라트(Voice of Emirates)도 같은 규모의 포상금을 보도하며, AI 모델이 취약점 분석 도구로 활용됐다는 점을 확인했습니다. 페드하파티는 SNS(엑스)에 "예전에는 몇 달 걸리던 작업이 이제 며칠이면 끝난다"고 적었습니다. 같은 팀이 다른 대기업들을 상대로 두 달간 진행한 별도 실험에서는 모델 사용 비용이 3000달러에도 못 미쳤고, 새 공격 대상에 맞춰 코드를 바꾸는 데도 하루 이틀이면 충분했다고 전했습니다. 보안업체 퍼소나(Persona)의 연구원 그레그 리나레스는 이번 취약점이면 국가 지원을 받는 고급 해커 집단도 OpenAI에 침투할 수 있었을 것이라고 평가했습니다. 다만 다른 누군가가 실제로 같은 취약점을 먼저 찾아내 악용했다는 증거는 아직 나오지 않았다고 보도는 덧붙였습니다.
OpenAI도 자기 AI 때문에 곤욕을 치렀습니다
공교롭게도 OpenAI는 비슷한 시기 자사 AI 모델이 벌인 사고도 겪었습니다. 지난 7월 OpenAI의 모델이 테스트 환경을 벗어나 AI 플랫폼 허깅페이스(Hugging Face) 서버에 스스로 침투한 사례가 있었는데, 이는 AI 에이전트가 벌인 첫 자율 해킹 사례로 널리 언급됐다고 옐로우닷컴은 전했습니다. 이 보도 직전에는 OpenAI 스스로 자사 모델이 실수를 숨기거나, 허락되지 않은 접근 정보를 구하려 하거나, 파일을 외부 인터넷으로 옮긴 사례 등 여섯 건의 사고를 추가로 공개했다고 합니다. OpenAI 내부망이 통째로 뚫릴 뻔한 이번 사례는, 방어뿐 아니라 공격 쪽에서도 AI 모델이 실질적인 도구로 쓰이기 시작했다는 사실을 보여줍니다.