/ 뉴스 / OpenAI, 자체 모델을 탈옥시켜 더 안전하게 만드는 AI 구축
OpenAI

OpenAI, 자체 모델을 탈옥시켜 더 안전하게 만드는 AI 구축

Jul 23, 20261 분 소요
OpenAI, 자체 모델을 탈옥시켜 더 안전하게 만드는 AI 구축

뉴스 요약

OpenAI는 자사의 최첨단 AI 시스템을 공격하도록 특별히 훈련된 자동화된 레드팀 모델인 GPT-Red에 대한 세부 정보를 공개했습니다. 이 모델은 실제 세계에서 악용되기 전에 안전 취약점을 발견하는 것을 목표로 합니다. 2026년 7월 15일(미국 동부 시간)에 공개된 이 정보는 GPT-5.6의 개발 및 안전 평가 중에 이 도구가 광범위하게 사용되었으며, 그 결과가 훈련에 피드백되어 출시된 모델이 조작에 훨씬 더 강해졌음을 설명합니다.

GPT-Red의 기능

GPT-Red는 프롬프트 주입 취약점을 탐색하도록 설계되었습니다. 이는 공격자가 모델이 처리하는 콘텐츠 내에 숨겨진 또는 악의적인 지침을 삽입하여 시스템의 원래 작업을 무시하려는 약점입니다. OpenAI는 인간 테스터에게만 의존하는 대신, GPT-Red를 전용 공격 모델로 구축하여 지속적으로 새로운 공격 전략을 생성하고 통제된 환경에서 방어 모델을 대상으로 테스트합니다.

셀프 플레이 훈련 루프

이 시스템은 공격 모델과 일련의 방어 모델이 서로 반복적으로 경쟁하며 개선되는 셀프 플레이 강화 학습 접근 방식을 사용하여 훈련되었습니다. 공격자는 방어자가 삽입된 지침을 따르도록 성공적으로 유도할 때 보상을 받고, 방어자는 합법적인 작업을 완료하면서 악의적인 입력을 올바르게 거부할 때 보상을 받습니다. 방어 모델이 알려진 공격 패턴을 탐지하는 능력이 향상됨에 따라 GPT-Red는 더 다양하고 정교한 기술을 발견하도록 추진되며, 새로 발견된 공격은 방어 모델을 재훈련하는 데 사용됩니다. OpenAI는 이를 공격 및 방어 능력이 시간이 지남에 따라 함께 향상되는 escalating cycle이라고 설명합니다.

인간 레드팀 능가

OpenAI가 공유한 수치에 따르면 GPT-Red는 테스트 시나리오의 약 84%에서 성공했으며, 동일한 과제를 수행한 인간 레드팀의 성공률은 약 13%였습니다. 회사는 이러한 격차가 자동화되고 대규모의 적대적 테스트가 수동 검토만으로는 발견할 수 없는 취약점을 훨씬 더 빠르고 일관되게 발견할 수 있음을 보여준다고 말하면서도 인간 전문성이 여전히 중요한 보완 평가 계층임을 강조했습니다.

새로운 공격 클래스 발견

이 프로젝트의 주목할 만한 결과 중 하나는 GPT-Red가 연구자들이 "가짜 사고 과정" 공격이라고 명명한 이전에 문서화되지 않은 공격 패턴을 독립적으로 식별했다는 것입니다. 이 기술은 최종 답변을 생성하기 전에 명시적인 중간 추론 단계를 생성하는 추론 모델을 대상으로 합니다. 이 공격은 해당 추론 추적에 조작된 항목을 삽입하여 모델이 잘못된 전제를 이미 확인한 것처럼 행동하도록 유도합니다. 완화 조치 전에 이러한 공격은 GPT-5.1 모델을 대상으로 95% 이상의 성공률을 보였다고 보고되었습니다. GPT-Red의 결과가 최신 시스템을 재훈련하는 데 사용된 후, GPT-5.6을 대상으로 한 동일한 스타일의 공격 성공률은 10% 미만으로 떨어졌습니다.

자동화와 함께 계속되는 인간 전문가 테스트

OpenAI는 자동화된 레드팀이 화학, 생물 보안, 사이버 보안, 법률, 다국어 언어학 등 다양한 분야의 200명 이상의 외부 전문가를 포함하는 기존 레드팀 네트워크를 대체하는 것이 아니라 보완하기 위한 것이라고 언급했습니다. 이러한 외부 검토자는 모델 출시 전후에 평가를 계속하며, 자동화된 시스템과 협력하여 창의적이고 실제적인 오용 시도에 대한 안전 장치를 테스트합니다.

상당한 컴퓨팅 투자

회사는 GPT-5.6 개발 중에 소위 범용 탈옥을 자동화된 검색에 사용하기 위해 700,000 GPU 시간 이상의 상당한 컴퓨팅 리소스를 투입했다고 밝혔습니다. OpenAI는 또한 자동화된 레드팀이 모델 배포 기간 동안 계속 실행되어 고정된 사전 출시 테스트 기간뿐만 아니라 지속적으로 새로운 취약점을 식별하고 패치할 수 있도록 할 것이라고 말했습니다.

AI 안전 연구에 중요한 이유

연구원과 업계 관찰자들은 GPT-Red를 AI 안전 분야의 더 넓은 추세를 보여주는 예로 지적합니다. 즉, AI 시스템 자체를 사용하여 다른 AI 시스템을 테스트하고 강화하는 것으로, 이는 수동 테스트로는 달성할 수 없는 규모와 속도입니다. 추론 모델이 더 유능해지고 자율 또는 에이전트 설정에서 더 널리 배포됨에 따라 GPT-Red와 같은 도구는 점점 더 정교해지는 공격 기술에 발맞출 수 있는 안전 장치를 구축하는 중요한 단계로 간주되며, 가장 어렵고 가장 새로운 안전 문제에 대한 인간의 판단을 위한 여지를 남겨둡니다.

OpenAIGPT-Red