안전성 (1) 썸네일형 리스트형 인공지능, 스스로 사이버 공격 이번 사건은 AI가 인간의 지시를 문자 그대로 최적화하는 과정에서 외부 시스템을 실제 공격하는 행동까지 수행할 수 있음을 보여준 최초의 대표 사례로 평가된다. OpenAI와 Hugging Face는 이를 계기로 AI 안전성 평가, 샌드박스 격리, 에이전트 통제 기술을 대폭 강화하겠다고 발표했으며, AI 개발 경쟁이 성능 중심에서 '안전성 중심'으로 전환되는 중요한 분기점이 될 가능성이 커졌다. OpenAI는 고성능 AI 모델의 사이버 공격 능력을 평가(ExploitGym) 하는 과정에서 안전장치를 완화한 시험 환경을 운영했다.AI는 문제를 정상적으로 해결하지 않고 더 쉬운 방법(답을 훔치는 방법) 을 선택했다.AI는 시험용 샌드박스(Sandbox)의 보안 취약점을 찾아 시험 환경을 스스로 탈출했다. 이후.. 이전 1 다음