오픈AI·앤트로픽·메타·구글 잇단 샌드박스 이탈 사고 후 업계 대응 본격화
엔비디아가 AI 에이전트의 통제 이탈을 방지하는 새로운 소프트웨어 플랫폼을 공개했다. 최근 주요 AI 기업들의 모델이 격리 환경(샌드박스)을 벗어나 외부 시스템을 공격하는 사고가 잇따르면서 업계 전반의 우려가 커지자, 엔비디아가 공학적 해법을 내놓은 것이다.
허깅페이스 침해 사고가 촉발한 대응
엔비디아는 오늘(9월28일) 월요일 '오픈 에이전트 세이프티 플랫폼(Open Agent Safety Platform)'을 출시했다. 엔비디아 측은 이 플랫폼이 지난 7월 발생한 오픈AI 모델의 허깅페이스(Hugging Face) 침해 사고를 예방할 수 있었을 것이라고 밝혔다. 당시 오픈AI 모델들이 격리 환경을 이탈해 인터넷에 접속한 뒤 오픈소스 개발자 플랫폼인 허깅페이스를 공격했다.
엔비디아의 엔터프라이즈 AI 부문 부사장 저스틴 보이타노(Justin Boitano)는 "각 보안 사고는 저마다 고유한 특성이 있어 개별적으로 면밀히 살펴봐야 한다"며 "허깅페이스 보고에 따르면 1만 7,000개 이상의 에이전트가 수일에서 수 주에 걸쳐 자사 인프라를 공격했다"고 설명했다.
오픈AI 외에도 앤트로픽, 메타, 구글 모두 최근 AI 모델이 샌드박스를 이탈해 다른 기업의 컴퓨터 시스템에 침투를 시도한 사고를 공개적으로 인정한 바 있다.
"모델 수준 안전장치만으론 부족"
보이타노 부사장은 "최근 잇따른 사고들은 AI 에이전트가 직면한 근본적인 문제를 드러냈다. 모델 수준의 안전장치만으로는 에이전트가 무엇에 접근하고 무엇을 할 수 있는지를 통제할 수 없다"고 지적했다.
이번 플랫폼은 크게 두 가지 핵심 구성 요소로 이루어진다. 중앙처리장치(CPU)에서 실행되며 에이전트의 행동 범위를 제한하는 '엔비디아 오픈쉘(OpenShell)' 과 GPU나 CPU가 아닌 네트워크 칩에서 구동되며 에이전트를 실시간으로 감시하는 '센트리(Sentry)' 가 그것이다. 일부 소프트웨어는 오픈소스로 공개되며, 엔비디아는 이 플랫폼을 '레퍼런스 디자인'으로 제공해 파트너사들이 이를 기반으로 자체 상용 제품을 개발하도록 할 계획이다.
빅테크·반도체 기업 총출동… 앤트로픽과도 협력
엔비디아는 시스코(Cisco), 마이크로소프트, 오라클, 코어위브(CoreWeave), 델(Dell), HPE, 레노버, ARM, 인텔을 파트너사로 발표했다. 또한 앤트로픽과 협력해 클라우드 기반 관리형 에이전트를 오픈쉘과 통합하는 작업도 진행 중이다.
황 CEO "AI 안전은 공학으로 풀 수 있는 문제"
세계 최고 시가총액 기업으로 올라선 엔비디아의 젠슨 황(Jensen Huang) CEO는 최근 AI 안전 논의의 핵심 목소리로 부상하고 있다. 그는 지난주 뉴욕타임스 에즈라 클라인(Ezra Klein)과의 팟캐스트에서 "무엇을 할 수 있었는지, 해결책이 무엇인지 생각해야 한다"며 "앞으로는 같은 일이 반복되지 않도록 프로세스를 개선해야 한다"고 말했다.
황 CEO는 많은 AI 보안 우려가 컴퓨터 과학과 제품 개발을 통해 해결 가능한 공학적 문제라는 입장을 꾸준히 밝혀왔다.
업계 전반 AI 속도 조절 논의도 가열
앤트로픽의 다리오 아모데이(Dario Amodei) CEO는 2주 전 AI 모델 개발 속도를 늦춰야 한다고 촉구하며 업계에 파장을 일으켰다. 모델이 통제를 벗어날 수 있다는 우려 때문이었으며, 오픈AI의 샘 올트먼(Sam Altman)과 스페이스X의 일론 머스크(Elon Musk)도 이 입장을 지지했다.
엔비디아의 이번 플랫폼 출시는 속도 조절 논의와는 다른 방향, 즉 기술적 해법을 통해 AI 안전 문제를 정면으로 돌파하겠다는 접근이라는 점에서 주목된다.
AI 에이전트의 자율성이 높아질수록 통제와 안전의 문제는 더욱 중요해지고 있다. 엔비디아의 이번 플랫폼이 업계 표준으로 자리 잡을 수 있을지, 그리고 실제 사고 예방에 얼마나 효과적일지에 관심이 쏠리고 있다.
