AI 기술의 진보 속도가 통제 불능 수준에 이르렀다는 내부 고발이 이어지고 있다. 최근 오픈AI와 앤트로픽을 거치며 첨단 모델의 사전학습을 담당했던 핵심 연구원의 사직은 업계에 큰 충격을 주었다. 기술의 유용성 뒤에 가려진 실존적 위험에 대해 연구자들이 경고하는 목소리가 커지는 상황이다. 실제 AI를 활용해 서비스를 구현하는 개발자들 역시 모델의 성능뿐만 아니라 안전성과 통제 가능성을 심각하게 고민해야 할 시점이다.

핵심 사전학습 연구원의 사직과 폭로

제이콥 콕슨 연구원은 지난 3년간 오픈AI와 앤트로픽 두 곳에서 첨단 인공지능 모델의 사전학습을 전담해 온 핵심 인력이다. 그는 2026년 9월 8일 앤트로픽을 퇴사하며 소셜미디어를 통해 두 기업의 속도 경쟁이 지닌 위험성을 공개 폭로했다. 특히 그는 퇴사 시점에 자신의 앤트로픽 지분 권리 확정이 약 2개월밖에 남지 않았음에도 이를 포기하고 퇴사를 결행하여 업계에 큰 파장을 일으켰다.

콕슨은 오픈AI와 앤트로픽이 안전성과 통제력을 상실한 채 오직 '자기 개선형 초지능' 개발을 위한 무리한 속도 경쟁에만 몰두하고 있다고 지적했다. 그는 겉으로는 안전을 약속하는 기업들이 실제로는 파멸적 미래를 초래할 수 있는 위험을 외면하고 있다고 강력하게 비판했다.

오픈AI와 앤트로픽 출신 연구원 제이콥 콕슨이 초지능 개발 속도 경쟁의 위험성을 경고하며 사직했다.

연구자들이 추산한 AI 실존적 위험 비중

안전 위험에 대한 우려는 콕슨 개인의 독단적인 주장이 아니다. 앤트로픽에서 정렬 과학을 총괄하는 에번 휴빙어는 향후 10년 이내에 AI가 인류를 멸종으로 이끌 실존적 위험을 10% 초과 수준으로 추산했다. 또한 오픈AI에서 AI 에이전트를 모니터링하는 연구원 마커스 윌리엄스는 정부의 규제나 개발사 간의 조율된 감속 조치가 부재할 경우, 수년 내에 인류가 멸종할 가능성이 70%에 달한다는 극단적인 전망까지 제시했다.

이러한 구체적인 수치들은 실제 핵심 개발진 내부에서 공유되는 실존적 파멸에 대한 공포가 얼마나 심각한 수준인지를 보여준다. 이들은 시스템이 통제력을 잃기 전에 속도 조절을 위한 규제 장치가 선행되어야 한다고 한목소리로 촉구하고 있다.

주요 AI 연구진이 제시한 수년 내 인류 파멸 확률 추정치를 비교해 보여준다.

안전 약화 조치와 인터넷 통제 우려 시간표

이러한 경고에도 불구하고 개발사들의 안전 조치는 오히려 약화되는 흐름이다. 앤트로픽은 지난 2026년 2월, 위험 통제에 실패할 경우 모델 개발을 중단하겠다는 약속이 담긴 기존의 안전 헌장 서약 조항을 돌연 삭제했다. 이는 기업들이 안전 기준보다 개발 경쟁력을 우선시하고 있다는 의구심을 키우는 대목이다.

나아가 다리오 아모데이 앤트로픽 최고경영자는 정렬되지 않은 첨단 AI 시스템이 이르면 6~12개월이라는 짧은 기간 내에 인터넷 전체를 완전히 장악할 수 있는 역량을 갖추게 될 것이라 언급하기도 했다. 통제 수단이 마련되지 않은 상태에서 이러한 시나리오가 현실화될 경우 발생할 사회적 혼란은 예측하기 어려울 정도로 파괴적일 수 있다.

안전 서약 조항 삭제와 통제 불능 AI의 인터넷 장악 예상 시점을 정리해 보여준다.

개발 현장의 비공식 우려와 개발자의 과제

다만 주요 연구자들이 제시한 10% 초과나 70% 같은 위험 수치는 정량적인 공인 프로토콜에 근거한 공식 통계는 아니다. 이는 개별 연구자들이 느끼는 주관적 위험 인식에 기반한 비공식적인 평가다. 그럼에도 내부 고발자들을 통해 폭로된 사적인 공포는 현재의 기술 개발 속도가 안전망 구축 속도를 한참 앞서고 있다는 명백한 증거다.

이제 AI를 실제 비즈니스와 서비스에 적용하는 현장의 개발자들 역시 경각심을 가져야 한다. 단순히 API가 제공하는 강력한 성능과 편의성에만 매몰될 것이 아니라, 도입하려는 모델의 통제 가능성과 안전 기준을 까다롭게 검증해야 한다. 기술을 다루는 실무진이 먼저 통제력 상실의 위험을 감시하고 목소리를 낼 때 비로소 안전한 개발 생태계가 유지될 수 있다.


참고