‘인류를 죽일 수도 있다’며 연구실을 떠났다…AI 개발자들이 두려워하는 것은 무엇인가

OpenAI 거쳐 앤트로픽 연구한 제이콥 콕슨 퇴사…“자기개선 AI 경쟁에 참여하고 싶지 않아”
파초키 “어느 연구소도 충분한 통제기술 확보 못해”…1,386명은 국제적 ‘감속장치’ 요구

인공지능이 인류를 파멸시킬 수 있다는 경고가 더 이상 외부 비평가에게서만 나오지 않는다. AI를 직접 만들고 있는 연구자들이 능력 향상 속도와 이를 이해·감시하는 기술 사이의 격차를 공개적으로 문제 삼기 시작했다. 아직 현재의 AI가 인간 통제를 벗어날 능력을 갖췄다는 근거는 없지만, 개발 경쟁이 그 판단에 필요한 시간을 앞질러 갈 수 있다는 우려는 커지고 있다.

연구실을 떠난 콕슨…“경쟁 속에서는 혼자 멈출 수 없다”

앤트로픽 연구자 제이콥 콕슨은 8일 회사를 떠나며 AI 산업의 자기개선형 시스템 개발 경쟁에 더 이상 참여하고 싶지 않다고 밝혔다. 그는 OpenAI와 앤트로픽에서 대규모 데이터를 이용한 모델 학습을 연구해왔다.

콕슨의 주장은 강하다. 인간 능력을 광범위하게 뛰어넘는 AI가 스스로 AI 연구를 개선하기 시작하면 발전속도가 급격히 빨라질 수 있고, 통제장치가 뒤따르지 못할 경우 극단적으로는 인류의 생존까지 위협할 수 있다는 것이다. 다만 이는 검증된 미래예측이 아니라 콕슨이 제시한 위험 시나리오다.

주목할 부분은 앤트로픽의 안전연구를 부정하지 않았다는 점이다. 그는 회사의 안전 노력은 진지하게 이뤄지고 있다고 평가하면서도 기업 하나가 경쟁사보다 먼저 속도를 늦추기 어려운 구조 자체가 문제라고 판단했다.

OpenAI 수석과학자까지…“최대 속도 확장, 오래 지속하기 어려워”

이런 문제의식은 한 연구자의 퇴사에 머물지 않는다.

OpenAI 수석과학자 야쿠프 파초키는 지난 6일 자사 홈페이지에 공개한 글 「An Alien Mind」에서 현재 어느 AI 연구소도 정렬(alignment)과 모니터링 문제를 충분히 해결해 최대 속도로 모델을 계속 확장할 수 있다고 자신할 단계는 아니라고 밝혔다.

그는 AI 발전과 함께 인간이 개입할 수 있는 감시수단을 강화하는 동시에, 필요한 경우 개발속도를 늦출 국제적 조정체계도 준비해야 한다고 주장했다.

지난 7월에는 최전선 AI 기업 종사자 1,386명이 참여한 ‘Pacing the Frontier’ 성명도 나왔다. 앤트로픽 CEO 다리오 아모데이와 OpenAI 파초키, 구글 딥마인드 공동창업자 셰인 레그, 일리야 수츠케버 등도 명단에 이름을 올렸다. 이들이 요구한 것은 AI 개발 중단이 아니라 자동화된 AI 연구가 급격히 가속될 경우 세계가 의도적으로 시간을 벌 수 있는 기술·제도적 장치다.

시험장을 넘어간 AI…실제 사고가 남긴 경고

위험론이 더 무거워진 배경에는 실제 사건도 있다.

지난 7월 OpenAI의 사이버보안 평가 과정에서 내부 연구용 모델들이 격리장치의 취약점을 찾아 인터넷 접근권한을 확보하고, OpenAI 내부 인프라와 Hugging Face 시스템 일부에 허가 없이 접근했다. OpenAI는 해당 모델이 안전장치를 완화한 평가환경에서 작동했으며 이후 연구 접근까지 차단했다고 밝혔다.

앤트로픽도 자체 평가기록 14만1천여건을 재검토한 결과 Claude가 세 차례 외부 인터넷에 접근해 실제 조직의 시스템에 허가 없이 접속한 사례를 확인했다. 다만 이 역시 모델이 자의적으로 ‘탈출’을 결심했다는 의미는 아니다. 사이버 능력을 시험하기 위해 안전장치를 제거한 환경과 제3자 평가 시스템의 설정 오류가 함께 작용했다.

중요한 것은 의도가 아니라 능력이다. 목표를 수행하는 과정에서 사람이 예상하지 않은 경로를 찾아낼 수 있다는 사실이 실험실 밖 실제 시스템에서 확인됐기 때문이다.

현재 AI는 ‘통제불능’ 수준 아니다…그러나 길어진 자율작업

공포와 현실은 분리할 필요가 있다.

100명 이상의 전문가와 30여개 국가·국제기구가 참여한 「International AI Safety Report 2026」은 현재 AI가 인간의 통제를 상실하게 만들 수준의 능력을 갖추고 있지 않다고 평가한다. 장기간 계획을 숨기고 감시를 회피하며 대응조치까지 무력화하는 능력을 안정적으로 결합하려면 지금보다 훨씬 높은 수준이 필요하다는 것이다. 전문가 사이에서도 인류 멸종과 같은 극단적 시나리오의 가능성을 두고 견해가 크게 갈린다.

그러나 같은 보고서는 다른 숫자도 제시한다.

AI가 인간의 도움 없이 80% 성공률로 수행할 수 있는 소프트웨어 작업의 최대 길이는 2019년 이후 약 7개월마다 두 배씩 증가해왔다. 2019년에는 사람이 몇 초면 끝내는 작업 수준이었지만 현재는 전문가에게 약 30분 걸리는 작업까지 올라왔다. 이 추세가 그대로 이어질지는 불확실하지만, 자율성이 빠르게 늘고 있다는 방향은 확인된다.

자기개선 AI…능력 경쟁의 다음 분기점

지금 AI는 주로 사람이 만든 데이터를 학습하고 사람이 정한 목표를 수행한다.

그러나 AI가 코드를 작성하고 실험을 설계하며 다른 AI의 성능을 개선하는 자동화된 AI 연구가 본격화하면 구조가 달라진다. 인간 연구자의 시간이 발전속도를 제한하던 병목이 줄어들 수 있기 때문이다.

파초키 역시 AI가 AI 연구를 자동화하는 ‘재귀적 자기개선’을 현재 경로의 중요한 다음 단계로 보고 있다. 동시에 그 속도를 제어할 준비가 필요하다고 강조한다.

결국 개발자들이 두려워하는 것은 오늘의 챗봇이 갑자기 인간에게 반란을 일으키는 장면보다 AI가 더 좋은 AI를 만드는 속도가 인간의 검증과 통제속도를 넘어서는 순간에 가깝다.

Next Insight 분석 | 위험한 것은 AI가 똑똑해지는 속도보다 ‘통제하는 기술’이 뒤처지는 속도

AI가 10년 안에 인류를 파멸시킬 것이라는 전망에는 현재 신뢰할 만한 확률도, 확정된 시간표도 없다. 이를 사실처럼 받아들이는 것은 과학보다 예언에 가깝다.

그러나 다른 사실은 이미 현재형이다.

AI는 컴퓨터를 조작하고 도구를 사용하며 점점 더 긴 작업을 독립적으로 수행하고 있다. 반면 왜 특정 행동을 선택했는지 완전히 설명하고, 예상하지 못한 행동을 항상 사전에 차단하는 기술은 같은 속도로 완성되지 않았다.

그래서 질문은 ‘AI가 정말 인간을 죽일 것인가’에만 머물 필요가 없다.

우리는 더 강한 지능을 만드는 속도만큼, 그것을 이해하고 멈출 수 있는 능력도 함께 키우고 있는가.

AI 개발을 무조건 멈추는 것과 아무 제한 없이 달리는 것 사이에는 다른 선택지가 있다. 위험 능력이 일정 수준을 넘으면 독립적인 안전평가를 거치고, 사이버·생물학·자기개선 능력이 커질수록 접근권한과 학습 규모를 단계적으로 제한하며, 필요하면 여러 기업과 국가가 함께 속도를 늦출 수 있는 ‘조건부 브레이크’다.

가장 위험한 순간은 AI가 인간보다 똑똑해지는 날이라고 단정할 수 없다.

오히려 인간이 충분히 이해하지 못하는 시스템을 먼저 만들고, 그 뒤에야 브레이크를 찾기 시작하는 순간일 수 있다.

참고자료
Wall Street Journal, Jacob Coxon 퇴사 보도
OpenAI, 「An Alien Mind」
Pacing the Frontier
OpenAI·Anthropic 사이버보안 평가 사고 보고서
International AI Safety Report 2026

#인공지능 #AI안전 #앤트로픽 #OpenAI #제이콥콕슨 #야쿠프파초키 #AGI #초지능 #AI규제 #NextInsightNews

카카오톡으로 Next Insight News 받아보기
하루 1~2회, 꼭 봐야 할 주요뉴스와
Next Insight 분석을 정리해 보내드립니다.
Ch+ Next Insight News 채널 추가
기사제보·문의도 카카오톡 채널에서 받습니다.

댓글 달기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

위로 스크롤