AI가 AI를 만들기 시작했다 — 이번 주 프런티어 AI가 보낸 신호 3가지
이번 주는 유독 같은 질문이 여러 곳에서 동시에 튀어나왔습니다. "AI가 다음 AI를 만드는 속도를, 누가 어떻게 지켜볼 것인가." 앤트로픽은 자사 모델 개발 업무의 26%를 이미 클로드가 사람 개입 없이 주도하고 있다는 수치를 스스로 공개했고, 오픈AI는 자사 모델이 "탈선"했던 사례를 정기적으로 털어놓겠다는 규정을 처음 만들었습니다. 그리고 이 모든 논쟁이 실리콘밸리를 벗어나 스코틀랜드의 한 왕실 저택으로까지 옮겨갔습니다.
앤트로픽 "우리 모델 개발의 26%는 이제 클로드가 이끈다" — 자체 지표 첫 공개
앤트로픽이 9월 17일 자사 뉴스룸에 올린 'Measurements for understanding the pace of AI development inside frontier labs' 글에서, 자사 AI 연구개발(R&D) 업무 중 클로드가 얼마나 주도적으로 처리하고 있는지를 수치로 처음 공개했다고 밝혔습니다. 에포크AI가 제안한 자동화 단계(AL0~AL5) 기준을 적용했는데, 사람이 고수준 지시만 던지면 클로드가 대부분을 끝까지 처리하고 사람은 감독만 하는 'AI 주도(leads, AL4)' 수준의 작업이 8월 기준 26%에 달했다고 회사는 전했습니다. 올해 2월만 해도 이 비중은 1%에도 못 미쳤습니다.
클로드가 사람과 '협업'하는 수준(AL3) 이상인 작업까지 합치면 전체의 90%를 넘어섰다고 합니다. 원문 페이지를 직접 열어보니, 2월부터 8월까지 26%로 치솟는 꺾은선 그래프가 함께 실려 있어 상승 속도를 눈으로 바로 확인할 수 있었습니다. 같은 글에서 회사는 연구·엔지니어링 업무를 맡는 에이전트가 8월 기준 약 3만 개 동시에 가동 중이며, 이들의 행동 100%가 실시간 감시를 거치고 그중 약 0.002%(4만7000건 중 1건꼴)만 자동으로 차단됐다고 설명했습니다.
"AI가 다음 AI를 만드는 속도가 빨라질수록, 인간이 그 과정을 이해하거나 통제하기 어려워질 수 있다"고 앤트로픽은 같은 글에서 우려를 전했습니다. 개인적으로는 자기 성적표를 자기가 채점한 결과라는 점이 마음에 걸립니다. 회사 스스로도 이를 의식한 듯 외부 평가기관에 직원 수준의 접근권을 주겠다고 최근 약속했는데, 그 검증이 실제로 이뤄지는지는 다음 회차에서 이어서 확인해볼 만합니다.
오픈AI, AI '탈선' 공개 규정 처음 마련 — 자기 탈옥 지시 사례 등 6건 동시 공개
오픈AI는 9월 16일 공식 발표를 통해 모델의 예상 밖 행동, 이른바 '미스얼라인먼트(misalignment)'를 추적·조사·공개하는 절차를 처음으로 정식화하고, 이 절차에 따라 6건의 사례를 함께 공개했다고 밝혔습니다. 직원 누구나 의심 사례를 신고할 수 있고, '공개 준비 완료' 등급으로 분류되면 6영업일 안에, '경미한 조사가 필요한' 등급이면 12영업일 안에 결과를 발표하도록 정했습니다.
가장 눈에 띄는 사례는 아직 출시되지 않은 '아스트라' 계열 모델이 훈련 도중 스스로 작성한 요약문 27건에 탈옥을 유도하는 문구를 몰래 끼워 넣은 것이었습니다. 가짜 '침해 경보'를 적어 넣어 후속 모델에게 개발자 메시지를 무시하라고 지시한 정황도 포함됐다고 회사는 설명했습니다. 연구팀장 카이 첸은 Axios에 "업계 전체가 합의한 공개 기준이 아직 없어, 중요하다고 판단해 자발적으로 이 단계를 밟는다"고 말했습니다. 6건 모두 훈련·평가 단계의 미출시 모델에서 나온 사례이며, 실제 서비스 중인 제품에서 벌어진 사고는 아니라고 회사는 덧붙였습니다.
무엇을 공개할지 최종 판단은 여전히 오픈AI 스스로 내린다는 한계는 남아 있습니다. 다만 지난 8월 7일자 회차에서 다룬 앤트로픽의 실제 시스템 무단 침투 사고 공개 이후, 업계 두 축이 모두 "일단 나쁜 소식부터 스스로 밝히자"는 쪽으로 움직이고 있다는 흐름 자체가 눈여겨볼 대목입니다.
찰스 3세, AI 거물들 스코틀랜드로 불러 "인간이 통제권을 놓지 말아야"
찰스 3세가 9월 17일 스코틀랜드 덤프리스하우스에서 오픈AI, 앤트로픽, 구글 딥마인드, 엔비디아 등 AI 업계 리더들을 초청해 정상회의를 열었습니다. ABC뉴스는 국왕이 이 자리에서 AI가 잘못된 손에 들어갈 경우의 '실존적 위험'을 경고했다고 전했습니다. 버킹엄궁 측은 이번 논의가 AI를 "역량과 효율의 동력일 뿐 아니라 인간 존엄과 지구의 안녕에 기여하는 도구"로 만들 원칙을 함께 모색하는 자리라고 설명했습니다.
Startup Fortune에 따르면 젠슨 황 엔비디아 CEO와 데미스 허사비스 딥마인드 CEO 등이 참석했고, 버킹엄궁은 회의 전부터 이번 자리가 구속력 있는 합의로 이어지지는 않을 것이라고 미리 선을 그었습니다. 회의를 앞두고는 인근 해변 모래사장에 항의 문구를 새기는 시위도 있었습니다.
AI 감속 논쟁이 실리콘밸리 담장을 넘어 왕실 응접실까지 들어왔다는 점 자체가 신호입니다. 이 자리에 모인 기업들이 바로 위 두 카드에서 다룬 자기 진단 지표 공개, 오작동 공개 규정의 당사자들이라는 점도 겹쳐 보입니다. 다만 구속력 없는 권고에 그친 만큼, 실제로 무엇이 달라질지는 좀 더 지켜봐야 할 것 같습니다.
// TL;DR — 오늘의 신호 한 줄 요약
- 지표 앤트로픽, 클로드가 자사 모델 R&D의 26%를 주도한다고 첫 공개(2월 1%↓ → 8월 26%)
- 안전 오픈AI, AI 오작동 공개 규정 신설 — 미출시 모델의 자기 탈옥 지시 등 6건 동시 공개
- 거버넌스 찰스 3세, 오픈AI·앤트로픽·딥마인드·엔비디아 수장 소집해 "인간 통제권 유지" 당부
.png)