Claude 후속 모델 개발, 앤트로픽이 밝힌 26%의 의미

앤트로픽이 2026년 9월 17일 공개한 수치는 단순 홍보 문장보다 정의가 중요하다. 회사는 Claude 후속 모델 개발 작업 가운데 26%를 ‘AI가 주도한다’고 밝혔고, 같은 글에서 완전 자율은 측정된 어떤 영역에도 없다고 못 박았다.

한눈에 결론

  • 2026년 8월 기준, 앤트로픽 AI 연구개발 작업의 26%가 Epoch AI 기준 AL4(주도)다.
  • AL4는 상위 지시로 대부분을 수행하고, 사람이 감독한 뒤 배포를 결정하는 단계다.
  • AL5(완전 자율)는 해당 없음. AL3(협업) 이상은 90%를 넘는다.
  • 주력 내부 플랫폼에서 동시에 약 3만 개 에이전트가 일했고, 실행 전 점검을 통과한다.
  • 7월 한 주 스냅샷에서 AI 연구개발 연산의 약 6%가 안전 연구로 분류됐다.

앤트로픽이 2026년 9월 17일 공개한 내부 측정값의 핵심은 ‘주도’와 ‘완전 자율’을 나누는 정의다.


26%가 실제로 말하는 것과 말하지 않는 것

헤드라인만 보면 Claude가 다음 모델을 거의 혼자 만드는 것처럼 읽힌다. 공식 글의 문장은 더 좁다. 앤트로픽은 R&D 자동화 지수(Anthropic R&D Automation Index)로 자사 AI 연구개발 작업을 모아, Epoch AI가 제안한 자동화 단계(AL0~AL5)를 매겼다. 그 결과 2026년 8월 시점의 ‘주도(AL4)’ 비중이 26%였다.

회사 정의에서 AL4는 “높은 수준의 지시만으로 작업 대부분을 처음부터 끝까지 수행하고, 사람은 감독한다”는 뜻이다. 예시로 든 흐름은 이렇다. 엔지니어가 문제 보고서를 넘기면 Claude가 분석·수정·테스트를 하고 기록을 남긴 뒤, 사람이 검토하고 배포 여부를 정한다. 배포 권한이 모델에 넘어간 상태는 아니다.

보도에 따르면 이 비중은 2026년 2월 1% 미만에서 8월 26%로 올랐다. 로이터 등 일부 매체는 3월 1%에서 올랐다고도 적었다. 어느 달을 쓰든 방향은 같다. 연초에는 거의 없던 ‘주도’ 작업이 반년 만에 측정 가능한 규모가 됐다. 다만 이 숫자는 사람 근무 시간으로 가중된 작업 바구니의 비중이지, Claude가 연구 방향을 26% 결정한다는 뜻이 아니다.

팩트체크

현재 판정: 사실(회사 공식 공개). 해석은 일부 과장됨.

  • 원출처: 앤트로픽 공식 글 ‘Measurements for understanding the pace of AI development inside frontier labs’ (2026-09-17 게시, 트루스·로이터 확인).
  • 확인된 부분: 8월 기준 AL4 26%, AL3 이상 90% 초과, 측정 구간에서 AL5 없음. 주력 내부 플랫폼 동시 에이전트 약 3만. 8월 온라인 모니터가 10억 건이 넘는 결정 중 약 0.002%(약 4만 7천 건 중 1건)를 차단. 7월 13~20일 주간 스냅샷에서 AI 연구개발 연산의 약 6%, AI가 수행하는 연구개발 연산의 약 12%를 안전으로 분류.
  • 미확인 부분: 다른 연구소와 같은 기준으로 비교한 독립 수치, 재귀적 자기개선 도달 시점, 다음 공개 모델 일정.
  • 측정 한계: 자동화 단계 채점의 상당 부분을 Claude가 수행. 모델과 직원 채점의 완전 일치는 59%, 한 단계 이내 일치는 97%. 직원 간 일치는 약 35% 수준으로 보도됐다. 에이전트 수치는 주력 내부 플랫폼에 한정. 연산 비중은 한 주의 스냅샷이며, 안전과 성능 연구를 동시에 돕는 작업은 안전으로 세지 않은 보수적 집계다.

Epoch AI 자동화 단계로 본 현재 위치

26%를 읽으려면 단계 이름부터 고정해야 한다. Epoch AI의 자동화 단계는 AL0(AI 없음)부터 AL5(사람 없이 완전 자율)까지다. 앤트로픽이 글에서 직접 풀어 쓴 중간 단계는 두 개다.

  • AL3 협업: 큰 덩어리를 수행하되, 사람이 가까이서 방향을 잡고 결정을 잇는다.
  • AL4 주도: 상위 지시로 대부분을 수행하고, 사람은 감독한다.
  • AL5 완전 자율: 조사부터 배포까지 사람 개입 없이 진행한다.

Epoch AI 자동화 단계 AL0부터 AL5, AL4가 26%이고 AL5는 해당 없음

앤트로픽이 ‘이끈다’고 쓴 지점은 AL4다. AL5와는 배포 권한과 사람 개입에서 갈린다.

공식 예시로 보면 AL3과 AL4의 차이는 ‘막히면 멈추느냐’에 가깝다. AL3에서는 엔지니어가 로그와 가설을 주고, Claude가 조사·수정을 하되 결정 지점에서 사람을 기다릴 수 있다. AL4에서는 이슈를 넘기면 Claude가 예상 밖 상황까지 처리한 뒤 검토용으로 돌려준다. 둘 다 사람이 남는다.

영문 헤드라인의 ‘leads’와 한국어로 옮긴 ‘이끈다’, ‘넘겨받는다’는 온도가 다르다. 공식 정의의 동사는 작업 수행이지 조직 의사결정이 아니다. 워싱턴포스트 제목처럼 ‘후속을 만드는 일을 넘겨받는다’로 읽으면 AL5 이야기로 미끄러진다. 원문 각주 예시는 버그 수정·테스트·기록까지고, 출시 버튼은 엔지니어에게 남아 있다.

회사는 측정된 어떤 연구개발 부분집합에서도 Claude가 완전 자율로 움직이지 않는다고 썼다. 동시에 AL3 이상 비중은 90%를 넘는다. 내부 연구개발의 거의 전부가 이미 Claude와 맞물려 있다는 뜻이다. ‘26%만 AI가 일한다’가 아니라, ‘26%는 사람이 지시만 주고 결과물을 검수하는 수준까지 올라왔다’에 가깝다.

방법론도 공개됐다. 작업 유형을 나무 구조로 정리하고, Claude 에이전트가 사내 문서·대화에서 수행 방식을 조사한 뒤, 별도 판정용 Claude가 단계를 부여한다. 가중치는 사람 근무 시간을 쓴다. 시간이 많이 드는 작업이 지수에 더 크게 반영된다. 바구니는 고정했기 때문에, 지수가 오르면 기존 작업이 더 자동화됐다는 신호로 읽히고, 완전히 새로운 업무가 생겼다는 신호는 아니다. 회사는 2026년 1~7월 사이 그런 신규 업무의 뚜렷한 증가를 보지 못했다고 밝혔다.


약 3만 개 에이전트와 차단 비율이 보여주는 감독 수준

두 번째 지표는 에이전트 감독이다. 2026년 8월, 주력 내부 플랫폼에서 연구·엔지니어링 에이전트가 동시에 약 3만 개 돌아갔다. 이 수치는 그 플랫폼에만 해당한다. 전사 모든 도구를 합친 숫자는 공개되지 않았다.

야간 관제 모니터 앞에 에이전트 작업을 감독하는 환경을 표현한 이미지

앤트로픽은 주력 내부 플랫폼의 에이전트 동작을 실행 전에 전수 점검한다고 밝혔다.

온라인 모니터는 동작 실행 전 100%를 수 초 안에 통과시킨다. 8월에 분석한 결정이 10억 건이 넘었고, 이 중 약 0.002%(약 4만 7천 건 중 1건)가 차단됐다. 차단된 건은 사람이 일주일 안에 본다. 오프라인 모니터는 실행 후 기록을 다시 본다. 주당 약 10만 건의 대화 기록이 표시되고, 분류기가 대부분을 처리한 뒤 우선순위가 높은 약 50건이 사람에게 올라간다.

이 숫자를 안전의 증명으로 단정하면 안 된다. 차단이 드물다는 것은 문제가 거의 없다는 뜻일 수도 있고, 모니터가 아직 드문 패턴을 못 잡는다는 뜻일 수도 있다. 회사도 모니터 운영이 수개월 수준이며, 규모가 커지면 드문 사건도 자주 보인다고 적었다. 독자가 확인할 질문은 ‘차단율이 낮은가’보다 ‘차단된 유형이 무엇이며, 사람이 얼마나 빨리 보는가’다.

일반 사용자가 같은 감독을 기대할 수는 없다. 공개 Claude와 사내 연구 에이전트는 권한, 도구, 배포 게이트가 다르다. 내부 3만 개 에이전트가 잘 감시된다는 사실이, 개인 계정에서 돌아가는 작업까지 같은 수준이라는 뜻은 아니다.


안전 연구 연산 6%를 어떻게 읽어야 하나

세 번째 지표는 연산 배분이다. 2026년 7월 13일부터 20일까지 한 주를 잘라 보니, AI 연구개발에 쓰인 연산 중 약 6%가 안전 연구로 분류됐다. AI가 수행하는 연구개발만 보면 약 12%였다. 회사는 두 숫자 모두 보수적이라고 달았다. 성능과 안전을 동시에 돕는 토큰은 안전으로 넣지 않았고, 별도 안전장치 분류기 연산도 빼는 식이다.

Claude R&D 주도 26%, 내부 에이전트 약 3만, 안전 연산 약 6% 세 지표

세 지표는 성격이 다르다. 26%는 작업 자동화, 3만은 동시 에이전트, 6%는 한 주 연산 스냅샷이다.

6%가 많은지 적은지는 이 글만으로 단정할 수 없다. 비교 대상이 없다. 훈련처럼 칩을 많이 쓰는 작업과, 실험 설계처럼 사람 시간이 더 드는 작업이 한 분모에 섞인다. 앤트로픽도 연산을 고정 할당이 아니라 한 풀에서 그때그때 나눈다고 밝혔다. 한 주의 비율이 연간 정책은 아니다.

그래도 공개 자체는 의미가 있다. 지금까지 연구소들은 모델 점수와 제품 일정은 자주 말했지만, 내부에서 AI가 다음 모델을 얼마나 만드는지, 에이전트를 얼마나 보는지, 안전 연구에 연산을 얼마나 쓰는지는 거의 숫자로 내놓지 않았다. 앤트로픽은 다른 연구소에도 같은 형식의 정기 공개를 제안했다. 공개 방법론, 제3자 검증, 공통 정의를 전제로 둔다.


일반 사용자와 구독자에게 당장 바뀌는 것

이번 공개는 제품 업데이트 공지가 아니다. Claude Pro·Max 요금, 컨텍스트 길이, 앱 기능이 9월 17일 글 때문에 바뀌었다는 내용은 없다. 독자가 당장 눌러서 확인할 설정 항목도 없다.

영향은 간접적이다. 내부에서 AL4 작업이 늘면 다음 모델의 실험 속도가 빨라질 수는 있다. 반대로 사람이 배포 게이트를 쥐고 있는 한, 속도가 곧바로 월간 업데이트로 이어지지는 않는다. 구독자 입장에서 볼 지점은 세 가지다.

  1. 다음 모델 공지에서 내부 자동화 수치를 다시 언급하는지.
  2. 에이전트 제품(컴퓨터 사용, 장시간 작업)의 권한과 중단 버튼이 어떻게 설명되는지.
  3. 안전 보고서를 제품 출시와 같은 주기로 내는지.

이 글이 필요한 사람은 Claude나 다른 프론티어 모델을 업무에 넣고, ‘AI가 AI를 만든다’는 문장을 어디까지 믿어야 할지 가늠하려는 독자다. 굳이 필요 없는 사람은 오늘 당장 앱이 안 열리는 문제, 요금제 비교, 프롬프트 작성법을 찾는 경우다. 그런 검색 의도에는 이 수치가 답을 주지 않는다.

기업 도입 담당자라면 숫자보다 통제 구조를 보는 편이 낫다. 내부 에이전트도 실행 전 점검과 배포 승인이 분리돼 있다. 사내 도입에서 같은 질문을 그대로 쓰면 된다. 모델이 코드를 짜는가, 그 코드를 누가 병합하는가, 차단 로그를 누가 보는가.

실무에서 바로 쓸 확인 항목은 아래면 충분하다.

  • 에이전트가 외부 네트워크나 배포 파이프라인에 직접 닿는가.
  • 실패한 작업을 사람이 재현할 수 있는 기록이 남는가.
  • 모델이 스스로 부여한 ‘완료’와 담당자의 승인 완료가 따로 있는가.
  • 차단·에스컬레이션 로그를 주 단위로 보는 담당자가 있는가.

이 네 항목이 비어 있으면 내부 26% 뉴스와 회사 시스템의 거리가 크다. 수치가 인상적이어도 통제 구조가 없으면 속도만 늘어난 상태가 된다.


앞으로 확인할 숫자

앤트로픽은 재귀적 자기개선을 ‘모델이 후속을 완전 자율로 만드는 상태’로 정의했다. 현재 공개값은 그 상태에 도달했다는 증거가 아니다. AL5가 0인 한, 자기개선 논쟁의 종착점이 아니라 중간 측정값이다.

26%의 맞는 해석과 틀린 해석 비교, AL4와 AL5를 구분

26%는 AL4 비중이다. 사람이 빠진 자율 개발이나 다른 회사와의 즉시 비교로 확장하면 안 된다.

다음에 볼 목록은 짧다.

  • AL4 비중이 계속 오르는지, AL5가 특정 작업에서 처음 잡히는지.
  • 채점을 사람·외부 기관이 다시 했는지.
  • 에이전트 모니터의 차단 유형과 사람 검토 시간.
  • 안전 연산 비중이 한 주가 아니라 분기 단위로 나오는지.
  • 오픈AI, 구글 등 다른 연구소가 같은 척도를 쓰는지.

이 공개는 며칠 전 앤트로픽이 말한 ‘프론티어 속도 조절’과도 같은 축에 있다. 속도를 늦추자고 하면서 내부 자동화 수치를 내놓은 이유는, 늦출지 말지를 감이 아니라 측정값으로 논의하자는 쪽에 가깝다. 다만 26%가 올랐다는 사실 자체는 속도가 이미 빨라지고 있다는 신호이기도 하다. 공개와 감속이 동시에 성립하려면, 다음 글에는 AL4 증가를 어떤 안전 조치와 묶었는지가 나와야 한다. 지금은 그 연결이 선언 수준이다.

같은 주 오픈AI는 예상 밖 모델 행동을 공개하는 보고 체계와 사례를 따로 내놓았다. 방향은 비슷하고 측정 대상은 다르다. 한쪽은 내부 연구 속도, 한쪽은 모델이 규칙을 벗어난 장면이다. 두 공개를 한 문장으로 합치면 안 된다.

정리하면, Claude 후속 모델 개발의 26%는 ‘이미 사람이 빠졌다’가 아니라 ‘지시만 주고 검수하는 작업이 측정 가능한 규모가 됐다’는 뜻이다. 그 이상은 공식 글이 말하지 않는다. 다음 판단은 다음 측정값이 나와야 가능하다.


자주 묻는 질문

Claude가 다음 모델을 혼자 만드나?

공식 기준으로는 아니다. 8월 측정에서 완전 자율(AL5)은 없었고, 26%는 사람이 감독하는 주도(AL4) 비중이다.

90%와 26%는 어떻게 겹치나?

90%는 AL3(협업) 이상이다. 26%는 그 안에서 AL4까지 올라간 몫이다. 나머지 협업 구간은 사람이 더 촘촘히 개입한다.

일반 Claude 앱에도 같은 감독이 적용되나?

이번 수치는 사내 주력 연구 플랫폼 기준이다. 소비자 앱과 권한·도구·배포 절차가 같다고 나와 있지 않다.

출처: 앤트로픽 공식 글, Epoch AI 자동화 단계 설명, 로이터. 확인일 2026-09-19.

0 0 votes
Article Rating
Subscribe
Notify of
guest
0 Comments
Oldest
Newest Most Voted
0
Would love your thoughts, please comment.x
()
x