Claude가 Anthropic AI 개발 26%를 주도

Claude가 주도하는 Anthropic AI 개발 비중이 1% 미만에서 26%로 오른 것을 나타낸 썸네일

2026년 2월 1% 미만이던 숫자가 8월 26%가 됐다. Anthropic이 자사 AI 연구개발 업무 중 Claude가 ‘주도’하는 비중을 처음으로 측정해 공개한 값이다. 다만 같은 자료는 측정 대상 AI R&D 업무 범주 가운데 완전 자율(AL5)에 해당하는 것은 하나도 없다고 못박았다.

이 글의 결론

26%는 ‘회사 업무의 26%’가 아니라 Anthropic이 정의한 AI R&D 작업 바구니를 사람의 투입시간으로 가중한 값이다. 채점은 Claude가 했다. 그래서 이 숫자는 ‘AI가 스스로를 만든다’의 증거가 아니라, 인간의 역할이 실행에서 판단으로 밀려나는 속도를 처음 측정한 눈금에 가깝다.

Claude가 Anthropic AI 개발 26%를 주도한다는 말의 정확한 뜻

Anthropic이 2026년 9월 17일(현지시각) 공개한 자료 「Measurements for understanding the pace of AI development inside frontier labs」의 핵심 수치는 셋이다. 2026년 8월 기준이다.

측정 항목값
Claude가 ‘주도'(AL4 이상)하는 AI R&D 업무26%
‘협업'(AL3) 이상 단계에 있는 업무90% 초과
완전 자율(AL5)로 수행된 업무0%
2026년 2월 시점 AL4 비중1% 미만

여기서 먼저 갈라야 할 게 있다. AL0(AI 관여 없음)부터 AL5(사람 없이 완전 자율)까지 여섯 단계로 나눈 등급 정의 자체는 Anthropic이 만든 기준이 아니다. 비영리 연구기관 Epoch AI가 제안한 AI R&D 자동화 척도를 그대로 가져다 썼다. 국내 보도에서 대체로 빠지는 부분이다.

다만 어떤 Anthropic 업무가 어느 등급에 해당하는지는 내부 자료를 바탕으로 Claude가 평가했다. 자를 남에게서 빌려 왔지만 재는 일은 직접 했다는 뜻이다. 이 차이가 뒤에서 중요해진다.

AL0부터 AL5까지 여섯 단계 자동화 척도에서 AL3 이상 90% 초과, AL4 26%, AL5 0%를 표시한 계단 도표

26%는 어떻게 계산됐나 — 그리고 누가 채점했나

국내 기사 대부분이 26%라는 결과만 옮겼다. 실제로 더 흥미로운 건 과정이다. Anthropic은 부록에 계산 절차를 전부 적어뒀다.

2026년 7월, 매주 모델 R&D 부서 직원의 20%를 무작위 표본으로 뽑았다. Claude 리서치 에이전트가 표본 직원의 한 주를 Slack과 내부 문서로 훑어 그 주에 한 작업을 나열했다. 7월 4주치를 합치니 약 1만 5천 개의 세부 작업 목록이 나왔다. 이를 다시 Claude가 계층 트리로 정리해 542개 노드, 그중 최종 말단 378개 범주를 만들었다. ‘평가 플랫폼 결함 진단과 수정’, ‘서빙 장애 사후분석’ 같은 구체적 단위다. 이 트리는 이후 고정된다. 같은 바구니로 매달 다시 재는 구조다.

가중치는 사람의 투입시간(person-time)이다. 한 사람이 한 주에 1의 가중치를 받고, 그 주에 한 작업 수로 균등 분할한다. 네 가지 일을 했으면 각 0.25다. 중요도를 회사가 임의로 정하지 않기 위한 대체 지표라고 설명한다.

그래서 26%가 아닌 것

✕ Anthropic 전체 업무의 26%

✕ 연구원 26%가 필요 없어졌다는 뜻

✕ AI가 연구 방향의 26%를 혼자 정한다는 뜻

○ 2026년 7월 기준으로 고정한 모델 R&D 작업 바구니를 사람의 투입시간으로 가중했을 때, AL4 이상으로 평가된 몫이 26%

채점자 문제가 남는다. 작업을 수집한 것도 Claude, 각 범주의 자동화 등급을 판정한 것도 별도의 Claude judge다. Claude가 얼마나 일하는지를 Claude로 쟀다.

Anthropic도 이걸 감추지 않는다. 판정을 검증하려고 해당 업무를 담당하는 직원들에게 같은 등급을 매기게 했다. 모델과 사람의 등급이 정확히 일치한 비율은 59%, 사람끼리 정확히 일치한 비율은 35%였다. 한 단계 이내로 근접한 비율은 97%다. 사람끼리도 35%밖에 안 맞는 판정이라는 점에서 모델 판정이 특별히 부실하다고 보긴 어렵다. 다만 판정 모델이 검사 대상 모델과 같은 종류의 오류를 반복할 수 있다는 한계를 회사가 직접 적었고, 제3자 검증이 필요하다고 밝혔다.

바구니를 고정한 데서 오는 허점도 스스로 반증했다. 7월 기준 업무만 재면 “사람이 새로운 종류의 일로 옮겨간 것”을 놓칠 수 있다. 그래서 2026년 1월 데이터로 별도 트리를 만들어 2월부터 7월까지 새로 등장한 작업을 대조했는데, 새로운 유형의 작업이 늘어난 신호는 없었다고 한다.

직원 20% 표본에서 1만 5천 개 작업을 모아 542개 노드로 정리하고 투입시간으로 가중해 26%를 산출한 과정 흐름도

AL3·AL4·AL5의 차이는 파이프라인 장애 하나로 갈린다

등급 이름만 보면 추상적이다. Anthropic은 각주에서 야간 데이터 파이프라인이 고장난 상황 하나로 세 단계를 갈라 보여준다. 이 예시가 ‘어디까지 왔나’라는 질문에 가장 직접적인 답이다.

AL3
AI가 협업
엔지니어가 로그를 들고 온다. 이미 한 번 훑어보고 가설도 있다. Claude가 맥락을 되물어 확인한 뒤 조사와 수정에 들어간다. 도중에 다른 문제가 튀어나오면 Claude는 멈춘다. 우회할지 제대로 고칠지는 사람이 정한다. 테스트가 통과하면 사람이 한 줄씩 검토하고 직접 재실행한 뒤 배포한다.
AL4
AI가 주도 — 지금 26%
엔지니어는 장애 알림만 넘기고 자리를 뜬다. Claude가 로그를 파고 실패 단계와 원인을 찾아 수정안을 쓰고 테스트한다. 중간에 생긴 돌발 문제도 스스로 처리하고 무엇을 더 고쳤는지 기록한다. 복제 데이터로 재실행해 마지막 정상 결과와 비교한 뒤 보고서를 쓴다. 배포는 하지 않는다. 엔지니어를 호출하고, 오늘 밤 내보낼지는 사람이 정한다.
AL5
완전 자율 — 도달 전
장애가 났다는 사실을 사람이 알려주지 않아도 된다. Claude가 직접 감지하고, 조사 범위를 정하고, 수정하고, 테스트하고, 운영에 배포까지 한다. 무엇을 왜 했는지는 여전히 말하지만 사람이 개입할 필요는 없다.

차이는 능력의 크기가 아니라 호출 지점이다. AL3는 사람이 옆에 붙어 있고, AL4는 사람이 끝에서 기다리고, AL5는 사람이 없어도 된다. 26%가 AL4라는 말은 Claude가 일을 끝까지 끌고 가되 마지막 승인 버튼 앞에서 멈춘다는 뜻이다.

그래서 “Claude가 다음 Claude를 스스로 만들고 있다”는 표현은 한 단계 앞서간 서술이다. 정확히는 다음 세대 AI를 만드는 과정의 일부를 주도하기 시작했다가 맞다.

왜 반년 만에 이렇게 빨라졌나

26%는 갑자기 나타난 숫자가 아니다. Anthropic이 같은 날 함께 낸 「When AI builds itself」에 앞선 구간의 데이터가 있다.

  • 2026년 5월 기준, 운영 코드베이스에 병합되는 코드의 80% 이상을 Claude가 작성했다. Claude Code가 리서치 프리뷰로 나오기 전인 2025년 2월 이전에는 한 자릿수 초반이었다.
  • 2026년 2분기 엔지니어 1인당 하루 병합 코드량은 2024년의 약 8배다. 회사는 코드 줄 수가 실제 생산성 향상을 과장한다고 직접 단서를 달았다.
  • 가장 열린 형태의 문제에서 Claude Code 세션 성공률은 2026년 5월 76%까지 올랐다. 반년 전보다 50%포인트 높다.
  • 학습 코드를 빠르게 만드는 고정 과제에서 평균 속도 개선은 2025년 5월 약 3배에서 2026년 4월 약 52배가 됐다. 숙련된 연구자가 4~8시간을 들여 내는 값이 약 4배다.
  • 2026년 4월에는 Claude 에이전트들이 AI 안전 분야의 열린 문제를 가설 수립부터 실험·공유·반복까지 수행했다. 사람 연구자 둘이 약 1주에 성능 격차의 23%를 메운 과제에서 에이전트는 97%를 메웠다. 다만 문제 선정과 채점 기준은 사람이 정했고, 이 결과가 실제 대규모 모델로 그대로 이어지지는 않았다는 단서도 함께 붙었다.

흐름을 이으면 코드 생성, 코드 실행, 긴 작업 수행, 실험 반복, 해결 방식 결정 순서다. 26%는 이 사슬에서 튀어나온 값이 아니라 몇 달간 쌓인 자동화가 처음 하나의 눈금으로 잡힌 결과에 가깝다.

그런데 같은 자료가 남은 격차도 분명히 적는다. 잘 정의된 실험을 실행하는 능력은 사람과 견주거나 앞서지만, 무엇을 연구할지 고르는 판단에서는 여전히 큰 차이가 있다는 것이다. 이 격차가 정확히 AL4와 AL5를 가른다.

Anthropic 안에서 3만 개 에이전트를 감시하는 구조

26%만큼 중요한데 덜 다뤄진 숫자가 있다. 2026년 8월 기준, 가장 많이 쓰이는 사내 플랫폼 한 곳에서 특정 시점에 약 3만 개의 AI 에이전트가 연구·엔지니어링 작업을 동시에 수행했다. 사람 3만 명이 아니라 에이전트 인스턴스 수이고, 그 플랫폼 한 곳만 집계한 값이다.

감시 층작동 방식과 규모
실시간 감시에이전트 행동 100%가 실행 전에 통과한다. 8월 한 달 10억 건 이상을 검사해 0.002%, 약 4만 7천 건당 1건을 차단했다. 모델 가중치 외부 반출처럼 되돌릴 수 없는 행동을 막는 층이다.
사후 감시행동 100%를 사후에 읽는다. 주당 약 10만 건의 기록을 추가 검토 대상으로 표시하고, 여러 자동 분류를 거쳐 우선순위가 가장 높은 주당 약 50건이 사람 검토까지 올라간다. 서서히 드러나는 정렬 문제를 잡는 층이다.

설계 쪽도 눈여겨볼 만하다. 각 에이전트에 개별 신원을 부여해 생성한 데이터를 전부 그 신원에 묶었다. 다른 에이전트의 말을 자기 생각이 아니라 검증할 주장으로 다루게 하려는 장치다. 신원이 모델에 묶이지 않아 모델이 교체돼도 기록이 이어진다. 에이전트끼리의 소통도 개별 대화가 아니라 공개 메시징으로 돌린다. 서로의 오류를 교정하고, 감시 쪽에서는 에이전트 간 대화를 추적할 수 있다.

컴퓨트 배분도 처음 공개됐다. 2026년 7월 13일부터 20일까지 한 주를 표본으로, AI R&D에 쓰인 연산의 약 6%가 안전 연구에 갔다. AI가 수행한 R&D 연산만 따로 보면 약 12%다. 회사는 두 값이 보수적 추정이라고 밝혔다. 역량과 안전에 똑같이 기여하는 작업은 안전으로 세지 않았기 때문이다. 동시에 1주 표본이라 추세를 말할 수 있는 자료가 아니라는 단서도 붙였다.

실시간 감시와 사후 감시 두 층이 에이전트 행동을 검사하는 방식과 각 층의 처리 건수를 비교한 카드

‘연말 80%’를 봤다면 출처를 한 번 더 확인할 필요가 있다

보도 일부가 연말 80%라는 수치를 함께 전한다. 이 숫자는 세 층으로 나눠 봐야 한다.

FACT — 2026년 2월 1% 미만에서 8월 26%. Anthropic 공식 자료의 차트 설명에 그대로 적혀 있다.

추세 연장값 — 연말 약 80%. 일부 2차 매체가 2월 1% 미만에서 8월 26%로 오른 흐름이 이어질 경우의 조건부 값으로 전한 수치다. 그러나 2026년 9월 19일 기준 Anthropic 공식 게시물의 본문·부록·각주와 차트 대체텍스트 어디에서도 80%는 확인되지 않는다.

확정 전망 — 없다. Anthropic은 프런티어 속도 조율이 이뤄지면 이 수치들이 달라질 것이라고 직접 밝혔다.

혼동하기 쉬운 지점이 하나 더 있다. 이번 자료군에는 성격이 전혀 다른 80%가 이미 하나 있다. 2026년 5월 기준 운영 코드베이스 병합 코드의 80% 이상을 Claude가 작성했다는 값으로, 이쪽은 Anthropic 공식 자료로 확인되는 측정 실적이다. R&D Automation Index의 AL4 26%와는 다른 지표다. 기사에서 80%를 만나면 둘 중 어느 쪽인지 먼저 갈라 읽는 편이 안전하다.

시작 시점 표기도 갈린다. 원문 차트 설명은 2026년 2월 1% 미만인데 “3월 1%”로 적은 기사가 여럿이다. 참고로 1% 미만은 점추정이 아니라 상한값이다.

그래서 Amodei는 왜 속도를 늦추자고 했나

닷새 앞선 9월 12일, Anthropic CEO Dario Amodei가 「We Must Pace the Frontier」를 냈다. 제3자 평가팀에 내부 위험팀 수준의 상시 접근권을 주는 1단계, 기업 간 공통 안전기준을 만드는 2단계, 국가 간 협약으로 넓히는 3단계다. Anthropic은 1단계를 다른 회사 참여와 무관하게 시행하겠다고 했다.

당시 독자 입장에서 남는 의문이 있었다. AI 회사 대표가 왜 자기 제품 개발 속도를 늦추자고 하는가.

이번 자료가 그 답의 상당 부분이다. 두 게시물은 별개 사건이 아니라 같은 주장의 앞뒤다. Anthropic은 이번 측정 자료에서 여러 조직의 독립 제3자 평가자를 사내에 상주시켜 안전 관행을 검증하고 사고를 보고하며 이 지표들을 감시하게 하겠다고 밝혔다. 자기 회사가 낸 26%를 자기 회사가 채점했다는 약점을, 외부 검증으로 메우겠다는 순서다.

흐름은 이렇다. 9월 12일, AI가 다음 세대 AI 개발을 가속하고 있으므로 속도 조율이 필요하다는 주장이 먼저 나왔다. 9월 17일, 그 회사의 AI R&D 26%가 AL4에 도달했다는 수치가 뒤따랐다.

남은 병목은 AI의 능력이 아니라 사람의 검토 속도다

Anthropic이 자료에서 직접 언급한 현상이 하나 있다. 코드가 조직 안에서 빠르게 돌기 시작하자 사람의 코드 리뷰가 새로운 병목이 됐다는 것이다. 한 구간을 빠르게 만들면 전체 속도는 빨라지지 않은 구간이 결정한다는 암달의 법칙이 조직에도 적용된 사례로 설명한다.

감시 구조도 사람의 역할이 어디로 옮겨가는지 보여준다. 실시간 감시는 8월 한 달 10억 건이 넘는 에이전트 결정을 실행 전에 검사해 약 0.002%를 차단했고, 차단된 행동은 이후 사람이 검토한다. 별도의 사후 감시는 주당 약 10만 건의 기록을 추가 검토 대상으로 올린 뒤 여러 자동 분류를 거쳐 최우선 약 50건을 사람에게 넘긴다. AI 행동을 1차로 걸러내는 일 역시 상당 부분 AI가 맡고, 사람은 예외와 고위험 사례에 집중하는 구조다.

이 배치는 사람을 빼기 위한 게 아니라 사람이 감당할 수 있는 지점까지 물량을 줄이기 위한 것이다. 그래서 AI가 일하는 속도보다 사람이 확인할 수 있는 속도가 먼저 한계에 닿는 순간이 다음 병목이 된다.

이번 26%가 보여주는 것은 AI 개발에서 인간이 사라졌다는 사실이 아니다. 인간이 ‘어떻게 만들 것인가’를 수행하던 자리에서 ‘무엇을 만들 것인가, 그리고 결과를 승인할 것인가’를 정하는 자리로 옮겨가고 있다는 점이다. AL4에서 AL5로 넘어가는 순간은 그 마지막 역할까지 AI가 가져가기 시작할 때다.

자주 묻는 질문

26%는 Anthropic 전체 업무의 26%인가요?

아닙니다. 모델 R&D 부서를 대상으로 2026년 7월에 고정한 작업 바구니가 모수입니다. 영업·법무 같은 다른 조직은 들어 있지 않고, 사람의 투입시간으로 가중한 값이라 ‘직원 26%’나 ‘예산 26%’와도 다릅니다.

“3월에 1%였다”고 적은 기사도 봤습니다

Anthropic 공식 게시물의 차트 설명은 2026년 2월 1% 미만입니다. 3월로 적은 보도가 여럿 있어 시작 시점이 매체마다 다르게 보입니다. 인용하실 때는 원문 기준으로 2월을 쓰는 편이 안전합니다.

이 수치를 외부에서 검증할 수 있나요?

현재는 불가능합니다. 측정도 채점도 사내에서 이뤄졌고 원자료는 공개되지 않았습니다. Anthropic은 공통 방법론 부재와 자체 모델 채점을 두 가지 걸림돌로 직접 지목하고, 제3자 평가자를 사내에 상주시키겠다고 밝힌 상태입니다. 실행 여부는 앞으로 확인할 부분입니다.

Anthropic 사례가 다른 회사에도 적용되나요?

이 수치는 프런티어 AI 연구소 한 곳의 내부 스냅숏입니다. 다만 Anthropic은 같은 지표를 다른 개발사도 지금 당장 공개할 수 있다는 점을 강조하며 방법론을 함께 공개했습니다. 비교 가능한 두 번째 숫자가 나오는지가 다음 관전 포인트입니다.

참고자료

  • Anthropic, 「Measurements for understanding the pace of AI development inside frontier labs」 — anthropic.com
  • Anthropic, 「When AI builds itself」 — anthropic.com
  • Dario Amodei, 「We Must Pace the Frontier」 — darioamodei.com
  • Epoch AI, AI R&D 자동화 등급 척도 제안 — epochai.substack.com

본문 수치는 Anthropic이 2026년 9월 17일(현지시각) 공개한 자료 기준이며 확인 시점은 2026년 9월 19일입니다. 측정은 Anthropic 내부에서 수행됐고 원자료는 공개되지 않았습니다. 연말 80% 관련 서술은 일부 2차 매체가 전한 추세 연장값이며 확인 시점 기준 Anthropic 공식 자료에서는 확인되지 않습니다. 해석과 판단 부분은 공개 자료를 근거로 한 것이며 확정된 사실이 아닙니다.

관련 글: Claude Mythos의 능력과 안전 문제 · AI 개발 속도조절 논쟁 정리

글쓴이 Hoony

콘텐츠 크리에이터로 활동 중입니다. Hoonyspot은 AI와 IT·영화와 드라마를 공식 자료와 신뢰할 수 있는 출처를 바탕으로 확인하고, 필요한 맥락과 분석을 더해 정리하는 라이프 매거진입니다. 이 글에 적힌 수치·정책 조건은 발행 시점 기준이며, 변동될 수 있습니다.

함께 보면 좋은 글

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다