AC-Research›칼럼시황AI 하이퍼사이클
성능표와 월급명세서 사이 목차 펼치기

AC 칼럼 · AI와 일자리

성능표와
월급명세서 사이

AI는 이미 전문가의 책상 위에 올라왔다. 그런데 회사의 인원표는 좀처럼 바뀌지 않는다. 둘 사이에 놓인 두 개의 간격, 타임갭과 도메인갭을 따라가 본다.

2026년 9월 26일AC리서치읽는 시간 약 18분

Fig 01 · 개념도두 개의 시계
두 개의 시계: 성능표와 월급명세서 2022년부터 모델이 할 수 있는 일은 가파르게 늘었지만 조직이 실제로 바꾼 일은 완만하게 늘었다. 두 선 사이의 벌어진 면적이 타임갭이다. 수치가 아닌 개념도. 202220232024202520262027 타임갭 ChatGPT 공개 GDPval 공개 · 전문가 결과물과 비교 전문가와 같거나 낫다 70.9% AI 사용 기업 18%AI로 인원 감축 2% 모델 성능표 AI가 해낼 수 있는 일 월급명세서 조직이 실제로 바꾼 일
두 선의 높이는 수치가 아니라 방향을 나타낸 개념도다. 표시한 사건의 수치는 본문에 있다.
한 줄 요약

AI가 할 수 있는 일과 회사가 실제로 바꾼 일 사이에는 두 간격이 있다. 능력이 조직의 절차와 예산으로 번역되는 시간인 타임갭, 그리고 범용 AI와 현장의 맥락 사이의 거리인 도메인갭이다. 둘 다 빠르게 줄고 있다. 그 사이를 유예기간으로 쓸지 준비기간으로 쓸지가 남은 질문이다.

00

두 이야기가 동시에 참이다

2025년 말부터 2026년 초 사이, 미국 기업 가운데 업무에 AI를 사용한다고 답한 곳은 18%⁠였다. AI로 인원을 줄였다고 보고한 기업은 2%⁠에 그쳤다. 같은 무렵 프론티어 모델들은 회계 스프레드시트, 영업 제안서, 제조 설계도처럼 실제 전문가가 만드는 결과물과 경쟁하기 시작했다. 2025년 12월 GPT-5.2는 전문가가 만든 결과물과 나란히 놓고 비교한 과제의 70.9%⁠에서 같거나 낫다는 판정을 받았다.

AI는 벌써 전문가의 책상 위에 올라왔는데, 회사의 인원표는 좀처럼 바뀌지 않았다.

18%업무에 AI를 쓰는 미국 기업
2025.11~2026.1
2%AI 때문에 고용을 줄인 기업
같은 기간
70.9%전문가 결과물과 같거나 낫다는 판정
GPT-5.2 · 2025.12

그래서 우리는 서로 반대되는 두 이야기를 동시에 듣는다. 한쪽에서는 곧 대부분의 지식노동이 자동화될 것이라고 말한다. 다른 쪽에서는 주변에 AI 때문에 해고된 사람이 얼마나 되느냐고 되묻는다. 둘 중 하나가 거짓인 것은 아니다. 모델 성능표와 월급명세서가 같은 속도로 움직이지 않을 뿐이다.

그 사이에는 두 개의 간격이 있다. 타임갭과 도메인갭이다.

Time gap

타임갭

할 수 있다는 것과 대체한다는 것 사이. AI의 능력이 기업의 업무 절차와 비용 계산, 책임 구조와 채용 계획으로 번역되는 데 걸리는 시간.

Domain gap

도메인갭

정답과 실제 일 사이. 범용 AI의 능력과 특정 현장에 쌓인 맥락, 예외, 절차, 관계, 책임 사이의 거리.

Part 1 · 타임갭할 수 있다는 것과 대체한다는 것 사이
01

능력이 인원표가 되기까지

AI가 어떤 과업을 수행할 수 있게 되었다고 해서 그날 바로 일자리가 사라지지는 않는다. 회사는 먼저 도구를 골라야 한다. 보안팀을 설득하고, 사내 데이터를 연결하고, 오류가 났을 때 책임질 사람을 정해야 한다. 기존 업무를 뜯어고치고 직원을 훈련한 뒤에야 채용과 인원 계획을 바꿀 수 있다.

Fig 02 · 인터랙티브단계를 눌러 보세요

AI를 쓰기 시작한 회사가 인원 계획을 바꾸기까지

성능표가 월급명세서로 넘어가려면 일곱 개의 문을 지나야 한다. 첫 문을 연 기업이 18%, 마지막 문까지 간 기업이 2%⁠다.

  1. 도구 고르기 · 모델과 제품, 비용을 정한다.
  2. 보안 심사 · 고객 정보와 영업비밀이 새지 않는지 확인한다.
  3. 데이터 연결 · 사내 문서와 시스템을 잇는다.
  4. 책임자 정하기 · AI가 틀렸을 때 누가 서명하는지 정한다.
  5. 업무 다시 짜기 · 맡길 단계와 검토할 단계를 새로 그린다.
  6. 사람 훈련 · 검증하는 법을 익힌다.
  7. 채용·인원 계획 · 여기서 비로소 월급명세서가 바뀐다.
단계와 장벽은 AC리서치가 기업의 도입 과정을 단순화해 정리했다. 18%⁠와 2%⁠는 미국 인구조사국 기업 동향 조사의 AI 부가 조사(2025년 11월~2026년 1월) 값.

그러므로 타임갭은 AI가 아직 일을 못해서 생기는 시간이 아니다. AI의 능력이 기업의 워크플로와 비용 계산, 책임 구조와 채용 계획으로 번역되는 데 걸리는 시간이다.

02

쓴다는 것과 바뀐다는 것

미국 인구조사국의 2026년 기업 조사에서 이 간격이 선명하게 보인다. 인구조사국은 2주마다 기업의 경영 상황을 묻는 기업 동향 조사(BTOS)에 AI 부가 문항을 붙여 2025년 11월부터 2026년 1월까지 응답을 모았고, 2026년 4월 연구 보고서로 결과를 냈다. 업무 기능 하나에라도 AI를 쓴 기업은 18%⁠였다. 직원 수로 가중하면 32%⁠로 올라간다. 큰 회사일수록 먼저 쓴다는 뜻이다.

Fig 03 · 데이터미국 인구조사국 BTOS

업무에 AI를 쓴다고 답한 미국 기업 비율

2년 반 사이 다섯 배가 됐다. 다만 2025년 11월 질문이 넓어지면서 수치가 한 번 크게 뛰었다는 점을 함께 봐야 한다.

업무에 AI를 쓴다고 답한 미국 기업 비율 2023년 9월 3.7%⁠에서 2025년 9월 약 10%⁠로 늘었다. 2025년 11월 질문이 바뀐 뒤 18%, 2026년 5월 19.8%⁠로 집계됐다. 0%5%10%15%20%25% 202420252026 2025년 11월 질문 변경 → '상품·서비스 생산에' → '어느 업무 기능에든' 2023.9 · 3.7%2024.2 · 5.4%2024.8 · 6.6%2025.9 · 약 10%2025.11~2026.1 · 18%2026.5 · 19.8%
미국 인구조사국 기업 동향 조사(BTOS), 기업 수 기준. 2025년 9월까지는 "상품·서비스 생산에 AI를 썼는가", 11월부터는 "어느 업무 기능에든 AI를 썼는가"를 물었다. 2025.11~2026.1 값은 AI 부가 조사.

숫자가 늘어난 것만 보면 확산은 빨라 보인다. 그러나 AI를 쓰는 기업 안으로 들어가면 그림이 달라진다. AI를 도입한 기업의 57%⁠는 세 개 이하의 업무 기능에서만 AI를 사용했다. 65%⁠는 세 개 이하의 작업에만 적용했다. 대부분은 글쓰기, 문서 분석, 정보 검색처럼 잘게 떼어낼 수 있는 일이었다. AI 사용 기업의 66%⁠는 자동화가 아니라 기존 업무의 보조에만 AI를 썼다.

Fig 04 · 데이터넓이보다 깊이

AI를 쓰는 기업 안을 들여다보면

AI를 쓰는 18%⁠만 놓고 본 비율이다. 넓게 퍼졌다기보다 얕게 퍼졌다.

세 개 이하 업무 기능에서만 사용
57%
세 개 이하 작업에만 적용
65%
자동화 없이 보조로만 사용
66%

전체 기업 기준 · AI 때문에 고용이

늘었다
2.3%
줄었다
2.0%
미국 인구조사국 연구 보고서 CES-WP-26-25(2026년 4월), BTOS AI 부가 조사(2025년 11월~2026년 1월). AI를 가장 많이 쓰는 기능은 영업·마케팅(52%)과 전략·사업개발(45%).

고용이 움직인 방향도 한쪽으로 쏠리지 않았다. AI 때문에 고용을 줄였다는 기업이 2.0%, 오히려 늘렸다는 기업이 2.3%⁠였다. 둘을 합해도 스무 곳 중 한 곳이 안 된다.

AI를 사용한다는 말과 AI가 조직의 생산 방식을 바꿨다는 말은 전혀 다르다. 회사 계정으로 챗봇에 접속해 본 것과 채용 공고가 사라지는 것 사이에는 생각보다 많은 과정이 있다.

여기까지만 보면 안심하기 쉽다. 우리 회사는 보안 때문에 못 쓴다. 우리 업계는 규제가 많다. 우리 업무는 너무 복잡하다. 그러니 아직 시간이 있다고 생각한다.

03

그 시간은 누구의 것인가

시간이 있는 것은 맞지만 그 시간이 누구의 것인지는 따져봐야 한다.

우리는 타임갭을 유예기간이라고 부른다. 프론티어 랩은 같은 시간을 제품 로드맵이라고 부른다.

기업이 도구를 고르고 보안 심사를 거쳐 업무를 다시 짜는 동안 모델은 기다려 주지 않는다. AI의 장기 작업 능력을 추적하는 METR은 AI가 절반의 확률로 끝낼 수 있는 과제가 얼마나 긴지를 잰다. 이 길이를 시간 지평이라고 부른다. 2019년의 GPT-2는 사람이 몇 초면 끝내는 일을 겨우 해냈다. 2023년의 GPT-4는 5분짜리 일을, 2025년 8월의 GPT-5는 2시간 17분짜리 일을 절반의 확률로 해냈다. 2026년 2월 Claude Opus 4.6은 약 14.5시간으로 측정됐다. METR 스스로 오차가 매우 크다고 밝힌 수치지만 방향은 분명하다.

METR은 2025년 3월 이 길이가 약 7개월마다 두 배가 된다고 발표했다. 2026년 1월 측정 방식을 손본 뒤에는 2024년 이후만 떼어 보면 두 배가 되는 간격이 4개월 안팎으로 짧아졌다고 봤다.

Fig 05 · 인터랙티브METR 시간 지평

우리 회사의 타임갭 동안 모델은 얼마나 자랄까

AI 도입을 결정하고 인원 계획을 바꾸기까지 걸리는 시간을 골라 보자. 과거 추세가 그대로 이어진다고 가정하면, 그 사이 AI가 절반의 확률로 끝내는 과제의 길이가 몇 배가 되는지 계산된다.

두 배가 되는 주기
두 배가 되는 횟수2.6번
과제 길이×5.9
2026년 2월 측정값 약 14.5시간에서 출발하면약 86시간약 2주 근무
METR 측정값타임갭 동안 추세를 늘린 가정
AI가 절반 확률로 끝내는 과제의 길이 (METR) GPT-2 약 2초(2019), GPT-4 약 5분(2023), o1 약 40분(2024), Claude 3.7 Sonnet 약 50분(2025.2), GPT-5 2시간 17분(2025.8), Claude Opus 4.5 4시간 49분(2025.11), Claude Opus 4.6 약 14.5시간(2026.2). 세로축은 로그 눈금이다. 추세를 그대로 늘린 가정 → 1초1분10분1시간8시간 · 하루40시간 · 1주1개월1년 201920212023202520272029 ↑ 1년치 일을 넘어 차트 밖 GPT-2 약 2초GPT-4 약 5분o1 약 40분Claude 3.7 Sonnet 약 50분GPT-5 2시간 17분Claude Opus 4.5 4시간 49분Claude Opus 4.6 약 14.5시간

예측이 아니라 추세를 그대로 늘린 계산이다. METR의 과제는 맥락이 적고 성공 기준이 분명한 소프트웨어 과제이고, 16시간을 넘는 측정은 지금의 과제 묶음으로는 신뢰도가 낮다. 과제 길이는 AI가 일하는 시간이 아니라 같은 일을 사람이 할 때 걸리는 시간이다.

METR 「Measuring AI Ability to Complete Long Tasks」(2025년 3월), 모델별 평가 발표(GPT-5 2025년 8월, Claude Opus 4.6 2026년 2월), 시간 지평 1.1 갱신(2026년 1월). 일부 값은 측정 방식 개정 뒤 다시 계산됐다. 세로축은 로그 눈금.

이 계산을 그대로 믿을 필요는 없다. 다만 한 가지는 분명하다. 한 회사가 도입 절차를 한 바퀴 도는 동안 모델은 몇 세대를 건너뛴다. 보안 심사를 통과한 모델이 현업에 깔릴 무렵이면 다음 모델이 이미 나와 있다. 타임갭을 버티는 쪽과 타임갭을 쓰는 쪽의 시계는 다르게 간다.

04

간격은 가장자리부터 닫힌다

타임갭은 한꺼번에 닫히지 않는다. 회사가 AI를 이유로 인원을 조정할 때 가장 먼저 손대는 곳은 지금 일하는 사람의 자리가 아니라 아직 뽑지 않은 사람의 자리다.

뉴욕 연방준비은행이 2026년 8월 뉴욕 일대 기업을 조사한 결과, 서비스 기업의 61%⁠가 올해 AI를 쓰고 있었다. 2024년 25%, 2025년 40%⁠에서 가파르게 늘었다. 그런데 최근 6개월 사이 AI 때문에 직원을 내보냈다는 서비스 기업은 4%⁠였다. AI가 없었을 때보다 사람을 덜 뽑았다는 곳은 15% 안팎이었다. 제조업체 가운데 AI 때문에 해고했다는 곳은 올해도 작년에도 없었다.

61%AI를 쓰는 뉴욕 일대 서비스 기업
2026년 8월 조사
4%AI 때문에 해고했다
최근 6개월
15%AI 때문에 덜 뽑았다
같은 조사

덜 뽑힌 자리는 주로 경력의 첫 칸이다. 스탠퍼드 디지털경제연구소의 에릭 브린욜프슨 연구팀은 미국 최대 급여 대행사 ADP의 급여 기록을 추적해, AI에 가장 많이 노출된 직업에서 22~25세의 고용이 덜 노출된 직업의 같은 나이대 추세보다 약 19% 낮다고 2026년 8월 발표했다. 같은 직업에서도 경력이 긴 사람들에게서는 이런 격차가 나타나지 않았다. 감소는 AI가 사람의 일을 넘겨받는 방식으로 쓰이는 직업에 몰렸고, 사람을 거드는 방식으로 쓰이는 직업에서는 고용이 그대로이거나 오히려 늘었다.

전체 노동시장은 아직 조용하다. 예일대 버짓랩은 2026년 9월 갱신한 분석에서 직업 간 이동, 실업자의 AI 노출도, AI 사용 지표가 모두 역사적 범위 안에 있거나 AI 이전의 추세를 따르고 있다며 AI로 인한 노동시장 교란의 뚜렷한 증거는 없다고 봤다.

두 결론은 충돌하지 않는다. 전체 평균에는 아직 잡히지 않지만, 경력의 입구에서는 문이 이미 조금씩 좁아지고 있다.

월급명세서는 해고 통지보다 채용 공고에서 먼저 바뀐다.

Part 2 · 도메인갭정답과 실제 일 사이
05

정답과 실제 일 사이

프론티어 모델은 세상의 많은 지식을 알고 있다. 그러나 직업은 지식 퀴즈가 아니다.

변호사의 일은 법률 문서를 작성하는 것으로 끝나지 않는다. 애초에 어떤 문서가 필요한지 판단하고, 의뢰인이 말하지 않은 사정을 끌어내고, 상대방이 어떻게 반응할지 예상해야 한다. 의사는 의학 정보를 찾는 것뿐 아니라 환자의 생활과 표정, 치료를 거부할 가능성까지 함께 본다. 개발자는 코드를 만드는 것보다 이 수정이 오래된 시스템의 어느 부분을 망가뜨릴지 알아차리는 데 더 많은 시간을 쓴다.

범용 AI의 능력과 이처럼 특정 현장에 쌓인 맥락, 예외, 절차, 관계, 책임 사이의 거리가 도메인갭이다. 그리고 이 거리의 한가운데에는 암묵지가 있다.

암묵지는 전문가가 알고는 있지만 규칙으로 전부 설명하기 어려운 지식이다. 어떤 법률 조항을 써야 하는지보다 이번 의뢰인에게는 왜 그 조항을 쓰지 말아야 하는지 아는 것, 검사 수치에 적히지 않은 환자의 말투에서 무엇을 더 물어야 할지 알아차리는 것, 테스트를 통과한 코드에서도 어딘가 불길한 냄새를 맡는 판단에 가깝다. 전문가는 정답만 많이 기억하는 사람이 아니다. 정답이 통하지 않는 순간을 많이 겪은 사람이다.

우리는 말할 수 있는 것보다 더 많이 안다.

마이클 폴라니, 『The Tacit Dimension』(1966)

헝가리 출신의 화학자이자 철학자 마이클 폴라니가 남긴 이 문장은 경제학에서 오래 쓰였다. MIT 경제학자 데이비드 오터는 2014년 여기에 폴라니의 역설이라는 이름을 붙였다. 사람이 규칙으로 설명하지 못하는 일은 컴퓨터에 규칙으로 가르칠 수도 없으니 자동화가 어렵다는 것이다. 지난 수십 년 동안 컴퓨터가 계산과 서류 처리를 가져가면서도 판단과 대면의 일은 남겨 둔 이유가 여기서 설명됐다. 생성형 AI는 규칙 대신 사례로 배우면서 이 역설의 일부를 돌아가기 시작했다. 남는 질문은 사례로조차 남지 않는 지식이다.

06

결과물은 남고 판단은 사라진다

AI가 주로 배우는 것은 기록된 지식이다. 매뉴얼과 보고서, 코드와 진료기록에는 전문가가 내놓은 최종 결과가 남는다. 그러나 왜 다섯 가지 선택지를 버리고 여섯 번째를 골랐는지, 회의에서 왜 질문 하나를 삼켰는지, 어느 예외를 위험하다고 판단했는지는 좀처럼 남지 않는다. 결과물은 저장되지만 결과물에 도달한 판단의 흔적은 자주 사라진다. 사내 문서를 모델에 연결하는 것만으로 도메인갭이 전부 닫히지 않는 이유다.

Fig 06 · 인터랙티브막대를 움직여 보세요

결과물은 수면 위에, 판단은 수면 아래에

수면 위는 기록으로 남는 결과물, 수면 아래는 좀처럼 남지 않는 판단의 흔적이다. 업무 로그와 수정 이력, 전문가의 피드백이 쌓일수록 수면이 내려가고 판단의 일부가 데이터가 된다.

기록의 수면
최종 계약서
분석 보고서
배포된 코드
진료기록
수정 이력초안에서 무엇을 고쳤나
전문가의 피드백이건 왜 안 되는가
평가 기준무엇이 충분히 좋은가
버린 다섯 가지 선택지
위험하다고 본 예외
회의에서 삼킨 질문
의뢰인의 말투에서 읽은 것
테스트를 통과한 코드에서 맡은 불길한 냄새
■ 기록으로 남는 결과물□ 수면 아래 판단의 흔적▣ 데이터가 된 판단 0개
개념도. 어떤 판단이 먼저 데이터가 되는지는 업무마다 다르다. 기록이 아무리 쌓여도 맨 아래 판단은 수면 위로 잘 올라오지 않는다.

다만 암묵지가 영구적인 성벽인 것은 아니다. 업무 로그와 수정 이력, 전문가의 피드백과 평가 기준이 쌓이면 암묵지의 일부도 데이터로 바뀐다. 프론티어 랩이 전문가를 고용해 과제를 만들고, 모델의 답을 평가하게 하며, 실제 업무 도구와 연결하는 이유도 여기에 있다. 지금 AI가 배우기 어려운 지식과 앞으로도 배울 수 없는 지식은 같은 말이 아니다.

07

평가표 밖의 공간

AI의 시간 지평을 재는 METR도 이 차이를 분명히 경고한다. AI가 두 시간짜리 과제를 수행한다는 말은 이미 프로젝트를 잘 아는 직원의 두 시간을 대신한다는 뜻이 아니다. METR은 시간 지평이 맥락이 적은 사람, 예컨대 신규 직원이나 원격으로 일하는 외부 계약자가 해낼 수 있는 일에 더 가깝다고 설명한다. 주어진 자료와 성공 기준이 명확한 과제를 받은 사람의 두 시간이다. 실제 직업은 문제가 깔끔하게 주어지지 않고, 사람을 상대하며, 성공 여부를 숫자로 채점하기도 어렵다.

METR은 2026년 1월 이 지표의 한계를 정리하며 한 걸음 더 나갔다. 믿을 수 있어야 하고 검증이 어려운 일은 성공률이 98%⁠를 넘어야 자동화할 가치가 생긴다. 시간 지평이 두 배가 된다고 자동화되는 몫이 두 배가 되지도 않는다. 사람이 끼어드는 횟수가 절반으로 줄어도 AI가 더 복잡하게 틀리면 한 번 끼어들 때 드는 품이 커지기 때문이다.

맥락의 무게는 METR의 다른 실험에서 더 선명하게 드러났다. 2025년 7월 METR은 대형 오픈소스 프로젝트에서 오래 일해 온 숙련 개발자 16명에게 실제 이슈 246건을 맡기고, 이슈마다 AI 도구 사용을 무작위로 허용하거나 금지하는 무작위 대조 실험을 했다. AI를 쓴 쪽이 작업에 19% 더 오래 걸렸다. 개발자들은 시작 전 AI가 24% 빠르게 해 줄 거라 예상했고, 끝난 뒤에도 20% 빨라졌다고 믿었다. 자기 코드를 속속들이 아는 사람에게 맥락 없는 AI의 제안은 검토하고 고쳐야 할 일거리가 되기도 한다.

이 결과를 모든 개발 현장에 넓혀 적용할 수는 없다. METR이 2026년 다시 시도한 실험에서는 AI 없이 일하겠다는 개발자가 줄어 깨끗한 비교 자체가 어려웠다. 그만큼 도구가 빨리 현장에 스며들었다는 뜻이기도 하다. 그래도 도메인갭이 무엇인지 보여 주는 장면으로는 충분하다.

OpenAI가 만든 GDPval도 마찬가지다. 이 평가는 미국 경제에서 비중이 큰 9개 산업, 44개 직업에서 평균 14년 경력의 전문가들이 만든 1,320개 과제로 이뤄진다. 모델과 전문가가 같은 과제로 결과물을 만들면, 다른 전문가가 누가 만든 것인지 모르는 블라인드 상태에서 둘을 비교해 채점한다.

Fig 07 · 데이터OpenAI GDPval

전문가 결과물과 비교해 '같거나 낫다'는 판정을 받은 비율

점선은 50%⁠다. 이 선을 넘으면 전문가와 맞붙어 이기거나 비기는 경우가 지는 경우보다 많다는 뜻이다.

GPT-4o 2024년 출시
13.7%
GPT-5 2025.9 측정
40.6%
Claude Opus 4.1 2025.9 측정
47.6%
GPT-5.2 Thinking 2025.12
70.9%
GPT-5.2 Pro 2025.12
74.1%
평가 안에 있는 것
  • 필요한 자료와 목표가 주어진 과제
  • 한 번에 끝내는 결과물
  • 컴퓨터로 만드는 문서·표·설계도
  • 누가 만들었는지 모르고 하는 비교
평가 밖에 있는 것
  • 의뢰인과 대화해 목표를 정하는 일
  • 피드백을 받아 여러 번 고치는 일
  • 결과가 틀렸을 때 책임지는 일
  • 몸과 현장이 필요한 일
OpenAI GDPval 공개(2025년 9월)와 GPT-5.2 발표(2025년 12월). 2026년 이후 모델은 같은 방식의 공식 수치가 공개되지 않아 싣지 않았다. 외부 기관의 재현 평가는 채점 방식이 달라 함께 비교하지 않는다.

프론티어 모델의 향상 속도는 빨랐다. 2025년 9월 처음 공개될 때 가장 좋은 점수는 47.6%⁠였고, 석 달 뒤 GPT-5.2는 70.9%⁠에 이르렀다. 하지만 과제는 필요한 자료와 목표가 비교적 분명하게 주어진 일회성 작업이다. OpenAI도 지금의 평가는 한 번에 끝나는 방식이라 맥락을 쌓아 가거나 여러 차례 고쳐 쓰며 나아지는 경우를 담지 못한다고 밝혔다. 의뢰인과 대화해 모호한 목표를 정의하거나, 피드백을 받아 여러 차례 수정하고, 결과가 틀렸을 때 책임지는 과정은 아직 평가 밖에 있다.

바로 그 평가 밖의 공간에 전문가의 암묵지가 남아 있다. 현재의 도메인갭은 그 공간만큼 넓다.

Part 3 · 좁혀지는 간격프론티어 랩이 보고 있는 것
08

프론티어 랩도 그 공간을 보고 있다

도메인갭은 발견되지 않은 비밀이 아니다. AI 기업들은 이미 무엇이 빠졌는지 알고 있다.

그래서 최근의 경쟁은 더 큰 언어모델 하나를 만드는 데서 끝나지 않는다. 사내 문서를 불러오는 커넥터, 이전 작업을 기억하는 메모리, 브라우저와 업무 프로그램을 직접 다루는 컴퓨터 사용, 조직의 절차를 묶어 넣는 스킬, 의료와 금융에 맞춘 평가와 규제 기능이 모델 주변에 붙고 있다.

Fig 08 · 구조도모델 둘레에 붙는 것들

범용 모델을 현장 안으로 들여보내는 여섯 가지 장치

가운데 모델은 기록된 지식을 안다. 둘레에 붙는 장치들은 그 모델을 특정 회사, 특정 업무 안으로 한 걸음씩 들여보낸다. 카드마다 아래에 적은 것은 실제로 나온 제품과 시점이다.

범용 모델세상의 기록된 지식을 배웠다
정답은 알지만 우리 회사 사정은 모른다
사내 데이터커넥터

처음 온 외부인을 회사 사정을 읽는 동료로 바꾼다. 메일, 문서, 고객관리 시스템을 연다.

  • MCP 공개 · 앤트로픽 2024.11
  • ChatGPT 업무용 커넥터 · OpenAI 2025.6
이전 작업메모리

매번 처음부터 설명하던 일을 어제 하던 자리에서 이어 가게 한다.

  • ChatGPT 메모리 · OpenAI 2024.2
  • Claude 메모리 · 앤트로픽 2025.9
업무 프로그램컴퓨터 사용

답을 말하는 AI를 직접 클릭하고 입력하는 AI로 바꾼다.

  • Claude 컴퓨터 사용 · 앤트로픽 2024.10
  • ChatGPT 에이전트 · OpenAI 2025.7
  • ChatGPT Atlas 브라우저 · OpenAI 2025.10
조직의 절차스킬

일반적인 방법 대신 우리 회사의 양식과 순서를 따르게 한다.

  • Agent Skills · 앤트로픽 2025.10
규제 산업도메인 패키지

의료와 금융처럼 규제와 책임이 무거운 현장에 맞춘 데이터 연결과 평가를 묶는다.

  • Claude for Financial Services · 2025.7
  • Claude for Life Sciences · 2025.10
  • 의료용 ChatGPT·Claude · 2026.1
사람의 판단전문가 데이터

기록된 결과 대신 전문가가 판단하는 과정과 채점 기준을 모델에 가르친다.

  • 전직 투자은행원 100여 명의 재무 모델 과제 · OpenAI 2025.10 보도
  • 전문가 데이터 기업 머코어 · 연 환산 매출 20억 달러(2026.6)
각 사 발표 기준. 시점은 처음 공개된 달.

모델 바깥에서는 사람이 붙는다. 블룸버그는 2025년 10월 OpenAI가 전직 투자은행 직원 100여 명을 시간당 150달러에 고용해 재무 모델을 만드는 과제를 쓰게 했다고 보도했다. 전문가를 모아 AI 학습용 과제와 채점 기준을 만드는 기업들도 빠르게 커졌다. 그중 하나인 머코어(Mercor)의 연 환산 매출은 2026년 6월 20억 달러에 이르렀고, 매주 3만 명이 넘는 전문가가 이 회사를 통해 AI에 일을 가르친다. 전문가가 답을 고치고 점수를 매긴 흔적이 쌓일수록, 수면 아래에 있던 판단이 조금씩 데이터가 된다.

정확히 말하면 프론티어 랩은 도메인갭을 넓히는 것이 아니다. AI가 다룰 수 있는 도메인의 범위를 넓히면서 각 분야 안의 간격을 좁히고 있다. 이 과정이 빨라질수록 기업이 AI를 실제 업무에 올리는 타임갭도 함께 압축된다.

연결이 끝난 곳에서는 쓰임새도 달라진다. 앤트로픽이 2026년 1월 공개한 경제 지수에서 일반 사용자의 Claude.ai 대화는 보조형이 52%, 자동화형이 45%⁠였다. 기업이 자기 시스템에 모델을 직접 붙여 쓰는 API 사용에서는 4분의 3이 자동화형이었다. 챗봇 창에서는 사람이 AI의 도움을 받는 쪽에 가깝지만, 업무 시스템 안으로 들어간 AI는 일을 넘겨받는 쪽으로 기운다.

09

성벽이자 발판

OpenAI가 2026년 공개한 내부 사용 연구는 극단적이지만 흥미로운 사례다. 처음에는 개발자가 주로 쓰던 코딩 에이전트 Codex가 법무, 재무, 채용 같은 비개발 부서로 번졌다. OpenAI 안에서 법무·재무·채용 부서는 2026년 4월 무렵 Codex를 주로 쓰는 쪽으로 넘어갔다. 개발 부서보다 늦게 출발했지만 넘어가는 속도는 훨씬 빨랐다. 지금은 OpenAI의 변호사나 채용 담당자가 만들어 내는 결과물 토큰의 85% 이상이 Codex에서 나온다. 법무팀의 사용량은 2025년 11월보다 2026년 6월에 13배 많았다. 이들은 스프레드시트를 자동화하고 데이터를 가공하며, 예전 같으면 개발팀에 부탁했을 작은 사내 도구를 직접 만든다.

물론 OpenAI는 일반 기업보다 AI에 익숙하고 비용과 경영진 지원도 풍부하다. 수치는 모두 OpenAI가 스스로 집계했고 외부 검증을 거치지 않았다. 사용량이 곧 생산성이나 해고를 뜻하지도 않는다. 그럼에도 한 가지는 보여준다. 도구와 조직 학습이 갖춰진 환경에서는 늦게 출발한 도메인도 예상보다 빠르게 따라붙을 수 있다.

프록터앤드갬블(P&G)의 전문가 776명을 대상으로 한 현장실험에서는 AI를 사용한 개인이 AI 없이 일한 두 사람의 팀과 비슷한 수준의 결과를 냈다. 하버드경영대학원과 와튼스쿨 등의 연구진이 2025년 3월 발표한 연구로, 실제 신제품 개발 과제를 혼자 또는 둘이, AI와 함께 또는 AI 없이 수행하도록 참가자를 무작위로 나눴다.

Fig 09 · 데이터P&G 776명 현장실험

AI를 쓴 한 사람이 두 사람의 팀을 따라잡았다

신제품 개발 과제의 결과물 품질. 혼자 AI 없이 일한 그룹을 기준으로 얼마나 나아졌는지를 표준편차 단위로 쟀다.

혼자AI 없음둘이 한 팀AI 없음혼자AI 사용둘이 한 팀AI 사용

AI를 쓴 쪽은 작업 시간도 12~16% 덜 들었고, 결과물은 더 길고 자세했다. 상위 10% 수준의 해법은 AI를 쓴 팀에서 눈에 띄게 많이 나왔다.

Dell'Acqua 외, 「The Cybernetic Teammate」, NBER 워킹페이퍼 33641(2025년 4월), 2026년 『Organization Science』 게재. 사전 등록된 무작위 현장실험.

더 흥미로운 대목은 전문영역의 경계였다. AI가 없을 때 연구개발 담당자는 기술 쪽으로, 영업 담당자는 상업성 쪽으로 치우쳤다. AI를 사용하자 두 집단 모두 상대 영역을 더 균형 있게 다뤘다. 연구진은 AI가 있는 조건에서 두 전문가 집단의 차이가 사실상 사라졌다고 썼다. 연구개발 담당자가 영업의 언어를, 영업 담당자가 기술의 언어를 빌려 쓸 수 있게 된 것이다.

도메인지식은 AI를 막는 성벽이면서 동시에 AI가 다른 분야로 넘어갈 때 밟는 발판이기도 하다.

사내 맥락이 AI의 방어선이라는 말도 절반만 맞는다. 그 맥락이 문서와 로그, 업무 절차와 평가 기준으로 바뀌는 순간 방어선은 학습자료가 된다. 문서가 없다는 사실을 해자라고 부르기에는, 때로는 그냥 정리되지 않은 창고에 가깝다.

Part 4 · 무엇을 지킬까도메인지식의 무게
10

도메인지식의 세 층

그렇다면 무엇을 지켜야 할까? 도메인지식이라고 모두 같은 무게를 갖는 것은 아니다.

1층외워서 보유한 사실

문서로 남고 정답을 확인할 수 있다. 가장 약한 방어선.

2층맥락과 예외를 판별하는 지식

말하지 않은 조건, 문서에 없는 관행. 기록되면 AI 안으로 들어간다.

3층판단과 책임에 가까운 지식

문제를 정하고, 기준을 세우고, 이름을 건다. 지금 가장 오래 남는다.

외워서 보유한 사실은 가장 약한 방어선이다. 문서로 남아 있고 정답을 확인할 수 있다면 모델이 흡수하기 쉽다. 업계 용어를 많이 아는 것만으로는 충분하지 않다.

현장의 맥락과 예외를 판별하는 지식은 더 강하다. 고객이 말하지 않은 조건, 문서에 없는 관행, 실패했을 때 치러야 할 비용을 아는 능력이다. 다만 이것도 기록되고 반복되면 AI 시스템 안으로 들어갈 수 있다.

지금 가장 오래 남는 것은 판단과 책임에 가까운 지식이다. 무엇을 문제로 삼을지 정하고, 어떤 결과가 충분히 좋은지 기준을 세우며, 그럴듯하게 틀린 답을 알아보고, 마지막 결정에 이름을 걸 수 있는 능력이다. 이것은 단순히 오래 일했다고 자동으로 생기지 않는다. AI를 쓰지 않는다고 보존되는 것도 아니다.

Fig 10 · 인터랙티브직접 분류해 보세요

이 일은 어느 층일까

법률, 의료, 개발, 사무 현장의 여덟 가지 일이다. 사실, 맥락, 판단 가운데 어디에 가까운지 골라 보자.

판례 데이터베이스에서 관련 조항과 판결 찾기

사실 · 문서로 남아 있고 맞는지 확인할 수 있다. 모델이 가장 먼저 흡수하는 층이다.

의뢰인이 말하지 않은 사정을 끌어내기

맥락 · 문서에 없는 조건을 읽는 일이다. 다만 상담 기록이 쌓이면 일부는 패턴이 된다.

이번 건은 소송 대신 합의로 가자고 결정하기

판단 · 무엇을 문제로 삼을지 정하고, 결과에 이름을 거는 일이다.

검사 수치를 기준 범위와 비교하기

사실 · 기준표가 있고 정답이 있다. 이미 소프트웨어가 잘하는 일이다.

환자의 말투에서 더 물어볼 것을 알아차리기

맥락 · 검사지에 적히지 않는 신호다. 진료 대화가 기록되기 시작하면 일부는 데이터가 된다.

테스트를 모두 통과한 코드의 배포를 멈추기

판단 · 그럴듯하게 맞는 답을 의심하고, 멈춘 결정의 책임을 진다.

사내 양식에 맞춰 주간 보고서 채우기

사실 · 양식과 원자료가 있으면 끝나는 일이다. 커넥터 하나로 넘어간다.

약속보다 늘 2주 늦는 거래처를 감안해 일정 짜기

맥락 · 문서에 없는 관행이다. 누군가 기록하기 시작하면 AI도 쓸 수 있다.

분류는 이 칼럼의 기준이다. 같은 일도 누가 어디까지 책임지느냐에 따라 층이 달라질 수 있다.

타임갭이 있으니 아직 AI를 쓰지 않아도 된다는 태도는 위험하다. 그동안 프론티어 랩은 우리의 업무를 관찰하고, 전문가를 고용해 평가를 만들고, 도구와 데이터를 연결하며 도메인갭을 줄인다. 나는 멈춰 있는데 상대만 그 간격을 공부하는 셈이다.

질문은 AI가 내 직업의 지식을 언제 외우느냐가 아니다. 내가 가진 지식 가운데 무엇이 문제 정의와 검증 기준으로 남을 수 있는지, 무엇을 AI와 결합해 더 큰 판단으로 바꿀 수 있는지 물어야 한다.

11

월급명세서는 늦게 바뀐다

국제노동기구(ILO)는 2025년 5월 폴란드 국립연구소(NASK)와 함께 낸 보고서에서 전 세계 취업자 네 명 중 한 명이 생성형 AI에 어느 정도 노출된 직업에서 일한다고 추산했다. 고소득 국가에서는 그 비율이 34%⁠로 올라간다. 그러나 노출이 가장 높은 등급에 든 일자리는 3.3%⁠였다. 대부분의 직업에는 사람의 손을 거쳐야 하는 작업이 섞여 있어서, 생성형 AI에 노출된 직업 대부분에서 완전한 대체보다 직무의 변형이 먼저 일어날 가능성이 높다고 ILO는 본다.

변형이라는 말은 안심하라는 뜻이 아니다. 직업 이름은 남아도 그 안에서 값비싼 일이 무엇인지는 달라질 수 있다는 뜻이다.

다음 달 월급명세서에도 내 이름은 남아 있을 가능성이 크다. 하지만 그것은 내 직업이 안전하다는 증거가 아니다. 아직 타임갭 안에 있다는 표시일 뿐이다.

모델 성능표는 매달 바뀐다. 월급명세서는 조금 늦게 바뀐다. 그 사이를 내 자리라고 부르기에는 타임갭은 너무 빨리 줄어들고 있다.

AC Lens

AC리서치가 이 간격을 보는 법

AC리서치는 AI 하이퍼사이클이 온다고 본다. 다만 사이클은 한 박자로 움직이지 않는다. 데이터센터와 전력, 반도체에 들어가는 돈은 모델 성능표를 따라 먼저 움직이고, 기업의 AI 매출과 고용은 월급명세서를 따라 늦게 움직인다. 지금 'AI 거품' 논쟁의 한가운데 있는 것이 바로 이 시차다.

타임갭이 빨리 닫히면 기업 현장의 사용량이 불어나고, 그 사용량이 다시 연산과 전력 수요를 끌어올린다. 사이클을 강화하는 증거다. 타임갭이 오래 버티면 투자는 먼저 나갔는데 회수가 늦어진다. 사이클을 시험하는 변수다. 그래서 AC리서치는 성능표와 월급명세서를 함께 본다.

신호 ① 확산의 폭AI를 쓰는 기업 비율

미국 인구조사국 BTOS가 2주마다 집계한다. 18~20%⁠에서 얼마나 빨리 올라가는가.

신호 ② 능력의 길이METR 시간 지평

두 배가 되는 주기가 짧아지는가, 측정의 천장에 부딪히는가.

신호 ③ 직무의 깊이GDPval 같은 직무 평가

평가 밖에 있던 대화·수정·책임이 평가 안으로 들어오는가.

신호 ④ 연결의 속도기업용 에이전트와 AI 매출

AI가 챗봇 창을 넘어 업무 시스템 안으로 들어가는가.

네 신호가 한 방향을 가리킬수록 성능표와 월급명세서의 간격은 줄고, 먼저 나간 인프라 투자는 매출로 돌아온다. AC 시황은 매일 이 신호들을 강화와 시험으로 나눠 기록한다.

용어 풀이와 출처

본문에서 점선 밑줄이 그어진 말은 누르거나 마우스를 올리면 풀이가 뜬다. 같은 풀이를 여기에 모았다.

용어 풀이

  1. 프론티어 모델

    그 시점에 가장 앞선 성능을 내는 최상위 AI 모델. OpenAI의 GPT, 앤트로픽의 Claude, 구글의 Gemini 최신 버전이 여기에 든다.

  2. 지식노동

    몸보다 지식과 판단으로 가치를 만드는 일. 회계, 법률, 개발, 기획, 연구, 사무 같은 일이 여기에 든다.

  3. 워크플로

    일이 처리되는 순서와 절차. 누가 무엇을 받아 어떻게 처리하고 누구에게 넘기는지의 흐름이다.

  4. 기업 동향 조사(BTOS)

    미국 인구조사국이 2주마다 기업에 경영 상황을 묻는 조사(Business Trends and Outlook Survey). 2023년 9월부터 AI 사용 여부를 묻고 있고, 2025년 11월 질문 범위를 넓혔다.

  5. 고용 가중

    기업 수가 아니라 각 기업의 직원 수만큼 무게를 두어 계산하는 방식. 직원이 많은 큰 회사의 응답이 더 크게 반영된다.

  6. 보조와 자동화

    보조는 사람이 일을 하고 AI가 거드는 방식, 자동화는 AI가 일을 넘겨받아 처리하는 방식이다. 같은 AI라도 어떻게 쓰느냐에 따라 고용에 미치는 영향이 다르다.

  7. METR

    프론티어 AI 모델이 얼마나 길고 복잡한 일을 자율적으로 해낼 수 있는지 측정하는 미국의 독립 비영리 연구기관(Model Evaluation & Threat Research).

  8. 시간 지평

    AI가 50% 확률로 끝낼 수 있는 과제의 길이를, 같은 일을 사람 전문가가 할 때 걸리는 시간으로 잰 값. AI가 쉬지 않고 일하는 시간이 아니다.

  9. 노출도

    한 직업의 업무 가운데 AI가 수행할 수 있는 작업이 얼마나 되는지를 나타내는 지표. 노출이 곧 대체를 뜻하지는 않는다.

  10. 암묵지

    알고는 있지만 말이나 규칙으로 다 설명하기 어려운 지식. 자전거 타는 법이나 숙련 의사의 직감처럼 경험으로 몸에 붙는다. 화학자이자 철학자 마이클 폴라니가 개념을 정리했다.

  11. 폴라니의 역설

    사람이 규칙으로 설명하지 못하는 일은 기계에 가르치기도 어렵다는 관찰. 경제학자 데이비드 오터가 2014년 이름 붙였다.

  12. 무작위 대조 실험

    대상을 무작위로 나눠 한쪽에만 처치(여기서는 AI 도구)를 주고 결과를 비교하는 실험. 다른 요인의 영향을 걸러 낼 수 있어 인과관계를 따지는 가장 믿을 만한 방법으로 꼽힌다.

  13. GDPval

    OpenAI가 2025년 9월 공개한 평가. 44개 직업의 실제 업무 과제에서 AI 결과물과 전문가 결과물을 다른 전문가가 블라인드로 비교한다.

  14. 블라인드 평가

    채점자가 누가 만든 결과물인지 모르는 상태에서 비교하는 방식. "AI가 만들었다"는 선입견을 걷어 낸다.

  15. 커넥터

    AI가 회사의 메일, 문서 저장소, 고객관리 시스템 같은 외부 도구에 접속해 데이터를 읽고 쓰게 해 주는 연결 장치.

  16. 메모리

    AI가 이전 대화와 작업 내용을 기억해 다음 작업에 이어 쓰는 기능.

  17. 컴퓨터 사용

    AI가 화면을 보고 마우스와 키보드를 조작해 브라우저나 업무 프로그램을 사람처럼 다루는 기능.

  18. 스킬

    조직의 업무 절차, 양식, 점검 목록을 AI가 필요할 때 꺼내 쓰도록 묶어 둔 지침 꾸러미.

  19. API

    프로그램끼리 기능을 주고받는 통로. 기업은 API로 AI 모델을 자기 시스템에 직접 연결해 쓴다.

  20. 해자

    성 둘레에 판 물길. 경제에서는 경쟁자가 쉽게 넘보지 못하게 막아 주는 구조적 강점을 뜻한다.

  21. Codex

    OpenAI의 코딩 에이전트. 코드를 읽고 고치고 실행하는 일을 맡으며, 개발자가 아닌 사람도 말로 지시해 작은 프로그램을 만들 수 있다.

  22. 현장실험

    실험실이 아니라 실제 회사와 실제 업무 안에서 조건을 무작위로 나눠 효과를 재는 실험.

  23. 표준편차

    값들이 평균에서 얼마나 흩어져 있는지를 나타내는 단위. 효과를 표준편차로 재면 서로 다른 실험끼리도 크기를 견줄 수 있다. 0.37 표준편차는 평균적인 참가자를 상위 36% 안팎으로 끌어올리는 정도다.

  24. 국제노동기구(ILO)

    노동 기준과 고용 정책을 다루는 유엔 전문기구. 정부·사용자·노동자 대표가 함께 참여한다.

출처

  1. 미국 인구조사국(Bonney 외), The Microstructure of AI Diffusion: Evidence from Firms, Business Functions, and Worker Tasks, CES-WP-26-25 · 2026.4
  2. 미국 인구조사국, Large Firms With at Least 20 Employees Biggest AI Users (America Counts) · 2026.5
  3. 뉴욕 연방준비은행, Businesses Are Using AI to Transform Work, Not Cut Jobs (Liberty Street Economics) · 2026.9.1
  4. Brynjolfsson·Chandar·Chen, 스탠퍼드 디지털경제연구소, Canaries in the Coal Mine? (2026년 8월 갱신) · 2026.8.12
  5. 예일대 버짓랩, Tracking the Impact of AI on the Labor Market · 2026.9.15 갱신
  6. METR, Measuring AI Ability to Complete Long Tasks · 2025.3.19
  7. METR, Task-Completion Time Horizons of Frontier AI Models · 2026.5.8 갱신
  8. METR, Time Horizon 1.1 · 2026.1.29
  9. METR, Clarifying limitations of time horizon · 2026.1.22
  10. METR, Details about METR’s evaluation of OpenAI GPT-5 · 2025.8
  11. METR, Claude Opus 4.6 시간 지평 발표(X) · 2026.2
  12. METR, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity · 2025.7.10
  13. METR, Uplift study update · 2026.2.24
  14. OpenAI, Measuring the performance of our models on real-world tasks (GDPval) · 2025.9.25
  15. OpenAI, Introducing GPT-5.2 · 2025.12
  16. Michael Polanyi, The Tacit Dimension · 1966
  17. David H. Autor, Polanyi’s Paradox and the Shape of Employment Growth, NBER Working Paper 20485 · 2014.9
  18. Anthropic, Anthropic Economic Index: January 2026 report · 2026.1
  19. OpenAI, The Shift to Agentic AI: Evidence from Codex · 2026.6.25
  20. Dell’Acqua·Ayoubi·Lifshitz-Assaf·Sadun·Mollick 외, The Cybernetic Teammate: A Field Experiment on Generative AI Reshaping Teamwork and Expertise, NBER Working Paper 33641 · 2025.4
  21. ILO·NASK (Gmyrek 외), Generative AI and Jobs: A Refined Global Index of Occupational Exposure, ILO Working Paper 140 · 2025.5.20
  22. 블룸버그, OpenAI Looks to Replace the Drudgery of Junior Bankers’ Workload · 2025.10.21
  23. Dealroom, Mercor doubles to $2B gross revenue run-rate as AI labs buy expert data · 2026.7.6
  24. Fortune, OpenAI’s Project Mercury and entry-level banking jobs · 2025.10.21

AC리서치의 원고에 공개 통계와 연구를 보강해 편집한 칼럼이다. 수치는 각 기관이 발표한 값이며, 조사 방식과 시점이 서로 달라 직접 더하거나 빼서 비교하지 않았다. 정보 제공 목적이며 투자 권유가 아니다.

© AC-Research · 정보 제공 목적이며 투자 권유가 아닙니다. 홈으로