태스크 실험 생산성 향상 (RCT)
+14~56%
구조화 지식노동 일관 재현
경제 전체 노동시간 절감 (미국 2025)
1.6%
실험실 대비 10~30배 희석
10년 GDP 효과 추정 범위
+1~7%
Acemoglu vs Goldman Sachs
AI 추론 비용 (18개월간)
1/280
$20 → $0.07 / 100만 토큰
2023~2026년의 가장 영향력 있는 AI 생산성 연구 20여 편을 서베이한 결론. 생산성 향상은 실재하며 재현 가능하다 — 단 "AI 역량 경계 안의, 잘 정의되고, 검증 가능한 과업"이라는 조건 위에서다. 거시 추정은 연 +0.5~1.5%p 기여로 수렴 중이다. 그리고 "AI발 디플레이션"은 순서가 틀렸다: 지금 AI는 데이터센터 캐펙스를 통해 코어 물가를 +0.3~0.5%p 밀어올리는 인플레이션 요인이며, 디스인플레이션은 기계를 다 지은 후에야 도착한다.

1. 왜 지금 이 질문인가

"AI가 생산성을 높인다"는 명제는 2023년까지는 전망이었고, 2024~25년에는 실험이었으며, 2026년 현재는 측정의 문제가 되었다. 콜센터 상담원 5,179명의 실제 업무 데이터, BCG 컨설턴트 758명의 통제실험, 개발자 4,867명의 3사 현장실험, 덴마크 노동자 2만 5천 명의 행정 데이터 — 과거 어떤 범용기술도 도입 초기에 이 정도로 촘촘하게 측정된 적이 없다.

시장에서는 한발 더 나아간 주장이 나온다. ARK의 캐시 우드는 "미국 인플레이션이 0 또는 마이너스로 갈 수 있다"(2025.9)고 했고, 샘 알트먼은 "동일 수준 AI의 사용 비용이 12개월마다 약 10분의 1로 떨어진다"고 관찰했다. 반면 파월 연준 의장은 2026년 3월 "데이터센터 건설이 오히려 물가를 밀어올리고 있다"고 정반대 진단을 내렸다. 본 서베이는 세 질문을 다룬다. (Q1) 어떤 조건에서 생산성이 실제로 향상되는가, (Q2) 거시경제 효과는 얼마이고 왜 추정이 10배씩 갈리는가, (Q3) 디플레이션 가설은 얼마나 타당한가.

2. 태스크 수준 실증: 무엇이 얼마나 빨라지는가

연구 (게재지)대상·설계대표 효과핵심 단서
Noy & Zhang 2023 (Science)전문직 453명, 글쓰기 RCT시간 −40% · 품질 +18%하위 수행자 향상 최대, 68%는 AI 초안 그대로 제출
Brynjolfsson 외 (QJE 2025)콜센터 5,179명, 준실험시간당 해결 +14~15%신입 +34%(1개월 미만 +46%), 최상위 숙련자 ~0%
Peng 외 2023 (Copilot RCT)개발자 95명, 표준 과업+55.8% 단축그린필드 단일 과업 — 거시 추정에 가장 많이 인용된 수치
Dell'Acqua 외 2023 (BCG 758명)컨설팅 실무 과업 RCT품질 +40%, 속도 +25%AI 역량 경계 밖 과업에선 정답률 −19%p ("들쭉날쭉한 경계")
Cui 외 2024 (MS·액센츄어 등 3사)개발자 4,867명 현장 RCT주간 PR +26.1%실험실 대비 절반 — 현장 감쇠. 주니어 >> 시니어
METR 2025숙련 OSS 개발자 16명, 실제 이슈 246건완료 시간 +19% (느려짐)본인들은 20% 빨라졌다고 믿음 — 자기보고 불신의 근거
Schwarcz 외 2025 (법률)로스쿨생 127명, 추론모델·RAG생산성 +34~140%GPT-4 시대의 "품질 무변화" 결과를 뒤집음 — 경계는 이동한다
Goh 외 2024 (JAMA)의사 50명, 진단 RCT+2%p (유의하지 않음)GPT-4 단독은 의사보다 16%p 높았다 — 병목은 인터페이스
세계은행 2025 (나이지리아)6주 GPT-4 튜터링 RCT+0.31 SD (1.5~2년치 학습)역대급 교육 개입 효과 — 저소득국 레버리지 최대
Otis 외 2025 (케냐 SME 640곳)AI 비즈니스 멘토 RCT평균 0 (상위 +15% / 하위 −8%)비정형 난제에선 AI가 격차를 벌린다

교차 패턴은 여섯 가지다. 첫째, 스킬 평준화 — 구조화된 과업에서는 저숙련·신입의 향상이 압도적이다(AI가 최상위 수행자의 암묵지를 코드화해 뿌리기 때문). 둘째, 그러나 평준화는 조건부다 — 비정형 과업(케냐)이나 전문가의 고맥락 업무(METR)에서는 부호가 뒤집힌다. 셋째, 들쭉날쭉한 경계는 모델 세대마다 전진한다(법률 RCT의 반전). 넷째, 인식 ≠ 실제 — 자기보고식 생산성 서베이는 체계적으로 부풀려질 수 있다. 다섯째, 실험실→현장 감쇠율은 약 절반(+56%→+26%). 여섯째, 검증·수정 비용은 숨은 세금이다.

3. 거시경제: 0.7%인가 7%인가

기관/연구추정치방법론
Goldman Sachs (2023)글로벌 GDP +7% (~$7조) · 미국 생산성 연 +1.5%p직업 노출 매핑, 보급 완료 조건부. 3억 개 일자리 노출
Acemoglu (2024)10년 누적 GDP +0.9~1.1% · TFP +0.66~0.71%Hulten 정리 — 영향 과업 GDP 가중 4.6%뿐, 2023년 기술 고정
Aghion & Bunel (2024)연 TFP +0.68%p (Acemoglu의 10배)같은 공식, 동적 파라미터(컴퓨팅 비용 연 22% 하락 반영)
McKinsey (2023)연 $2.6~4.4조 가치 잠재력63개 유즈케이스 상향식 — GDP 개념 아님. 가치의 75%가 4개 기능에 집중
IMF (2024)선진국 고용 60% 노출 (글로벌 40%)노출도+보완성 지수. 절반은 증강, 절반은 대체 위험
Penn Wharton (2025)TFP 기여 2032년 정점 연 +0.2%p · GDP 2035년 +1.5%Acemoglu 틀 + 동적 보급 S-커브
OECD (2024) / BIS (2026)연 +0.25~0.6%p / 중앙값 ~+0.5%p시나리오 종합·추정치 서베이
Anthropic Economic Index (2026)연 +1.0~1.2%p (성공률 조정)실제 Claude 사용을 O*NET 과업에 매핑 — 사용 데이터 기반 최초 거시 추정

추정이 갈리는 이유는 다섯 가지로 분해된다. 노출 범위(과업의 4.6% vs 직업의 3분의 2), 정적 vs 동적 기술 가정(이것 하나로 10배), "효과"의 정의(TFP만 vs 캐펙스 포함 GDP vs 유즈케이스 총가치), 신규 직업 창출 포함 여부, 조건부 vs 무조건부 전망. 2025~26년 신규 추정들은 연 +0.5~1.5%p 기여의 중간 지대로 수렴 중이다.

실측은 어떤가. 미국 노동생산성은 2023년 +1.6%, 2024년 +2.3%(개정 +3.0%), 2025년 +2.1%로 팬데믹 전보다 뚜렷이 높지만, 캔자스시티 연준(2026.2)은 "AI 도입이 높은 산업일수록 생산성 증가가 유의하게 빠르나, 총량 가속의 대부분은 아직 AI로 설명되지 않는다"고 결론지었다. 표준 해석은 Brynjolfsson의 생산성 J-커브다: 범용기술은 프로세스 재설계라는 무형자산 투자를 먼저 요구하고, 이 구간에서 측정 생산성은 눌린다(전기 ~30년, IT는 1995~2004년에야 가속). 현재의 밋밋한 거시 데이터를 회의론의 승리로 읽을 수 없는 이유다.

4. 실험실 vs 현실: 10~30배의 격차

측정 층위효과 크기출처
실험실 단일 과업+55.8%Peng et al. 2023
기업 현장 실험+26.1%Cui et al. 2024
사용자 체감 (도구 사용 중)~+33%Bick-Blandin-Deming
경제 전체 노동시간 절감1.6%미국, 2025.8 기준
누적 거시 생산성 기여 (상한)≤1.3%St. Louis Fed 2025

격차의 메커니즘: (1) 산수 — 노동자 37~41% × 노동시간 6% 사용 × 부분적 과업 커버리지, (2) 과업 ≠ 직무 — AI는 직업의 절반에서 과업의 4분의 1을 수행하지만 4분의 3 이상을 수행하는 직업은 4%뿐, (3) 조직 병목 — 고성과 기업(EBIT 5% 이상 기여, McKinsey 기준 단 6%)을 가르는 건 모델이 아니라 워크플로 재설계, (4) 절감 시간의 재흡수 — 덴마크 데이터에서 절감 시간의 80% 이상이 다른 업무로 흘러갔고 임금·노동시간 효과는 사실상 0, (5) 품질·검증 세금 — Klarna는 AI 상담 전면 자동화 후 품질 문제로 인력을 재고용하고 하이브리드로 정착했다.

"파일럿 95% 실패"의 진실 — 바이럴이 된 MIT 보고서의 수치는 "맞춤형 엔터프라이즈 GenAI 구축 중 P&L 효과를 내며 프로덕션에 도달한 비율 5%"라는 의미다. 같은 보고서에서 범용 LLM 도구는 40%가 실전 배치에 성공했고, 직원의 90%는 이미 개인 AI 도구를 업무에 쓴다("그림자 AI 경제"). 실패하는 것은 AI가 아니라 조직의 배치 역량이다.

주목할 비대칭 하나: Anthropic Economic Index(2026.1)에 따르면 소비자용 Claude 대화의 52%는 증강(협업)이지만, 기업 API 트래픽의 약 75%는 자동화 지향이다. OpenAI GDPval(2025)에서 프런티어 모델은 44개 직업의 1회성 결과물 과업에서 전문가 대비 약 절반의 승률(최고 모델은 Claude Opus 4.1, ~48%)에 비용은 100분의 1이었다. 천장은 이미 높다 — 낮은 것은 흡수 속도다.

5. 디플레이션 논쟁: 순서가 틀렸다

반도체 PPI (2026.4, 전년비)
+26.0%
1984년 이후 최고
미국 전기요금 (2026.5, 전년비)
+5.9%
헤드라인 물가 상회
AI 캐펙스의 코어 물가 기여
+0.5%p
2026년 추정 (Northern Trust 등)
빅4 하이퍼스케일러 2026 캐펙스
$7,100억+
메모리 최대 +400% (JPM)

강세론의 실체는 비용 곡선이다. GPT-3.5급 쿼리 비용은 18개월 만에 280분의 1이 됐고(스탠퍼드 AI Index), Epoch AI 측정으로 추론 가격은 과업에 따라 연 9~900배씩 떨어진다. 그러나 상대가격 하락 ≠ 총물가 하락이다 — 품질조정 컴퓨터 가격은 수십 년간 폭락했지만 디플레이션은 오지 않았고, 총물가는 결국 통화정책의 함수다. 게다가 단가가 떨어지면 사용량이 폭증한다(제번스 역설).

2025~26년 실측에서 AI는 인플레이션 요인이다. 파월(2026.3): "데이터센터 건설이 온갖 재화·서비스 가격을 압박하고 있다. 지금은 인플레이션을 밀어올리는 쪽이다." 슈나벨 ECB 이사(2026.3): "단기적으로 AI는 인플레이션 쪽일 가능성이 크다." 리치먼드 연준 분해로는 애플리케이션 소프트웨어 PPI +8.5%(1998년 이후 최고), PCE 소프트웨어 +14.5%(1977년 통계 개시 후 최고). BIS의 이론 틀이 이를 정리한다: AI는 공급(생산성)과 수요(투자+기대 소비)를 동시에 밀며, 현재는 수요가 공급보다 먼저 도착했다.

1990년대의 교훈 — IT 생산성 붐 때 인플레이션은 낮아졌지만 디플레이션은 없었다. 그린스펀은 금리를 동결하며 공급 확장을 수용했고, 결과는 "고용-물가 상충관계의 개선"이었다(세인트루이스 연준, 2026.7). 인플레이션 목표제 하에서 AI 공급 충격은 더 높은 실질성장과 더 낮은 금리로 흡수되지, 마이너스 CPI로 가지 않는다.

시나리오조건물가 경로평가
A. 양호한 디스인플레이션생산성 연 +0.5~1.5%p 확산, 캐펙스 정점 통과, 병목 해소목표 복귀/하회 + 강한 실질성장 (1990년대형)가장 유력
B. 실제 디플레이션변혁적 AI로 임금 붕괴(나쁜 디플레) 또는 비용 곡선 전방위 확산 + 중앙은행 무대응CPI 0 이하꼬리 시나리오
C. 인플레이션 지속캐펙스·전력·칩 수요 충격, AI 기대의 중립금리(r*) 상승코어 +0.3~0.5%p 상방2025~26 현실

6. 산업별 유즈케이스: 어디서 확실히 향상되는가

McKinsey 추정으로 생성형 AI 가치의 약 75%는 고객 운영, 마케팅·영업, 소프트웨어 엔지니어링, R&D 4개 기능에 집중된다. 측정된 증거 기준 성공 조건은 네 가지다: 잘 정의된 반복 과업, 검증 가능한 출력, 최상위 수행자 패턴의 학습 가능성, 인간이 예외를 맡는 하이브리드 설계.

산업/기능측정된 효과단서
소프트웨어 개발+26~56% · 구글 신규 코드 30%+ AI 작성 · Amazon Java 마이그레이션 4,500 개발자-년 절감숙련자·성숙 코드베이스에선 0~−19%
고객 서비스+14~34% · Klarna 상담 3분의 2 처리(11분→2분)복잡 상담 품질 문제로 하이브리드 회귀
의료임상 오류 −13~16%(케냐 4만 진료) · 방사선 판독 +15.5%진단 추론 RCT는 효과 없음 — 인터페이스가 병목
법률+34~140% (추론모델·RAG)주니어 업무 집중 → 로펌 피라미드 압박
금융JPMorgan 연 ~$2B 가치(자체 추산) · 엔지니어 +10~20%자체 추산은 RCT 대비 부풀려질 소지
교육6주에 1.5~2년치 학습 효과 (나이지리아 RCT)교사 매개 설계가 성공 조건
번역·프리랜스 글쓰기·디자인일자리 −2%, 월수입 −5.2% (Upwork 노출 직군)향상이 아닌 대체가 관측되는 첫 직군들

7. 투자 시사점

Goldman Sachs의 AI 트레이드 4단계 프레임: 1단계 NVIDIA → 2단계 인프라(반도체·클라우드·전력·네트워킹) → 3단계 AI 매출화 애플리케이션 → 4단계 광범위 생산성 수혜. 2023~26년 실현 이익은 압도적으로 1~2단계에 쌓였다. NVIDIA 데이터센터 매출 FY2023 $15B → FY2025 $115B, 전력주 Vistra는 2024년 S&P 500 수익률 1위(+258%), 그리고 SK하이닉스는 HBM 주도권으로 2025년 이익이 두 배로 뛰며 사상 처음 삼성전자 연간 이익을 추월했다(CNBC). 3단계(에이전트·애플리케이션) 매출은 아직 캐펙스 대비 작다 — 본 서베이 4장의 조직 흡수 병목이 그 미시적 이유이며, 역으로 J-커브 논리가 맞다면 4단계 수혜는 시장이 덜 반영한 영역이다.

대체 신호가 이미 주가로 번역된 곳들: 에드테크 Chegg 고점 대비 −99%, 인도 IT 서비스 대형주 최대 −50%(노동 차익거래 모델의 AI 잠식 우려), 광고지주 WPP 2025년 −60%. 실증 연구에서 향상 폭이 주니어에 집중된다는 사실 자체가 주니어 대량 고용에 기반한 전문서비스 피라미드의 경제성을 흔든다.

금리 함의는 두 방향이다. 단기적으로 AI 캐펙스는 자본을 흡수해 실질금리·기간프리미엄을 밀어올리고(J.P. Morgan: 10년물 4.35% 전망, 끈적한 ~3% 인플레), AI 기대가 중립금리를 올려 "AI 붐 = 금리 인하"가 아니라 오히려 고금리를 정당화할 수 있다. Morgan Stanley는 "캐펙스 붐이 생산성으로 이어지지 못하는 것"을 2026년 최대 리스크로 꼽았다. 장기적으로 4단계에 도달하면 디스인플레이션 + 균형성장률 상승으로 듀레이션과 주식에 동시 우호적이다. 관건은 그 시간표다.

정리

Q1 — 생산성이 향상되는 시나리오 5가지 (증거 강도 순): ① 스킬 압축형 향상(신입을 상위 수행자 수준으로 — 이미 진행 중), ② 검증 가능한 반복 업무의 자동화(기업 API 트래픽의 75%가 이 방향), ③ J-커브 후반부의 조직 재설계 배당(현재 10~30배 격차 자체가 잠재력), ④ 에이전트·추론 모델의 경계 전진(법률 +34~140% 반전이 신호), ⑤ R&D·과학 자체의 가속(이론적 상방 최대, 증거는 아직 초기).

Q2 — 경제 효과: 10년 GDP +1%(Acemoglu)~+7%(Goldman)의 격차는 가정의 차이로 분해되며, 2025~26년 추정은 연 +0.5~1.5%p 생산성 기여로 수렴 중. 거시 통계의 밋밋함은 J-커브 초입의 예상된 모습.

Q3 — 디플레이션: 현재는 캐펙스발 인플레이션(코어 +0.3~0.5%p), 장기 기본 시나리오는 1990년대형 양호한 디스인플레이션. 문자 그대로의 디플레이션은 임금 붕괴를 동반하는 꼬리 시나리오뿐이다. 먼저 기계를 짓는 비용, 그 다음에야 기계가 낳는 절감.

주요 출처

이 글은 개인적인 학습과 기록을 위한 것이며, 특정 종목의 매수·매도를 권유하지 않습니다. 일정과 수치는 발표 시점에 변경될 수 있으므로 반드시 원문을 확인하시기 바랍니다. 투자 판단과 그 결과에 대한 책임은 투자자 본인에게 있습니다.