AC-Research›칼럼시황칼럼리서치AI 하이퍼사이클
OpenAI와 수학계, 부딪힌 곳은 연구 주도권이다 목차 펼치기

AC 칼럼 · AI와 학문의 경계

OpenAI와 수학계,
부딪힌 곳은 연구 주도권이다

OpenAI가 내부 모델로 수학 난제를 대거 풀었다고 밝히면서 수학계와의 갈등이 다시 불붙었다. 공개된 문서를 나란히 놓으면 이번 일은 AI의 수학 실력을 둘러싼 논쟁이면서, 학문을 운영하는 권한이 어디에 있어야 하는지를 둘러싼 충돌이다. 발표된 숫자의 뜻, 수학계가 낸 두 문서의 차이, 그리고 자문과 결정권의 구분을 차례로 짚는다.

2026년 10월 7일AC리서치읽는 시간 약 18분

핵심 요약

  • OpenAI는 내부 모델에 수학 문제 약 4,000개를 제시했고, 결과를 372개 결과군과 722편의 원고로 정리했다. 세 숫자는 세는 단위가 달라 서로 나눠 성공률을 낼 수 없다.
  • 리만 가설 관련 결과는 실수부가 7/8보다 큰 특정 영역에 관한 것이고, 호지 추측 결과도 CM 아벨 다양체 같은 특정 대상에 관한 것이다. 부분적 진전과 넓은 해결 주장이 한 목록에 섞여 있다.
  • 9월 11일 수학자 선언과 9월 29일 자문그룹 권고는 다른 문서다. 9월 29일 문서는 비공개 모델로 최전선 문제를 시험하는 관행을 멈춰 달라고 하면서, 중요한 결과를 냈다면 책임 있게 공개하라고도 요구했다.
  • 9월 21일 출범한 자문그룹은 무보수로 비판을 공개할 수 있지만 OpenAI 내부 수학 연구의 속도에는 조언하지 않는다. 자문은 받되 결정권은 나누지 않는 구조다.
  • AC리서치는 칩·메모리·전력에 이어 연구 도구에 대한 접근권이 AI 하이퍼사이클의 다음 병목이 된다고 본다. 9월 17~18일 하버드에 모인 수학자 24명은 박사 평가부터 바꾸자고 권고했다.
Part 1 · 숫자무엇이 발표됐고 어디까지 주장인가
01

4,000문제에 372개 결과군이면 성공률 9%⁠인가?

아니다. 세 숫자는 세는 대상이 달라 서로 나눌 수 없다. OpenAI는 10월 6일(현지 시각) 공개하지 않은 내부 모델 하나에 문제 약 4,000개를 제시했고, 그 결과를 372개 결과군, 총 722편의 원고로 정리했다고 밝혔다. 처음 보면 4,000문제 가운데 372개를 풀었다는 뜻으로 읽히지만, 문제 수와 결과군 수와 원고 수는 단위가 다르다.

결과군 하나에는 핵심 결과뿐 아니라 보조 논증, 파생 결과, 다른 증명이 함께 들어갈 수 있다. 원고 722편도 논문 수나 성과 수가 아니라 정리된 문서의 수다. OpenAI의 저장소 스스로 검증 단계가 서로 다른 결과가 섞여 있고 모두 Lean으로 형식화된 것은 아니며, 형식화되지 않은 결과 가운데 일부는 문제가 있을 수 있다고 적었다.

Fig 01 · 개념도숫자의 단위

4,000·372·722는 서로 다른 것을 센다

제시한 문제4,000OpenAI가 내부 모델에 낸 문제 수푼 문제 수가 아니다
결과군372핵심 결과와 보조 논증, 파생 결과, 다른 증명을 묶은 단위푼 난제 수가 아니다
원고722결과를 정리한 문서 수. 검증 단계가 서로 다르다심사를 통과한 논문 수가 아니다
표로 보기
세 숫자가 세는 대상
숫자세는 대상이렇게 읽으면 안 된다
4,000내부 모델에 제시한 문제 수해결한 문제 수
372결과군 수. 핵심 결과와 보조 논증, 파생 결과가 한 묶음해결한 난제 수
722정리된 원고 수학술 심사를 통과한 논문 수
세 숫자는 모두 OpenAI의 공식 저장소에 나오지만 세는 대상이 달라, 372를 4,000으로 나눈 9.3%⁠는 성공률이 아니다. openai/math 저장소 기준, AC리서치 정리.

그래서 독립 검증을 마친 난제 372개를 풀었다거나, 학술 심사를 통과한 논문 722편을 냈다고 바꿔 말하면 틀린다. 이 글은 공개 문서와 논쟁의 구조를 다룬다. 722편의 증명을 전수 심사하거나 Lean 코드를 다시 돌리는 일은 따로 해야 하는 검증이다.

02

평균 3시간이면 누구나 같은 결과를 얻나?

그렇지 않다. OpenAI가 제시한 것은 성과 하나에 평균적으로 ChatGPT Pro의 생각하기 약 3시간에 해당하는 계산량이 들었다는 설명이다(OpenAI 발표). 일반 사용자가 지금 같은 모델을 골라 3시간을 기다리면 같은 결과가 나온다는 뜻이 아니고, 학습비와 실패한 시도까지 합친 총비용이 그만큼이라는 뜻도 아니다.

평균이라는 말도 함께 읽어야 한다. 성과마다 든 계산량이 다르고, 실패한 시도와 사전 학습 비용은 이 숫자에 들어 있지 않다. 나온 결과만 모아 평균을 낸 값이라, 문제 하나를 처음부터 끝까지 푸는 데 드는 비용과는 다르다. OpenAI는 결과 대부분이 같은 표준 절차로 나왔지만 리만 가설과 호지 추측 관련 결과는 그 절차의 예외였다고도 적었다.

03

리만 가설과 호지 추측은 풀렸나?

풀리지 않았다. 공개된 개요의 주장은 크지만, 각각 범위가 정해져 있다. 리만 가설 관련 결과는 제타함수를 포함하는 디리클레 L함수의 특정 영점 없는 영역, 예컨대 실수부가 7/8보다 큰 반평면에 관한 것이다(결과 개요). OpenAI는 이 항목에 준리만 가설(quasi-Riemann hypothesis)이라는 이름을 붙였다. 모든 비자명한 영점의 실수부가 1/2이라는 리만 가설 전체와는 다르다.

호지 추측 관련 결과도 복소수 위의 CM 아벨 다양체라는 특정 대상 전체에 대해 유리 호지 추측을 증명했다는 주장이다. 반면 마흘러 추측은 대칭과 비대칭 경우를 모든 차원에서 다룬다는 넓은 해결 주장이 들어 있다. 부분적 진전과 광범위한 해결 주장이 한 목록 안에 같이 있다는 뜻이다. 이름이 잘 알려진 추측일수록 원래 문제 전체를 푼 것처럼 요약되기 쉽다.

Fig 02 · 정리주장의 범위

유명한 이름과 실제 주장의 크기는 다르다

주요 추측별 원래 문제와 이번 주장의 범위
추측원래 문제이번 주장범위
리만 가설제타함수의 비자명한 영점은 모두 실수부가 1/2디리클레 L함수의 특정 영점 없는 영역(실수부 7/8 초과 등)부분적 진전
호지 추측사영 대수다양체의 특정 호지류가 대수적 순환으로 표현되는가복소수 위의 모든 CM 아벨 다양체(모든 차원·여차원)특정 대상 전체
마흘러 추측볼록체의 부피 곱에 관한 하한대칭·비대칭 경우를 모든 차원에서넓은 해결 주장
리만 가설과 호지 추측에 대한 주장은 특정 영역과 대상에 한정되지만, 마흘러 추측은 모든 차원을 다룬다는 넓은 주장이라 목록 안에서도 주장의 크기가 다르다. OpenAI 결과 개요 기준, 검증 수준은 결과마다 다르다. AC리서치 정리.

발표의 잠재적 규모는 매우 크다. 다만 공개된 목록 전체를 이미 확립된 수학 지식의 목록처럼 읽어서는 안 된다. 규모가 크다는 점과 검증 수준이 아직 고르지 않다는 점을 동시에 봐야 한다. 어느 한쪽만 보면 이번 발표를 과소평가하거나 과대평가하게 된다.

Part 2 · 충돌두 문서와 한 가지 분명한 대립
04

9월 11일 선언과 9월 29일 권고는 무엇이 다른가?

앞의 것은 수학의 목적에 관한 문제 제기이고, 뒤의 것은 기업이 AI 수학 성과를 어떻게 만들고 공개해야 하는지에 관한 운영 원칙이다. 이번 일은 몇 달 동안 쌓인 갈등의 연장선에 있고, 두 문서를 구분해야 무엇이 실제로 부딪혔는지 보인다.

Fig 03 · 데이터8월부터 10월까지

두 달 사이 발표와 반론이 번갈아 나왔다

OpenAI 수학 발표와 수학계 반응 타임라인2026년 8월 1일 OpenAI의 수학 성과 10건 발표부터 10월 6일 문제 4,000개·결과군 372개·원고 722편 공개와 자문그룹 성명까지, OpenAI와 수학계, 자문그룹, 교육 현장의 움직임을 날짜순으로 정리했다.8월9월10월8.1수학 성과 10건 발표, 저자성 입장8.28새 내부 모델 학습 시작9.7벅마스터 진술 공개9.8나비에-스토크스 결과 발표9.10벅마스터 프롬프트 조사 결과 추가9.11필즈상 수상자 선언(타오·허준이 등)9.17가워스, 서명하지 않은 이유9.17하버드 박사교육 회의(17~18일)9.21수학·AI 자문그룹 출범(9명)9.24사하이 기고: 아름다운 새 아이디어9.29독점 모델 시험 중단 요청 권고10.5아비가드 기고: 기존 기법의 결합10.6문제 4,000개·결과군 372·원고 722 공개10.6OpenAI 공개에 대한 성명10.6WIRED 보도(브라이나 크라)OpenAI수학계자문그룹교육·현장
날짜 표로 보기
OpenAI 수학 발표와 수학계 반응 날짜표
날짜(2026)주체일
8월 1일OpenAI수학 성과 10건 발표, 저자성 입장
8월 28일OpenAI새 내부 모델 학습 시작
9월 7일수학계벅마스터 진술 공개
9월 8일OpenAI나비에-스토크스 결과 발표
9월 10일OpenAI벅마스터 프롬프트 조사 결과 추가
9월 11일수학계필즈상 수상자 선언(타오·허준이 등)
9월 17일수학계가워스, 서명하지 않은 이유
9월 17일교육·현장하버드 박사교육 회의(17~18일)
9월 21일자문그룹수학·AI 자문그룹 출범(9명)
9월 24일수학계사하이 기고: 아름다운 새 아이디어
9월 29일자문그룹독점 모델 시험 중단 요청 권고
10월 5일수학계아비가드 기고: 기존 기법의 결합
10월 6일OpenAI문제 4,000개·결과군 372·원고 722 공개
10월 6일자문그룹OpenAI 공개에 대한 성명
10월 6일교육·현장WIRED 보도(브라이나 크라)
2026-09-11 · 선언

수학의 목적

테런스 타오(Terence Tao)와 허준이(June Huh) 등 필즈상 수상자 28명이 이름을 올렸고, 10월 7일 현재 지지 서명은 8,173명이다. AI의 수학 능력이 실제로 크게 발전했다고 인정하면서도, 수학의 목적을 참·거짓 판정의 수를 늘리는 일로 줄여서는 안 된다고 주장한다(선언문).

2026-09-29 · 권고

성과의 생산과 공개

외부 과학계가 쓸 수 없는 독점 모델로 고급 수학 문제를 시험하는 관행을 지적하고, 지지하지 않으며 멈춰 달라고 적었다(자문그룹 문서).

9월 11일 선언을 쉬운 말로 옮기면 이렇다. 수학자가 원하는 것은 이 추측이 맞다는 판정이 아니다. 왜 맞는지, 증명의 핵심 아이디어는 무엇인지, 어떤 가정을 바꾸면 틀리는지, 이 방법이 다른 분야에도 통하는지를 알고 싶어 한다. 하나의 증명에서 새 질문이 나와야 한다는 것이다.

9월 29일 자문그룹 문서는 이 요구를 새로 만든 것이 아니라, 이미 제기된 문제에 구체적인 운영 원칙을 붙였다. 그리고 같은 문서는 중요한 결과를 냈다면 문서의 절차대로 가능한 한 빨리 책임 있게 공개하라고도 요구한다. 아무도 아직 이해하지 못한 결과는 먼저 공개한 뒤 사람의 이해를 돕는 2단계 절차를 따로 제안했다. 600명 넘는 수학자의 설문 응답을 바탕으로 했다(9월 29일 문서).

그러니 이 문서를 AI가 얻은 답은 숨기라거나, 사람이 먼저 이해할 때까지 아무것도 발표하지 말라는 주장으로 읽어도 틀린다. 결과를 공개한 것 자체는 학계의 권고를 거스른 것이 아니고, 오히려 공개하라는 요구에 맞는 면이 있다. 실제로 부딪히는 곳은 외부 연구자가 쓸 수 없는 내부 모델로 최전선 연구를 계속하는 방식이다.

05

자문그룹은 OpenAI의 연구를 멈출 수 있나?

멈출 수 없다. OpenAI가 9월 21일 발표한 자문그룹에는 티머시 가워스(Timothy Gowers), 마틴 헤어러(Martin Hairer), 에드워드 위튼(Edward Witten) 등 수학자 9명이 들어갔다. OpenAI가 외부 자문위원회를 제안하자 위원들이 회사와 합의해 독립 기구로 만든 것이다. 설명에는 독립성을 보장하는 조항이 있다. 위원들은 무보수로 활동하고, 회사가 요청하지 않은 의견도 낼 수 있으며, 그 의견을 공개할 수 있다. 동시에 회사의 내부 수학 연구를 어떤 속도로 진행할지에 대해서는 자문그룹이 조언하지 않는다고 적었다.

이 조합을 그대로 읽어야 한다. OpenAI가 수학자들의 의견을 막은 것은 아니다. 비판과 공개적인 이견을 허용하는 장치를 만들었다. 그러나 연구를 계속할지, 얼마나 빠르게 할지는 회사가 정한다. 자문그룹도 홈페이지에서 스스로 어떤 AI 기업에 대해서도 의사결정 권한이 없고, 결정의 책임은 그 기업에 있다고 밝힌다. 이 기구를 학계 전체를 대표하는 규제기관처럼 이해해서는 안 된다.

자문을 받는 것과 결정권을 나누는 것은 다르다. OpenAI는 성과를 학계와 어떻게 나눌지는 협의하지만, 학계가 회사의 연구 지속 여부를 정하는 구조는 받아들이지 않았다.

이 부분이 정면충돌이라는 표현의 가장 강한 근거다. 반대로 회사가 중단을 약속해 놓고 몰래 어겼다거나, 자문그룹이 연구 전체를 승인했다는 이야기도 이 문서들로는 뒷받침되지 않는다. 같은 회사의 다른 발표에서도 비슷한 태도가 보인다. 9월 말 DevDay에서 OpenAI는 가장 강한 모델 GPT-6.1 Astra를 안전 기준을 이유로 내놓지 않았는데, 그 판단 역시 회사가 내렸다(「OpenAI는 이제 모델만 팔지 않는다」 칼럼).

06

OpenAI는 수학계 요구를 얼마나 받아들였나?

공개 절차는 고치고 핵심 연구 방식은 유지했다. 선택적 수용에 가깝다. 이번 공개를 아무것도 고치지 않은 일방적 발표로 보는 것도 정확하지 않다. OpenAI는 10월 6일 발표에서 고등연구소(IAS)의 독립 자문그룹과 상의했고 그 공개 권고를 참고했다고 밝혔다. 자문그룹의 요구와 실제 공개 내용을 맞대 보면, 진전이 있는 항목과 아직 이행되지 않았거나 요구와 어긋나는 항목이 함께 있다.

Fig 04 · 정리권고와 실제 공개

공개 절차는 따랐고, 연구 방식은 바꾸지 않았다

자문그룹 권고와 OpenAI 10월 6일 공개 대조
자문그룹의 권고·요구OpenAI의 10월 6일 공개판단
독점 모델로 최전선 문제를 시험하는 관행을 멈춰 달라(9/29)공개하지 않은 내부 모델 하나로 문제 약 4,000개를 시험어긋남
중요한 결과는 절차대로 가능한 한 빨리 공개(9/29)GitHub 저장소에 원고 722편과 결과 개요 공개진전
검증할 수 있는 형태로 공개많은 증명에 Lean 형식화, 형식화 안 된 결과는 문제가 있을 수 있다고 명시부분
아무도 이해 못 한 결과는 공개 뒤 사람의 이해를 지원(9/29)추론 요약 10개 공개, 워크숍·학회·특별 프로그램 지원 예고(금액 미공개)약속 단계
강력한 연구 도구에 대한 공평한 접근(10/6)결과를 낸 모델을 책임 있게 공개하려 노력 중, 시점 미공개미이행
OpenAI는 결과의 공개 절차에서는 자문그룹 권고를 상당 부분 따랐지만, 독점 모델로 최전선 문제를 시험하는 방식과 외부 접근은 바꾸지 않았다. 자문그룹 9월 29일·10월 6일 문서와 OpenAI 10월 6일 발표를 맞댄 AC리서치 정리.

특히 미래의 약속과 지금의 이행을 구분해야 한다. 모델을 책임 있게 공개하려고 노력한다는 설명은 외부 연구자가 지금 같은 모델을 쓸 수 있다는 뜻이 아니다. 워크숍과 학회, 특별 프로그램을 지원하겠다는 약속에도 아직 금액과 집행 방식은 나오지 않았다. 모든 요구를 무시했다는 평가와 권고를 충실히 이행했다는 평가는 둘 다 틀리고, 실제는 그 사이에 있다.

회사 쪽 입장도 가장 강한 형태로 이해해 둘 필요가 있다. OpenAI는 기존 수학 평가에서 성능이 포화되면서 공개 연구 문제로 평가를 넓혔다고 설명한다. 일반적인 평가 문제로 모델 간 차이를 재기 어려워졌다면 더 어려운 과제를 시도하는 것은 연구개발로서 이해할 수 있고, 그 과정에서 쓸 만한 결과가 나왔다면 공개하는 편이 지식 축적에 도움이 된다. 쟁점은 연구 문제를 시험하는 일 자체가 아니라, 그 평가가 다른 연구자의 활동과 어떤 관계를 맺고 어떤 책임을 지느냐다.

Part 3 · 구조왜 직업 문제로 줄일 수 없나
07

결과를 만드는 비용과 이해하는 비용은 왜 갈라지나?

결과를 빨리 만드는 쪽은 기업이고, 그 결과를 읽고 정리하는 일은 학계가 떠안기 때문이다. 반대편의 우려는 직업적 자존심 문제가 아니다. 가장 강력한 연구 도구를 기업만 쓸 수 있는 상태에서 기업이 문제를 고르고 성과를 발표하면, 학계는 뒤늦게 그것을 검토하고 이해하는 역할을 맡게 된다. 자문그룹은 10월 6일 성명에서 수학 연구의 미래가 AI 연구소가 만든 결과를 이해하는 일로만 이뤄질 수는 없다고 강조했다. 이 성명이 결과의 영향을 평가하거나 OpenAI가 결과를 얻은 방식을 지지하는 것은 아니라는 단서도 달았다.

기업은 모델이 중요한 결과를 냈다는 사실을 빠르게 알릴 수 있다. 하지만 그 결과를 전문가가 읽고, 빠진 문헌을 찾고, 핵심 방법을 추려 내고, 학생이 배울 수 있는 형태로 바꾸는 일은 별도의 노동이다. 그 노동이 충분히 지원되지 않으면 기업이 얻는 성능 입증의 이익과 학계가 지는 검토 비용 사이에 불균형이 생긴다. 연구 지원금과 설명 자료를 요구하는 목소리를 보상 요구로만 볼 수 없는 이유다.

6월 2일 국제수학연맹(IMU)이 지지한 라이덴 선언은 이미 AI 산출물이 기존 심사 체계에 부담을 주고, 연구의 정확성과 투명성, 독립 검증을 유지하기 어렵게 만들 수 있다고 경고했다. 이런 변화가 학생과 초기 경력 연구자에게 더 크게 닿을 수 있다는 지적도 담았고, 10월 7일 현재 4,252명이 서명했다.

08

논문을 읽을 수 있으면 충분하지 않나?

충분하지 않다. 공개된 논문을 읽을 수 있다는 것과 같은 연구 도구를 쓸 수 있다는 것은 다르다. 자문그룹은 10월 6일 성명에서 수학자들이 스스로 질문을 만들고, 자기 접근법을 개발하고, AI 시스템의 능력을 보여 주려고 고른 문제가 아닌 방향도 탐구할 수 있어야 한다고 했다. 이를 위해 강력한 연구 도구에 대한 공평한 접근과 충분한 계산 자원이 필요하다고 본다.

걱정하는 구조는 이렇다. 기업은 연구 방향을 정하는 주체가 되고, 학계는 기업이 고른 결과를 해설하는 집단이 된다. 이것은 AI가 인간보다 똑똑하냐는 질문과 별개다. 인간에게 유능한 AI 도구가 주어지더라도, 접근 비용이나 사용 한도 때문에 일부 기업과 기관만 충분히 쓸 수 있다면 연구 주도권은 한쪽에 몰린다. 계산 자원이 곧 생산능력이 되는 흐름은 「전력은 이제 생산능력이다」 칼럼에서 다뤘다. 수학 연구에서도 같은 일이 벌어지고 있다.

09

벅마스터 진술로 확인된 것은 무엇인가?

연구자가 의문을 공개적으로 제기했다는 사실까지다. 데이터가 쓰였다는 사실은 확인되지 않는다. 뉴욕대 수학자 트리스탄 벅마스터(Tristan Buckmaster)는 OpenAI의 나비에-스토크스 발표 직전인 9월 7일(현지 시각) 진술을 공개했다. 그는 앤트로픽 소속인 레벤트 알푀게(Levent Alpöge)와 함께 앤트로픽의 Claude와 OpenAI의 Codex 등 여러 AI 도구를 써 연구했고, 그것이 어느 회사의 공식 사업도 아닌 순수한 개인 공동연구였다고 설명했다. 그는 OpenAI와의 소통 과정, 선행 아이디어와 기여의 인정, 자신의 Codex 대화가 OpenAI 내부 모델의 학습이나 접근에 쓰였는지를 물었다.

다만 의혹과 사실은 엄격히 나눠야 한다. 벅마스터는 진술 끝부분에서 OpenAI의 증명을 보지 못했고, 모델이 무엇을 어떻게 했는지 모르며, 자신들의 데이터가 쓰였는지도 모른다고 적었다. 그의 글을 OpenAI가 연구자의 비공개 데이터를 가져갔다는 근거로 쓸 수는 없다.

OpenAI는 9월 10일 발표를 고쳐, 조사해 보니 9월 8일 발표 전 두 달 동안의 벅마스터 Codex 프롬프트는 학습을 포함한 어떤 방식으로도 해당 시스템에 영향을 줄 수 없었다고 밝혔다. 같은 페이지에서 강제 오일러 방정식 결과에 대해서는 두 사람의 우선권을 인정했다. 회사가 직접 조사한 결과라 외부 독립 감사와 같다고 볼 수는 없다. 그렇다고 회사가 학습 관련 질문에 끝내 답하지 않았다는 서술도 최신 입장과 맞지 않는다.

이 일이 드러내는 더 큰 구조는 연구 도구를 파는 회사가 동시에 연구 경쟁자가 될 수 있다는 점이다. 연구자는 미완성 아이디어를 도구에 넣는다. 도구를 파는 쪽은 더 강한 내부 시스템과 더 많은 계산 자원을 가진 채 같은 분야의 성과를 발표할 수 있다. 데이터 오용이 실제로 있었는지와 별개로, 이런 겹친 역할은 더 높은 수준의 투명성과 이해충돌 관리가 필요하다는 근거가 된다. 이 논쟁은 누가 먼저 풀었느냐를 넘어, 연구자가 어떤 조건에서 기업의 도구를 믿고 쓸 수 있느냐의 문제다.

10

Lean으로 검증하면 논쟁이 끝나나?

증명이 맞는지에는 강한 답을 주지만, 이번 갈등 전체를 끝내지는 못한다. Lean은 다른 AI에게 맞는 것 같으냐고 물어보는 도구가 아니다. 정해진 논리 체계 안에서 증명이 명제로 이어지는지를 기계적으로 검사한다. 다만 Lean 공식 문서도 증명이 유효한가와, 검사한 명제가 우리가 뜻한 내용을 표현하는가를 구분한다.

그래서 개별 결과마다 형식화된 명제가 원래 문제와 같은지, 공개하지 않은 추가 가정이나 증명되지 않은 공백에 기대지 않는지, 필요한 의존성과 검증 환경을 갖춰 다시 검사할 수 있는지를 봐야 한다. 이번 저장소에서 문제가 나왔다는 뜻이 아니라, 형식증명을 평가하는 일반적인 기준이다.

구분이 하나 더 있다. 증명을 검증하는 데 원래의 비공개 AI 모델이 꼭 필요하지는 않다. 공개된 증명 산출물이 충분하면 제3자가 검사할 수 있다. 모델이 닫혀 있으니 결과도 검증할 수 없다는 비판은 지나치다. 그러나 결과를 검증할 수 있다는 것과 발견 과정을 재현할 수 있다는 것은 다르다. 어떤 문제를 골랐고, 어떤 자료와 지시를 썼고, 몇 번 실패했고, 사람이 어디에 개입했는지는 별개의 질문이다.

논증의 저자성 문제도 있다. OpenAI는 8월 1일 발표에서 전적으로 AI가 만든 증명에 사람의 저자성을 주장하면 시스템의 기여와 진짜 인간 지적 노동의 성격을 모두 잘못 전하게 된다고 주장했다. 사람은 같은 모델과 함께 원고를 정리했고, Lean 형식화는 모델이 했다는 설명이다. 진지하게 들을 주장이다. 사람이 사실상 발견하지 않은 증명을 유명 수학자의 업적으로 포장하는 것이 더 정직하지는 않다. 그러나 AI가 마지막 논증을 만들었다는 사실과, 그 논증이 기댄 사람의 선행 아이디어를 충분히 밝힐 의무는 함께 성립한다.

Part 4 · 전망학계와 기업이 각자 움직이는 곳
11

수학자들은 모두 OpenAI에 반대하나?

그렇지 않다. 수학자들 사이에서도 평가가 갈린다. 대표적인 인물이 티머시 가워스(Timothy Gowers)다. 그는 9월 11일 선언의 많은 내용에 동의하면서도 서명하지 않았다고 썼다. 어떤 수학자에게는 개념적 이해가 문제 해결의 수단이고, 다른 수학자에게는 문제 해결이 이해의 수단이며, 한쪽만 올바른 태도로 정하고 싶지 않다는 이유였다. 그는 결과가 많이 나오는 것보다, 그 결과를 이해하고 다음 세대에 전할 사회적 구조가 남는지를 더 걱정했다. 그러면서 가워스는 OpenAI와 접촉하고 모델을 미리 써 봤지만 돈을 받은 적은 없다고 밝혔고, 독립 자문그룹에도 참여했다.

Fig 05 · 정리수학자들의 입장

같은 수학계 안에서도 평가는 여러 갈래다

주요 수학자들의 입장
인물입장날짜
테런스 타오·허준이 등 필즈상 수상자 28명선언 서명. 문제 해결은 이해를 위한 도구9.11
티머시 가워스선언 상당 부분에 동의하지만 서명 안 함. 자문그룹 참여9.17
아미트 사하이AI가 아름다운 새 아이디어를 내고 있다9.24
제러미 아비가드지금까지 AI 풀이는 모두 기존 기법을 엮은 것, 새 통찰은 아직10.5
브라이나 크라설명 논문 요청은 무시됐다, 그래도 강력한 새 도구는 반갑다10.6
트리스탄 벅마스터기여 인정과 소통에 의문, 데이터가 쓰였는지는 모른다9.7
수학자들의 입장은 AI 찬반으로 나뉘지 않고, AI의 능력과 기업의 연구 방식을 따로 평가하는 쪽에 가깝다. 각자의 선언·블로그·기고·인터뷰 기준, AC리서치 정리.

AI가 정말 새로운 수학적 아이디어를 만드는지에 대해서도 평가가 갈린다. 아미트 사하이(Amit Sahai)는 9월 24일 테런스 타오의 블로그에 실은 기고에서 AI와 일하며 아름다운 새 아이디어를 봤다고 했다. 제러미 아비가드(Jeremy Avigad)는 10월 5일 같은 블로그의 기고에서 지금까지 AI가 미해결 문제에 내놓은 풀이는 모두 있는 기법을 엮어 풀 수 있는 종류였다며, AI가 아직 새로운 통찰을 만들지는 못하지만 머지않아 그럴 수 있다고 봤다.

현장 반응도 한 가지가 아니다. 10월 6일 WIRED와 인터뷰한 노스웨스턴대 브라이나 크라(Bryna Kra)는 수학자들이 블로그나 트윗이 아닌 설명 논문을 내 달라고 OpenAI에 요청했지만 그 의견은 무시된 것 같다고 했다. 그러면서도 지금이 무섭지만 무척 흥미로운 시기이고 강력한 새 도구가 생겨 기쁘다고 말했다. 기술에 대한 기대와 기업에 대한 불신이 함께 있다.

12

박사 교육과 평가는 어떻게 바뀌나?

최초 증명보다 이해하고 설명하는 능력을 보는 쪽으로 움직인다. 이 논쟁을 선언문 수준의 철학 다툼으로만 보면 이미 시작된 변화를 놓친다. 9월 17일과 18일 하버드에서 열린 수학 박사교육 회의에는 수학자 24명이 모였다. 회의 보고서는 아홉 가지 핵심 권고에서 박사 논문이 넓은 의미의 독창적인 학술 기여여야 한다는 원칙은 지키되, 반드시 어떤 명제의 최초 증명을 담아야 하는 것은 아니라고 권고했다. 학위를 논문 원고만으로 주지 말고, 엄격한 심사로 내용을 완전히 이해하고 있음을 보이게 하며, 평가는 구술·대면 평가로 하자는 제안도 넣었다.

이것은 학생에게 AI를 쓰지 말라는 대응이 아니다. AI 도구의 접근성, 사용 사실의 공개, 형식화, 협업, 질문을 만드는 능력, 설명 능력을 교육과 평가에 반영하려는 움직임이다. 다만 이 보고서는 논의의 출발점으로 낸 권고이고, 전 세계 수학 박사과정이 이미 받아들인 통일 규정은 아니다(회의 보고서). 기술이 바뀐 뒤 제도가 따라오기까지 시차가 생기는 모습은 일자리에서도 같다(「성능표와 월급명세서 사이」 칼럼).

13

앞으로 무엇을 봐야 하나?

몇 개를 더 풀었느냐보다 세 가지 쟁점이 이 전환의 성격을 더 잘 보여 준다. 아직 확정된 미래는 아니지만 판단 기준으로 삼을 만하다.

첫째, 도구의 접근성

연구자가 같은 회사의 제품을 쓸 수 있느냐가 아니라, 실제로 비슷한 연구 능력과 충분한 계산 자원을 쓸 수 있느냐가 중요해진다. 제품 이름이 같아도 쓸 수 있는 모델과 계산량이 다르면 연구 조건은 다르다.

둘째, 이해와 설명에 대한 보상

최초 증명만 높이 치고 AI 결과를 검토·정리하는 일만 사람에게 맡기면, 꼭 필요한 일을 할 유인이 줄어든다. 새 개념을 뽑아내고 분야를 잇고 중요한 질문을 던지는 기여를 어떻게 인정할지가 핵심이다.

셋째, 연구 지원의 독립성

기업이 결과를 만들고, 후속 연구비를 대고, 무엇을 연구할지까지 정하면 학계의 의존은 깊어진다. 충분한 자원이 독립적인 판단 구조와 함께 주어진다면 AI가 연구 자율성을 넓히는 쪽으로 작용할 수도 있다.

14

과대해석하면 안 되는 네 가지

숫자를 나눌 수 없다

문제 수, 결과군 수, 원고 수는 단위가 다르다. 372를 4,000으로 나누거나 722를 성과 수로 세면 성립하지 않는다(저장소).

리만 가설을 푼 것이 아니다

공개된 주장은 실수부가 7/8보다 큰 특정 영역에 관한 것이고, 호지 추측 주장도 특정 대상에 관한 것이다(결과 개요).

벅마스터 진술은 데이터 오용의 증거가 아니다

그는 증명을 보지 못했고 데이터가 쓰였는지도 모른다고 적었다. 회사의 조사 결과도 외부 독립 감사와 같지 않다(진술).

Lean은 연구 수행의 책임까지 판정하지 않는다

형식 검사는 명제의 논리적 성립을 확인할 뿐, 연구 주도권과 기여 인정, 사람이 이해할 수 있는 설명을 대신 보장하지 않는다(Lean 문서).

AC Lens

AC리서치가 이 사건을 보는 법

AC리서치는 이번 일을 AI의 수학 실력 논쟁이면서, 학문을 운영하는 권한이 어디에 있어야 하는지를 둘러싼 충돌로 본다. 외부 연구자에게 공개되지 않은 모델로 고급 수학 문제를 시험하는 관행을 멈춰 달라는 요구가 있었고, OpenAI는 그 방식을 이어 가겠다는 입장을 지켰다. 이 점에서 실제 충돌은 있다. 그러나 낡은 수학자들이 발전을 막는다거나 OpenAI가 학계의 모든 요청을 무시했다는 이야기로 만들면 정확하지 않다. 수학자들 사이에도 견해가 갈리고, 공개 방식에는 개선이 있으며, 공개된 성과의 검증 수준도 제각각이다.

AI 하이퍼사이클 관점에서 이번 일은 다음 병목의 위치를 보여 준다. 지금까지 병목은 칩, 메모리, 전력처럼 물리적인 것이었다. 여기에 연구 도구에 대한 접근권과 연구 주도권이라는 조건이 더해지고 있다. AC리서치는 이 접근권이 앞으로 AI 기업과 학계, 그리고 각국 연구 체계의 경쟁력을 가르는 변수가 된다고 본다.

신호 1 · 접근외부 연구자의 모델 접근

OpenAI가 말한 책임 있는 공개가 언제, 어떤 조건으로 실제 접근이 되는지.

신호 2 · 검증Lean 형식화 비율

722편 가운데 형식화를 마친 결과가 얼마나 늘어나는지, 독립 검토가 붙는지.

신호 3 · 지원독립 기관을 거친 연구 지원

약속한 지원이 학계가 운영하는 기관을 통해 실제로 집행되는지.

신호 4 · 제도박사 평가와 저자성 규칙

하버드 권고처럼 대학과 학회가 평가·저자성 규칙을 실제로 바꾸는지.

Q

자주 묻는 질문

OpenAI가 수학 난제 372개를 해결한 것인가?

아니다. 372는 결과군 수이고, 한 결과군에는 핵심 결과뿐 아니라 보조 논증과 파생 결과, 다른 증명이 함께 들어갈 수 있다. 저장소는 검증 단계가 다른 결과가 섞여 있고 모두 Lean으로 형식화되지는 않았다고 적었다.

리만 가설이 해결된 것인가?

아니다. 공개된 주장은 제타함수를 포함하는 디리클레 L함수의 특정 영점 없는 영역, 예컨대 실수부가 7/8보다 큰 영역에 관한 것이다. 모든 비자명한 영점의 실수부가 1/2이라는 리만 가설 전체와는 다르다.

수학자들이 AI에게 문제를 풀지 말라고 한 것인가?

요구는 더 구체적이다. 9월 29일 자문그룹 문서는 외부 과학계가 쓸 수 없는 독점 모델로 고급 수학 문제를 시험하는 관행을 멈춰 달라고 했다. 같은 문서는 중요한 결과를 냈다면 가능한 한 빨리 책임 있게 공개하라고도 요구했다.

OpenAI가 연구자의 데이터를 가져갔다는 것이 확인됐나?

아니다. 벅마스터는 OpenAI의 증명을 보지 못했고, 자신들의 데이터가 쓰였는지도 모른다고 적었다. OpenAI는 자체 조사 결과 그의 Codex 프롬프트가 시스템에 영향을 줄 수 없었다고 밝혔지만, 이는 회사의 조사이지 외부 독립 감사가 아니다.

Lean으로 검증되면 논쟁이 끝나는가?

아니다. Lean은 명제의 논리적 성립을 강하게 뒷받침하지만, 형식화된 명제가 뜻한 내용을 담는지는 따로 봐야 한다. 연구가 책임 있게 수행됐는지, 선행 기여가 충분히 인정됐는지도 별개의 질문이다.

용어 풀이와 출처

본문에서 점선 밑줄이 그어진 말은 누르거나 마우스를 올리면 풀이가 뜬다. 같은 풀이를 여기에 모았다.

용어 풀이

  1. 결과군

    OpenAI가 성과를 묶어 세는 단위. 한 결과군에 핵심 결과와 함께 보조 논증, 파생 결과, 다른 증명이 들어갈 수 있어 문제 수나 논문 수와 같은 단위가 아니다.

  2. Lean

    수학의 정의와 정리를 컴퓨터가 검사할 수 있는 형식 언어로 적고 증명을 검증하는 도구. 명제가 논리적으로 성립하는지는 확인하지만, 그 명제가 원래 문제와 같은 내용인지까지 보장하지는 않는다.

  3. 계산량(컴퓨트)

    모델이 추론하는 데 쓰는 연산 자원. 같은 모델이라도 추론에 연산을 얼마나 투입하느냐에 따라 결과가 달라진다.

  4. 리만 가설

    리만 제타함수의 모든 비자명한 영점의 실수부가 1/2이라는 추측. 이번 발표의 주장은 제타함수를 포함하는 디리클레 L함수의 특정 영역에 관한 것으로, 리만 가설 전체와는 범위가 다르다.

  5. 호지 추측

    복소수 위의 사영 대수다양체에서 특정 호지류가 대수적 순환으로 표현되는지를 묻는 추측. 이번 발표의 주장은 CM 아벨 다양체 등 특정 대상에 관한 것이다.

  6. 자문그룹(Advisory Group)

    OpenAI가 2026년 9월 21일 소개한 수학과 AI 외부 자문 기구. 위원은 무보수로 활동하고 요청받지 않은 의견도 공개할 수 있지만, 회사 내부 연구의 속도에는 조언하지 않는다.

  7. 이해충돌

    한 주체가 연구 도구를 제공하면서 같은 분야의 연구 경쟁자가 되는 것처럼, 판단의 공정성이 의심받을 수 있는 겹친 역할.

  8. 구술·대면 평가

    제출된 문서만으로 학위를 판단하지 않고, 지원자가 내용을 스스로 이해하고 설명할 수 있는지를 직접 확인하는 평가 방식.

출처

  1. OpenAI, openai/math 저장소(검증 단계·형식화 안내) · 2026.10
  2. OpenAI, overview.tex(결과 개요) · 2026.10
  3. OpenAI, Sharing AI progress in mathematics · 2026.10.6
  4. OpenAI, Announcing the advisory group on mathematics and AI · 2026.9.21
  5. OpenAI, Ten advances in mathematics · 2026.8.1
  6. OpenAI, Navier-Stokes 관련 발표(조사 결과 업데이트) · 2026.9.8, 9.10 갱신
  7. Advisory Group on Mathematics and AI, 자문그룹 소개(독립성·책임) · 2026.10 열람
  8. Advisory Group on Mathematics and AI, On OpenAI's Release of Mathematical Results · 2026.10.6
  9. Advisory Group on Mathematics and AI, 9월 29일 운영 원칙 문서 · 2026.9.29
  10. Math and AI, A Severe Misalignment of AI in Mathematics · 2026.9.11
  11. Leiden Declaration, Leiden Declaration on Artificial Intelligence and Mathematics · 2026.6.2
  12. Tristan Buckmaster, 공개 진술(PDF) · 2026.9.7
  13. Lean, Validating Proofs · 2026
  14. Timothy Gowers, Why I didn't sign the Fields medallists' letter · 2026.9.17
  15. Terence Tao 블로그, We're gonna need a lot more mathematicians(아미트 사하이 기고) · 2026.9.24
  16. Terence Tao 블로그, The Future of Mathematics(제러미 아비가드 기고) · 2026.10.5
  17. WIRED, OpenAI Is Pissing Off a Bunch of Mathematicians, Again · 2026.10.6
  18. Harvard CMSA, Summit on PhD Math Education in the Age of AI · 2026.9.17~18
  19. Harvard CMSA, 회의 보고서(PDF) · 2026.9

2026년 10월 7일까지 공개된 자료를 기준으로 썼다. 발표 수치와 당사자의 입장은 본문에 연결한 OpenAI·자문그룹·수학자들의 공개 문서에서 가져왔고, 연구 주도권에 관한 평가는 AC리서치의 해석이다. 722편의 증명을 전수 검토하거나 Lean 코드를 다시 실행하지는 않았다. 정보 제공 목적이며 투자 권유가 아니다.

© AC-Research · 정보 제공 목적이며 투자 권유가 아닙니다. 홈으로