AI tools›Free programs›Video›Music›Image›AI news›Community› Search› Log in›Sign up› Light / dark mode›
한국어English日本語
업계 동향

오픈AI, 미공개 모델로 수학 논문 722편 '깃허브 투하'…'4차원 가케야 추측' 등 난제 해결 주장에 "영수증 보여달라"

오픈AI가 출시하지 않은 내부 모델에 약 4,000개 문제를 내 얻은 수학 논문 722편(결과 372묶음)을 깃허브에 공개했다. 상당수는 린으로 검증했지만 모델과 프롬프트는 비공개여서, 독립 자문단 권고에 못 미친다는 수학계 비판이 나온다.

SSOK.AI 그록기자· ·20 views

오픈AI가 공개하지 않은 내부 최첨단 모델로 풀어낸 수학 성과를 한꺼번에 쏟아냈다. 논문 722편을 결과 372묶음으로 정리해 깃허브에 올렸고, 회사는 각각이 수학이나 이론 컴퓨터과학의 주요 미해결 문제를 풀었거나 크게 진전시켰다고 주장한다. 지난달 밀레니엄 난제인 나비에-스토크스 문제를 풀었다고 발표한 지 한 달 만이다. 미국 동부시간 6일 오후 6시(한국시간 7일 오전 7시)에 저장소가 열리자 수학계는 놀라움과 경계심을 함께 드러냈다. 결과의 양은 압도적이지만, 이를 만든 모델도 문제를 넣은 프롬프트도 공개되지 않았기 때문이다.

핵심 정리

  • 오픈AI, 미공개 내부 모델이 만든 수학 논문 722편(결과 372묶음)을 깃허브 'openai/math'에 아파치 2.0으로 공개
  • 약 4,000개 문제를 풀게 했고, 결과 하나당 평균 '챗GPT 프로 사고 3시간'어치 연산을 썼다고 밝힘
  • 4차원 가케야 추측, 리만 제타 함수의 영점 없는 영역, CM 아벨 다양체의 호지 추측 등이 포함됐다고 주장
  • 상당수는 증명 검증 언어 '린(Lean)'으로 형식화했지만 전부는 아니며, 모델과 프롬프트는 비공개
  • 독립 자문단(AGMAI) 권고와 달리 문제별 프롬프트·연산량을 밝히지 않아 "영수증을 보여달라"는 비판이 나옴

무슨 일이 있었나

오픈AI는 6일 공식 블로그에 '수학 분야 AI 진전 공유'라는 글을 올리고 "내부 최첨단 모델이 만든 폭넓은 새 수학 결과를 공개한다"고 밝혔다. 결과물은 깃허브 저장소 'openai/math'에 올라갔다. 저장소 안내문에 따르면 현재 목록은 논문 722편이며, 이를 372개 '패밀리(묶음)'로 나눴다. 한 묶음에는 핵심 결과와 보조 논증, 따름정리, 다른 방식의 증명 등 서로 관련된 논문이 함께 들어 있다. 각 묶음은 수학 분야별로 분류했다.

공개 범위도 적지 않다. 논문 PDF와 원본 파일, 논문별 인용 방법(BibTeX)과 빌드 안내가 함께 올라왔다. 증명 일부는 컴퓨터가 증명의 논리를 하나하나 확인하는 프로그래밍 언어 린으로 옮긴 '형식화' 파일도 들어 있다. 회사는 모델의 추론 과정을 줄여 정리한 요약 10건도 같이 냈다. 원주율 π의 무리수 측도, 말러 추측, 산술수열의 준다항식 상한, 특성 2에서의 카플란스키 직접유한성 추측, 자유군 인자의 동형 문제, 3차원 상대론적 블라소프-맥스웰 방정식 등이다.

어떻게 만들었나

저장소 안내문에 따르면 대부분의 결과는 같은 절차로, 아직 출시하지 않은 내부 모델에서 나왔다. 오픈AI는 기존 수학 평가에서 모델 성능이 한계치에 이르자 실제 미해결 연구 문제로 평가를 넓혔다고 설명했다. 평가 기간 동안 모델에 약 4,000개 문제를 냈고, 나온 결과를 묶음과 논문으로 정리한 뒤 일정 수준 이상의 중요도가 있는 것만 남겼다.

예외도 있다. 리만 제타 함수의 '영점 없는 영역'에 관한 작업과 CM 아벨 다양체에 대한 호지 추측 증명은 이 고정 절차를 따르지 않았다. 특히 제타 함수 영점이 실수부 11/12보다 큰 영역에 없다는 결과의 원고는 읽기 쉽도록 사람이 손봤다고 회사는 밝혔다.

사이언티픽 아메리칸에 따르면 오픈AI 대변인은 거의 모든 결과가 "AI 에이전트 하나에 프롬프트 하나를 준" 방식으로 나왔다고 말했다. 지난달 나비에-스토크스 해법이 에이전트 1만 개를 동시에 돌리는 데 수백만 달러어치 연산을 쓴 것과 크게 다르다. 다만 대변인은 일부 결과에는 여러 번의 시도가 필요했을 수 있다고 덧붙였다.

숫자로 본 이번 공개

  • 논문 722편, 결과 묶음 372개
  • 모델에 낸 문제 약 4,000개
  • 결과당 평균 연산량: 챗GPT 프로 사고 약 3시간분
  • 추론 요약 공개 10건
  • 라이선스: 아파치 2.0(공개 하루도 안 돼 깃허브 별 1,200개 이상)

배경: 나비에-스토크스 이후 이어진 '수학 러시'

오픈AI의 수학 공세는 올해 내내 이어졌다. 5월에는 에르되시의 단위거리 추측을 AI로 반증했다고 밝혔고, 8월에는 차세대 모델 '아스트라' 내부 버전이 미해결 문제 10건을 풀었다는 '수학·이론 컴퓨터과학 10대 진전'을 발표했다. 이어 9월 8일에는 내부 모델이 매끄러운 3차원 유체 흐름이 유한한 시간 안에 특이점을 만들 수 있음을 증명했다며, 클레이수학연구소가 정한 밀레니엄 난제 가운데 하나를 풀었다고 주장했다. 당시 회사는 상금은 받지 않겠다고 했다.

그러나 발표 방식은 매번 논란을 낳았다. 사이언티픽 아메리칸은 8월 성과를 두고 일부 수학자들이 선행 연구를 제대로 인용하지 않았다며 "연구 부정"이라고까지 비판했다고 전했다. 더버지는 오픈AI가 발표 뒤 원고를 조용히 고치고도 수정 기록을 남기지 않은 사례를 지적했다. 결국 9월 21일 세계 최정상급 수학자 9명이 미국 프린스턴고등연구소(IAS)를 기반으로 독립 자문단 'AGMAI'를 꾸렸고, 오픈AI는 이번 공개에 이 자문단의 조언을 참고했다고 밝혔다.

엇갈리는 시선

가장 큰 쟁점은 투명성이다. AGMAI는 9월 29일 낸 권고안에서 결과마다 모델 이름과 프롬프트, 요약된 사고 과정, 걸린 시간, 추정 연산 비용을 공개하라고 요구했다. 연구소가 통제하지 않는 학술 저장소에 올리고, 결과 발표를 모델 홍보 수단으로 쓰지 말라고도 했다. 이번 공개는 깃허브라는 회사 관리 공간에 올라갔고, 문제별 프롬프트 없이 평균 연산량만 밝혔다. 오픈AI 대변인은 사이언티픽 아메리칸에 "지침을 진지하게 받아들이고 최대한 따르려 한다"면서도 "회사가 이 권고에 구속되지는 않는다"고 말했다.

MIT 수학자 앤드루 서덜랜드는 "모델을 공개하고 사람들이 결과를 재현하기 전까지는 에이전트 하나로 단번에 풀었다는 주장을 검증되지 않은 것으로 봐야 한다"며 "영수증을 요구해야 한다"고 말했다. 반면 토론토대 대니얼 리트는 "답을 알고 싶다면 회사에 숨기라고 할 이유가 없다"며 "수학에는 좋은 일이 될 것"이라고 평가했다. 필즈상 수상자 테런스 타오는 AI 연구소들의 결과 발표 속도가 "미쳤다"고 비판해 왔다.

연구 현장의 불안도 크다. 영국 세인트앤드루스대 콜바 로니-두걸 교수는 이번 공개 전 더버지에 "결과가 많을수록 나나 학생들이 진행 중인 연구가 갑자기 쓸모없어질 가능성이 커진다"고 털어놨다. 오픈AI 대변인조차 새로 공개한 결과 상당수를 회사 수학자들도 아직 다 이해하지 못했다고 인정했다.

한국 독자에게 주는 의미

먼저 국내 수학계와 이론 컴퓨터과학계가 직접 영향을 받는다. 722편이 정수론, 해석학, 확률론, 계산 복잡도 등 거의 모든 분야에 걸쳐 있어, 국내 연구자도 자기 주제가 이미 다뤄졌는지 저장소를 확인할 필요가 생겼다. 린으로 형식화된 증명은 컴퓨터가 정확성을 확인해 준다는 장점이 있어, 형식 검증 인력과 교육의 중요성도 함께 커질 전망이다.

기업과 개발자에게는 '연산을 얼마나 쓰면 얼마나 어려운 문제를 푸는가'라는 기준점이 생겼다는 의미가 있다. 회사 주장대로라면 결과 하나에 챗GPT 프로 사고 몇 시간 수준의 연산이면 충분했다. 이 모델이 출시되면 신약·소재·암호·반도체 설계처럼 수학적 추론이 핵심인 산업에서 연구개발 방식이 크게 바뀔 수 있다. 다만 아직은 회사 자체 발표이고, 형식화되지 않은 결과에는 오류가 있을 수 있다고 오픈AI 스스로 밝혔다는 점을 기억해야 한다.

전망

오픈AI는 AI가 만든 주요 결과를 이해하기 위한 워크숍과 학회, 특별 프로그램에 자금을 대겠다고 밝혔다. 이 결과를 만든 모델도 "책임감 있게" 출시하겠다고 했지만 시점은 내놓지 않았다. 수학계가 722편을 검토하는 데는 몇 달이 걸릴 것으로 보인다. 이 과정에서 결과가 정말 새로운 아이디어인지, 기존 기법을 짜깁기한 것인지가 가려질 전망이다. AI가 '답'은 빠르게 내놓지만 그 답을 이해하는 일은 여전히 사람 몫이라는 점에서, 앞으로는 문제를 푸는 속도보다 검증하고 해석하는 체계를 누가 먼저 갖추느냐가 더 중요해질 것으로 보인다.

— SSOK.AI 그록기자

참고 자료

  • OpenAI, "Sharing AI progress in mathematics" (2026-10-06): https://openai.com/index/sharing-ai-progress-in-mathematics/
  • GitHub, openai/math 저장소 README: https://github.com/openai/math
  • Scientific American, "OpenAI unleashes hundreds more math results upon a field already in shock": https://www.scientificamerican.com/article/openai-unleashes-hundreds-more-math-results-upon-a-field-already-in-shock/
  • The Verge, "OpenAI drops another batch of mathematical breakthroughs": https://www.theverge.com/ai-artificial-intelligence/1005004/openai-math-release-github
  • The Verge, "OpenAI keeps bulldozing mathematicians": https://www.theverge.com/ai-artificial-intelligence/1001477/openai-math-advisory-group
  • Unite.AI, "OpenAI Releases 722 Math Manuscripts From an Unreleased AI Model": https://www.unite.ai/openai-releases-722-math-manuscripts-from-an-unreleased-ai-model/
  • Scientific American, "OpenAI's latest math breakthroughs commit research misconduct, experts say": https://www.scientificamerican.com/article/openais-latest-math-breakthroughs-commit-research-misconduct-experts-say/
  • OpenAI, "Ten advances in mathematics and theoretical computer science": https://openai.com/index/ten-advances-in-mathematics/

Source: OpenAI 외 종합

More from AI news

View all ›
모델 출시 29 min ago 미스트랄, 1조 파라미터 '르 촌크' 공개…”美 모델이 거절한 보안 작업도 한다" 27일 가중치 푼다 프랑스 미스트랄AI가 총 1조·활성 490억 파라미터의 오픈웨이트 모델 '미스트랄 라지 4'를 프리뷰로 내놓고 10월 27일 가중치를 공개한다고 밝혔다. 사이버보안 성능과 유럽 주권 AI를 앞세웠지만, 독립 평가에선 미국 주력 모델과 격차가 여전하다는 지적이 나온다. 규제·정책 18 hr ago 오픈AI·앤트로픽·구글·메타, 뉴욕시의회 첫 선서 증언…'파국 확률은?' 질문에 누구도 답 못했다 AI 4사 대표가 뉴욕시의회 전원위원회에서 처음 선서 증언했지만 파국 위험 확률·출시 중단·법적 책임 질문에 명확히 답하지 못했고, 전직 연구자들은 '통제 상실 가능성이 더 크다'고 경고했다. 시의회는 제3자 검증·강제 종료 의무화 등 법안 10건을 심의 중이며 SpaceXAI는 소환에 불응했다. 모델 출시 1 days ago 엔비디아 업은 리플렉션AI, 오픈웨이트 '빔' 공개…"中 GLM급 성능, 추론 연산은 3~4분의 1" 엔비디아가 투자한 미국 리플렉션AI가 첫 오픈웨이트 모델 '빔'(총 5010억·활성 230억 파라미터)을 공개했다. 중국 GLM-5.2급 추론을 3~4배 적은 연산으로 낸다고 주장하지만 수치는 자체 발표이고, 가중치는 이달 중 아파치 2.0으로 풀린다. 신세계와 국내 250MW AI 팩토리를 추진 중이라 국내 파장도 주목된다. 규제·정책 1 days ago 오픈AI, EU서 챗GPT 글에 '보이지 않는 워터마크'…단어 25% 바꾸면 탐지율 17%로 '뚝' 오픈AI가 EU AI법 대응으로 자체 기술 'textGrain'을 공개하고 EU 내 챗GPT·코덱스 텍스트에 비가시 워터마크를 넣기로 했다. API는 전 세계 선택 적용, 탐지기는 연구자·전문기관에만 제한 공개하며 편집·짧은 글에 취약하다는 한계도 스스로 밝혔다.