OpenAI 「o4」 공식 출시——수학·코딩·과학 3개 분야에서 PhD 수준 달성, 전문직 AI가 실제 구현 단계로
機械翻訳 / Machine-translated
OpenAI는 2026년 9월 13일, 추론 특화 모델 「o4」의 API 및 ChatGPT 제공을 동시에 시작했다. 수학(AIME 2026: 94.7%), 과학 난제(GPQA Diamond: 89.2%), 실제 환경 버그 수정(SWE-bench Verified: 63.8%)의 3개 지표에서 PhD 수준으로 여겨지는 기준선을 처음으로 동시 돌파했다. '성능이 언젠가 전문가를 뛰어넘을 것'이라는 명제가, '어떤 업무부터 구현할 것인가'라는 설계 문제로 바뀌었다.
한국 시간 2026년 9월 14일, OpenAI는 o4를 공식 발표했다. 주요 벤치마크는 다음과 같다:
가격은 o3 대비 입력 토큰 비용 약 20% 절감. 다만 당분간 제공은 API Tier 4 이상으로 제한된다.
출시 직후, 연구자들의 반응이 X(구 트위터)에 집중됐다:
「o4에 자신의 연구실 미해결 문제를 던졌더니, 놓치고 있던 접근법에 대한 제안이 돌아왔다. 맞는지는 아직 모르지만, 엉뚱한 답은 아니었다」
o1(2024년 9월)을 출발점으로 하는 추론 모델 계보는 o1 Pro → o3 → o3-mini로 진화해왔다. 각 단계에서 '특정 벤치마크에서의 전문가 초월'이 보고되어 왔지만, 이번에는 독립된 3개 분야에서의 동시 도달이라는 점에서 성격이 다르다.
배경으로는 2026년 전반기의 Gemini 2 Ultra·Qwen 3.5의 대두가 OpenAI의 개발 압력을 높인 것으로 보인다. 독립 벤치마크 기관의 집계에 따르면, o4와 Claude 4 Opus의 차이는 오차 범위 내에 수렴하고 있으며, 상위 모델 간의 성능 차이는 실질적으로 줄어들고 있다.
'실제 환경의 미해결 GitHub 이슈를 단독으로 수정할 수 있는 확률'로 읽을 수 있는 이 수치는, 2024년 o1이 기록한 약 14%에서 2년 만에 약 4.5배로 성장했다. 코딩 에이전트와 결합했을 경우, 시니어 엔지니어 수준의 버그 수정 자동화 비용이 현실적인 범위에 들어온다. 'AI가 PR을 작성한다'가 아니라 'AI가 프로덕션 환경의 문제를 수정한다'는 단계로의 전환을 보여주는 수치다.
PhD 취득자의 평균 정답률이 70~75%로 알려진 GPQA Diamond에서 89.2%를 기록한 의미는 크다. 의료 진단 지원·법률 조사·금융 리스크 평가 등의 분야에서, 기존의 '초안 생성 + 인간 검토'에서 '결론 제시 + 예외 케이스 확인'으로 업무 설계의 판도가 바뀐다.
얼핏 소폭의 절감처럼 보이지만, 추론 모델은 사고 연쇄(Chain of Thought)를 반복하기 때문에 에이전트 워크플로에서의 토큰 소비량은 채팅 용도의 수 배~수십 배에 달한다. 이 영역에서의 비용 절감은, 중소 규모 스타트업이 월별 예산 내에서 프로덕션 운용을 할 수 있는 문턱을 낮추는 효과가 있다.
'PhD 수준 도달'이라는 표현은 과거에도 등장했지만, 이번의 구조적 차이는 '복수의 독립된 난제 분야에서의 동시 도달'에 있다. 단일 태스크 최적화가 아닌, 범용적인 난제 해결 능력의 전반적인 향상으로 읽어야 할 단계에 접어들었다.
주의점은 두 가지다. 하나는 가용성의 제약이다. Tier 4 제한으로 인해, 활용하고 싶은 기업이 즉시 사용할 수 없는 상태가 일시적으로 지속된다. 경쟁사가 거의 동등한 성능을 내고 있는 국면에서는, '성능 차이'보다 '사용 가능 여부'가 실질적인 경쟁 축이 될 수 있다.
또 하나는 규제 환경이다. EU AI법의 고위험 조항이 2026년 8월에 전면 시행된 지금, 의료·법률 분야에서의 '판단 대행' 활용은 규제 리스크와 직결된다. 성능의 향상과 규제의 강화가 동시에 진행되고 있는 구도는, 한국 기업의 구현 설계에도 영향을 미친다.
o4의 등장은 'AI가 전문가를 따라잡았다'는 기술적 이정표가 아니라, '전문 지식을 통합한 업무 설계를 어떻게 바꿀 것인가'라는 경영·조직의 물음으로 전환되는 국면이다. 오늘부터 바뀌는 것은, 전문직이 '무엇을 AI에게 맡길 것인가'가 아니라, '무엇을 AI에게 맡기지 않을 것인가'라는 판단 기준일지도 모른다.
다음 초점은, Anthropic의 Claude 4 Opus 계열 업데이트 대응 타임라인과, Google이 Gemini 2 계열로 o4 수준에 얼마나 추격하느냐의 두 가지일 것이다.
※본 기사는 미래 뉴스 편집부의 AI 작가(AI 뉴스)가 작성했습니다.