GPT-5.5가 엔지니어를 매료시키는 이유|최고 성능이 아님에도 주목받는 까닭과 평가 기준의 변화
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
이 글에서 알 수 있는 것
2026년 4월 23일, OpenAI는 새로운 AI 모델 'GPT-5.5'를 발표했습니다. 이 모델은 프로그래밍 지원에 특화된 '코딩 에이전트'로 설계되었습니다.
사실 GPT-5.5는 모든 벤치마크(AI 성능을 측정하는 테스트)에서 최고 점수를 기록하는 것은 아닙니다. 예를 들어, 프로그래밍 문제 해결 능력을 측정하는 'SWE-Bench Pro'라는 테스트에서 GPT-5.5의 점수는 58.6%였습니다. 반면 경쟁 모델인 Claude Opus 4.7은 64.3%로 더 높은 점수를 기록했습니다.
그럼에도 불구하고 많은 엔지니어들이 GPT-5.5에 주목하고 있습니다. 왜일까요?
GPT-5.5가 높이 평가받는 가장 큰 이유는 'agentic durability(에이전트 지속성)'라고 불리는 능력입니다. 한국어로 풀어쓰면 '끝까지 스스로 생각하며 계속 동작하는 힘'이라는 의미입니다.
기존의 AI는 사람이 세세하게 지시를 내리지 않으면 중간에 멈춰버리는 경우가 많았습니다. 예를 들어, 프로그램을 작성하는 도중 오류가 발생하면 "어떻게 하면 좋을까요?"라고 되묻는 경우가 많았습니다.
그러나 GPT-5.5는 다릅니다. 오류가 발생해도 스스로 원인을 파악하고, 수정 방법을 고민한 뒤 실제로 고치고 나서 다음 작업으로 넘어갑니다. 즉, 사람이 지켜보지 않아도 '끝까지 스스로 달릴' 수 있는 것입니다.
구체적인 수치를 살펴보겠습니다. GPT-5.5는 'Terminal-Bench 2.0'이라는 테스트에서 82.7%의 점수를 기록했습니다. 이는 커맨드라인(문자만으로 컴퓨터를 조작하는 방법)을 활용한 복잡한 작업을 얼마나 끝까지 완성할 수 있는지를 측정하는 테스트입니다.
이 점수는 기존 모델과 비교해 크게 향상된 수치입니다. 예를 들어 'OSWorld-Verified'라는 일반적인 컴퓨터 조작 테스트에서는 78.7%, 지식 노동 태스크인 'GDPval'에서는 84.9%를 기록했습니다.
AI 업계에서는 오랫동안 '벤치마크에서 높은 점수를 받는 것'이 가장 중요하다고 여겨져 왔습니다. 벤치마크란 AI 성능을 측정하기 위한 표준 테스트를 말합니다.
그러나 2026년에 들어서면서 상황이 달라졌습니다. 엔지니어들은 '테스트에서 높은 점수를 받는 AI'보다 '실제 업무를 끝까지 완수하는 AI'를 요구하게 된 것입니다.
이 변화를 보여주는 데이터가 있습니다. 스탠퍼드 대학교가 발표한 'AI Index 2026'에 따르면, AI 에이전트가 PC 조작 태스크를 성공시키는 확률은 2024년에 불과 12%에 불과했습니다. 그것이 2026년에는 66%까지 상승했습니다. 불과 2년 만에 5배 이상 개선된 것입니다.
이러한 급격한 진화로 인해 AI 평가 기준도 크게 달라졌습니다. 기존에는 '개별 테스트에서 얼마나 높은 점수를 받을 수 있는가'가 중시되었지만, 현재는 다음 세 가지가 중요하게 여겨지고 있습니다.
즉, '얼마나 똑똑한가'보다 '얼마나 믿고 맡길 수 있는가'가 중요해진 것입니다.
GPT-5.5의 또 다른 특징은 '토큰 효율'의 높음입니다. 토큰이란 AI가 문장을 처리할 때의 최소 단위로, 토큰 수가 많을수록 처리 비용이 높아집니다.
GPT-5.5는 동일한 작업을 처리하는 데 다른 모델보다 72% 적은 토큰으로 충분합니다. 이는 짧은 문장으로 정확하게 답변을 반환할 수 있다는 것을 의미합니다.
구체적으로 GPT-5.5는 '적은 토큰으로 더 높은 점수를 달성한다'는 설계 철학으로 만들어졌습니다. 불필요한 설명을 줄이고 필요한 작업에만 집중할 수 있어, 비용을 억제하면서도 높은 성과를 낼 수 있습니다.
다만, API(프로그램에서 AI를 사용하기 위한 인터페이스)의 이용 요금은 입력이 $5.00, 출력이 $30.00으로 이전 세대의 2배로 설정되어 있습니다. 그럼에도 불구하고 토큰 효율이 높기 때문에 실제 태스크당 비용은 다른 모델보다 저렴해지는 경우가 많습니다.
GPT-5.5의 주요 경쟁 모델은 Anthropic이 2026년 4월 16일에 발표한 'Claude Opus 4.7'입니다. 두 모델은 어떻게 다를까요?
Claude Opus 4.7은 SWE-Bench Pro에서 64.3%, SWE-bench Verified에서 87.6%를 기록하며, 코딩 능력에서는 왕좌를 되찾았다는 평가를 받고 있습니다. 특히 대규모 코드베이스(수많은 파일로 구성된 프로그램 전체)를 이해하고, 광범위한 설계 변경에 강점이 있습니다.
반면 GPT-5.5는 도구 사용이 정확하고, 파일 조작이나 구체적인 문제 해결에 뛰어납니다. 즉, 큰 그림을 그리는 것은 Claude, 세밀한 작업을 정확하게 처리하는 것은 GPT-5.5라는 특징이 있습니다.
전문가들은 "어느 쪽이 뛰어난지는 어떤 작업을 하느냐에 달려 있다"고 지적합니다. 대규모 애플리케이션 전체를 조망할 필요가 있는 경우에는 Claude, 구체적인 태스크를 자동화하고 싶은 경우에는 GPT-5.5가 적합하다는 것입니다.
프로그래머에게 인기 있는 도구 'GitHub Copilot'에서 GPT-5.5를 선택하면 요금의 '승수'가 7.5배가 됩니다. 이는 동일한 작업이라도 통상의 7.5배 요금이 부과된다는 의미입니다.
따라서 기업에서 대규모로 GPT-5.5를 도입할 경우, 총 비용(TCO: Total Cost of Ownership)이 크게 증가할 가능성이 있습니다. 비용 면에서는 신중한 검토가 필요합니다.
한편, GPT-5.5의 높은 토큰 효율을 감안하면 실제 태스크당 비용이 다른 모델보다 저렴해지는 경우도 있습니다. 사용하는 상황에 따라 어떤 모델이 최적인지를 판단하는 것이 중요합니다.
GPT-5.5와 Claude Opus 4.7의 등장으로 AI 업계의 경쟁은 새로운 단계에 접어들었습니다. 전문가들은 "한 달 만에 이 상황이 크게 바뀔 가능성이 있다"고 지적하며, AI 개발 속도가 가속화되고 있음을 보여줍니다.
앞으로는 단순한 성능 비교가 아닌, 구체적인 운용 시나리오에서의 효율성 평가가 중요해질 것입니다. 즉, 'AI가 테스트에서 몇 점을 받는가'라는 정보만이 아니라, '실제 업무에서 얼마나 도움이 되는가'를 파악하는 것이 필요합니다.
또한 2026년에는 AI 평가의 다원화가 진행되고 있습니다. 코딩에는 SWE-bench가 표준, 웹 조작에는 BrowserGym, 엔터프라이즈 환경에는 τ-bench와 같이, 용도별로 서로 다른 평가 지표가 사용되게 되었습니다.
이러한 변화는 AI가 '연구실의 장난감'에서 '실무에서 사용할 수 있는 도구'로 진화하고 있음을 보여줍니다.
GPT-5.5의 등장은 AI 업계에서 '무엇이 정말로 중요한가'라는 질문을 던지고 있습니다. 단순히 똑똑하기만 한 것이 아니라, 믿고 맡길 수 있는 것. 그런 AI가 앞으로의 시대에 요구되고 있는 것입니다.
이 글은 AI Friends 의 크로스포스트입니다.