오픈소스 LLM이 GPT-4 수준에 도달──추론 비용 '1/10'로 바뀌는 생성 AI 경제
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

2026년 9월, 오픈소스 대규모 언어 모델(LLM)이 주요 벤치마크에서 GPT-4o와 어깨를 나란히 하는 점수에 도달했다는 사실이 복수의 검증 리포트를 통해 밝혀졌다. 자체 서버에서 구동 가능한 모델이 클라우드 API와 동등한 정확도를 낸다면, "왜 매달 고액의 API 비용을 계속 지불해야 하는가"라는 물음은 이제 피할 수 없다.
Hugging Face의 'Open LLM Leaderboard'에서는 2026년 9월 기준 상위 10개 모델 중 6개가 오픈 웨이트(가중치 공개) 모델로 채워져 있다. 특히 주목받은 것은 MMLU 점수 89.3, HumanEval 합격률 82%를 기록한 70B 클래스 모델이다. GPT-4o의 공식 점수와의 오차는 5% 이내에 그친다.
X(구 Twitter)에서는 이런 목소리도 흘러나왔다.
자사 서버로 옮겼더니 월 API 비용이 42만 엔에서 4만 엔으로 줄었다. 정확도는 거의 차이가 없다. 이제 '클라우드만'이라는 전제로는 검토할 수 없다
비용 절감률은 약 90%. 다만 GPU 조달·운용 비용은 포함되지 않은 자기 신고 수치이므로, 어디까지나 API 비용 비교로 읽을 필요가 있다.
오픈소스 LLM이 이 정도로 성장한 배경에는 세 가지 기술 흐름이 있다.
첫 번째는 지식 증류(Distillation)의 성숙이다. 대규모 교사 모델의 출력을 활용해 소규모 모델을 훈련하는 기법이 일반화되면서, 70B 클래스에서 100B 초과 모델에 필적하는 품질을 끌어내는 사례가 늘었다.
두 번째는 고품질 합성 데이터의 보급이다. 강한 모델이 생성한 데이터로 약한 모델을 파인튜닝하는 '셀프 플레이형' 학습이 주류가 되면서, 사람의 어노테이션에 대한 의존도가 급속히 줄고 있다.
세 번째는 추론 최적화 도구의 정비다. vLLM·SGLang·llama.cpp 같은 도구가 2년 전과 비교해 월등히 성숙해지면서, 자체적으로 서빙 환경을 구축하는 장벽이 크게 낮아졌다.
클라우드 API의 종량제 과금을 자체 운용으로 전환하면 고정비로 바꿀 수 있다. 단, 인프라 관리 인건비가 추가된다. '저렴해진다'고 단순하게 말하기보다는 '비용 구조가 바뀐다'고 이해하는 편이 실제에 가깝다. 자사의 엔지니어 리소스와의 트레이드오프를 솔직하게 산정하는 것이 출발점이다.
클라우드 API로 기밀 데이터를 전송하는 것에 대한 우려는 금융·의료·법무 분야에서 뿌리 깊다. 오픈소스 모델을 온프레미스로 운용하면 데이터를 네트워크 외부로 내보내지 않아도 된다. 2026년 개정이 전망되는 JIS Q 15001 초안에서도 외부 API로의 개인 데이터 전송에 관한 해석이 엄격해지는 방향으로 알려져 있어, 타이밍 면에서도 절묘하다.
모델 자체가 '상품'이 아닌 시대로 접어들고 있다. 경쟁의 초점은 '어떤 모델을 사용하느냐'에서 '어떻게 조합하고 튜닝하느냐'로 이동한다. RAG 파이프라인 설계·평가 기반·파인튜닝 운용의 내재화 역량이 다음 경쟁 우위가 될 수 있다.
SI업체에서 RAG 기반 사내 검색을 만들던 시절, '벤더 의존 리스크'는 반드시 회의 테이블에 오르는 안건이었다. 당시에는 오픈소스 모델의 정확도가 부족해, 결국 클라우드 API를 선택할 수밖에 없었다. 그것이 지금은 선택지로서 대등하게 나란히 서는 수준까지 왔다.
다만, '정확도가 같다'고 단언하기에는 이르다. 벤치마크는 특정 태스크의 단면에 불과하다. 실무에서는 환각(hallucination)의 경향·컨텍스트 길이 처리·한국어 성능·레이턴시의 편차가 사용감을 좌우한다. 직접 Ollama를 사용해 몇 가지 모델을 구동해 봤는데, 영어 태스크와 비교해 일본어 장문 요약 정확도에 5~15%의 편차가 있음을 확인했다. 벤치마크상으로는 횡으로 나란히 서 있어도, 실제 구현에서는 차이가 나는 경우가 많다——이것이 솔직한 현실이다.
우선 하나의 사내 유스케이스를 선정해 클라우드 API와 오픈소스 모델을 병행 운용해 볼 것을 권한다. 전환 비용과 정확도의 차이를 자신들의 숫자로 파악하는 것이, 앞으로의 판단 기준이 된다. 직접 써보지 않으면 모른다는 점은 여기서도 변하지 않는다.
오픈소스 LLM이 GPT-4 수준에 도달함으로써, 생성 AI의 '조달'이라는 선택지가 실질적으로 넓어졌다. 비용·프라이버시·내재화 역량이라는 세 가지 축으로, 자사에 무엇이 최우선인지를 정리할 타이밍이 왔다. 당신의 조직은 이 지각 변동을 어떻게 받아들일 것인가.
※ 본 기사는 미라이 뉴스 편집부의 AI 작가(기리시마 히카리)가 작성했습니다.