Mistral "Mistral 3 Large" 공개——유럽산 LLM이 추론 벤치마크에서 미국 모델과 어깨를 나란히 하는 전환점
機械翻訳 / Machine-translated
프랑스 Mistral AI가 2026년 9월 14일, 플래그십 모델 "Mistral 3 Large"를 정식 공개했다. MMLU 스코어 92.4는 GPT-4o(92.0)를 0.4포인트 웃돌며, Apache 2.0 라이선스의 가중치가 당일부터 배포 시작되었다. "유럽산 오픈 웨이트가 미국 클로즈드 모델과 실용적으로 구별되지 않는 수준에 도달했다"는 의미에서, LLM 조달의 선택 기준이 바뀌는 분기점이 되었다.
Mistral AI는 일본 시간 14일 22시, 공식 블로그와 Hugging Face에서 "Mistral 3 Large"를 공개했다. 모델 크기는 약 1,230억 파라미터, 컨텍스트 길이는 128,000 토큰이다. 주요 벤치마크 결과는 다음과 같다.
X(구 Twitter)에는 엔지니어들의 검증 게시글이 잇따르고 있다.
"Mistral 3 Large를 로컬에서 구동해봤다. HumanEval의 난이도 높은 문제도 통과된다. GPT-4o와 거의 구별이 안 된다. 게다가 Apache 2.0이다. 이것이 유럽에서 나왔다는 의미는 결코 작지 않다"(엔지니어 계정, 1.4만 좋아요)
Mistral AI는 2023년 파리에서 설립되었다. 같은 해 9월 공개된 "Mistral 7B"가 오픈 웨이트 성능 기준을 새로 썼고, 2024년의 "Mistral Large" 시리즈로 유럽 발 LLM으로서는 처음으로 엔터프라이즈 시장에 파고들었다.
2025년에는 유럽 AI법(EU AI Act)의 단계적 시행을 맞아, GDPR 준수 및 EU 데이터 경계 대응을 무기로 유럽 기업 대상 영업을 강화했다. 유료 플랜 기업 수는 2026년 3월 기준 "1,200개사 이상"이라고 최근 인터뷰에서 언급된 바 있다.
이번 업데이트는 12개월 만의 플래그십 갱신이다. 오픈 웨이트로서는 Llama 4 Maverick에 이어 두 번째 "GPT-4o 수준" 클레임이 된다.
Meta Llama 시리즈에는 월간 활성 사용자 7억 명 초과 시 상업적 제한이 부과되는 라이선스가 적용되지만, Mistral 3 Large는 Apache 2.0을 채택했다. 규모에 관계없이 상업적 내장이 가능하여, 법무 부서의 검토 비용이 크게 줄어든다.
릴리스 노트에서는 Mistral 3 Large가 EU AI Act 부속서 III의 고위험 요건에 대응하는 기술 문서를 동시에 공개했다고 명기했다. 모델 카드에 학습 데이터의 출처와 제외 목록을 공시하여, 유럽 공공기관 조달에서의 적격성을 사전에 확보했다.
HumanEval 87.6%는 현재 주류 AI 코딩 에이전트 기반이 채택하는 클로즈드 모델과 동일한 수준이다. 금융·의료 등 외부 API 이용에 제약이 있는 업종에서의 로컬 또는 프라이빗 클라우드 운용이 현실적인 선택지가 된다.
MMLU에서 GPT-4o를 0.4포인트 상회했다는 수치는 통계적 오차 범위 내에 들어온다. "유럽산이 미국산을 넘어섰다"는 서사를 앞세우기보다, "처음으로 실용적으로 구별되지 않는 수준에 도달했다"는 사실이 더 무게 있다.
주목해야 할 것은 벤치마크 점수보다, Apache 2.0 + EU AI Act 준수 + EU 데이터 경계라는 세 가지 요소가 동시에 성립했다는 점이다. 유럽·일본의 규제 산업(금융·의료·공공)에서는 이 패키지가 조달 판단의 실질적인 조건으로 자리 잡고 있다. 2026년 들어 "국산·유럽산 LLM 채택 검토"를 표명한 국내 금융기관은 최소 5개 행에 달하는 것으로 알려지며, Mistral 3 Large는 그 타이밍에 정확히 맞아떨어졌다.
API 가격은 입력 100만 토큰당 2.4달러(Mistral 2 Large 대비 44% 감소)다. 로컬 배포를 선택하지 않더라도 API로 해결되는 용도에서는 비용 구조의 선택지가 늘어났다.
유럽산 LLM이 "벤치마크 점수상의 동급"을 처음으로 획득했다. 다음 초점은 Mistral 3 Large를 기반으로 하는 에이전트나 파인튜닝 모델이 실제 업무에서 어느 수준까지 정확도를 낼 수 있는지다. Mistral AI는 엔터프라이즈용 파인튜닝 API를 4분기 중 제공할 예정이며, 실제 구현 사례가 나오기 시작하는 것은 2026년 말 이후가 될 것으로 보인다. LLM 선정의 "미·유럽 양자택일" 구조는 조용히 무너지기 시작하고 있다.
※ 본 기사는 미라이 뉴스 편집부의 AI 작가(AI 뉴스)가 작성했습니다.