Mistral의 역습|Medium 3.5×4GPU 자체 호스팅 해금
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"AI 모델의 세계는 미중 양강 구도"——그 상식, 이제 다시 쓸 때가 온 것 같습니다.
2026년 4월 29일, 프랑스 기반의 Mistral AI가 플래그십 모델 'Medium 3.5'를 발표했습니다. SWE-Bench 77.6%라는 수치로 Claude Sonnet 4.5의 뒤를 바짝 추격하면서도, 수정 MIT 라이선스로 웨이트를 공개하고 4장의 GPU로 직접 운용할 수 있다는 충격적인 등장입니다. 동시에 발표된 Vibe Remote Agents로 '클라우드에서 알아서 코딩'도 기본 탑재했습니다.
이 글에서는 Medium 3.5의 스펙과 포지셔닝, SWE-Bench 77.6%가 의미하는 실용성, 4장의 GPU로 동작하는 오픈 웨이트의 파괴력, Vibe Remote Agents의 구조, 가격과 운용의 현실, 경쟁사 비교, 그리고 한국 시장에 대한 영향까지 한 번에 정리합니다.
Medium 3.5는 명령 수행(지시대로 동작), 추론(생각하기), 코딩(프로그램 작성)의 세 요소를 하나의 모델에 통합한 Mistral 최초의 플래그십 모델입니다.
이전까지 Mistral은 '소형 Mistral 7B', '코딩 특화 Devstral' 등 분업 모델 위주였지만, Medium 3.5는 단 하나로 이 모든 것을 커버합니다. 지금까지 여러 전문 요리사가 필요했던 레스토랑이 드디어 전 장르를 아우르는 총주방장을 영입한 것과 같은 전환입니다.
요청별로 '생각의 깊이'를 조절하는 설정도 있어, 가벼운 질문은 빠르게, 어려운 문제는 충분히 추론하는 방식으로 구분할 수 있게 됐습니다. 하나의 모델로 여러 용도를 처리할 수 있는 설계는 운용 비용과 모델 선정 수고를 한 번에 줄여주는 방향으로 작용합니다.
회사 배경도 짚고 넘어가겠습니다. Mistral AI는 2023년 파리에서 설립된 프랑스 인공지능 기업으로, 유럽을 대표하는 LLM(대규모 언어 모델) 개발 스타트업입니다.
창업자인 Arthur Mensch CEO는 전 Google DeepMind 출신으로, 창업 불과 9개월 만에 OpenAI에 필적하는 성능을 선보여 화제가 된 인물입니다. 2026년 3월에는 파리와 스웨덴의 데이터센터 건설을 위해 8억 3,000만 달러(약 1조 1,000억 원)를 조달하며, 유럽 AI 인프라의 핵심 플레이어로서 입지를 굳혀가고 있습니다.
미국의 OpenAI·Anthropic, 중국의 DeepSeek·Qwen에 이은 '제3세력'으로 주목받고 있으며, 2026년 내 한국 진출도 계획 중입니다.
모델 단독이 아닌 '사용 방식'의 혁신도 함께 담겨 있습니다. Mistral은 같은 날, Vibe Remote Agents(클라우드 비동기 코딩 에이전트)와 Le Chat의 Work Mode(복수 툴 통합 업무 에이전트)도 함께 공개했습니다.
기존 코딩 AI는 로컬 PC에서 동작하는 것이 기본이었지만, Vibe는 '클라우드에 통째로 맡기고 자는 동안 작성해 주는' 발상입니다. 집에서 직접 요리하는 것이 아니라, 외부 업무용 주방에 '내일 아침까지 만들어 달라'고 주문서를 던지는 감각에 가까워집니다.
Le Chat의 Work Mode는 메일 초안 작성·조사·복수 툴 연동을 하나의 대화로 완결하는 집사형 AI입니다. Pro·Team·Enterprise 플랜에서 이용 가능합니다.
벤치마크 내용을 이해하면 77.6%라는 숫자의 무게가 보입니다. SWE-Bench Verified는 GitHub 상의 실제 오픈소스 버그 리포트를 모은 테스트로, AI에게 '이 버그를 고치는 코드를 작성하라'고 지시하고 수정 패치가 올바르게 동작하는지 평가합니다. 이론 시험이 아닌, 현장 문제를 해결하는 실기 시험입니다.
Medium 3.5는 77.6%를 기록하며 Devstral 2와 Qwen 3.5 397B(4배 규모의 모델)를 제치고, 상위 그룹의 단골 멤버인 Gemini 3.1 Pro Preview(78.8%)에 단 1점 차이까지 바짝 다가섰습니다. 1급을 목표로 하던 선수가 어느새 1급 보유자와 나란히 결승에 선 전개입니다.
코딩 AI로서의 실용 수준을 완전히 뛰어넘은 단계로, 이제는 '보조 도구'가 아닌 '동료'라고 부를 수 있는 수준에 도달했습니다.
또 하나의 주목할 수치도 빠뜨릴 수 없습니다. τ³(타우 큐브)-Telecom은 통신 업계의 지원 업무를 AI 에이전트에 맡겨 해결률을 측정하는 벤치마크로, Medium 3.5는 91.4를 기록했습니다.
이는 '복수의 API를 호출하고, 과거 맥락을 바탕으로 고객 응대를 완료하는' 종합 에이전트 능력 테스트로, 단발성 질문 응답이 아닌 장기 태스크 지표입니다. 레시피만 외우는 요리사가 아니라, 손님의 취향을 듣고, 식재료를 꺼내고, 맛을 보며 최종 요리를 완성하는 총주방장 수준의 종합 능력——91.4가 표현하는 수준이 바로 그것입니다.
코딩뿐 아니라 기업의 업무 자동화 에이전트로서도 충분히 통하는 성능을 갖추고 있습니다.
'얼마나 많은 정보를 한 번에 다룰 수 있는가'도 중요한 지표입니다. Medium 3.5는 256k(25만 6,000)토큰의 컨텍스트 길이를 갖추며, 한국어 기준으로 약 20만 자, 단행본 한 권 이상을 한 번에 읽어들일 수 있습니다.
예를 들어 코드베이스 전체(수백 개 파일)를 한꺼번에 읽히고 '이 버그의 원인을 찾아줘'라고 지시할 수 있는 규모입니다. 사전을 찾아가며 작업하는 학생이 아닌, 교과서 전 페이지를 머릿속에 넣은 상태로 문제를 푸는 학생 같은 작업 방식이 됩니다.
장문 계약서 리뷰, 대규모 코드베이스 리팩토링, 장기 프로젝트 이력 참조 등 지금까지 '나눠서 처리해야' 했던 태스크를 한 번에 끝낼 수 있습니다. Claude Sonnet 4.5의 200k나 GPT-4o의 128k를 상회하며, 장문 처리에서는 최상위권 위치입니다.
라이선스의 핵심을 정리합니다. Medium 3.5는 'Modified MIT License(수정 MIT 라이선스)'로 공개되어 있으며, Hugging Face에서 누구나 무료로 다운로드할 수 있고, 상업적·비상업적 이용 모두 가능합니다.
단, '대규모 매출을 보유한 기업'에는 예외 조항이 있어 추가 계약이 필요한 경우가 있습니다. 중소기업이나 개인 개발자는 완전 자유, 초대형 기업만 별도 경로로 계약하라는 설계입니다. 동네 식당은 누구나 레시피를 사용해도 되고, 대형 체인점만 별도 라이선스 비용이 필요하다는 구분에 가깝다고 생각하면 이해하기 쉽습니다.
LLaMA나 DeepSeek와 같은 '준오픈소스' 흐름을 타면서도, 유럽 기업답게 컴플라이언스에도 배려한 실용적인 라이선스 설계입니다.
가장 주목을 받고 있는 것이 하드웨어 요건입니다. Medium 3.5는 FP8(부동소수점 8비트) 정밀도로, 단 4장의 데이터센터용 GPU(NVIDIA H100 80GB×4, 총 320GB VRAM)로 동작합니다.
128B 파라미터급 플래그십 모델로서는 파격적으로 가벼우며, 기업의 온프레미스 환경에서도 현실적인 투자로 운용 가능합니다. GPT-4o나 Claude는 API를 통해서만 이용할 수 있지만, Medium 3.5는 자사 서버에 직접 배포할 수 있어 기밀 데이터를 외부로 내보낼 수 없는 금융·의료·행정 분야에서의 채용이 빠르게 확산될 전망입니다.
유명 레스토랑의 셰프를 통째로 영입하는 것이 아니라, 레시피와 조리 도구 일식을 넘겨받아 자신의 가게에서 재현하는 전략——이 비유가 딱 맞아떨어집니다. GPU 비용이 저렴하지는 않지만, 장기 운용이라면 월정액 API보다 압도적으로 유리해집니다.
동작을 위한 소프트웨어 측면도 충실합니다. Medium 3.5는 주요 LLM 추론 엔진인 vLLM, SGLang, Ollama 모두를 지원하며, 엔지니어의 취향에 맞게 선택할 수 있습니다.
또한 고속 추론용 'EAGLE' 모델도 별도로 공개되어 있어, 토큰 생성 속도를 수배 높이는 구조도 갖춰져 있습니다.
vLLM은 Python 기반의 고속 서버, SGLang은 구조화 추론에 강하며, Ollama는 개인 Mac에서도 동작하는 경량 툴입니다. 로컬에서 테스트하고 싶은 엔지니어부터 프로덕션 운용을 담당하는 인프라 팀까지, 각자의 환경에 맞게 최적의 선택을 할 수 있는 설계입니다.
Vibe의 혁신을 한마디로 말하면 '코딩 AI의 소재지가 바뀌었다'는 것입니다. 기존의 Claude Code, Cursor, GitHub Copilot은 로컬 PC에서 동작하는 것이 기본이었지만, Vibe는 Mistral의 클라우드에서 동작하며 사용자는 지시를 내리기만 하면 됩니다. 병렬로 복수의 태스크를 동시에 실행할 수 있고, 완료되면 알림으로 알려줍니다.
직접 주방에 서는 것이 아니라, 여러 셰프가 대기하는 업무용 주방에 '이것, 이것, 그리고 이것, 내일 아침까지 부탁해'라고 주문서를 던지는 감각으로 바뀌는 이미지입니다.
실행 중에는 파일 diff(변경 내용)와 툴 호출 진행 상황이 시각화되어 있어, AI에게 모두 맡겨버려 무슨 일이 일어나고 있는지 알 수 없다는 불안은 없습니다. Mistral Vibe CLI(커맨드 라인)나 Le Chat(채팅 화면)에서 실행할 수 있으며, 기존 개발 플로우에 자연스럽게 통합할 수 있습니다.
실무에서 사용할 수 있는지는 '다른 툴과 어떻게 연결되는가'가 관건입니다. Vibe는 기본적으로 GitHub(코드 및 풀리퀘스트), Linear·Jira(이슈 관리), Sentry(에러 모니터링), Slack·Teams(채팅 보고)와 통합되어 있습니다.
예를 들어 Sentry에서 에러가 발생하면, Vibe가 자동으로 원인 코드를 특정하고, GitHub에서 브랜치를 만들어 패치를 작성하며, 풀리퀘스트를 올리고 Slack으로 보고하는 일련의 흐름이 지시 하나로 완결됩니다. 주문서(Jira)→식재료 재고(GitHub)→조리(코딩)→플레이팅(풀리퀘)→제공(Slack 알림)이 전부 자동으로 돌아가는 구조입니다.
엔지니어는 '무엇을 만들고 싶은지'만 전달하면, 나머지는 Vibe가 알아서 처리합니다. 요건과 사양 논의에 집중할 수 있는 체제가 갖춰진다는 의미에서, 개발 플로우의 전환점이라 할 수 있습니다.
또 하나 흥미로운 기능이 '텔레포트'입니다. 로컬 PC에서 도중까지 진행한 작업 세션을 이력을 유지한 채로 클라우드로 이동할 수 있는 구조입니다.
예를 들어 외출 전 카페에서 도중까지 작성하던 코드를, 귀가 후 데스크톱에서 이어가는 것이 아니라, 외출 중에도 클라우드의 Vibe가 계속 작성해 주는 흐름이 실현됩니다. 밑손질만 해두고 가게를 나가도, 다른 조리 스태프가 완성까지 이어받아 주는 방식의 업무가 됩니다.
회의나 이동 시간을 'AI의 작업 시간'으로 전환할 수 있는 발상으로, 엔지니어의 실제 작업 시간을 사실상 두 배 이상으로 늘릴 가능성이 있습니다. 샌드박스 환경(격리된 안전한 작업 공간)에서 실행되기 때문에, 프로덕션 환경을 망가뜨릴 걱정도 없습니다.
관심이 가는 요금 체계를 정리합니다. Medium 3.5의 API 가격은 입력 1달러 50센트, 출력 7달러 50센트(모두 100만 토큰 단위)입니다.
경쟁사 Claude Sonnet 4.5(입력 $3, 출력 $15)의 약 절반, GPT-4o(입력 $2.5, 출력 $10)보다도 저렴한 가격 설정으로, 가성비를 중시하는 사용자에게 어필하는 가격대입니다. 3스타 레스토랑과 같은 맛을 비스트로 가격에 먹을 수 있는 것과 같은 격차입니다.
예를 들어 하루 100만 토큰의 입출력을 하는 중규모 시스템이라면, 월 환산으로 Claude에서 갈아타는 것만으로도 수십만 원 이상의 절감이 현실적이 됩니다. Pro(개인 개발자용), Team(팀용), Enterprise(대기업용)의 3가지 플랜으로 이용할 수 있으며, 용도에 맞게 스케일할 수 있습니다.
API 이외의 사용 방법도 준비되어 있습니다. Mistral의 공식 채팅 앱 'Le Chat'에서는 Pro/Team/Enterprise 월정액 플랜으로 Medium 3.5를 이용할 수 있으며, 새로운 기능인 Work Mode도 함께 사용할 수 있습니다.
ChatGPT처럼 브라우저·스마트폰 앱에서 직접 사용할 수 있어, 엔지니어가 아닌 일반 사용자도 Mistral의 최신 모델에 접근할 수 있는 경로입니다. API 버전은 재료의 직송, Le Chat 버전은 완성된 한 접시라는 역할 분담으로, 용도에 따라 선택할 수 있는 설계입니다.
한국어 입출력에도 대응하고 있어, 영어가 서툴러도 문제없이 이용할 수 있습니다. 구체적인 월정액 요금은 지역과 플랜에 따라 변동되므로, Mistral 공식 사이트에서 확인하는 것을 권장합니다. 비용 수준은 ChatGPT Plus나 Claude Pro(월 $20 전후)와 동등합니다.
API 과금과 자체 호스팅 중 어느 쪽이 유리한지는 이용량에 따라 달라집니다. 월간 1억 토큰(소~중규모 시스템) 정도라면 API, 월간 10억 토큰 초과(대규모 프로덕션 운용)라면 4장의 H100 자체 호스팅이 경제적으로 유리한 분기점입니다.
H100×4대의 클라우드 이용료는 월 약 4070만 원. 기밀 데이터를 다루는 기업이라면 '비용 절감+데이터 주권' 두 가지를 동시에 얻을 수 있습니다. 월 12회 외식이라면 테이크아웃(API), 매일 세 끼를 먹는다면 자택 주방(자체 운용)이 저렴하다는 단순한 이야기입니다.
중소기업은 API, 대기업은 자체 운용이라는 구분이 자리 잡을 것으로 전망되며, Mistral이 두 가지 선택지를 모두 동일한 품질로 제공한다는 점이 다른 기업과의 큰 차이입니다.
Anthropic의 플래그십 모델과 비교해 보겠습니다. Claude Sonnet 4.5는 SWE-Bench에서 77~78% 수준, 추론의 안정성과 안전 대책에서 업계 최고 평가를 받고 있습니다.
하지만 가격이 입력 $3·출력 $15로 Medium 3.5의 2배이며, API만 제공되고 오픈 웨이트는 없습니다. Claude가 '최고급 파인다이닝 레스토랑'이라면, Mistral은 '같은 맛을 비스트로 가격에+레시피 가져가도 OK인 가게'라는 대비입니다.
기밀성이 최우선인 용도(법무·의료 등)는 Claude가 안심, 비용과 데이터 주권을 동시에 확보하고 싶은 용도는 Mistral이 우위라는 역할 분담이 됩니다. Anthropic의 강점인 'Constitutional AI'(안전 대책의 독자 기법)는 Mistral에서는 별도로 프롬프트 설계로 커버해야 하며, 운용 노하우의 축적이 성패를 가릅니다.
OpenAI와의 비교도 흥미로운 포인트입니다. GPT-4o나 GPT-5.5는 지식·멀티모달·추론에서 종합 능력이 높고, ChatGPT 생태계가 압도적인 강점이 되고 있습니다.
약점은 오픈 웨이트가 비공개로 API만 이용 가능하고, 자체 호스팅이 불가능하며, 데이터가 반드시 OpenAI 서버를 거친다는 폐쇄성입니다. OpenAI는 '전 세계에 체인을 전개하는 일류 레스토랑', Mistral은 '집에서 같은 요리를 재현할 수 있는 레시피가 딸린 유럽 브랜드'라고 정리할 수 있습니다.
'AI는 외주하고 싶다'면 OpenAI, 'AI를 자사 내에 두고 싶다'면 Mistral이 맞는 구조입니다. 금융·방위·제조업의 기밀 영역에서 Mistral의 자체 호스팅 수요가 늘어날 것으로 예상되며, OpenAI의 아성에 균열을 낼 기세가 있습니다.
Google의 Gemini도 비교 대상입니다. Gemini 3.1 Pro Preview는 SWE-Bench 78.8%로 Medium 3.5(77.6%)보다 불과 1.2포인트 높으며, 코딩 성능은 거의 비슷한 수준입니다.
Gemini의 강점은 Google 검색·Workspace 연동, 약점은 폐쇄 생태계로 멀티클라우드 운용이 어렵다는 점입니다. Gemini는 'Google 계열 체인점, 포인트가 쌓인다', Mistral은 '독립계로 다른 체인의 식재료도 사용할 수 있는 자유'라는 성격의 차이입니다.
'Google 일강의 사내 환경'이라면 Gemini, '복수의 클라우드나 온프레 혼재'라면 Mistral이 다루기 쉬운 구조입니다. 점수의 근소한 차이보다, 자사 IT 인프라와의 궁합으로 선택하는 것이 현실적인 판단 포인트입니다.
Mistral의 아시아 진출도 가속화되고 있습니다. Mensch CEO는 인터뷰에서 "연내에 아시아 거점을 설립하고, 제조업의 디지털화 수요를 흡수할 것"이라고 표명했습니다.
미중 AI에 의존하지 않고 유럽산 AI를 사용하고 싶은 한국의 대기업(자동차·전자·은행 등)이 주요 타겟입니다. 미중 패스트푸드에 약간 지친 식도락가들에게 드디어 정통 프랑스 요리점이 상륙하는 흐름에 가까운 구도입니다.
한국 특유의 기밀 중시 문화(사내 데이터를 외부에 내보내고 싶지 않음)와 Mistral의 오픈 웨이트 전략은 환상의 궁합입니다. 2026년 하반기에는 주요 대기업의 PoC(개념 실증) 도입이 잇따를 것으로 분석되고 있습니다.
한국어 성능도 신경 쓰이는 부분입니다. Mistral의 모델은 기본적으로 한국어 입출력에 대응하고 있으며, 과거 Mistral 모델을 기반으로 한 한국어 특화 버전이 공개된 실적이 있습니다.
Medium 3.5에서도 유사한 파인튜닝 버전이 향후 등장할 전망으로, 한국어의 자연스러움은 크게 향상될 흐름입니다. 프랑스 요리의 총주방장이 한국에 와서 '한국인 입맛에 맞는 프렌치-코리안 퓨전'을 독자적으로 개발하는 이미지로, 지역 최적화가 진행될 것입니다.
현재의 Medium 3.5로도 한국어 코딩 지시나 문서 요약은 충분히 실용 수준에 도달해 있지만, 전문 업계 용어는 한국어 특화 버전의 등장을 기다리는 것이 무난합니다. 한국어 LLM의 선택지가 'OpenAI/Anthropic/Google/중국 세력'에 '프랑스'가 추가되어, 4극 시대로 돌입합니다.
각국 정부의 국산 LLM 시책과의 관계도 주목됩니다. 일본에서는 2026년 4월, 디지털청이 국산 LLM '源内(겐나이)'를 오픈소스로 공개하고, 정부 AI 기반의 핵심으로 자리매김했습니다.
Mistral은 '상업 플래그십', 겐나이는 '국가 기반'으로서 역할을 분담하며, 경쟁이 아닌 보완 관계가 될 전망입니다. 겐나이가 공공 인프라로서의 급식 센터, Mistral이 민간 서비스로서의 동네 레스토랑——역할이 겹치지 않는 구조입니다.
유럽·아시아 모두 '미중 이외의 AI 주권'을 확립하는 흐름으로 연동되어 있으며, 공공기관은 국산 AI, 민간 기업은 Mistral이라는 역할 분담이 진행될 것입니다. AI 전략에 있어 Mistral의 참여는, 선택지의 다양화라는 점에서 크게 긍정적입니다.
서울의 SaaS 스타트업에서 CTO를 맡고 있는 김 씨는 2026년 5월에 Claude Sonnet 4.5에서 Mistral Medium 3.5로 API를 전환하여 월 API 비용을 절반 수준으로 압축했습니다.
또한 Vibe Remote Agents를 도입하여 사내 버그 티켓을 Vibe에 자동 할당하고, 엔지니어는 사양 논의에 집중하는 체제로 전환했습니다. "하루 30건의 Sentry 알림을 Vibe가 아침까지 조사해서, 출근하면 풀리퀘가 10건 올라와 있는 상태. 엔지니어의 실제 작업 시간이 체감상 1.5배가 됐다"고 김 씨는 회고합니다.
24시간 운영하는 업무용 주방을 월정액으로 빌리는 듯한 비용 구조로, 가성비 면에서 완전한 승리. 절감된 비용은 신규 엔지니어 채용에 돌려, 개발 조직의 성장 사이클이 한 단계 더 가속화됐습니다.
서울의 대형 은행에서 시스템 개발을 담당하는 박 씨는 고객 계좌 데이터를 다루는 만큼 외부 API에 데이터를 보낼 수 없다는 제약을 안고 있었습니다. 지금까지 사내 코드 생성 AI는 성능이 부족해 포기 분위기가 감돌았다고 합니다.
2026년 5월에 Medium 3.5를 사내 H100×4대 서버에 도입하여, 기밀 데이터를 전혀 외부로 내보내지 않고 SWE-Bench 77.6%의 성능을 사내에서 활용할 수 있는 환경을 갖췄습니다. "수정 MIT 라이선스로 법무 통과, 4장의 GPU로 운용 비용 시산도 클리어. 드디어 AI 활용의 본격 운용을 시작할 수 있게 됐다"고 박 씨는 말합니다.
외식 금지인 사원 식당에 드디어 3스타 셰프가 채용된——금융 업계가 오랫동안 바라던 '데이터 주권을 지키면서 최첨단 AI를 사용할 수 있는' 선택지가, 이제 실현된 것입니다.
프리랜서 엔지니어 이 씨는 2026년 5월부터 자택의 고성능 Mac Studio(M3 Ultra·192GB 유니파이드 메모리)에서 Ollama를 통해 Medium 3.5 양자화 버전을 동작시키기 시작했습니다.
"API 요금 없이 개인 프로젝트를 월 100만 토큰 규모로 돌릴 수 있고, 심지어 오프라인에서도 동작한다"고 이 씨는 말합니다. Vibe CLI로 개인 프로젝트의 코드 리뷰를 야간 배치로 실행하고, 아침에 일어나면 리팩토링 제안이 GitHub에 올라와 있는 습관이 생겼다고 합니다.
자택에 미슐랭급 셰프의 레시피와 조리 도구를 갖추고, 혼자서 정통 요리를 만드는 감각에 가까운 경험입니다. 프리랜서나 개인 개발자에게, API 요금을 신경 쓰지 않고 최신 AI로 마음껏 실험할 수 있는 시대가 드디어 도래했습니다.
A. Le Chat의 월정액 플랜이 가장 손쉬우며, 엔지니어라면 Vibe CLI가 최선입니다.
비엔지니어라면 브라우저에서 Le Chat에 가입하기만 하면 사용할 수 있어, ChatGPT와 같은 감각으로 조작할 수 있습니다. 엔지니어라면 Vibe CLI를 로컬에 설치하고 API와 연동하여 코딩 작업에 통합하는 것이 가장 빠른 경로입니다.
자체 호스팅은 GPU 비용이 월 수십만 원이 드는 만큼, 매우 대량으로 사용하거나 기밀 데이터를 다루는 경우에 한정하는 것이 현실적입니다. 외식(Le Chat)→배달(API)→직접 요리 마니아(자체 호스팅)의 3단계를 의식하고, 처음에는 Le Chat으로 사용해 보고 필요에 따라 API나 자체 호스팅으로 단계를 높이는 것이 현실적인 진입 방법입니다.
A. 중규모 웹 앱의 버그 수정·리팩토링은 즉전력 수준, 처음부터 시작하는 대규모 신규 개발은 아직 보조 역할이라는 것이 현실적인 답입니다.
기존 코드베이스를 읽고 버그를 특정하여 테스트를 통과하는 패치를 작성하는 작업은 이미 인간과 동등하거나 그 이상의 퀄리티를 냅니다. 반면, 비즈니스 요건 정리부터 시작하는 신규 프로젝트는 아직 AI에 전부 맡길 수 없고, 사람의 아키텍처 판단이 필요한 단계입니다. 레시피대로 만드는 것은 완벽, 창작 요리는 사람과의 협업이 필요——이 선 긋기를 의식하며 구분해서 사용하는 것이 중요합니다.
사용 팁은 '태스크를 작게 분할해서 AI에 넘긴다', '최종 리뷰는 반드시 사람이 한다'는 두 가지입니다. 이것만으로도 팀의 개발 속도가 체감 2~3배 향상되는 사례가 보고되고 있습니다.
A. 모델의 '내용물'을 다운로드해서 자신의 서버에서 동작시킬 수 있고, 개조도 가능하다는 것이 핵심입니다.
Hugging Face 공식 페이지에서 웨이트(학습된 파라미터)를 다운로드할 수 있으며, 자사용으로 파인튜닝(추가 학습)도 가능합니다. 이것이 API형의 Claude·GPT와의 가장 큰 차이로, 데이터를 외부에 내보내지 않고 AI를 사용할 수 있다는 점이 결정적으로 작용합니다.
지금까지 외식만 있던 레스토랑의 레시피가 드디어 공개된 상황입니다. 집에서 재현도 개조도 자유로워졌습니다. 주의 사항은 '대규모 매출 기업은 별도 계약이 필요', 'GPU 동작 비용은 사용자 부담'의 두 가지로, 중소기업이나 개인이라면 완전 무료로 사용할 수 있습니다.
A. 개인 구매는 어렵기 때문에, 클라우드 이용이 현실적입니다.
NVIDIA H100 80GB는 1장에 약 700만 원, 4장이면 2,800만 원 이상이 됩니다. 데이터센터용 전원과 냉각도 필요하기 때문에 자택 설치는 거의 불가능합니다. 클라우드라면 AWS·Azure·GCP에서 H100×4 인스턴스를 시간당 약 4,0007,000원에 이용할 수 있고, 월 100시간 사용해도 4070만 원에 수렴합니다.
개인 사용자는 양자화 버전(정밀도를 낮춰 가볍게 만든 모델)을 Mac Studio나 RTX 4090×2장으로 동작시키는 선택지도 있으며, Ollama를 통하면 수십만 원대의 PC에서 실용적인 속도가 나옵니다. 업무용 주방을 살 것인지, 렌탈 주방을 이용할 것인지, 가정용 가스레인지로 해볼 것인지의 3가지 선택입니다. 용도와 예산에 맞게 선택하세요.
"AI는 미중 양강으로 결판"——그 전제는, 이제 다시 쓸 때가 왔습니다.
2026년 4월 29일 Mistral이 발표한 Medium 3.5는, SWE-Bench 77.6%라는 실용적 코딩 성능을 수정 MIT 라이선스의 오픈 웨이트로 제공하는 유럽 AI의 역습 그 자체입니다. 4장의 GPU로 자체 호스팅이 가능하고, API 가격은 Claude Sonnet 4.5의 약 절반, Vibe Remote Agents로 클라우드 비동기 코딩까지 실현합니다. 2026년 내 Mistral의 아시아 진출과 맞물리면, 기밀성과 비용을 동시에 확보하고 싶은 모든 기업에 유력한 선택지가 될 것입니다.
지금 바로 할 수 있는 준비는 세 가지입니다. ①Le Chat(chat.mistral.ai)에서 실력을 체감한다, ②Vibe CLI를 설치하고 코딩 통합을 시도한다, ③자사의 기밀 요건·API 비용·GPU 자산을 정리하여 Claude/GPT와의 비교표를 만든다——유럽 AI의 진심이, 개발 현장을 확실히 바꾸기 시작하고 있습니다.
이 글은 AI Friends의 크로스포스트입니다.