Mistral发布"Mistral 3 Large"——欧洲产大语言模型在推理基准测试中与美国模型并驾齐驱的转折点
機械翻訳 / Machine-translated
法国Mistral AI于2026年9月14日正式发布旗舰模型"Mistral 3 Large"。其MMLU得分92.4,较GPT-4o(92.0)高出0.4个百分点,并以Apache 2.0许可证当日起开放权重下载。此举意味着"欧洲开放权重模型在实际使用层面已与美国闭源模型难分伯仲",堪称大语言模型采购选择标准发生转变的历史节点。
Mistral AI于日本时间14日22时,在官方博客及Hugging Face上正式发布"Mistral 3 Large"。模型参数量约为1230亿,上下文长度为128,000个token。主要基准测试结果如下:
X(原Twitter)上,工程师们的实测帖子接连不断。
"在本地跑了Mistral 3 Large。HumanEval的难题都能通过。和GPT-4o几乎分不出差别。而且还是Apache 2.0授权。这东西从欧洲出来,意义不小。"(工程师类账号,1.4万点赞)
Mistral AI于2023年在巴黎成立。同年9月发布的"Mistral 7B"重新定义了开放权重模型的性能标准,2024年推出的"Mistral Large"系列则作为欧洲首款大语言模型成功打入企业市场。
2025年,随着欧洲AI法案(EU AI Act)分阶段实施,Mistral AI以符合GDPR、支持欧盟数据边界为卖点,加强了面向欧洲企业的营销攻势。据近期采访中的提及,截至2026年3月,付费订阅企业数已超过1200家。
此次发布是12个月以来首次旗舰版本更新。作为开放权重模型,这也是继Llama 4 Maverick之后,第二个声称"达到GPT-4o同等水平"的案例。
Meta Llama系列对月活跃用户超过7亿的场景设有商业限制,而Mistral 3 Large采用Apache 2.0许可证,无论规模大小均可商业集成,大幅降低了法务审核成本。
发布说明中明确指出,Mistral AI同步公开了Mistral 3 Large符合EU AI Act附录III高风险要求的技术文档。模型卡片上披露了训练数据来源及排除列表,提前确保了在欧洲公共机构采购中的合规资质。
HumanEval 87.6%的成绩与当前主流AI代码智能体所采用的闭源模型处于同一水平。对于金融、医疗等在使用外部API方面存在限制的行业而言,本地部署或私有云运行成为切实可行的解决方案。
MMLU较GPT-4o高出0.4个百分点,这一差距在统计误差范围之内。与其急于渲染"欧洲产超越美国产"的叙事,不如正视这一事实本身的分量——"首次在实用层面达到难以区分的水平"。
真正值得关注的,与其说是基准分数,不如说是Apache 2.0 + EU AI Act合规 + 欧盟数据边界这三点同时成立的组合。在欧洲和日本的监管行业(金融、医疗、公共部门),这一"套餐"正逐渐成为采购决策的实质性门槛。据悉,自2026年以来,宣布"研究引入国产或欧洲产大语言模型"的国内金融机构至少已达5家,Mistral 3 Large的发布恰好切中这一时机。
API定价为每100万输入token 2.4美元(较Mistral 2 Large降低44%)。对于无需本地部署、通过API即可满足需求的应用场景,成本结构上的选择空间进一步扩大。
欧洲产大语言模型首次在基准测试分数上实现"与美国模型同台竞技"。下一个焦点在于,以Mistral 3 Large为基础构建的智能体及微调模型,能否在实际业务中达到足够高的精度。Mistral AI预计最早将于第四季度提供面向企业的微调API,实际落地案例有望在2026年底之后陆续涌现。大语言模型选型中"美国与欧洲二选一"的格局,正在悄然瓦解。
※本文由ミライ・ニュース编辑部AI写手(AI新闻)撰写。