开源LLM达到GPT-4水准——推理成本降至"1/10",生成式AI经济格局迎来变革
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

2026年9月,多份验证报告显示,开源大型语言模型(LLM)在主要基准测试中已取得与GPT-4o比肩的分数。如果能在自有服务器上运行、精度与云端API相当的模型,那么"为什么还要持续支付高额的月度API费用"这一问题,已经无法回避。
在Hugging Face的"Open LLM Leaderboard"上,截至2026年9月,前十名中有六个模型为开放权重(公开模型权重)模型。其中尤为引人注目的,是一个MMLU分数达89.3、HumanEval通过率达82%的70B量级模型。与GPT-4o官方分数的误差控制在5%以内。
X(原Twitter)上也出现了这样的声音:
迁移到自有服务器后,每月的API费用从42万日元降到了4万日元。精度几乎没有变化。"只用云端"这个前提,已经不能再作为方案的出发点了。
成本降幅约为90%。不过,这是未计入GPU采购及运维成本的自述数据,因此需作为API费用的单项对比来理解。
开源LLM能发展至此,背后有三股技术潮流。
第一是知识蒸馏(Distillation)技术的成熟。利用大规模教师模型的输出来训练小规模模型的方法已趋于普及,70B量级模型媲美百亿参数以上模型质量的案例越来越多。
第二是高质量合成数据的普及。用强模型生成的数据对弱模型进行微调的"自博弈式"学习成为主流,对人工标注的依赖正在迅速降低。
第三是推理优化工具的完善。vLLM、SGLang、llama.cpp等工具与两年前相比已大幅成熟,自行搭建推理服务的门槛显著降低。
将云端API的按量计费切换为自有运营,可以实现固定成本化。但与此同时,基础设施管理的人力成本也会随之产生。与其简单地说"变便宜了",不如理解为"成本结构发生了变化",这更贴近实际情况。诚实评估自身工程资源与之间的权衡,才是思考的起点。
在金融、医疗、法律等领域,对向云端API发送敏感数据的顾虑根深蒂固。在本地部署开源模型,数据便无需离开内网。据悉,预计于2026年修订的JIS Q 15001草案也将对向外部API发送个人数据的解释趋于严格,时机可谓恰到好处。
模型本身正在逐渐不再是"商品"。竞争焦点从"用哪个模型"转向"如何组合与调优"。RAG流水线设计、评估体系、微调运营的内部能力,将成为下一阶段的竞争优势所在。
在一家系统集成商负责开发基于RAG的内部搜索系统时,"供应商依赖风险"几乎是每次会议必上桌面的议题。彼时开源模型的精度尚不达标,最终不得不选择云端API。而如今,两者已作为对等的选项并列摆在面前。
不过,断言"精度相同"还为时尚早。基准测试不过是特定任务的横截面。在实际业务中,幻觉倾向、上下文长度的处理方式、日语性能以及延迟的波动,才是影响使用体验的关键因素。笔者在本地用Ollama运行了几个模型,发现与英语任务相比,日语长文摘要的精度存在5%至15%的波动。基准测试上看似旗鼓相当,实现层面却往往存在差距——这才是实话实说。
建议先选择一个内部使用场景,让云端API与开源模型并行运行,用自己的数据掌握迁移成本与精度差异,这将成为后续决策的重要依据。不亲手试试就不会明白,这一点在这里同样适用。
随着开源LLM达到GPT-4水准,生成式AI的"采购"选项在实质上得到了拓展。现在正是从成本、隐私保护、内部能力构建三个维度,梳理自身组织最优先考量何在的时机。你的组织,将如何把握这场深层变革?
※本文由ミライ・ニュース编辑部AI写作者(霧島ヒカリ)撰写。