OpenAI「o4」正式发布——数学、编程、科学三大领域同时达到博士水准,专业级AI进入实装阶段
機械翻訳 / Machine-translated
OpenAI于2026年9月13日正式通过API及ChatGPT同步开放推理专用模型「o4」。该模型在数学(AIME 2026:94.7%)、科学难题(GPQA Diamond:89.2%)、真实环境Bug修复(SWE-bench Verified:63.8%)三项指标上,首次同时突破博士水准线。「AI性能终将超越专家」这一命题,已转变为「从哪些业务开始落地」的系统设计问题。
北京时间2026年9月14日,OpenAI正式发布o4。主要基准测试结果如下:
定价方面,输入Token成本较o3降低约20%。但目前供应仅限API Tier 4及以上用户。
发布后,研究者的反应迅速在X平台上集中涌现:
「把实验室里的未解决问题丢给o4,它返回了一个我此前忽略的解题思路。是否正确尚不确定,但绝非无的放矢。」
以o1(2024年9月)为起点的推理模型系列,经历了o1 Pro→o3→o3-mini的演进。每个阶段都曾有「在特定基准上超越专家」的报告,但此次在三个独立领域同时达标,性质截然不同。
背景方面,2026年上半年Gemini 2 Ultra和Qwen 3.5的崛起,被认为加大了OpenAI的研发压力。独立基准测评机构的汇总数据显示,o4与Claude 4 Opus之间的差距处于误差范围以内,顶尖模型之间的性能差距实质上已大幅收窄。
这一数值可理解为「在真实环境中独立修复未解决GitHub Issue的成功概率」,从2024年o1所记录的约14%,在两年内增长了约4.5倍。结合编程Agent使用,与高级工程师相当的Bug修复自动化成本已进入现实可行的范围。这一数字标志着从「AI写PR」向「AI修复生产环境问题」阶段的转变。
在博士持有者平均正确率为70~75%的GPQA Diamond上取得89.2%,意义重大。在医疗诊断辅助、法律研究、金融风险评估等领域,业务设计将从此前的「生成草稿+人工审核」转向「输出结论+确认例外情形」。
降幅看似不大,但推理模型因反复执行思维链(Chain of Thought),在Agent工作流中的Token消耗量可达聊天场景的数倍乃至数十倍。在这一领域的降本效果,将有助于中小规模初创企业在月度预算范围内实现生产部署。
「达到博士水准」的表述此前也曾出现,但此次结构性的不同在于「在多个独立难题领域同时达标」。这应被解读为:已进入不再是单一任务优化,而是通用难题解决能力整体提升的新阶段。
有两点值得注意。其一是可用性限制。由于Tier 4的限制,希望使用的企业短期内无法立即接入。在竞争对手性能几乎相当的当下,「性能差距」可能不及「能否用上」更具实质竞争意义。
其二是监管环境。随着《欧盟AI法》高风险条款于2026年8月全面施行,在医疗、法律领域进行「替代判断」的使用方式与监管风险直接挂钩。性能提升与监管收紧同步推进的格局,同样会影响日本企业的落地设计。
o4的出现,不是「AI赶上了专家」这一技术里程碑,而是将问题转化为「如何重新设计融入专业知识的业务流程」这一经营与组织层面的追问。从今天开始真正改变的,或许不是专业人员「把什么交给AI」,而是「把什么不交给AI」的判断标准。
下一个焦点,将是Anthropic的Claude 4 Opus系列更新的对应时间线,以及Google能否以Gemini 2系列追平o4水准这两个问题。
※本文由ミライ・ニュース编辑部AI写手(AI新闻)撰写。