Google「Gemini 2 Ultra」正式发布——200万Token·实时视频推理重塑AI标准
機械翻訳 / Machine-translated
Google DeepMind于2026年9月13日正式发布了旗舰模型「Gemini 2 Ultra」。最大200万Token的上下文窗口,以及能对摄像头画面进行实时推理的「Live API」是此次发布的亮点。API定价为输入每百万Token 15美元,低于17天前发布的OpenAI o4(同为18美元)。
Google DeepMind在官方博客中公布了Gemini 2 Ultra的主要规格。
发布后3小时内,X平台上的相关帖子超过2万条,国内AI开发者社区也即刻引发广泛讨论。
"200万Token,意味着可以把整个律师事务所的合同数据库直接塞进去。结合Live API,现场的使用方式将从根本上改变。"(国内AI开发者,4.2万粉丝)
Gemini 2 Ultra的前身Gemini 1.5 Pro于2025年2月发布,凭借100万Token支持,提升了长上下文处理的行业标准。同年年底,Gemini 2.0 Flash以高性价比受到关注,在智能体开发者中的采用迅速加速。
此次发布距OpenAI公开o4仅17天,外界普遍认为Google在前沿模型领域刻意选择了追击OpenAI的时机。
在长上下文处理市场,法律、金融、医疗领域对文档解析的需求急剧增长,分析师估计2026年全球市场规模将达到约120亿美元。各大前沿模型厂商争夺这一市场主导权的格局正日趋清晰。
200万Token换算为日文约100万字,相当于800本单行本的体量。对于法律事务所、会计师事务所、制药企业等需要「批量处理大量文档」的行业,实际效益立竿见影。过去需要拆分处理与摘要流水线才能完成的工作,现在可以通过单一Prompt一次完成。RAG架构的复杂性有望降低一个层级。
每秒10帧的实时视频推理,预计将加速其在制造流水线异常检测、医疗现场辅助等需要「人眼判断」任务上的应用落地。这是将Project Astra中已验证的技术向开发者开放的举措,预计未来60天内面向工业场景的PoC将大量涌现,并与现有计算机视觉产品形成直接竞争。
输入每百万Token 15美元,比o4的18美元低约17%。不过推理速度与精度的实测结果仍有待社区验证。比单纯的价格比较更关键的,是在「长上下文×视频」复合任务中能否体现出实质差异。若OpenAI、Anthropic、Mistral跟进价格竞争,2026年底LLM API的商品化进程将进一步加速。
Google此次声称「包含日语在内的100种语言多语言基准测试得分最高」。国内基准(如JBLUE等)的独立验证结果预计本周内公布,将成为国内企业项目采用决策的重要参考。
Gemini 2 Ultra所揭示的最大转变,并非「上下文战争的终结」,而恰恰是「上下文战争进入下一阶段」。当200万Token成为可用,下一个问题随即而来——「精度真的能保持吗」「300万什么时候来」。数字的竞争之外,在实际任务中保持精度,才是差异化竞争的核心所在。
值得关注的是Live API的商业化速度。以开放API的形式面向大众发布,意味着摄像头型智能体的准入门槛大幅降低。这意味着将与医疗、制造、零售现场的现有计算机视觉产品直接竞争,预计大型系统集成商将比初创企业更快行动。
企业采购决策者当下最需要核实的,是「现有RAG流水线能否通过200万Token支持实现简化」的成本测算。在能够同时实现降本与降低架构复杂性的场景下,迁移决策的推进速度将比以往更快。
随着Gemini 2 Ultra的发布,前沿模型的竞争维度已从「推理精度的单一评估」转向「长上下文×视频×价格」的综合评估。下一个关键节点,是基于Live API的工业应用初期案例出现的时机——预计将在未来30至60天内陆续报道。
我们将持续追踪哪个行业率先大规模落地Live API。
※本文由ミライ・ニュース编辑部AI作者(AI新闻)撰写。