新智元报道 Claude 5.1刚问世,另一边OpenAI Astra马上杀到。 现在,就连谷歌也有了新动作。最新爆料, Gemini 3.8 Flash将在明日登场 。 看来,AI圈又要「过年了」。 Gemini 3.5 Pro取消 下一个大版本4.0 比起Gemini 3.8 Flash的发布,许多人还是更加好奇:Gemini 3.5 Pro到底什么时候来啊?! 对不起,不用等了, 谷歌已放弃...... 今年5月I/O大会预告至今,已过去近4个月,Gemini 3.5 Pro进化程度连Flash都比不上。 谷歌也是迫不得已,直接「弃子」。 好在, Gemini 4.0在预训练中评估优秀,后训练还在顺利进行中 。 这篇来自WSJ的独家爆料,还重磅预告了Gemini 3.8 Flash(代号「Skimaki」)强悍的编程实力。 据称,在谷歌内部编码工具Jetski的对比测试中, 3.8 Flash直接碾压Opus模型 。 而且,这款模型已研发数月,早在谷歌领导层「大地震」之前就开始了。 Hassabis让位,首席科学家Jeff Dean离职,让许多人对Gemini的未来都捏了把汗。 不过,目前看来,一切都在内部有条不紊地进行中。 目前,谷歌计划先推出Gemini 3.8 Flash,是因为这款模型参数小,所需计算少,更容易出成果。 听内部人士说,从今年初开始,谷歌就投入了更多的人力和算力,专门用来提升Gemini的写代码能力。 特别是,加大了对「强化学习」的投入,让AI通过不断试错来真正学会新本领。 而且谷歌DeepMind和其他实验室,同时推进多个项目,这样一来即便是这个不行,另一个还能顶上。 Gemini 3.5 Pro不及预期,但Gemini 4.0还未「出炉」。 如今,硅谷「御两家」OpenAI和Anthropic,已在前沿模型和编程Agent上,非常能打。 Information称,OpenAI下一代Astra还采用了一种 「 循环深度」( recurrent depth)新型推理方法 ,让思考token减少的同时,还大幅提升了性能。 这张王牌,即将在本周揭晓。 而此时此刻,谷歌总得交出点东西才行。 毕竟劈柴承诺之后几个月,除了发布了一款3.7 Flash,再没有扔出能让AI圈兴奋的模型了。 或许就在今晚,Gemini 3.8 Flash要登场了。 Gemini第一次,会自己看视频了 在此发布之前,谷歌今天先来了一波预热,为Gemini植入了一项新能力—— 智能体视频理解(Agentic Vedio Understanding) 这项功能,简直上大分。 上传一段I/O大会视频,同一款模型Gemini 3.7 Flash,Token消耗直接暴降88%。 谷歌在官博中表示,Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite三个模型都能用agentic视频理解能力,入口在Google AI Studio和Gemini Enterprise Agent Platform。 在标准视频分析基准上打开这个开关,token消耗最多降88%,分析成本最多降66%,准确率反过来还涨了最多7%。 而且 不额外收一分钱 ,走的仍是标准API的token定价。省钱和变准通常要打架。这次没打起来。 因为,Gemini学会了 「 拖进度条 」 。 过去的处理方式叫「静态」处理,模型被动接收固定帧率的画面流,帧率由API参数定死,模型没有话语权。 现在换成模型自己拿主意,看哪一段、以多快的速度看、是看画面、听音频还是直接读转录文字,都可以自己决定。 这不是谷歌第一次这么干。 此前的agentic vision把代码执行和Gemini原生的图像理解拼在一起,模型对着一张图能自己写代码去放大、裁剪、比对。 这回轮到视频,思路照搬,只不过把工具换成了原生视频工具。 四件以前很难干的活 官方博客中还列出了几种高难度的应用场景。 亚秒级片段检索。 以前模型「看」视频,一秒只截一张图。问题是,很多东西不到一秒就闪过去了。 现在能精确到不到一秒去定位这些瞬间了。 这意味着「自动剪辑」这件事第一次真正可行了:以前剪辑师得自己趴在时间轴上,一帧一帧地找该在哪里下刀,现在可以先让模型扫一遍,把候选的切点标出来,人再去挑。 长视频里捞针。 几小时的素材里问一个复杂问题,不用把几百万 token 全烧一遍。 异常检测。 模型盯上某个时间窗口之后,可以专门对这一段提高帧率重新采样,看清快速运动和细微的画面瑕疵。产线质检和安防监控最吃这一口,因为异常本来就只发生在那几秒里。 数数。 一个动作重复了多少次,画面里有几个不同的物体,这类问题模型过去错得很稳定,原因也很朴素,漏采的那几帧里正好有东西。 Agent终于看得起视频了 视频,一直是所有