![]()
新智元报道
![]()
Claude 5.1刚问世,另一边OpenAI Astra马上杀到。
现在,就连谷歌也有了新动作。最新爆料,Gemini 3.8 Flash将在明日登场。
![]()
![]()
看来,AI圈又要「过年了」。
Gemini 3.5 Pro取消
下一个大版本4.0
比起Gemini 3.8 Flash的发布,许多人还是更加好奇:Gemini 3.5 Pro到底什么时候来啊?!
对不起,不用等了,谷歌已放弃......
![]()
今年5月I/O大会预告至今,已过去近4个月,Gemini 3.5 Pro进化程度连Flash都比不上。
谷歌也是迫不得已,直接「弃子」。
好在,Gemini 4.0在预训练中评估优秀,后训练还在顺利进行中。
![]()
![]()
这篇来自WSJ的独家爆料,还重磅预告了Gemini 3.8 Flash(代号「Skimaki」)强悍的编程实力。
据称,在谷歌内部编码工具Jetski的对比测试中,3.8 Flash直接碾压Opus模型。
而且,这款模型已研发数月,早在谷歌领导层「大地震」之前就开始了。
Hassabis让位,首席科学家Jeff Dean离职,让许多人对Gemini的未来都捏了把汗。
![]()
不过,目前看来,一切都在内部有条不紊地进行中。
目前,谷歌计划先推出Gemini 3.8 Flash,是因为这款模型参数小,所需计算少,更容易出成果。
听内部人士说,从今年初开始,谷歌就投入了更多的人力和算力,专门用来提升Gemini的写代码能力。
特别是,加大了对「强化学习」的投入,让AI通过不断试错来真正学会新本领。
而且谷歌DeepMind和其他实验室,同时推进多个项目,这样一来即便是这个不行,另一个还能顶上。
Gemini 3.5 Pro不及预期,但Gemini 4.0还未「出炉」。
如今,硅谷「御两家」OpenAI和Anthropic,已在前沿模型和编程Agent上,非常能打。
Information称,OpenAI下一代Astra还采用了一种「循环深度」(recurrent depth)新型推理方法,让思考token减少的同时,还大幅提升了性能。
这张王牌,即将在本周揭晓。
![]()
而此时此刻,谷歌总得交出点东西才行。
毕竟劈柴承诺之后几个月,除了发布了一款3.7 Flash,再没有扔出能让AI圈兴奋的模型了。
或许就在今晚,Gemini 3.8 Flash要登场了。
![]()
Gemini第一次,会自己看视频了
在此发布之前,谷歌今天先来了一波预热,为Gemini植入了一项新能力——
智能体视频理解(Agentic Vedio Understanding)
这项功能,简直上大分。
上传一段I/O大会视频,同一款模型Gemini 3.7 Flash,Token消耗直接暴降88%。
![]()
谷歌在官博中表示,Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite三个模型都能用agentic视频理解能力,入口在Google AI Studio和Gemini Enterprise Agent Platform。
在标准视频分析基准上打开这个开关,token消耗最多降88%,分析成本最多降66%,准确率反过来还涨了最多7%。
![]()
而且不额外收一分钱,走的仍是标准API的token定价。省钱和变准通常要打架。这次没打起来。
![]()
因为,Gemini学会了「拖进度条」。
过去的处理方式叫「静态」处理,模型被动接收固定帧率的画面流,帧率由API参数定死,模型没有话语权。
现在换成模型自己拿主意,看哪一段、以多快的速度看、是看画面、听音频还是直接读转录文字,都可以自己决定。
![]()
这不是谷歌第一次这么干。
此前的agentic vision把代码执行和Gemini原生的图像理解拼在一起,模型对着一张图能自己写代码去放大、裁剪、比对。
这回轮到视频,思路照搬,只不过把工具换成了原生视频工具。
四件以前很难干的活
官方博客中还列出了几种高难度的应用场景。
亚秒级片段检索。以前模型「看」视频,一秒只截一张图。问题是,很多东西不到一秒就闪过去了。
现在能精确到不到一秒去定位这些瞬间了。
这意味着「自动剪辑」这件事第一次真正可行了:以前剪辑师得自己趴在时间轴上,一帧一帧地找该在哪里下刀,现在可以先让模型扫一遍,把候选的切点标出来,人再去挑。
![]()
长视频里捞针。几小时的素材里问一个复杂问题,不用把几百万 token 全烧一遍。
异常检测。模型盯上某个时间窗口之后,可以专门对这一段提高帧率重新采样,看清快速运动和细微的画面瑕疵。产线质检和安防监控最吃这一口,因为异常本来就只发生在那几秒里。
数数。一个动作重复了多少次,画面里有几个不同的物体,这类问题模型过去错得很稳定,原因也很朴素,漏采的那几帧里正好有东西。
![]()
Agent终于看得起视频了
视频,一直是所有模态里最贵的那个。
文字便宜,图片还行,视频又大又长,一分钟就能顶掉一本书的token。
所以这两年所有人聊Agent,更多还是在聊它会读、会写、会调用工具。
问题是,一个主要靠文字理解世界的Agent,看到的其实只是一个被人「转述」过的世界。
摄像头拍到的、会议录下的、生产线上跑过去的,那些没人愿意花时间转成文字的东西,它一概不知道。
现在,这条成本曲线被砍掉一大截。
一个Agent如果能自己翻完几小时的监控、几十小时的课程、上百条素材,还不至于把预算烧穿,那它接触世界的方式就变了。
它不用再等着人把画面转述成文字喂给它,也不用再在「看得起」和「看得准」之间选一个。
谷歌,就先做了这个破局者。
AI大战,下一回合
这几天,四家的发布节奏,几乎撞到了一起。
Claude 5.1刚来,OpenAI Astra已经在门口,谷歌憋了几个月也终于拿出Gemini 3.8 Flash迎战。
这一波更新后,如今的Claude主攻两大领域:编程+科研。
下一代Astra将变成一个「持续智能体」,用奥特曼的话来说,其计算机使用能力已达人类水平。
![]()
Gemini 3.8 Flash也将在编程方面,有更大的跃升。
现在,OpenAI、Anthropic、谷歌,以及SpaceXAI已经同时开足马力。
![]()
马斯克预告Grok 4.7十天后发布
这场混战,才刚刚进入最凶的一段。
参考资料:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
编辑:所罗门 桃子
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.