琅琊榜
Gemini 3.5 Pro难产,谷歌先交了两张草稿纸_我的网站

一 | 7月21日,谷歌突然上线了两个新模型: Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。 没有一点点防备,也没有一丝顾虑,它俩就这样出现在了Google AI Studio和Gemini的模型选择器里。
8月16日,武安市贺进镇苏庄村乡村大食堂内,低龄老人正在做饭。

二 | 高树良供图“十五五”规划纲要提出,统筹规划养老服务设施布局,优化基本养老服务供给,推动养老服务扩容提质增效。 这两个模型,一个主打更强的代码和Agent能力,一个主打更低成本的大规模调用。在,一张张热气腾腾的饭桌,解决众多乡村老年人的吃饭难题,传递出浓浓的民生暖意。近日,记者走访了省内多个乡村的食堂,记录下这些家门口的烟火气如何温暖人心。积分换餐,撬动参与治理热情“今天你挣了几个积分?”“我现在有8分呢。 而作为旗舰模型的Gemini 3.5Pro,千呼万唤依然……出不来。

三 | 按照此前的计划,3.5 Pro本应在6月份上线,现在7月都过一大半了,这款被寄予厚望的模型仍然没有正式亮相。 代表旗舰实力的答卷迟迟不交,谷歌先拿出两张“草稿纸”,是个什么意思? 01 3.6 Flash:比上一代便宜,不比上一代聪明 谷歌表示,相比上一代Flash模型,Gemini 3.6 Flash进一步提升了编码、推理和工具调用表现,同时通过减少输出token降低运行成本。”……8月13日17时30分,武安市贺进镇苏庄村农村互助幸福院配套的乡村大食堂里,50多位老人边排队打饭边分享着生活的点滴。老人们口中的积分指的是乡村大食堂的“食堂积分就餐制”,1积分兑换1餐。“80周岁以上老人免费就餐,65至80周岁老人凭积分就餐。”村党支部书记高树良解释,村里65至80周岁老人参与食堂帮工、村庄环境整治、邻里矛盾调解都能获得积分,并且积分可自用、转让、捐赠,年底用不完还能兑换现金。作为山区村,苏庄村不大,有198户人家,65周岁以上老人98位,因年轻人多在外务工,空巢老人、留守老人所占比例不小。

四 | 高树良介绍,村里有的老人一个人在家,凑合一顿是一顿。 Gemini 3.6 Flash的定位是一个面向真实生产环境的高效模型,或者更直白一点,为Agent服务。今年5月5日起,村里在互助幸福院内开设乡村大食堂,老人们一日三餐都可以在乡村大食堂就餐。

五 | 在Agent时代,一次任务可能需要几十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。 Google此前已经在Gemini 3.5 Flash上强化了这条路线。根据官方API文档,Gemini 3.5 Flash支持100万token的长上下文,可以一次处理大量信息,同时支持代码执行、调用外部工具、搜索文件等能力,能够完成更复杂、更长时间的任务。“以前大家各顾各的家,叫都叫不动。

六 | 现在村里有点事,‘积分群’里喊一声,志愿者名额抢着报。”高树良说,积分模式铺开后,以往靠干部串户磨嘴皮子的事,现在成了村民抢着干的“热门儿活”。

七 | 全村90余位老人享受助餐服务,日均就餐55人次,参与公共事务的村民增加近四成,文明家庭、美丽庭院申报数量同比上升30%。在内丘县,类似的探索也在展开。8月10日,五郭店乡后李阳村乡村大食堂正式投入运营。开餐首日,不少老人早早来到食堂,满怀期待等候食堂第一餐。崭新的乡村大食堂,就餐大厅干净整洁,桌椅摆放整齐,后厨操作规范,菜品搭配兼顾营养与老年人口味。 Gemini 3.6 Flash延续了这条路线,它追求的并不是单次回答的质量,是一个“能够承担得起每日真实工作”的位置。“一个人在家,做饭嫌麻烦,经常凑合一口。 Gemini 3.6 Flash的定价如下: 输入:1.50 美元/百万 token 输出:7.50 美元/百万 token 相比此前Gemini 3.5 Flash每百万token输入1.5美元、输出9美元的价格,输入成本没有变化,但输出成本进一步下降。

八 | 对于需要大量调用AI的企业来说,这种成本变化可能比benchmark上的几个百分点提升更加重要。现在村里大食堂开了,出门就能吃上热菜热饭,菜品搭配也适合我们老年人。

九 | 另外,谷歌展示的一项内部测试显示,在完成同一任务时,Gemini 3.6 Flash相比3.5 Flash减少了55.8%的token消耗,同时将任务评分从85分提升到了100分。

十 | ”村民梁建敏说。 当然,这只是谷歌自己的测试结果,只能说明Google希望展示的方向: 新模型不仅更省,而且能够用更少的计算完成同样甚至更好的任务。 在那些被公开的benchmark里,谷歌主要强调的是代码能力和Agent能力。 在DeepSWE代码评测中,Gemini 3.6 Flash得分49%,高于上一代的37%。

十一 | “我们不想只办成一个简单吃饭点,希望依托食堂搭建互助平台,让老人聚在一起,互相陪伴,把互助养老落到实处。”村党支部书记梁成超说,该村的乡村大食堂在保障老人就餐基础上,搭建邻里交流平台,鼓励身体条件允许的老人主动参与村里志愿服务、食堂日常辅助工作,形成互帮互助、共建共享的养老氛围。谷歌表示,新模型能够减少无效代码修改和重复执行过程。 在测试AI操作电脑能力的OSWorld-Verified评测中,Gemini 3.6 Flash得分83%,超过3.5 Flash的78.4%。 而在面向机器学习任务的MLE Bench中,Gemini 3.6 Flash得分63.9%,相比上一代的49.7%也有明显提升。 不过,上述数据更多说明Gemini 3.6 Flash相比上一代有所进步。 如果放到当前大模型竞争中横向比较,Google选择的对手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5(这里也可以看出这个产品的定位)。多方共建,确保食堂长久运营8月16日11时,秦皇岛市北戴河区戴河镇北戴河村84岁的刘纯刚走出家门,来到村里的供销便民大食堂就餐。 从结果来看,Gemini 3.6 Flash并没有全面领先,GPT和Claude的模型在复杂软件工程和知识工作任务上仍然保持优势。“每天都能免费吃午饭,真是太好了。”刘纯刚说。 但这其实也是Flash系列存在的意义: 它不一定要成为最强模型,只需要在明显低于旗舰模型成本的情况下,提供够用的能力。食堂原址是村里一处闲置多年的老院子,省供销合作总社通过“社村共建”模式将其盘活。

十二 | 去年9月启动爱心助老服务,本村近30位80岁以上老人免费,本村村民6元、外村村民或者游客10元即可享用一荤一素、主食不限量的午餐。

十三 | 为让食堂长久运营,省供销合作总社成立专项孝善资金,通过系统内捐款带动社会各界捐款捐物。 官方测评之外,根据Artificial Analysis的发布前测试,Gemini 3.6 Flash在Intelligence Index上拿到了50分,与Gemini 3.5 Flash持平。食堂内的两位厨师是半帮忙性质,只有少量工资。 这意味着,如果只看模型综合“智力”,Gemini 3.6 Flash并没有什么升级。

十四 | 食堂还组建了由60岁至75岁的健康老人、村党员干部构成的“银龄志愿服务队”。

十五 | “有人经常捐赠蔬菜、肉、鱼等物资,也能减少一部分开支,再加上孝善资金兜底,完全可以保证80岁以上老人长期免费吃。”省供销富民农业发展有限公司副总经理张恒金说。参与多方共建的还有高阳县小王果庄镇于堤村。 但是呢,它的速度又很好地弥补了这一点。 Artificial Analysis还统计了模型完成Intelligence Index任务所需的平均时间。“开饭喽!”8月5日中午,高阳县小王果庄镇于堤村老年食堂里,随着清脆的吆喝声,老人们有序排队打饭。结果显示,Gemini 3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash的约2.7分钟,减少了一半。 与此同时,Gemini 3.5 Flash-Lite的任务完成时间也从上一代3.1 Flash-Lite的约1.6分钟,下降到约0.6分钟。

十六 | 总的来说,Gemini 3.6 Flash的升级方向其实是效率——更少的token消耗,更低的运行成本,以及更适合长期运行的Agent能力。 对于习惯使用Gemini 3.5 Flash的用户来说,确实是非常不错的升级。 02 3.5 Flash-Lite:更快,但没有上一代便宜 然后再来看另一个模型Gemini 3.5 Flash-Lite。 顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。

十七 | 大家端着可口的饭菜围坐在桌前,边吃边聊。自2025年9月,于堤村多方整合资源,打造标准化村级老年食堂,创新“政府补、集体出、个人付、社会捐”四方筹资,组建以专职人员为主、志愿服务为辅的服务队伍,构建起兼具公益底色、普惠定价、科学配餐、温情陪护的乡村养老助餐新模式。

十八 | 张家口尚义县七甲乡探索的是“乡贤反哺”模式。针对辖区高龄、独居、行动不便老人吃饭难题,七甲乡主动对接本土在京创业企业家孙小龙,通过盘活乡内闲置建筑,共同打造公益社区食堂。该乡还计划把这种模式推向全乡8个行政村,通过中央厨房统一配送、村级就近助餐的模式实现全覆盖。 就像前面提到的那样,Gemini 3.5 Flash-Lite的任务完成时间从上一代3.1 Flash-Lite的约1.6分钟,下降到了约0.6分钟。延伸服务,老人和游客都吃农家饭8月13日一早,在阜平县顾家台村游玩的张女士来到村里的共享食堂,边吃边点赞。 3.5 Flash-Lite也是3.5系列中速度最快的型号,根据Artificial Analysis测试数据,其生成速度达到约350 token/秒,已经属于当前主流大模型中的高速水平。正吃着,村里几位老人也端着餐盘坐下,和游客一起用餐。“游客吃的是农家饭,村民们图的是方便实惠。”顾家台村党支部委员刘娇说,建共享食堂的初衷是为了解决“游客没处吃早饭、老人做饭不方便”的问题。随着樱桃采摘基地、儿童乐园等新业态相继落地,近几年来顾家台村游玩的游客越来越多,对村里的接待能力提出了更高要求。让老人们晚年过得更舒心,再结合游客和村民们的建议,村“两委”决定建设共享食堂,村里老年人与游客都可以享受服务。 Gemini 3.5 Flash-Lite的定价如下: 输入:0.30 美元/百万 token 输出:2.50 美元/百万 token 相比Gemini 3.6 Flash,输入价格约为1/5,输出价格约为1/3。不过,与上一代Gemini 3.1 Flash-Lite相比,新模型并没有进一步降价。在共享食堂就餐,本村70岁以上老人每天只需5元,80岁以上老人免费。游客每餐15元的价格,就能吃上一顿地道的农家饭,一周7天菜品不重样。 虽然Gemini 3.5 Flash-Lite由于能力提升,可以通过减少输出量降低部分成本,但综合起来,还是很难抵消单价上的成本增加。刘娇介绍,共享食堂将继续扩大规模,让前来游玩的研学团队、旅行团也能便捷就餐,把共享食堂做成展现顾家台特色、服务村民生活、壮大村集体收入的新窗口。 根据官方文档,相比上一代Gemini 3.1 Flash-Lite,新模型在不同思考等级(thinking levels)下都有明显提升。一餐一饭,看似寻常,照见的却是民生温度。开发者可以根据任务需求调整模型的思考深度。我省各地正以务实创新的探索,办好呵护乡村老人的“幸福食堂”。(日报记者 赵泽众)。 此外,Gemini 3.5 Flash-Lite还内置了Computer Use能力,可以帮助Agent更可靠地操作电脑环境,完成跨应用任务。 在具体测试中,Gemini 3.5 Flash-Lite相比上一代模型也有明显提升:在Terminal-Bench 2.1编程Agent测试中,成绩从31%提升到54%;在测试长上下文理解能力的GDM-MRCR v2中,从60.1%提升到72.2%;在更贴近真实工作场景的GDPval-AA v2任务执行测试中,从642提升到1140。 值得注意的是,在一些Agent和代码相关测试中,Gemini 3.5 Flash-Lite甚至超过了上一代更高定位的Gemini 3 Flash模型。 例如,在SWE-Bench Pro软件工程测试中,Gemini 3.5 Flash-Lite得分54.2%,高于Gemini 3 Flash的49.6%;在测试AI操作电脑能力的OSWorld-Verified中,Gemini 3.5 Flash-Lite也以74.0%的成绩超过Gemini 3 Flash的65.1%。 这意味着,随着模型能力不断提升,过去需要更大模型才能完成的部分Agent任务,正在逐渐下沉到更便宜、更快速的模型。 顺便一提,除了前两个面向普通用户的通用模型,谷歌还推出了Gemini 3.5 Flash Cyber。 它主要针对网络安全场景。根据官方文档,在CodeMender系统中,多个Gemini 3.5 Flash Cyber Agent可以协同工作,分别完成不同分析任务,并最终汇总成一份完整报告。在网络安全基准测试CyberGym中,Flash Cyber也达到了接近前沿模型的表现。

十九 | 该模型目前不会公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。 03 3.5 Pro:谷歌迟迟交不出的旗舰答卷 如果说Gemini 3.6 Flash和Gemini 3.5 Flash-Lite还可以看作是谷歌对AI规模化应用的判断,那么Gemini 3.5 Pro则代表着谷歌的模型上限。 但问题在于:这份答卷,到现在还没有交出来。 5月I/O的时候,谷歌表示Gemini 3.5 Pro将在“接下来一个月左右”推出,也就是预计在今年6月上线。现在7月都过了一大半了。 据彭博社7月16日报道,Gemini 3.5 Pro的发布时间已经落后原计划数月。谷歌正在继续优化模型能力,尤其是编码表现,希望达到内部设定的目标。 路透社最新的报道则显示,截至目前,谷歌仍未公布具体上线时间,只表示该模型正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4的训练工作已经开始了。 而我们都知道,“很快”就是不确定的意思。 Gemini 1.0发布时就曾因演示争议受到质疑;Gemini 1.5 Pro凭借百万token上下文短暂扳回局面,但随后Claude和GPT系列快速追赶;直到Gemini 3系列发布,谷歌才重新获得“回到前沿竞争”的评价。 如今Gemini 3.5 Pro再次延期,市场关注的已经不只是一个模型什么时候上线,还有谷歌到底能否保持旗舰模型的竞争节奏问题。 何况谷歌透露出的编码表现不及预期,并不是什么容易解决的小问题。 随着Agent开始进入企业工作流,代码能力的重要性迅速提升。

| 一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已经成为衡量它是否具备实际生产价值的重要指标。

| 路透社指出,华尔街正在等待Gemini 3.5 Pro,因为它将成为判断Google DeepMind是否能够跟上OpenAI和Anthropic的重要指标。 当然,谷歌并不是没有动作,这次推出的几个模型,恰说明谷歌正在强化另一条路线:让AI变得更便宜、更容易规模化。 谷歌CEO Sundar Pichai近期也多次强调成本优势,并表示企业如果将大部分AI工作负载迁移到Gemini模型,可以每年节省超过10亿美元。

| 但问题在于,市场在期待一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——很难不让人觉得,谷歌在用Flash系列填补Pro延迟留下的空档。 有意思的是,在Gemini 3.5 Pro延期的同时,AI竞争格局正在发生变化。 过去,人们讨论AI领先者,主要关注海外“御三家”:OpenAI、Anthropic和Google DeepMind。 但最近,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争,并引发了大量讨论。 前沿模型的追赶速度正在加快,也让谷歌的问题变得更加紧迫,它当然可以继续大力推出Flash模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。 如果谷歌最终推出一个真正领先的旗舰模型,那么Flash路线会成为完整体系的一部分:Pro负责突破能力上限;Flash负责规模化应用。 但如果Gemini 3.5 Pro持续落后,市场很可能会继续追问:谷歌拥有最强AI研究资源,为什么却无法稳定跑赢竞争对手? 在Alphabet本周举行第二季度财报电话会议时,人们很可能会进一步询问有关Gemini 3.5 Pro的更多细节。(作者:袁心玥)。
Current article:http://0i17.chaochangkuanbandangyogeseng.sbs/spbsmn/1if.html
Published on:02:47:12
