|
|
本帖最后由 麻薯滑芝士 于 2026-8-14 14:18 编辑
哈喽大家好!各位凌晨三点还盯着屏幕上那个死活合不进去的Pull Request、眼睛里布满血丝的全栈工程师,各位刚把商业计划书改到第八版、正发愁怎么跟投资人解释"我们产品的AI能力到底比别人强在哪"的创业公司技术合伙人,各位在高校实验室里守着嗡嗡作响的GPU服务器、一边扒拉已经凉透的外卖一边盯着训练损失曲线祈祷它别再震荡的机器学习方向博士生,各位在每个周一早晨被产品经理拿着竞品分析报告追在屁股后面问"为什么别人家的AI能自动生成报表而我们还要手动拖拽"而哑口无言的技术团队负责人,还有那些虽然自己一行代码都不写、但最近刷短视频总刷到"AI要取代程序员了"的帖子、心里既好奇又隐隐有点慌的互联网从业者和科技爱好者——不管你此刻是瘫在工位上盯着天花板发呆,还是窝在出租屋的床上百无聊赖地划着手机,今天这条来自大洋彼岸的消息,你都值得打起精神认真听完。就在昨天,也就是2026年8月13日星期四,谷歌那边毫无预兆地甩出了一颗重磅炸弹,正式发布了全新的Gemini 3.7 Flash大语言模型。这条消息最早是由国外科技媒体Notebookcheck在昨天抢先报道出来的,消息一经传出,整个中文互联网的技术社群——无论是微信群、QQ群还是知乎和即刻——立刻就炸了锅,到处都在转发和讨论。为什么大家的反应会如此剧烈?因为谷歌这次拿出来的可不是那种不痛不痒的小版本迭代,他们直接在官方公告里拍着胸脯宣称,Gemini 3.7 Flash是他们Flash系列有史以来最能打的一个版本,尤其是在写代码、搞网页开发和驱动AI智能体干活这几个核心方向上,进步幅度大得惊人。
咱们先把这个产品发布的节奏给大家仔仔细细地理一遍,这样你们就能更直观地感受到谷歌这次的动作到底有多快、有多猛。就在短短三个礼拜之前,也就是2026年7月下旬那会儿,谷歌才刚刚把Gemini 3.6 Flash端到台面上来。当时很多开发者还在忙着测试这个新版本跟自己现有项目的兼容性,有些动作慢一点的公司甚至连API密钥都还没来得及更换。结果呢?这才过了21天,Gemini 3.7 Flash就直接拍在桌子上了。这种迭代频率,说实话,在整个大模型行业的发展史上都是极其罕见的。通常情况下,一个大型语言模型从一个主要版本更新到下一个主要版本,中间至少要隔上好几个月,有的公司甚至要拖到一年以上,中间还得穿插好几个小版本的修修补补。但谷歌这次明显是不打算按常理出牌了,他们就像把油门焊死了一样,完全不给市场上的竞争对手留任何喘气和追赶的余地。这种疯狂的发布节奏也从侧面说明了一个非常残酷的现实:目前全球各大AI公司之间的竞争已经激烈到了一个近乎白热化的程度,不是你追我赶那么简单,而是所有人都在拼命往前冲刺,谁稍微慢下来一步,就可能被远远甩在后头吃灰。更要命的是,根据谷歌自家模型卡片里披露的信息,Gemini 3.7 Flash已经是谷歌近期密集推出的第四款Flash系列模型了,这种"机枪点射"般的发布节奏,让整个行业都感受到了谷歌想要在AI应用层话语权上"毕其功于一役"的决心。
那么,这个Gemini 3.7 Flash到底强在哪里?谷歌官方给它的定位非常清晰,他们说这是Flash系列里最强大的一个"主力干活模型",专门针对编码和AI智能体这两大方向做了深度优化。什么叫"主力干活模型"?说白了,谷歌就是想打造一个真正能顶到一线去帮程序员分担实际工作的得力助手,而不是以前那种只能陪你聊聊天、写点"Hello World"级别示例代码的玩具。为了证明自己不是在吹牛,谷歌这次直接甩出了一大堆硬邦邦的基准测试数据,咱们一条一条来掰扯清楚。首先是在代码能力方面,有一个叫做FrontierCode 1.1 Main的测试集,这个测试专门用来衡量模型理解和生成代码的真实水平,题目难度相当高,主要考察的是生产级别的代码质量。在这个测试上,Gemini 3.7 Flash直接拿下了43.6%的得分。这个数字单看可能没什么感觉,但你得拿它跟上一代产品做个对比:三个礼拜前发布的Gemini 3.6 Flash,在同一个测试上的得分只有34.4%。这意味着仅仅过了21天,谷歌就把模型的代码能力向上拉升了9.2个百分点,换算成相对提升率的话,涨幅达到了大约26.7%。这绝对不是那种挤牙膏式的微小改进,而是实打实的代际跨越。更有意思的是,如果我们把视野放宽到整个行业,根据谷歌模型卡片里披露的横向对比数据,Claude Sonnet 5在FrontierCode 1.1 Main上的成绩是42.7%,GPT-5.6 Terra是41.3%——也就是说,Gemini 3.7 Flash的43.6%不仅仅是对自家前代的超越,更是直接在第三方横向评测里把两个最主要的竞争对手按在了身下。
再来看看另一个更能模拟真实开发场景的测试——DeepSWE v1.1。这个测试的设计初衷就是为了模仿一个真正的软件工程师在日常工作中会遇到的各种长周期任务,包括理解需求、定位代码里的缺陷、动手修复Bug,然后提交一份能够通过审核的修改方案。在这个项目上,Gemini 3.7 Flash的成绩是从上一代的49%一下子飙升到了65.3%(这里要稍微做一点数据透明化的说明:Notebookcheck的原文引用谷歌说法是"从49%提升到65.3%",而谷歌自家模型卡片的精细表格里,3.6 Flash在DeepSWE v1.1上的成绩标注为48.6%,两家信源存在0.4个百分点的微小出入,但无论采用哪个口径,跃升幅度都超过16个百分点,是实打实的巨大跨越)。16.3个百分点的净增长,换算成相对提升比例的话,涨幅超过了33%。这个数据意味着什么呢?打个比方来说,假如你以前让Gemini 3.6 Flash帮你排查一个棘手的代码问题,它大概只有一半左右的概率能给出一个可用的解决方案。但现在换了Gemini 3.7 Flash之后,成功率直接就奔着三分之二去了。对于任何一个稍微有点规模的软件开发团队来说,每天要处理的Issue和Bug数量都是相当可观的,如果模型能把一次性的修复成功率提高这么多,累积下来节省的人力成本和时间成本将会是一个非常惊人的数字。
除了在纯粹的代码生成和Bug修复上表现出色之外,这次更新在网页开发这块的进步也同样让人眼前一亮。谷歌在官方公告里特别提到,Gemini 3.7 Flash现在可以用更少的提示词,就能生成功能更完备的页面布局和应用。这句话翻译成大白话是什么意思呢?就是说以前你如果想要让AI帮你做一个带登录框、商品展示区和购物车按钮的电商页面,你可能需要给它写很长一串详细的指令,告诉它每个元素应该放在哪里、颜色是什么、点击之后跳转到哪个链接。折腾半天,最后生成出来的东西还可能有各种错位和样式问题。但现在不一样了,你只需要给它一个大概的方向和几个关键的需求点,它就能自己揣摩你的意图,把大部分的脏活累活都给干了。更厉害的一点是,它对参考设计的遵循能力有了非常显著的提升。不管你是给它一张截图、一张UI设计师给的PNG图片,还是一整套包含了字体、颜色、间距规范的完整设计系统文件,它都能比以前更好地照着那个样子去生成对应的前端代码,最终产出的还原度高了一大截。在Arena.ai这个专门用来评测网页开发能力的WebDev Arena竞技场上,Gemini 3.7 Flash拿到了1588分的Elo评分。经常关注电竞或者棋类比赛的朋友应该都知道,Elo评分是一种用来衡量选手相对实力的等级分系统,分数越高代表水平越强。相比之下,Gemini 3.6 Flash在这个场地上的得分是1538分。虽然看起来只差了50分,但在Elo这套评分体系里,50分的差距已经足够说明这两个模型在网页开发能力上已经不在同一个档次了。如果再拿横向对比来看,GPT-5.6 Terra在Code Arena上的Elo是1523,Claude Sonnet 5是1541——Gemini 3.7 Flash的1588分,是这场对标里的最高分。
不过,谷歌的野心显然不只是停留在服务程序员写代码这件事上。他们还特别强调了Gemini 3.7 Flash在处理知识密集型任务方面的能力,尤其是在金融、法律和生物科学这些高度专业的领域。这些行业有一个共同的痛点:日常工作需要处理的文档又多又长又复杂,动不动就是几百页的PDF文件,里面密密麻麻地塞满了各种专业术语、财务表格、法条引用和复杂的逻辑推导链条。一般的AI模型面对这种信息密度极高的文档,要么是读到后面忘了前面,要么就是抓不住重点,给出的答案往往答非所问或者漏洞百出。为了验证自家模型在这方面的真实水平,谷歌专门拿出了一个叫做GDP.pdf的基准测试。这个测试的设计目的就是衡量模型处理和理解复杂文档的能力。结果怎么样呢?Gemini 3.7 Flash在这个测试上拿到了34%的得分,而它的前任Gemini 3.6 Flash只有22%。12个百分点的差距,换算成相对提升率的话,涨幅高达大约54.5%。这已经不是简单的进步了,这简直就是脱胎换骨。另外一个叫AutomationBench的测试,考察的是模型在真实商业工作流程中的表现,比如自动整理报销单据、根据客户邮件内容更新CRM系统里的项目状态、或者从一堆杂乱的Excel表格里提取关键数据生成报告之类的琐碎但又极其耗时的办公室日常事务。在这个测试里,Gemini 3.7 Flash拿到了30.4%的得分,而Gemini 3.6 Flash只有17%。超过78%的相对提升率,意味着如果你是个每天被各种行政流程和文书工作折磨得苦不堪言的上班族,这个新模型很有可能会成为你今年遇到的最得力的助手。
说到这儿,我相信很多正在读这篇文章的开发者朋友心里已经开始琢磨了:这个模型在实际用起来的时候到底顺不顺手?会不会像以前某些AI工具那样,碰到稍微复杂一点的场景就直接卡壳,然后需要我不停地给它喂提示词、手把手地教它每一步该怎么做?谷歌显然也提前想到了这个问题。他们在官方公告里专门花了不少篇幅来介绍Gemini 3.7 Flash在开发者体验方面所做的针对性改进。根据谷歌的说法,这个新模型在遇到障碍和困难时,随机应变的能力比以前强太多了。以前的模型如果碰到一个它搞不定的问题,往往就直接摆烂,要么输出一堆逻辑混乱的垃圾代码,要么干脆告诉你它不会让你另请高明。但现在不一样了,它会尝试自己去寻找绕过障碍的方法,或者换一种思路来解决问题。除此之外,它还能更好地澄清和确认用户的真实意图。也就是说,如果它觉得你给出的指令有些模棱两可或者信息不够充分,它不会闷着头瞎猜然后给你一个错误的答案,而是会反过来跟你确认:"你刚才说的那个需求,是不是指这个意思?"或者"这个地方我没有完全理解,你能不能再多给我一点背景信息?"这种交互方式的改进,对于减少开发过程中的沟通成本和来回返工的次数,帮助是非常巨大的。同时,它在严格遵守指令、自主规划需要多个步骤才能完成的任务,以及熟练调用各种外部工具(比如调用API接口、查询数据库、操作第三方插件等等)这些方面的能力,也都得到了全面的加强。谷歌在公告里给出的结论是,这些改进应该能够显著减少在构建软件智能体时需要的人工干预和反复尝试的次数。说白了,就是以后你可以把更多繁琐的底层工作放心地交给它去处理,把自己解放出来,去做那些真正需要人类的创造力、判断力和决策能力的高价值工作。
顺带提一句,根据谷歌模型卡片里额外的信息披露,Gemini 3.7 Flash在Terminal-bench 2.1这个考察智能体终端编码能力的测试上拿到了85.8%的成绩,而上一代3.6 Flash是78.0%;横向对比的话,GPT-5.6 Terra是87.4%,Claude Sonnet 5是80.4%——也就是说,在终端智能体这个细分赛道上,Gemini 3.7 Flash已经无限逼近目前业界最强的GPT-5.6 Terra,差距只有1.6个百分点。这说明谷歌这次的算法精炼,是实打实地把"智能体自主干活"这件事往前推了一大步,而不是只在PPT上画画饼。
当然,对于绝大多数普通用户和中小型开发团队的成员来说,前面聊的那些技术指标和基准测试分数可能稍微有点遥远,大家最敏感也最关心的东西归根结底其实就两个字:价格。这次Gemini 3.7 Flash在定价策略上,谷歌可以说是展现出了相当大的诚意,甚至带有几分不惜砸盘也要抢占市场的意味。我们来仔细看一下具体的收费标准。从现在开始一直到2026年12月31日,也就是今年年底之前,Gemini 3.7 Flash的输入价格是每100万个token收费0.75美元,输出价格是每100万个token收费3.75美元。这个价格到底有多便宜呢?谷歌自己给出了一个非常直观的对比:这个优惠价只有当初Gemini 3.6 Flash刚刚发布时的首发价格的一半。没错,直接腰斩。而且这个优惠窗口期并不是只有几天或者几周,而是长达四个多月的时间。对于那些每个月需要处理海量token的AI应用开发者来说,这笔账算下来能省下的钱可不是一个小数目。咱们来举一个具体的例子。假设你开发了一款AI驱动的智能客服系统,这个系统每个月大概需要消耗10亿个输入token和2亿个输出token。如果按照Gemini 3.7 Flash现在的优惠价来计算,你每个月在模型调用上的花费大约是输入部分750美元加上输出部分750美元,合计1500美元。但如果按照当初Gemini 3.6 Flash的原价来算,同样的用量你需要支付整整3000美元。一个月就能省下1500美元,一年下来就是18000美元。这笔钱对于一个初创团队来说,足够给核心成员多发几个月的工资,或者拿来投入到更关键的研发环节里去了。当然,天下没有永远免费的午餐,这个诱人的优惠价格只会持续到今年年底。从2027年1月1日开始,价格就会恢复到每100万个输入token收费1.50美元、每100万个输出token收费7.50美元的正常水平。但即使恢复到这个价格,跟市面上很多同级别的大模型比起来,依然具有很强的竞争力——同样是每100万输入token,Claude Sonnet 5要价2.00美元,GPT-5.6 Terra要价2.00美元;输出token方面,Claude Sonnet 5高达10.00美元,GPT-5.6 Terra更是达到了12.00美元。也就是说,就算明年涨价后,Gemini 3.7 Flash的输出价格也只有Claude Sonnet 5的不到四分之一、GPT-5.6 Terra的不到七分之一,性价比依然是断层式的领先。
这里要特别提醒一下那些打算长期依赖这个模型跑生产环境的团队:2027年1月1日到来之后,你的输出成本将直接翻倍,所以在做年度预算的时候,千万别只拿现在的优惠价去算账,否则到时候财务那边肯定要找你谈话。聪明的做法是:在今年剩下的四个多月时间里,尽可能把能跑的通量都跑在Gemini 3.7 Flash上,把成本优势吃到极致;同时预留一部分预算缓冲,应对明年涨价后的成本结构变化。
除了面向开发者的API接口调用之外,谷歌还迅速地把Gemini 3.7 Flash整合进了他们那个号称可以全天候24小时在线的个人AI助手——Gemini Spark。从昨天也就是8月13号开始,Gemini Spark就已经开始使用这个新模型来处理各种知识型的工作任务了。具体能干些什么呢?比如说,它可以帮你把散落在电脑硬盘不同文件夹里的各种资料和文件汇总到一起,自动整理归类;也可以根据你给的几句要点,帮你草拟一封措辞得体、格式规范的商务邮件;还可以在你忙不过来的时候,替你更新一下项目管理的状态文档。这些事情单个看起来都不是什么惊天动地的大项目,但日积月累下来,每天在这些琐碎杂务上耗费的时间和精力真的非常可观。现在好了,你完全可以把这些烦人的重复性劳动直接丢给Spark去处理,让自己专注于更重要的事情。不过这里需要提醒大家注意的是,Spark的这个新功能目前只向Google AI Pro和Ultra的付费订阅用户开放,而且覆盖范围是全球超过160个国家和地区。至于中国大陆地区的用户具体能不能正常使用,大家可能还需要自己去实际测试一下。对于企业级的客户,谷歌也提供了相应的接入渠道,可以通过Gemini Enterprise Agent Platform和企业版应用来使用这个模型的最新能力。而对于那些只想自己先尝尝鲜的个人用户来说,只要你所在的地区在支持列表里,并且你已经订阅了Google AI Pro或者Ultra,就可以在手机或者电脑上的Gemini App里通过Spark这个功能直接体验到Gemini 3.7 Flash的强大之处。
对于广大的开发者群体而言,获取和使用Gemini 3.7 Flash的途径也是相当丰富的,基本上覆盖了主流的开发场景。你可以通过Google Antigravity——这是谷歌自家推出的一个用于AI实验和快速部署的平台、Gemini API、Google AI Studio以及Android Studio等多种渠道来调用这个全新的模型。不管你现在是在做一个快速验证想法可行性的原型项目,还是在开发一个要上线给成千上万用户使用的生产级应用,基本上都能找到一个适合你自己的接入方式。尤其是Android Studio的集成,这对于所有做安卓开发的程序员来说绝对是一个重大的利好消息。以后在编写安卓应用程序的时候,你可以直接在集成开发环境里借助Gemini 3.7 Flash的能力来实时生成代码片段、快速定位和修复潜在的Bug、甚至对整个模块的结构进行智能化的重构和优化。这样一来,整体的开发效率和最终产出的代码质量,预计都会得到一个非常明显的提升。
咱们不妨站在一个更高的角度来审视一下谷歌这次的整体布局。三个星期前刚刚发布了Gemini 3.6 Flash,三个星期后就紧跟着端出了Gemini 3.7 Flash,而且在性能和价格这两个最核心的维度上都实现了对上一代产品的碾压。这背后透露出来的信号其实是相当清晰的:谷歌已经不满足于在人工智能这条赛道上扮演一个追赶者或者参与者的角色了,他们的目标是要成为那个制定游戏规则的人。他们正在利用极其迅猛的迭代速度和极具攻击性的定价策略,试图把所有的竞争对手都逼到一个进退两难的尴尬境地。别的公司如果不跟进,那在技术水平和开发者生态上就会被谷歌越甩越远;但如果选择跟进,那就意味着要承受巨大的研发投入成本和技术实现上的重重压力。而且大家别忘了,这还仅仅是Flash系列的表现。在谷歌的产品矩阵里,还有定位更高端、性能更强的Ultra系列和Pro系列。连Flash这个主打性价比和高效率的系列都已经进化到了这个地步,那些更高端的版本现在得强成什么样?光是想想就觉得后背有点发凉。
另外还有一个值得玩味的细节,那就是这次产品发布的具体时间节点。昨天是8月13号,星期四。按照科技行业多年形成的惯例,大多数公司都会选择在星期二或者星期三来发布重大的产品更新,因为这样可以在一周的工作日中间获得最大程度的媒体曝光和社区讨论热度。但谷歌偏偏反其道而行之,选在了星期四,而且是下午时分。这个时间点,北美西海岸的开发者可能刚刚吃完午饭,正准备下午开始干活;而东海岸的开发者可能已经开始收拾桌面,盘算着周末要去哪里玩了。为什么会选择这样一个看似不那么理想的时间窗口?我个人推测,最有可能的原因是谷歌对自己这次拿出来的产品有着极强的信心,他们觉得根本不需要依靠发布时机的选择来人为制造话题热度,产品本身的硬实力就足以引爆整个互联网的讨论。而从昨天消息传出后各大技术社区的反应来看,他们的自信确实是有道理的。
最后,我想再跟所有正在读这篇文章的朋友们聊一个比较现实的问题:这个看起来很厉害的模型,我们国内的用户到底能不能用得上?坦率地讲,由于一些大家都知道的原因,谷歌旗下的很多AI服务在大陆地区的访问都存在一定程度上的限制和不便。Gemini API和Google AI Studio这些平台虽然名义上是面向全球开发者开放的,但在实际操作过程中,身处大陆的用户可能需要借助一些特殊的网络手段才能顺利地访问和使用。不过,这并不意味着这条新闻就跟我们完全没有关系了。一方面,现在有大量的中国企业和开发者本身做的就是海外市场业务,他们本来就在频繁地使用国外的云服务和AI模型,Gemini 3.7 Flash的推出对于这些出海团队来说无疑是一个实实在在的重大利好。另一方面,国内的那些大模型厂商们——像百度、阿里巴巴、字节跳动、智谱AI、MiniMax这些公司——肯定也在派专人密切地盯着谷歌的一举一动。谷歌这边一旦把价格打下来、把性能提上去,国内的这些玩家必然会感受到巨大的竞争压力,从而被迫加快自己产品的迭代速度,并且在价格上做出相应的调整。最终真正享受到这一切红利的,还是我们这些处于产业链最末端的普通开发者和最终用户。说到底,技术进步带来的好处,终究会通过各种不同的渠道和方式,传递到每一个人的手上。
所以,如果你是一个热衷于追逐最新技术工具的开发者,我真心建议你今天就可以去Google AI Studio的官网上注册一个账号,试着申请一下Gemini 3.7 Flash的试用权限。哪怕你暂时没有什么具体的项目要用到它,单纯拿它跑几个你平时觉得特别棘手或者一直没搞定的代码片段,亲自感受一下那个在DeepSWE v1.1上达到65.3%成功率的模型到底有几斤几两,也是一件非常值得做的事情。如果你是一家创业公司的CTO或者技术合伙人,那你更应该认认真真地坐下来算一笔账,把你现有的AI基础设施迁移到Gemini 3.7 Flash上,究竟能为公司省下多少运营成本,又能带来多大的效率提升。至于那些到现在还在观望、犹豫要不要在自己的工作流里引入AI工具的同行们,我只能说一句不太好听但非常现实的话:留给你们慢慢考虑的时间,真的已经不多了。当你的竞争对手已经在利用一个拥有43.6%代码能力和30.4%业务自动化水平的AI工具来疯狂压缩成本和提高产出的时候,你还在手动一行一行地改Bug、一张一张地填报表,这场仗你还怎么打下去?人工智能这股浪潮已经实实在在地拍到了每个人的脸上,与其站在原地担心被淹死,不如赶紧跳上去,学着怎么驾驭这道浪。毕竟,工具已经明明白白地摆在这里了,用还是不用,最终的主动权还是在你自己手里。从今天算起,距离2026年12月31日这个优惠截止日,满打满算只剩下大约四个半月的时间,过了这个村,可就再也找不到这个店了。这四个半月里,你能用这个模型跑出多少价值,很大程度上决定了你明年面对涨价时的从容程度。别等到2027年1月1日价格翻倍的账单寄到手上,才后悔今天没有早点动手。
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有账号?立即注册
x
|