大众点评

刚刚,Gemini 3.6 Flash 正式发布,但网友笑得更大声了_我的网站

美味情缘

A |     如果你从去年就开始用 Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症。         这是最近网友对 Gemini 的一句调侃。         按理说,一家公司发新模型,通常是来打脸这种调侃的。可就在刚刚,Google 一口气发了三个新模型之后,网友非但没收回这句话,反而笑得更大声了。    

     一键部署OpenClaw        从时间线到主题库,重新组织你的内容资产 | 站长网出品 | 2026年8月    按日期堆文章,可能是最浪费内容的方式    干了这么多年站长,我见过太多人做内容的方式是这样的:今天想到一个话题就写一篇,明天看到热点又追一篇,后台文章列表是按发布时间排列的流水账。一年下来写了上百篇,认真整理一下发现——这些文章东一篇西一篇,互相之间没有关联,读者看完一篇就跑了,搜索引擎也看不出你到底在哪个领域有积累。

B | 多少有种他们都不看好你,可偏偏你最不争气的即视感。    问题不在内容质量,在组织方式。         三个模型分别是 3.6 Flash、3.5 Flash-Lite,还有一个专搞网络安全的 3.5 Flash Cyber。    你把一堆有价值的文章按照"发布时间的先后顺序"排列,就像把一本百科全书的条目按写作日期排序——内容再好,结构散了,价值就折损大半。

C |     搜索引擎对网站的评估方式变了    以前搜索引擎评估一个页面,基本只看这个页面本身:页面内容跟搜索词是否匹配、有没有外链指向它、用户体验好不好。

D | 官方博客的措辞也相当眼熟,「更高效」「更聪明」「为大规模 AI agent 而生」,一句不落。         只不过,实际体感却冰火两重天。所以即使你网站整体内容散乱,只要某几篇文章做得好,照样能获得不错的排名。         主角登场,3.6 Flash 到底强在哪          先说头牌,3.6 Flash。

E | 官方给的定位就俩字——「主力」(workhorse),干活模型。         3.5 Flash 是今年 5 月 I/O 大会上发的,这次算是小版本迭代。         最大的卖点是省 token。

F |     现在AI搜索的逻辑不一样了。         按 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 少用 17% 的输出 token,在 DeepSWE(Datacurve 出的基准)这类场景上甚至能省到 65%。    AI在决定要不要引用某个网站的内容时,不只是看单篇内容是否相关,还会评估这个网站在相关主题领域是否有持续的积累。官方还说它跑多步任务时,推理步数和工具调用都更少。

G | 也就是说,干同样的活,废话更少,绕路更少,账单更薄。         价格也确实降了。

H | 输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——注意,上一代 3.5 Flash 的输出是 9 美元,这波直接砍到 7.5。又快又省,单个 agent 任务的成本就压下来了。翻译过来就是:如果一个网站某个主题下只有一两篇文章,AI会倾向于选择那些在这个主题下写了十几篇、形成了知识体系的网站。

I |     这不是算法偏袒谁,而是理性判断——你想获取一个领域的全面信息,是更信任随手写过一两篇的网站,还是明显深耕这个领域、从多个角度反复探讨过的网站?    什么是知识中心模式    知识中心的思路不复杂:放弃按时间排列内容的习惯,转而围绕核心主题建立内容集群。         基准测试上,官方摆出了一整排数据。

J |          代码能力是重点。

K | DeepSWE 从 37% 提升到 49%,官方的说法是多余的代码改动更少、执行循环也更短,生成的代码更贴近生产环境的要求。    具体来说,你先把网站拆分出几个核心主题方向——比如服务器评测、网站加速、流量增长、安全防护。

L | 每个核心方向建一个"支柱页面",把这个方向的所有子主题系统覆盖一遍。

M |     然后围绕每个支柱页面,持续产出子主题文章。每篇子文章解决一个具体问题,同时用内链指向支柱页面和其他相关子文章。机器学习研究方向的 MLE Bench 提升更明显,从 49.7% 拉到了 63.9%。逐步形成一个紧密关联的内容网络。         计算机操作(computer use)能力也有长进,OSWorld-Verified 从 78.4% 升到 83%。    这个网络里的每篇文章都不孤立。并且,「计算机操作」(computer use)也成了Gemini API 和企业版的内置工具,主打一个开箱即用。

N |          知识工作方面,GDPval-AA v2 从 1349 涨到 1421。Hebbia、Harvey 等客户反馈,它在文档解析、图表数据分析、报告起草这类多模态任务上表现尤其突出。用户点进来读一篇,会被自然引导到相关文章继续阅读。Figma、JetBrains 也都出面背书了一番。搜索引擎爬一遍,能清晰识别出你这个网站的几个核心知识领域。         哦对了,还有个不起眼但挺实在的更新:知识截止日期终于从 2025 年 1 月推进到了 2026 年 3 月。    从博客到知识中心的三步切换    第一步:给现有内容做一次盘点    把你网站现有的所有文章拉出来,按主题分类。常用的分类维度包括:    • 这篇文章的核心话题是什么?    • 它回答了读者什么问题?    • 它跟网站其他哪些文章有关系?    • 它是这个主题下的入门内容还是进阶内容?    做这个盘点的时候你会有一个意外发现:很多文章其实天然就有内在关联,只是之前按时间排列时被割裂了。盘点本身就是把散落的珠子串起来的过程。老黄历总算翻篇了。

o |     第二步:确定支柱页面,开始建立主题集群    每个核心方向选一篇最全面、最有代表性的文章作为"支柱页面"。

p | 这篇支柱文章覆盖该主题的全貌,内容要足够深(至少3000字起步),结构要清晰到能当目录用。         安全这块,官方说 3.6 Flash 上了升级版的 Frontier Safety 防护,重点盯着 CBRN(化学、生物、放射性、核)和网络攻击这两类滥用,抗越狱能力更强了,同时又尽量不误伤正常需求、少乱拒绝。    然后整理出该主题下需要补充的子话题。         ·以小博大,便宜大碗的 3.5 Flash-Lite 也能更换推理档位了          第二个是 3.5 Flash-Lite,定位比 3.6 Flash 还低一档,主打「快」和「便宜」,专治高吞吐、低延迟的任务,比如 agent 搜索、文档处理。比如"网站加速"这个支柱下面,子话题可以包括:    • CDN是什么以及怎么选    • 图片压缩和格式选择    • 缓存策略的三种方案对比    • 服务器配置对速度的影响    • WordPress加速插件推荐    每个子话题单独写一篇文章,写完后用内链把支柱页面和所有子文章串联起来。用户在支柱页面看到"CDN选型"的概要介绍,点链接跳转到详细文章;在子文章读到"这只是加速策略的一部分",点链接回到支柱页面看全局。    第三步:把新内容自然地融入知识网络    习惯了知识中心模式之后,写新内容时会自然而然地想两个问题:    这篇文章属于我网站上哪个主题集群?    写完这篇文章,该主题集群还缺什么角度?    这样一来,内容创作就从"想到什么写什么"变成了"围绕核心主题系统性覆盖"。

q |          它是 3.5 系列里最快的,按 Artificial Analysis 的测量是每秒吐 350 个 token。产量可能没有变多,但每篇文章的战略价值翻倍了。价格更是白菜——输入 0.3 美元、输出 2.5 美元每百万 token。官方说质量比 3 月发的 3.1 Flash-Lite 好一大截。    一个真实场景的对比    假设你经营一个服务器评测站,某一周想写两篇关于VPS的内容。

r |          有个设计挺灵活:它支持调「推理档位」。    按传统博客思路:写一篇"A厂商VPS测评",再写一篇"B厂商VPS测评",两篇文章各自独立,唯一的关联可能是底部推荐列表里互相引用一下。低配活儿就开最低档,图个快和省;碰上要多步拆解的子任务,就把思考档位往上拨。电脑操作这次也做成了内置工具。         跟前代比,提升相当明显:代码和 agent 任务的 Terminal-Bench 2.1,从 31% 干到 54%;长上下文的 GDM-MRCR v2,从 60.1% 提到 72.2%;真实任务执行的 GDPval-AA v2,更是从 642 飙到 1140。    按知识中心思路:先确定"VPS选购指南"是支柱页面,然后规划子话题——"带宽和线路对比""CPU性能实测""价格性价比横评"。A厂商和B厂商的数据不是各写一篇测评,而是融入每个子话题中做对比。         最有意思的是,这个「小弟」在不少 agent 和代码任务上,居然反超了辈分更高的 3 Flash。         比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。以小博大,属实有点东西——等于说跑 3 Flash 的活儿,现在有了个更快更强的平替。         官方还举了几个用法:从海量电商数据里抽产品特征、给 3.6 Flash 当副手一口气生成 25 个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp 这几家客户也来夸了它「速度、智能、成本三合一」。最终形成的是一套完整的选购知识体系,而不是零散的测评合集。         最后一个 3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。    用户进来看的不只是一家的数据,而是能在不同维度上做出比较和判断。这种体验本身就能拉升页面停留时间和回访率。         Google 的逻辑挺有意思:现在 AI 找漏洞的速度,已经比现有系统修漏洞的速度快了。    知识中心模式和SEO的关系    从SEO角度看,知识中心模式有三个直接的好处。

s | 既然漏洞越堆越多,那干脆用便宜高效的 Flash 来批量补锅。    第一是内链结构更合理。

t |          这个模型是在 3.5 Flash 基础上微调出来的,搭配自家的 CodeMender 工具用。自然形成的内链网络让搜索引擎爬虫在页面之间顺畅流转,爬取效率更高。CodeMender 里跑的是好几个 Flash Cyber agent,协同工作、最后汇总成一份报告。         在业内有名的 CyberGym 基准上,官方称它摸到了第一梯队的水平,还比更大的模型更省 token。         不过这模型我们暂时也用不上。    第二是主题权重更集中。同一个主题下多篇文章互相引用,搜索引擎会把整个集群视为一个有深度的内容资产,单篇文章也能借助集群的权重获得更好的排名。         考虑到「找漏洞」这种能力是把双刃剑,浓眉大眼的 Google 也学 Anthropic 玩起了安全叙事。把它锁得死死的——只对「可信合作伙伴」限量开放,走内测。    第三是被AI搜索引用的概率更高。

u | AI倾向于引用那些在某个领域"讲透了"的网站。你围绕一个主题写了十几篇相互关联的文章,被引用的概率远大于只写了一篇的人。    不用一步到位    把整个网站从博客模式切换成知识中心模式,工程量不小。目的是给一线防守方争取时间,赶在漏洞被人利用前先修掉,同时防着有人拿它去干坏事。

v |          说好的 3.5 Pro 呢?如来          看到这儿你可能会问:发了一堆 Flash,那真正的旗舰 3.5 Pro 去哪了?          官方口径是「正在和合作伙伴测试,准备好就上」。但这套说辞背后的故事,可能没那么体面。

w | 不用想着一次性改完。         据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。

x |     可以从最重要的那个主题开始做。Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训。比如你的网站最核心的方向是"服务器评测",就先围绕这个方向建一个知识集群。把现有的评测文章盘点一下,写一篇"服务器选购指南"做支柱,然后慢慢地往里面补充子话题。    一个集群跑通了,再复制模式到第二个主题方向。         而 Google AI 宣传委员 Logan Kilpatrick 更是索性在舆论上直接跳过 3.5 Pro,将预告的重点放在了Gemini 4,声称他们已经启动了史上最雄心勃勃的 Gemini 4 预训练,还放话说进展让人兴奋。    节奏很重要。         听着虽然挺提振人心,但把它放在「旗舰跳票」的背景下看,多少有点转移视线、画饼续命的味道了。每个月花一天时间盘点现有的内容结构,更新支柱页面,规划下个月要补充的子话题。         除了这些内幕,光看今天刚刚发布的 Flash 模型本身,网友们也并不全然买账。小步快跑远比一步到位容易坚持。    总结    写这篇文章的时候我翻了翻自己之前积累的内容,发现有很多写了就忘的文章,如果当时稍微花点心思做内链和主题归类,流量和用户的停留深度应该会好不少。    知识中心模式不是什么复杂概念,说白了就是"别让你的内容资产散落一地"。         第三方评测机构 Artificial Analysis 表示:两个新模型确实把单任务耗时砍半、token 效率也提升了,Flash-Lite 的智能指数涨了 11 分——但 3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步。    开始做三步就行了:盘点现有内容、确定2-3个核心支柱、每篇新文章都放进对应的主题集群里。         价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。    这事难度不高,就是得养成习惯。         X 网友吐槽道:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 这一票对手,直呼简直烂透了(阴阳怪气 doge)。         吐槽的还不止一个。         网友 Angel 则直接从性价比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,可智能程度反而更低。做了之后可能不会立刻感受到变化,但三个月后再看数据,大概率会发现用户在网站的停留时间和页面浏览量有明显提升。

y | 又贵又笨,这组合属实有点尴尬——毕竟 Flash 系列立身的根本就是「性价比」,结果被人当场指出性价比不如对手,等于自砸招牌。

        
    

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!。         作为对比,OpenAI 的 Tibo 刚刚也发话了:由于周活跃用户达到 1000 万,新的一天,Codex 和 ChatGPT Work 的付费用户迎来新一轮额度重置,尽情享用。         这对比,这落差,还有人记得大明湖畔的 Google Gemini 3?          实测派也来补刀。

z | 网友 Balder 更是直接开团:          这三个模型性能全比之前的 3.5 Flash 差。

| 他甩出自己的测试吐槽,说问题包括但不限于——基础解码就有毛病、中文选词经常很离谱;生成的图片视频质量极差、跟指令对不上还限额严重;经常记忆混乱、调用完全错误的工具。         而且他还上了个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,还阴阳了一句这就是皮查伊想要的「Cloud First」。         此外,X 网友 Conor Dart 用 Google 自家的 Antigravity 跑了个 AI 生成游戏的测试,结果没有出乎意料,木头纹理更差了,大理石看着差不多但还是不能用。他直言这又是一次翻车,表示自己还是等 Gemini 3.5/3.6 Pro 吧。

|          简言之,你别问新模型强不强,你就说 Flash 不 Flash 就完事了。一边是官方更高效、更便宜、更省 token的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。         这很难不让人好奇是不是 Google 这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子?          反正 Gemini 4 的预训练都开跑了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

Current article:http://www.qiniaohongfangfoguisenzhai.cyou/muf87o5/71bu28.html

Published on:00:09:48


我可能不会爱你

千图网_Active users

无证之罪_Hottest this week