Skip to content Skip to footer

“豆包换血”对 GEO 到底有什么影响?

一天早上,我们突然发现所有服务的品牌在豆包上都不被提及了。

有几个跑了小半年、一直稳坐第一的品牌,一夜之间在自己最核心的词条上居然消失了。

联想到最近一直有豆包换血和改代码的传闻,我们猜测到可能和这个有关,于是就对过去一段时间豆包监测的数据进行了分析和复盘,结果真发现了一些猫腻。

顺着这条线往下挖,我们又发现了几个关于豆包引用源的深层信息。今天,就来和大家一起分享。

一、联网这件事,它开始看人下菜碟了

豆包的联网搜索,一直是自动触发的,它自己会判断这个问题要不要去联网查,很多用户不会在意这个开关,也不会这件事。

正因为看不见,出问题的时候没人察觉。

我们扒了一段时间的数据,摸出两个规律:

第一,同一个问题,问第二次它就不查了。

第一次问,它老老实实联网,引用源都会挂出来。但隔一会儿再问同样的问题,答案出来了,引用源却没了。

其实这个逻辑我们也能接受,因为如果是同样的问题,那大概率查出来的链接是差不多的,只需要把答案重新组织一遍就可以。但问题就在于,豆包在回答同样的问题时,不仅会把联网查询关闭,但也不会参考之前查询过的链接和答案,而是会根据训练数据生成,这就导致出来的答案和有联网时完全不一样。

第二,它会挑账号。

新注册的、没登录的、平时不怎么用的账号,拿到的回答明显更水——联网频率更低,引用更少,信息更旧。反倒是天天用的老账号,待遇好一些。

二、对抖音的引用,明显变多了

同一段时间里,另一个变化也很清楚:

以前一条回答里引两三篇抖音内容,现在能引到七八篇。这件事业内的普遍解读是豆包开始偏爱视频内容了,赶紧去抖音铺量。

我们的看法不太一样。

把它和第一件事放在一起看,答案其实很简单:抖音的数据,是不要钱的。联网搜外部网页,每一次都是真金白银的成本。而抖音的内容在自家仓库里躺着,调用一次接近零成本。当一家公司开始压成本的时候,最自然的动作是什么?少去外面查,多用内部的。

所以引用结构滑向站内内容为主,很可能根本不是什么算法审美升级,它和联网降级是同一件事的两个面。

三、豆包看视频会“快进”

那豆包引用了这么多抖音视频,它到底读进去了多少?

我们把豆包7月引用过的抖音链接全部导了出来,然后把视频原始的口播逐字稿完整扒下来,再把豆包实际读进上下文的那段文字(也就是接口回传的summary总结文字)取出来,两份文本逐句对齐,发现了下面的特点:

1.豆包压根没“看”视频

我们抓了豆包返回的原始数据包。视频这一块回传的是一个 text_card 结构,里面装着 title、desc、sitename 这些文字字段,外加一段现成的 summary。它读的是这条视频的文字说明,不是视频本身。

2.豆包看视频会“掐头去尾”

20 条能取到完整口播稿的样本里,只要逐字稿超过460字,summary文字总结就一律停在420到460字之间,一条不例外

而超出上限的部分,它不是随机截,也不是挑重点,处理方式基本就是掐头去尾,又分为三种情况:

1分钟以内,基本还是会读完的。

超过1分钟,头尾开始被掐掉。 这个阶段丢的字数不多,它会把一些不重要的信息,比如开头那句钩子和结尾那句引导都给去掉。

超过2分钟,中段主体开始整段跳过。

写在最后

平台要控成本,这没什么可指责的,每一次联网搜索都是钱,想省是人之常情。

但省钱有两种省法。

一种是明着省:告诉你这次没联网,答案基于既有资料,你自己判断要不要再查一次。

另一种是偷偷省:开关是自动的,你看不见,答案照样说得头头是道,你根本不知道自己拿到的是刚查的还是去年的。

豆包选的是第二种。

既想把用户吸引进来,又在用户看不见的地方按成本见人下菜碟——这个吃相,确实不太好看。

Go to Top

Our site uses cookies. Learn more about our use of cookies: cookie policy
Our site uses cookies. Learn more about our use of cookies: cookie policy