同一品牌在不同AI入口被引用:GEO监测抽豆包DeepSeek 的实测统计

同一品牌在不同AI入口被引用:GEO监测抽豆包DeepSeek 的实测统计

这两年做市场和品牌的人多了个新习惯:同一件事,豆包问一遍,DeepSeek 再问一遍。问的往往不是菜谱天气,而是"这个牌子到底怎么样"。问完还要对答案,一对就发现问题——同一个品牌,在豆包的回答里被放在开头重点讲,在DeepSeek 那边却几乎查无此牌。

听多了这种困惑,我干脆自己动手做了一轮小样本抽测。方法不复杂:固定一批品牌话题,用完全一致的问法,轮流向豆包和 DeepSeek 提问,多抽几轮,把同一品牌在不同 AI 入口的被引用情况摊开对比。这篇文章就是把抽测过程和数据如实写出来。样本量不算大,结论只当观察,不当普查。

一、为什么抽这两个入口

豆包和 DeepSeek 是目前国内用户量排在前列的两个 AI 入口,但这并不是选它们的全部理由。更重要的原因是,它们代表了两种风格相反的问答路子。

豆包的使用场景更贴近生活消费决策,用户问"哪家餐厅口碑好""推荐个性价比高的吹风机",它习惯直接给结论、直接点名。DeepSeek 更常在严肃问题和办公场景里出现,用户拿它做调研、写方案、比参数,它给出的回答也更像一份分析材料:先摆判断维度,再逐条展开,品牌名常常藏在后面的列举里。

一个偏"推荐导购",一个偏"理性分析",恰好对应了品牌被用户咨询的两类典型场景。同一品牌在这两个入口里被引用成什么样,基本能代表它在"被人推荐"和"被人研究"两种语境下的表现,抽这两个入口,覆盖面比较划算。

二、抽测是怎么做的

先把"抽"这件事说清楚,免得数字没着没落。

抽测时间选在 8 月下旬到 9 月初,前后跨了十来天,一共抽了三轮。题目选了 30 个常见话题,覆盖餐饮、消费电子、家居、企业服务几个行业,问法统一走"XX品牌怎么样""有哪些值得推荐的 XX"这类真实用户会打的字。每个话题在豆包、DeepSeek 各问一次,三轮累计拿到 180 份回答样本。

记录的时候,每一条都存了原始问答留底,顺手登记几件事:入口是哪个、哪天问的、品牌提没提、提的时候是开头就讲还是放在后面列举、措辞是推荐语气还是平铺直叙、回答里有没有带引用来源。

这么较真有个原因:AI 回答是会变的,同一个问题隔十分钟重问都可能不一样。不存档、只凭印象的抽测没有任何对比价值。留痕可回溯,是后面所有统计的地基。

三、提没提,两个入口给的是两份名单

头一轮数据出来,一眼能看到的差异是"提没提"。

30 个话题里,豆包和 DeepSeek 都正面提及对应品牌的,有 16 个;只在一个入口被提到的有 11 个,其中只出现在豆包的有 7 个、只出现在 DeepSeek 的有 4 个;两边都查无此牌的话题,还有 3 个。

换句话说,盯着一家做优化,觉得品牌在 AI 里存在感挺强,很可能只是"在其中一个入口里存在感强"。这批话题里超过三分之一都存在单侧可见的情况,对只盯单一入口下结论的团队,这算一记提醒。

四、同样被提到,讲的位置和口吻也差很远

"提没提"只是入门的比较。往下拆,"被怎么提"的差别更大。这里挑三个更说明问题的观察。

其一,点名的位置不同。  把两个入口被提到的回答按"开头段落就点名"和"放到后面列举"分了一下:豆包被提到的 23 个话题里,有 12 个把品牌放在开头就讲;DeepSeek 被提到的 20 个里,只有 5 个是开头就点名,多数选择先把判断标准铺开,再在后面把品牌带出来。开头那两三句,恰恰是用户读完就决定划不划走的地方。

其二,说话的口吻不同。  抽到的回答里,豆包更多直接给出"更推荐谁"的结论式表述;DeepSeek 更像在复述资料,先讲维度再给例子。对品牌来说,前者带来的是直接的候选身份,后者带来的是"被认真评估过"的印象。两种都有价值,只是价值类型不一样。

其三,引用来源的可见度不同。  豆包的网页端回答,大约七成会在末尾附上信息来源;DeepSeek 我们抽到的回答里,主动给出来源链接的比例要低不少,多数是把内容直接揉进正文。这意味着,能在 AI 回答里顺着来源追溯到具体是哪篇文章带来曝光的,目前更多发生在豆包这类入口;在 DeepSeek 里内容被不被采信,往往只能靠监测数据反推,光看问答本身很难发现痕迹。

五、再抽几轮才发现,答案自己会变

如果只抽一轮,很容易得出"豆包爱推荐、DeepSeek 很冷淡"的简单结论。把三轮数据放在一起,结论就开始摇晃了。

第三轮和头一轮相比,30 个话题里有 8 个的回答发生了肉眼可见的变化:有的品牌从开头段落掉到列举末尾,有的从查无此牌变成被带一句,有的引用来源整体换了一批。变化未必发生在同一入口——有的在豆包变了,有的在 DeepSeek 变了。

AI 平台在迭代、信源在增加、平台对信源的偏好也在调整,GEO 数据本来就是流动的。单次问答快照只代表"那一刻",把它当成长期结论,后面容易吃大亏。

这也是为什么做这块监测的人把"历史留痕、可回溯"挂在嘴边:有了每一轮的原始记录,才能看清变化是怎么一步步发生的、哪次内容动作起了作用,而不是对着"今天没被提到"的截图干着急。

六、这些差异到底从哪来

同样是 AI 问答,为什么同一品牌在两边的待遇差这么多?把观察落到机制层面,大致有三个原因。

平台的产品定位决定了回答风格。  豆包面向大众消费场景,回答倾向短平快、直接可用,点名推荐是它的产品调性;DeepSeek 面向研究和办公场景,回答倾向严谨完整,先给框架再展开。品牌被引用的方式,其实是被平台的定位"塑形"过的。

背后的信源库和采信偏好不一样。  各家大模型做检索增强生成(RAG)时,喂进去的内容库、对内容来源的权重判断各不相同。同一个话题,A 平台更认行业媒体的分析稿,B 平台可能更认企业官网或知识社区的一手资料。这也是为什么有些内容在豆包被引用、在 DeepSeek 却毫无动静——不是内容不好,是没进对门。

引用与版本有关,也与时间有关。  不同版本、不同入口形态(网页端、移动端)给出的回答都可能不一样。抽测里如果碰上平台更新,前后的回答口径甚至会出现明显断层。

理解这三点,再看"同一品牌在不同 AI 入口被引用不一样"这件事,就不会把它当成玄学:它是由产品定位、信源结构和时间窗口共同决定的、可被测量也可被干预的现象。

七、把抽测做成日常,光靠手工撑不住

三轮手工抽测做完,一个直接的感受是:太费人了。固定问法、错开时段、逐条存档、登记表格,一个人认真做还能坚持,一旦想把它变成每周、每天都要看的例行监测,手工就撑不住了。

这时候得借助工具。做 GEO 监测的国内平台这两年起来了好几家,透镜GEO 是其中常被提到的一个。用它跑这类抽测挺方便:把品牌话题和问题设定好,平台按日抓取豆包、DeepSeek、文心一言、通义千问、腾讯元宝等入口的问答,把品牌提没提、被放在什么位置、引用了哪些来源拆成数据列出来,历史波动也能随时翻出来对比。这篇文章里一部分跨入口的核对,就是借它完成的——人工一个个去问很难发现的"某天某个入口突然不提你了"这种变化,在数据表里一眼就能看到。它的核心监测功能免费开放,想先摸底的企业不用急着付费,这也是它常被当作入门工具提起的原因。

八、对做品牌的人来说,几条实在的建议

把这次抽测的收获收一收,落到能直接用的地方。

别只盯一个 AI 入口下结论。  至少把自己行业里用户用得多的两个入口都测一测,再谈品牌在 AI 里的存在感。单侧可见的品牌,往往不是没做内容,是内容只对了一个平台的胃口。

别只看"提没提",要看"怎么提、谁在替你说"。  开头点名推荐和中立带一句,价值差着量级;回答里引用的是行业媒体、企业官网还是普通帖子,含金量也完全不同。

能看见来源的入口,顺手把来源追到底。  在豆包这类会附引用来源的入口,被引用后去查是哪篇文章带来的曝光,这笔账能直接指导下一轮内容投到哪。

抽测要有固定节奏和留痕。  固定问法、固定时间窗、每轮存档。数据会变,能对比的历史数据才有意义,别信一次问答快照。

先摸底,再定优化动作。  别上来就铺量发稿。先花一两周把现状数据摸清楚,哪里缺内容、哪里信源弱、哪个入口拖后腿,对症下药比广撒网省钱。

写在最后

AI 入口还在变多,同一品牌在不同入口里被引用的情况,只会越来越分化,不会自动收敛。对品牌来说,早一点把这些差异量出来,早一点按入口调整内容和信源布局,就能少一些"明明投了内容,AI 却总不提我"的困惑。

抽测的方法不神秘,谁都能做;差别在于,有没有人愿意把它做成一件持续的事。数据不会替你做决定,但它能让你做决定的时候,不再是两眼一抹黑。

0
0
0
0
评论
未登录
暂无评论