网易首页 > 网易号 > 正文 申请入驻

Agent 的上限看模型,底线看什么?

0
分享至

AI SEARCH · 实测横评 2026.07

能搜到,就等于是对的?

真正的分水岭,是 该信谁

给 Agent 喂对数据

信源分级 · 三轮实测 · 豆包搜索 vs Tavily

豆包搜索 · Web Search for Agent

信源分级 Agent 实测

3 Parts + Conclusion

滑动

PART 01

从人到Agent

搜索对象之变

PART 02

重做一遍调研

先看证据再分析

PART 03

世界杯决赛夜

热点压力测试

PART ///

靠谱只能看事实

开篇一问

AI 搜出来的东西,真的能信吗?

大家好啊,我是甲木。

不管是之前在企业做培训,还是做分享的时候,经常会有朋友问到:AI 搜索出来的结果,其准确性该怎么保证?以及 AI 搜索的信息源又是怎么生成的?

今天这篇文章,就给大家聊一聊关于 AI 搜索Web Search。这话题我之前做过一期内容,今天来接着聊,我找了张图:


— AI 应用技术栈金字塔:最吃劲的一块,是中间那个蓝色小方块 Web Search

从下往上看这座塔:电、数据中心、芯片、Linux、云,再往上,才是你天天在用的 AI 应用。全塔最吃劲的一块,是中间那个蓝色小方块:Web Search。对于时效性信息,AI 给出的每个答案、每份研报、每条投资逻辑,都得打它这儿过一遍。

它无处不在,你一直在用;但它远比大家想象的脆弱。

脆弱在哪?看左边那列原料:新闻站、公司公告、年报,还混着博客、论坛和来路不明的截图、营销号。真真假假、新旧不一,全都灌入这一块。

开头那个问题,答案就藏在这儿。

经常会有朋友说,我喜欢用豆包去查找东西,问豆包已经成为了本能,而且效果也不错,现在它也把这个能力开放给企业和开发者,那我们可以在自己的 Agents 上去调用这个豆包搜索。我现在用的比较多的就是「豆包搜索」来提供的 Web Search 服务,免费够用。

这篇文章刚好拿它为例,和你分享:

1

「搜索」的演化路径以及重要的事

2

「信源分级」及 AI 搜索实战横评(对比 Tavily 效果如何)

供你选择,为自己的 Agent 选择一个好用的 Web Search 服务。

01

PART

搜索的对象,悄悄从人换成了 Agent

FROM HUMAN TO AGENT · 搜索对象之变

要回答这个问题,我们先来看看搜索这门生意的变化历程。过去它服务的是人:敲几个词,挨个挨个搜索结果,自己判断真伪。

AI 搜索往前走一步,直接给人一个综合答案。可 Agent 接到的压根不是单个问题:「研究一家公司」「核查一篇文章」这种活,它得自己拆问题、把问题改写成若干个关键词去查,再一轮轮搜索、筛选信息源、再整合。


— Agent 的搜索:拆问题、改写关键词、多轮搜索与整合

要说找得到、读得全,现在确实有人做得挺漂亮。可有个问题始终没人答:搜回来的这一堆,到底哪条能信?通用搜索眼里,网页不分高低:一份公司公告和一篇公众号,分量差不多。

更麻烦的是,这堆原料还在加速变质:如今互联网上充斥着 AI 生成的垃圾信息和洗稿文,通用搜索稍不留神就会把 Agent 带进沟里。


— AI 生成的垃圾信息与洗稿文,正让搜索原料加速变质

最近注意到豆包搜索,就是因为火山引擎把它定位成「为 Agent 构建的信息获取引擎」。用人话说:它不仅是个搜索引擎,还是个信息质检员。它搜回来的每条结果,都标好了发布时间和确定信息源,甚至还把信源分了等级:权威公告是一档,主流媒体是一档,XX 自媒体又是一档。


— 豆包搜索给每条结果标注发布时间与信源等级

巧了不是,给来源分等级这件事,去年那篇「AI 事实核查方法论」的文章就给大家讲过,整套办法就两张图:


— 去年「AI 事实核查方法论」里的信源分级思路


一级信源 · 结论锚点

公司公告、监管披露、政府统计、权威学术期刊、国际组织数据和顶级机构正式报告。


二级信源 · 专业补充

行业协会、知名咨询机构、主流媒体与专业出版物。核心数字仍要追到原始材料。


三级信源 · 线索池

公众号、博客、论坛和社交媒体。适合发现争议,不能单独支撑结论。


四级信源 · 禁止进入底稿

匿名爆料、无法追溯的「内部消息」、强广告内容和无证据判断。


— 信源四级分层:从一级结论锚点到四级禁入底稿

那会儿这套全凭自己一双手,点击一条、查看一条、判断一条,累得够呛。

所以看到豆包搜索给来源分等级的思路竟跟我这套对上了,我一下就来了精神。

02

PART

重做一遍调研:先看证据,再谈分析

EVIDENCE FIRST · 证据优先

是骡子是马,拉出来遛遛

为了测试这套方法到底顶不顶用,我拿「寒武纪」把整套调研重做了一遍。

演示环境:Claude Code + Doubao-Seed-Evolving 模型,大家也可以按需搭配。

PS:Doubao-Seed-Evolving 模型是豆包 Seed 每周保持迭代的模型版本,1M 上下文。火山方舟的 Agent Plan 订阅用户,套餐内同时包含 Evolving 模型和豆包搜索 API 额度。

✦ 顺带一提

豆包搜索每个账号每月提供 500 次免费额度,个人使用绰绰有余。它支持 API、MCP 和官方 Skill 三种方式接入 Agent,本文是通过 MCP 的方式接入的。


— 豆包搜索支持 API、MCP、官方 Skill 三种方式接入 Agent

为了看清不同搜索源对 Agent 的影响,在同一条指令、同一家公司的前提下,我设计了三组对比实验:


第一遍 · 不挂任何搜索

让模型纯凭自身记忆盲答。


第二遍 · 挂载 Tavily

一款通用的 Agent 聚合搜索。


第三遍 · 挂载豆包搜索

走火山引擎的搜索生态。

整个复现过程并不复杂。在火山引擎开通相关服务后,直接把帮助文档和 API key 喂给自己的 Agent 即可。

豆包搜索的官方文档:console.volcengine.com/search-infinity/web-search-exp


— 开通服务后,把帮助文档和 API key 喂给 Agent 即可

具体指令如下:

. . . prompt · 研究底稿指令

你是一名上市公司基本面研究 Agent。请围绕寒武纪(688256),

完成一份截至 2026-07-27 的公司研究事实底稿。

> 本任务不预测股价,也不直接给出买卖建议。

> 请先建立一套及时、权威、可追溯的事实基础。

> 执行规则(共 8 条,摘 4 条):

> 1. 先拆解研究问题,再调用搜索,不要直接生成结论。

> 2. 信源优先级:公司公告年报和交易所披露 > 政府监管

和行业协会 > 权威数据库券商研究和主流财经媒体 > 其他网页。

> 3. 每个关键 Fact 必须保留标题、发布日期、原始 URL、

检索日期和信源等级。

> 4. 找不到可靠证据时,明确写「无法核实」,禁止根据常识补全。


— 把研究指令喂给 Agent,让它先建证据、再谈分析

中间经过数轮调研,给出来了一个结果。


— 经过数轮调研后给出的事实底稿结果

为了方便展示,结果直接看这张对照图。


— 三组实验对照:不挂搜索 / 挂 Tavily / 挂豆包搜索

图里最能说明问题的是「字节占营收比」这条:


不挂搜索

模型直接两眼一抹黑,给不出数据。


挂 Tavily

极其自信地给出了错误答案:「字节是第一大客户、2024 年占近 80%」。它塞给 Agent 的全是自媒体的猜测文和转载稿,完全忽略了公司官方年报里压根没具名客户的事实。


挂豆包搜索

结果完全不同。因为有「官方年报」作为一级信息源,AI 核对出官方未具名客户,第一大客户其实约占 26%。


— 豆包搜索以官方年报为一级信源,核对出第一大客户约占 26%

你想要的内容,豆包搜索都会给你进行信源验证,并且进行权威性分级。


— 每条结果都做信源验证与权威性分级

为了验证这不是偶然,我又换了天孚通信(300394)按照同样的方法跑了一遍:

最能说明问题的是那条「6 月沟通会说 Q2 持平」的坊间传闻:


不挂搜索

完全无从核验。


挂 Tavily

它其实也搜到了公司否认的消息,但因为信源杂乱,大模型在生成答案时被自媒体带了节奏,竟然顺手引申成了「Q2 仍增长」。


挂豆包搜索

它一路溯源,直接把深交所互动易上官方那句「端午假期并未开会」作为高优信源递了上来。Agent 拿到这记「实锤」后,果断在底稿里如实标了「传闻不实」。


— 天孚通信:深交所互动易官方回应成为高优信源,判定「传闻不实」

虽然 Tavily 找得其实也又快又全,连巨潮资讯网的年报原文都能扒出来。

但是对于现在的 AI 搜索来说,它的使命就是给 Agent 这个精炼机提供高纯度的矿石。如今各家的差距早已不在于「能不能搜到」,而在于把海量信息捞回来之后,搜索能不能提前给信源排好座次,直接告诉你到底该信谁。


— AI 搜索的分水岭:能不能提前给信源排好座次

03

PART

换个赛道,再遛一遍:世界杯决赛夜

WORLD CUP NIGHT · 热点压力测试

投研只是我拿来讲道理的例子,这套核查流水线,放到全民吃瓜的热点事件上照样好使。

比如刚踢完的 7 月 19 日世界杯决赛,西班牙对阵阿根廷。这种全民话题,官方通报、媒体报道和自媒体小道消息全搅和在一起,泥沙俱下,最考验搜索的成色。


— 世界杯决赛夜:官方通报、媒体报道与小道消息泥沙俱下


挂 Tavily

答核心事实确实快——1 比 0 加时、托雷斯进球、大都会(MetLife)球场。可一到争议话题就露馅:前脚刚说金球奖是罗德里,后脚就把「赛事最佳」安给了梅西,左右互搏;甚至还把「FIFA 拒绝重赛请愿」写成了板上钉钉的定论,但其实官方压根还没理这茬。


挂豆包搜索

比分、进球分钟、恩佐的红牌、80663 名观众、裁判名单……每条数据都挂着具体时点和一手出处。最绝的是,它像个判官一样把坊间传闻逐条过了堂:「决赛延期」被证伪、「梅西拿金靴」不实(实际是姆巴佩)、「裁判受贿」尚无确凿证据,而「6 万多球迷请愿重赛」确有其事。最打动我的是一个细节:在扒不到银球、铜球奖的一手信源时,Agent 老老实实地在底稿里标了一句「无法核实,建议不写」。

给不给得出细节是其次;给出的细节带不带出处、敢不敢认账,才是工具好坏的分水岭。

对了,这里再补充一句,豆包搜索分着「Global 版」「Custom 版」,满足不同需求。

Global版本:开箱即用的通用搜索,内置搜索规则无需额外配置,覆盖广;

Custom版本是基于企业场景打造的规则版本,能够更好的适配企业复杂场景。

上述三个 case,我拿「豆包搜索」跟「Tavily」作对比,Tavily 就是只搜搜,不对新闻质量负责,豆包搜索的信源做的是真不错,质量也会更好,所以拿出来给大家分享。

而如果提到价格,国外 Tavily 等,有月免费额度,但付费区间定价基本在 0.03 元/次以上。「豆包搜索」给了每人每月 500 次免费搜索,超额后单次定价 0.02 元/次……还有包月套餐模式,能低至 0.005 元/次(不过包月有日限额)。

免费额度已经足够个人开发者的使用,字节大善人!

LAST

CONCLUSION · 靠谱只能看事实

Agent 的「聪明」看模型,但它的「靠谱」只能看事实。

再强的模型,一旦被喂了带毒的原料,也只会以更系统的方式把错误无限放大。

顺带交代一下这次的跑测环境:这几轮测试,我用的底层大模型都是Doubao-Seed-Evolving——这是豆包 Seed 系列里保持周更迭代的版本,1M 上下文,主攻 Coding 和 Agent 场景。


— 跑测底层模型:Doubao-Seed-Evolving,1M 上下文,主攻 Coding 与 Agent

想上手试试的同学,目前豆包搜索已经正式面向企业和开发者开放。配合火山引擎的 Agent Plan,基本可以一键把搜索和模型同时打包塞进你自己的 Agent。

说了这么多,它最核心的价值其实就一句话:

在 AI 开口说话之前,逼着它先把事实找对,把出处留下,把不知道的盲区老实交代。

让搜索提供高纯度的矿石,把盲目信任变成有据可查,这才是 AI 搜索该有的样子。

以上。

我是甲木,热衷于分享一些 AI 干货内容,同时也会分享 AI 在各行业的落地应用。


如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下期再见

转发

THANKS FOR READING

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
团队去度假,模型还在变强:Anthropic设计主管的5条反常识

团队去度假,模型还在变强:Anthropic设计主管的5条反常识

固件更新中
2026-09-14 03:13:14
皇马前6场战绩对比,上季6胜0负,本季5胜1负

皇马前6场战绩对比,上季6胜0负,本季5胜1负

懂球帝
2026-09-14 13:00:06
都体主编:穆阿尼5000万欧连一半都不值,他浪费球队财政资源

都体主编:穆阿尼5000万欧连一半都不值,他浪费球队财政资源

懂球帝
2026-09-14 20:34:23
我去男友家过夜,半夜他哥和他爸走进卧室,我装睡,却听见他哥说:爸,就是她,跟妈27年前长得一模一样

我去男友家过夜,半夜他哥和他爸走进卧室,我装睡,却听见他哥说:爸,就是她,跟妈27年前长得一模一样

黎兜兜
2026-09-14 12:24:13
性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

性专家说:当一个异性开口跟你要钱,要礼物,不管对方是不是想试探你的真心,你都应该明白,你已被对方列入供养者行列

心理观察局
2026-08-05 06:46:04
iPhone 18 Pro勃艮第酒红色卖爆!有评价“丑到不忍直视”,网友:不买这个色谁知道是新款…还有款式溢价3000元

iPhone 18 Pro勃艮第酒红色卖爆!有评价“丑到不忍直视”,网友:不买这个色谁知道是新款…还有款式溢价3000元

北京商报
2026-09-14 12:27:17
大一女生穿“洛丽塔”报到,本以为能惊艳全场,没想到连行李都没人愿意帮忙搬

大一女生穿“洛丽塔”报到,本以为能惊艳全场,没想到连行李都没人愿意帮忙搬

妍妍教育日记
2026-08-23 10:10:12
昨晚,有点崩。。

昨晚,有点崩。。

搬砖小组
2026-09-15 07:17:52
国家反诈中心APP的AI鉴图,成了网友们对付恶意的利器

国家反诈中心APP的AI鉴图,成了网友们对付恶意的利器

手谈姬
2026-09-14 13:17:07
烟草系统拉响警报:再这样下去,中国烟草真要出大问题

烟草系统拉响警报:再这样下去,中国烟草真要出大问题

阿振观点
2026-08-25 05:56:32
创近两年来IPO审核最快终止纪录,申报创业板上市仅三个半月,久易股份二闯A股缘何又当“逃兵”?

创近两年来IPO审核最快终止纪录,申报创业板上市仅三个半月,久易股份二闯A股缘何又当“逃兵”?

叩叩财讯
2026-09-15 03:15:01
每天只吃8小时,全因死亡风险飙升34%!16+8轻断食,这次真的翻车了

每天只吃8小时,全因死亡风险飙升34%!16+8轻断食,这次真的翻车了

爱医斯坦
2026-09-14 13:20:08
速递!广东宏远官方发声,朱芳雨李春江罕见合体,徐昕办签证准备赴美

速递!广东宏远官方发声,朱芳雨李春江罕见合体,徐昕办签证准备赴美

多特体育说
2026-09-15 00:05:03
不痴呆的老人,大多在60-65岁间

不痴呆的老人,大多在60-65岁间

芹姐说生活
2026-09-15 00:55:06
男性衰老的标志:1臭、2大、3小,如果你没有,说明还年轻!

男性衰老的标志:1臭、2大、3小,如果你没有,说明还年轻!

医学科普汇
2026-08-04 20:10:07
2.45亿人同时离场!中国最特殊的一代人,正在关上时代大门

2.45亿人同时离场!中国最特殊的一代人,正在关上时代大门

小虎新车推荐员
2026-09-05 01:27:47
离世不到24小时,央视人民日报接连点名敬一丹,释放三个强烈信号

离世不到24小时,央视人民日报接连点名敬一丹,释放三个强烈信号

萧佉影视解说
2026-09-15 05:26:08
“长得不好看,真考不上!”老师劝退视频火了,说得已经很委婉了

“长得不好看,真考不上!”老师劝退视频火了,说得已经很委婉了

泽泽先生
2026-08-20 15:35:06
中方,对菲律宾态度变了

中方,对菲律宾态度变了

戎评
2026-09-14 16:10:07
广汽集团电脑采购两度失败后终于落地 华为联想等知名企业都没来

广汽集团电脑采购两度失败后终于落地 华为联想等知名企业都没来

运营商财经网
2026-09-14 17:34:01
2026-09-15 08:00:50
甲木未来派 incentive-icons
甲木未来派
致力于分享 AI 应用,Prompt & AI Agent,在AI世界中虚心求教
54文章数 17关注度
往期回顾 全部

科技要闻

时隔近9年,特斯拉新款Roadster拟十一发布

头条要闻

"金龟子"刘纯燕悼念敬一丹:她见证了我和王宁的爱情

头条要闻

"金龟子"刘纯燕悼念敬一丹:她见证了我和王宁的爱情

体育要闻

兹维列夫,从三十年0冠到一百天2冠

娱乐要闻

敬一丹采访视频曝光,原来早有预兆

财经要闻

东莞证券原副总裁主动投案

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

数码
艺术
房产
本地
公开课

数码要闻

苹果Siri AI终于来了!历经延期后正式开放测试

艺术要闻

笔精墨妙有情怀,丁玉蝶画马,看完直呼绝了!

房产要闻

网易房产|《让爱驻下》云首发!以一首歌,致敬广州赶路人

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版