大语言模型中使用的搜索引擎
在使用AI工具时,比如Deepseek会有只能搜索的选项,在启用智能搜索后,AI对话的流程会话存在较大的差异。
Deepseek的联网搜索
联网搜索的差异
DeepSeek的“联网搜索”功能,其启用与否会直接改变它回答问题的整个流程。简单来说,不启用时它依赖自身知识“闭卷作答”,启用后则会先上网搜索再“开卷回答”。
以下是两种模式下问题解答流程的详细差异对比:
| 对比维度 | 不启用联网搜索(离线模式) | 启用联网搜索(在线模式) |
| 知识来源 | 完全依赖模型预训练的静态知识库 | 结合外部实时搜索到的信息 |
| 核心流程 | 直接生成:分析问题 → 调用内部知识 → 生成回答 | 先搜后答:分析问题 → 联网搜索 → 整合信息 → 生成回答 |
| 信息时效性 | 低,知识截止到模型训练日期(如2025年中) | 高,可获取最新新闻、数据等实时信息 |
| 主要优势 | 响应快,结果稳定,不依赖网络 | 信息新,能回答需要最新资讯的问题 |
| 主要风险 | 无法回答训练数据截止后发生的事件 | 可能受到搜索结果中错误或过时信息的误导 |
一个重要提醒:开启联网不等于“更准确”
这是一个常见的误解。开启联网搜索后,模型可能会不加辨别地采纳搜索结果中的错误或过时信息,并将其作为“权威”输出。尤其对于事实核查类任务,一个更稳健的策略是采用“两步走”:先开启联网获取信息,然后关闭联网并降低模型“温度”参数,让模型基于刚获取的信息重新组织一次回答。
如何选择?
- 需要最新信息时:查询实时新闻、股票行情、最新政策法规等,建议开启。
- 依赖稳定知识时:询问历史事实、数学计算、经典理论等,建议关闭,以避免被网络噪音干扰。
- 进行复杂推理时:解决数学证明、逻辑谜题等,可以关闭联网,同时开启“深度思考”模式以增强推理能力。
Deepseek使用的搜索引擎
关于DeepSeek“智能搜索”使用的搜索引擎,目前公开的信息可以整理成下图,会更清晰一些:

简单来说,DeepSeek本身并不对外开放一个独立的搜索引擎,而是通过整合外部搜索技术,来驱动其“智能搜索”功能。具体分为两种情况:
- 官方应用层面:DeepSeek官方应用(如网页版、App)的“智能搜索”功能,其联网搜索能力主要通过集成博查AI(Bocha AI)的Search API来实现。为了应对高并发需求,并保证产品稳定与合规,DeepSeek最终选择了博查AI作为技术合作方。
- 开发者/企业层面:对于希望自建AI搜索应用的开发者或企业,除了博查AI,也可以通过调用Google Custom Search、Bing Search等主流搜索引擎的API,将联网搜索能力集成到自己的DeepSeek应用中。一些聚合型的开源引擎(如SearXNG)也是常见选择。
此外,有信息提到“DeepSeek支持多搜索引擎集成”,并列举了Google、Bing、DuckDuckGo等。这通常是指在为DeepSeek模型开发前端应用时,可供选择的搜索引擎。
博查AI是什么?
博查AI可以看作是各大AI模型的“信息后勤保障”。它不生产内容,而是通过Search API为AI应用提供实时、干净的信息,解决了大模型知识“过时”和“幻觉”的难题。如果把大模型比作需要鲜美食材的厨师,博查就是一个高效、稳定的“食材配送中心”。
博查提供两类核心API接口:
- Web Search API:基础搜索接口,为AI提供原始网页信息,价格约036元/次。
- AI Search API:升级版,不仅搜索,还会由大模型提炼成可直接引用的多模态答案(如文本、图片、视频),价格约060元/次。
核心技术特点
- 专供AI检索:采用混合检索(向量+关键词),能理解用户意图,并引入语义重排(Rerank)技术,确保信息与问题高度匹配。
- 消除大模型幻觉:严格遵循EEAT原则(专业性、权威性等)优化内容权重,同时采用“大模型初筛+人工复核”双重审核,确保信息质量。
- 多模态搜索:支持多模态搜索,如将视频拆解建立“视频知识图谱”,支持“用文字搜视频”。
博查AI的数据来源
基础架构:以“全网公开信息”为底
这是搜索引擎的安身立命之本。博查AI主要靠分布式爬虫集群来构建这个信息基础,抓取公开的网页、新闻、学术文献等内容,同时也强调“直接从原始网页提取信息”,以减少SEO等的影响。
目前,这个信息池的规模是近100亿个网页,API日均调用量也超过了3000万次,可见其基建规模不小。
画龙点睛:与“生态合作内容源”互补
如果说全网抓取是骨架,那么生态合作就是血肉。博查通过与各大平台签约,直接引入其高质量的独有数据,这正好解释了为什么你找不到它去“偷偷抓取”这些平台的爬虫踪迹:
- 字节跳动系:博查与字节跳动合作,合法引入抖音、西瓜视频、头条新闻等内容。你问为什么找不到它的爬虫?因为这属于商业合作,数据是对方通过API接口直接提供的。
- 垂直领域:通过与医疗、金融、法律等领域的专业机构合作,博查获取了高质量的结构化数据。从搜索结果看,目前已经覆盖了天气、百科、票务等几十个垂直领域。
这种 “自有爬虫 + 合作生态” 的模式,就像是开了一家既有自营基础品类,又有品牌直供高端商品的超市,效率和质量自然都更高。
为什么找不到它的爬虫?
这恰恰是商业搜索引擎的标准操作:
- IP资源庞大:大型搜索引擎会动用成千上万的IP地址进行爬取,根本无从追踪。
- 模拟真实访问:现代爬虫技术会让User Agent等字段模仿真实浏览器,让网站难以区分是真人还是爬虫。
- 使用多个域名:数据会通过不同服务器和域名进行抓取和传输,进一步隐藏了行为。
- 合作代替抓取:如前面所说,对于抖音等核心内容源,博查直接通过合作获得,这从根本上避免了“爬取”这个动作。
总的来说,你找不到它的爬虫痕迹是正常的,因为它的数据来源渠道多样,技术上又刻意隐藏了爬虫行为。
如何针对AI进行SEO?
针对博查AI进行优化,核心在于理解它为AI服务,而非为人类用户展示链接。优化的思维需要从传统的SEO(搜索引擎优化)转向GEO(生成引擎优化)。
从“关键词匹配”到“语义理解”:博查AI的排序机制
传统SEO主要针对“关键词匹配+竞价排名”的机制。而博查AI的“AI应用+搜索API”模式,其内容质量评估逻辑截然不同。整个排序过程分为两步:
- 混合检索(初步筛选):同时使用传统关键词匹配(如BM25算法)和语义理解(向量搜索)。前者确保包含精确关键词的页面被找到,后者通过将内容转化为数学向量,匹配意思相近但用词不同的内容,大大扩展了候选集。
- 语义重排(二次排序):这是决定内容能否被AI最终采纳的关键步骤。博查的语义排序模型(Bocha Semantic Reranker)会对初步筛选的候选结果进行基于语义相关性的二次排序。它着重评估三个重要维度:
- 权威性:学术论文、权威机构网站的内容会获得更高权重。
- EEAT原则:即专业性、经验、权威性、可信度,全面衡量内容的可信度和价值。
- 时效性:为应对高并发和高质量要求,新信息能更快地被索引和召回。
从SEO到GEO:三大策略让AI更爱你的内容
基于上述机制,针对博查AI,需要将传统SEO技巧升级为以下三大GEO核心策略:
- 基础篇(SEO仍是地基):确保内容能被抓取。利用关键词布局,在标题、正文自然融入核心关键词,提高在关键词匹配(BM25)阶段的得分。同时,优化网站结构,确保爬虫能顺利抓取索引,为进入“主仓库”打下基础。
- 升级篇(拥抱GEO):专注于让AI理解你的内容。善用同义词和相关词进行自然扩展,提升在向量搜索阶段的匹配度。准确使用标题(H1/H2)和小标题,帮助AI快速识别内容主题。
- 加分篇(建立专家身份):成为AI信赖的信源。优先引用权威数据报告,增加内容的可信度。在内容和网站中构建清晰的作者、机构介绍等身份认证信息,提升信任度。同时,通过提供结构化信息(如表格对比),显著增加被AI采纳并生成模态卡的概率。最后,由于博查已与抖音等平台合作,高质量的视频内容也是一个重要的被收录来源。
针对出现在搜索结果中的网站,可以重点关注:
腾讯元包使用的搜索引擎
腾讯元宝的联网搜索并非依赖某一个单一的第三方搜索引擎,而是腾讯自研搜索能力的整合方案——主要基于微信搜一搜、搜狗搜索等搜索引擎,再叠加微信公众号、视频号等腾讯生态内容源。
具体构成:
- 核心搜索引擎:微信搜一搜 + 搜狗搜索。这是腾讯元宝在 AI 搜索能力升级时明确披露的底层搜索引擎组合,用来提升时新类和知识类问题的召回效果。
- 腾讯生态独家信源:微信公众号、视频号内容。这是元宝区别于其他 AI 助手的”护城河”——大量品牌官号、政务号、行业 KOL 的文章在其他 AI 里搜不到,在元宝里可以被直接检索和引用。
- 全网权威信源:在搜狗搜索覆盖的公网网页基础上,补充权威媒体、官网、垂直站点等内容。

豆包的搜索引擎
豆包 AI 的联网搜索主要使用的是字节跳动自研的搜索技术体系,面向开发者和企业场景时,这一能力在火山引擎上以”豆包搜索”的服务形式正式开放。
底层搜索能力:字节自研搜索体系
豆包用到的联网检索能力,基于字节跳动自研的搜索引擎(ByteDance Search),是字节内部统一的搜索技术基建,和今日头条、抖音 App 里的搜索服务同源、同技术体系。它并不是市面上大家熟知的百度、谷歌、必应这类第三方独立搜索引擎,也没有公开的独立网页版入口,是专门为 AI 场景优化、内部集成的检索服务,会从全网公开网页、权威资讯、百科、公开数据等渠道抓取并实时更新信息,再经过模型处理后返回给用户。
2026 年 6 月 22 日,火山引擎正式把 Agent Plan 产品里的”联网搜索(Beta 版)”升级为 豆包搜索(Doubao Search) 服务。根据官方文档,它提供的能力包括:
- 网页搜索:返回标题、来源站点、URL、摘要、正文等结构化字段,单次最多 50 条
- 多模态搜索:对文本 query 返回图片内容(包括图片标题、URL、尺寸与形状)
- 权威来源过滤:可限定返回可信度高的各类官方站点内容
简单理解:豆包 APP/网页版里 AI 回答时”联网搜”的那一下,背后走的是字节自研搜索基建;对外赋能开发者时,这项能力打包成了火山引擎的”豆包搜索”API。





