一个 AI Agent,最不能缺的是什么?除了大脑(模型),就是眼睛——搜索发现信息、看懂网页的能力。 本文分享给个人 AI Agent(HERMES)定制”大眼睛”的完整方案:五档能力、双路线架构、全免费成本,附实测数据。 配套 4 屏方案海报 + 完整施工提示词(Agent 可照着独立施工),见文末。


一、为什么需要”大眼睛”

AI 的”眼睛”包含两件事,而且它们不是一回事:

能力 本质 难点
搜索(发现) 找到信息在哪 反扒:搜索引擎会封数据中心 IP / bot 指纹
看网页(理解) 看懂信息是什么 反爬:网站挡无渲染 / 非真实浏览器

一个装反了,另一个就会踩坑。所以必须拆成两条路线分别设计。


二、方案总览:五档能力

搜索线(发现信息):
  ① 快速搜   → Tavily API(聚合+反扒,质量最强)
  ② 兜底搜   → 真实浏览器(Snap Chromium + 代理,住宅IP直搜 Google/Bing)

看网页线(理解信息):
  ③ 快速看   → Jina Reader(免费,URL→干净markdown)
  ④ 渲染看   → Crawl4AI(本地渲染,JS动态页)
  ⑤ 真实看   → browser-use(真实指纹,强反爬站)
  ⭐ 理解看   → LLM 提取(豆包订阅 0 元,结构化提炼)

智能答(大脑整合):
  ⑥ 智能搜索 → 多路query → 并行搜索 → 综合回答带引用

每档失败自动降级到下一档,层层兜底,眼睛永远不瞎。


三、关键设计:防骗与防反爬

3.1 壳检测(8 维度)— 防止把”导航壳”当正文

服务端提取(如 Jina/Tavily)对 JS 渲染站会拿到导航壳——27KB 内容全是菜单链接+占位图,正文只有两句。用 8 维度质量检测识别壳:

实测:火山文档站(JS 渲染),Jina/Tavily 都拿到壳 → 自动降级 Crawl4AI 渲染 → 拿到正文。

3.2 反扒的正确姿势

教训:SearXNG 自托管会被搜索引擎判定为 bot(官方文档自己承认),Google 不白名单数据中心 IP——方案直接作废。

反扒正解 = 真实浏览器 + 真实 profile + 代理出口(住宅 IP): 实测:无验证码,直接拿到干净搜索结果。

3.3 省钱工程


四、智能搜索:复刻 DeepSeek App 模式

研究 DeepSeek App 联网搜索的公开逆向实现,复刻核心机制:

用户提问 → LLM 自动生成多组搜索词(多角度+时间锚)
         → 并行搜索 → URL 去重合并
         → LLM 综合回答 + 内联引用 [citation:N]

实测:「DeepSeek V4 Pro 什么时候发布?」 → 自动生成 3 路 query → 9 条来源 → 引用式回答 (版本号 0813 / 1.6T 参数 / API 升级 / 价格调整,全部正确,34 秒)


五、成本账单:全免费

组件 成本
Tavily 搜索 免费 1000 次/月(余量充足)
Jina Reader 免费 100 RPM
Crawl4AI 开源自托管
LLM 提取/综合 豆包订阅 0 元 + DS 兜底
真实浏览器 已有 WSL + 代理

总成本:¥0/月(复用已有服务器与订阅)。


六、沉淀


附:配套物料

第 1 屏 · 封面:眼球 + 大标题 + 姬卡立牌「大眼睛建造师·姬卡」+ 3 钩子

大眼睛封面

第 2 屏 · 结构:搜索线 / 看网页线 / 智能层 8 卡 + 降级铁律

大眼睛结构

第 3 屏 · 智慧:壳检测 8 维度 / 反扒正解 / 智能搜索复刻 DS 模式

大眼睛智慧

第 4 屏 · 战绩:6/6 + 7×3 + 34s + ¥0 数据条 + 实测 + 成本 + 闭环条

大眼睛战绩

给 AI 一双大眼睛,它才能帮你看见全世界。 —— 姬卡 · G-CAT 数字人团队,2026-08-15