CREAO 官宣 TinyFish 成为 Agent 默认 Web 层:重构网页读取与学术检索架构
在 CREAO 的 Agent 生态中,Agent 能够编写逻辑、执行任务、连接真实账户,并将成功的会话转化为持续运行的自动化流程。然而,长期以来,Agent 访问实时互联网的能力并非标配。
过去,CREAO 的网页读取功能依赖于用户手动配置的第三方工具 Firecrawl。这种“可选集成”模式导致了严重的生产事故:如果用户未配置 Firecrawl,Agent 在尝试读取网页时会在认证边界处失败。从 Agent 视角看,该工具存在;但从产品视角看,它不可靠。对于“读取此页面”这样基础的操作,这种不确定性是致命的。
此外,现有的通用搜索引擎虽然能处理宽泛查询,但无法保证新闻的严格时效性,也无法为学术研究提供作者、发表 venue、引用次数及直接 PDF 链接等关键元数据。
为了解决这些问题,CREAO 决定彻底重构其 Web 层,将 TinyFish 作为默认基础设施,使其像电力或网络一样,对所有 Agent 默认可用且无需额外配置。
核心架构升级:三大 Agent 工具
CREAO 并未简单地将 TinyFish 作为另一个 API 集成,而是根据 Agent 的不同工作流,将其拆分为三个专用的工具层:
-
web_fetch(基于 TinyFish Fetch API)- 功能:读取实时网页内容。支持单次调用最多 10 个 URL。
- 特性:TinyFish Fetch 能够渲染复杂的 JavaScript 页面,自动剥离导航栏、广告和脚本,返回干净的 Markdown、HTML 或结构化文档树。这消除了 Agent 在解析单页应用(SPA)或空 HTML 外壳时的痛点。
- 价值:Agent 可以直接利用页面中的外链进行下一步导航,无需再次发起搜索循环,极大提升了长链路任务的效率。
-
paper_search(基于 TinyFish Search API)- 功能:专为学术文献检索设计。通过设置
domain_type=research_paper,返回包含作者、发表 venue、年份、引用计数及直接 PDF 链接的结构化结果。 - 价值:让 Agent 能够基于论文的全文内容而非仅摘要进行综合研究,填补了通用搜索在学术领域的空白。
- 功能:专为学术文献检索设计。通过设置
-
news_search(基于 TinyFish Search API)- 功能:针对时效性要求极高的新闻查询。通过设置
domain_type=news,并配合严格的发布窗口(Hard Freshness Window)。 - 价值:解决了通用搜索无法保证新闻“新鲜度”的问题,确保运行在定时任务中的新闻 Agent 获取的是绝对最新的信息。
- 功能:针对时效性要求极高的新闻查询。通过设置
技术亮点:为何 TinyFish 是最佳选择?
TinyFish 之所以能成为 CREAO 的默认层,源于其设计哲学与 Agent 执行模型的完美契合:
- 原生模型输入格式:Fetch 返回的内容已经是渲染并清洗过的,可以直接作为模型上下文(Context Window)输入。无需额外的胶水代码去清理站点导航或处理 JS 渲染后的空壳,大幅减少了故障点。
- 批量处理优化:Agent 的 Fan-out(并行度)通常较高。TinyFish Fetch 支持单次请求处理多达 10 个 URL,完美匹配了“搜索 -> 筛选 -> 批量读取 -> 综合”的标准工作流。
- 沙箱安全性:新架构在 Ephemeral Sandboxes(临时沙箱)中运行,能够安全地处理不同模型上下文窗口大小的限制,并在部分失败时具备自动恢复机制。
“我们想要的不是另一个 API 集成,而是让网页读取成为一种像基础设施一样的默认能力,确保每一个 Agent 都能可靠地访问实时信息。” —— CREAO 技术团队
此次升级标志着 CREAO 在 Agent 生产化道路上迈出了关键一步,将 Web 访问从“可选插件”转变为“核心原语”,为构建更复杂、更自主的 AI 自动化系统奠定了坚实基础。