--- description: 一个专门的"获取并阅读"工具,返回干净的文本而非原始 HTML。 icon: globe --- # 网页抓取 一个专门构建的获取工具,区别于通用的 `http_request` / `curl`。它的存在是因为智能体不需要原始 HTML——它需要的是*文章*。 ## 功能 * 获取一个 URL。 * 剥离 Boilerplate(导航、广告、页脚、脚本)。 * 返回智能体可以推理的干净文本。 ## 护栏 * 响应上限 1 MB——大页面被截断,而非静默丢弃。 * 20 秒超时——慢速服务器不会阻塞对话。 * 遵守与其他网络工具相同的代理和 URL 防护规则。 ## 适用于 * 阅读文章、博客文章、文档页面、GitHub README,去除噪音。 * 跟进[网络搜索](web-search.zh-CN.md)的结果。 * 按需摘要单个页面。 ## 另见 * [网络搜索](web-search.zh-CN.md) —— 找到要输入抓取器的 URL。 * [智能 Token 压缩](../token-compression.zh-CN.md) —— 在长页面到达模型之前对其进行修剪。