---
description: 一个专门的"获取并阅读"工具,返回干净的文本而非原始 HTML。
icon: globe
---
# 网页抓取
一个专门构建的获取工具,区别于通用的 `http_request` / `curl`。它的存在是因为智能体不需要原始 HTML——它需要的是*文章*。
## 功能
* 获取一个 URL。
* 剥离 Boilerplate(导航、广告、页脚、脚本)。
* 返回智能体可以推理的干净文本。
## 护栏
* 响应上限 1 MB——大页面被截断,而非静默丢弃。
* 20 秒超时——慢速服务器不会阻塞对话。
* 遵守与其他网络工具相同的代理和 URL 防护规则。
## 适用于
* 阅读文章、博客文章、文档页面、GitHub README,去除噪音。
* 跟进[网络搜索](web-search.zh-CN.md)的结果。
* 按需摘要单个页面。
## 另见
* [网络搜索](web-search.zh-CN.md) —— 找到要输入抓取器的 URL。
* [智能 Token 压缩](../token-compression.zh-CN.md) —— 在长页面到达模型之前对其进行修剪。