> ## Documentation Index
> Fetch the complete documentation index at: https://docs.counso.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 网站数据源

网站数据源可将公开网页纳入检索。在目标 Space 的 **Connections** 中添加网站连接，并填写一个无需登录即可访问的起始网址。抓取器会沿着该页面中找到的链接继续访问，不会猜测或发现未链接的页面。

根据站点结构设置抓取边界：

* 选择 **Follow all links within the domain**，遍历同一域名下可跟随的链接。
* 选择 **Only child pages of the provided URL**，将范围限定在某个目录，例如 `/articles`。
* 将 **Page limit** 设为 `1`，只收录起始页面。
* 使用 **Depth of search** 限制从起始页出发可以沿链接深入的层数。

抓取范围内可访问的 PDF 可以一并收录。直接填写 Google Docs 的网址时可收录该文件；如果网页链接到其他域名，通常不会跨域抓取。需要登录的页面无法读取，部分网站会屏蔽自动抓取。页面数量上限以当前配置界面为准；只需要少量内容时应设置更小的上限。

首次抓取完成后，搜索一篇已知页面并检查其网址。页面未出现时，确认它无需登录、从起始页可达、位于所选路径和深度内、未超过页面上限，并且站点没有屏蔽抓取。
