Skip to main content
网站数据源可将公开网页纳入检索。在目标 Space 的 Connections 中添加网站连接,并填写一个无需登录即可访问的起始网址。抓取器会沿着该页面中找到的链接继续访问,不会猜测或发现未链接的页面。 根据站点结构设置抓取边界:
  • 选择 Follow all links within the domain,遍历同一域名下可跟随的链接。
  • 选择 Only child pages of the provided URL,将范围限定在某个目录,例如 /articles
  • Page limit 设为 1,只收录起始页面。
  • 使用 Depth of search 限制从起始页出发可以沿链接深入的层数。
抓取范围内可访问的 PDF 可以一并收录。直接填写 Google Docs 的网址时可收录该文件;如果网页链接到其他域名,通常不会跨域抓取。需要登录的页面无法读取,部分网站会屏蔽自动抓取。页面数量上限以当前配置界面为准;只需要少量内容时应设置更小的上限。 首次抓取完成后,搜索一篇已知页面并检查其网址。页面未出现时,确认它无需登录、从起始页可达、位于所选路径和深度内、未超过页面上限,并且站点没有屏蔽抓取。