> ## Documentation Index
> Fetch the complete documentation index at: https://docs.counso.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Extract Data（提取数据）

如果工作区提供 **Extract Data** 操作，它可以让智能体在指定时间范围内处理较大范围的数据来源，并提取结构化信息。操作会按设定的 schema 返回对象列表，供智能体生成答复。该操作最高可处理 500,000 个 token 的来源内容；实际可用上限可能因工作区配置而异。

该操作适合从邮件列表生成周期摘要，或从持续产生的客服记录中提取固定字段。它与搜索互补：搜索会返回相关段落，但不保证处理整个来源范围；**Include Data** 则受自身上下文容量限制，主要面向近期资料。

## 配置 Extract Data

1. 如果 Agent Builder 提供此操作，为智能体添加 **Extract Data**。
2. 选择要处理的数据来源，方式与配置搜索类似。常见来源包括 Slack 频道、由集成填充的文件夹或客服工单来源。只选择工作区已连接、且智能体使用者有权访问的来源。
3. 如需更多控制项，展开 **Advanced Settings（高级设置）**。
4. 选择时间范围。默认情况下，操作可以根据对话内容推断期间；任务要求精确区间时，启用手动选择。
5. 如果结果需要稳定字段，定义提取 schema。可以直接填写 JSON Schema，也可以点击 **Generate（生成）**，根据指令生成草稿后再编辑。如果不指定 schema，操作会根据对话上下文确定结构。
6. 保存智能体，并先用一段较短且有已知记录的时间范围进行测试。扩大日期范围前，对照来源检查返回对象。

## 编写有效的提取指令

说明要提取什么、如何处理重复事项，以及字段缺失时怎么办。例如，每周客服摘要可以按公司归并互动，合并同一公司的多次联系，并返回简短要点、未解决问题和明确提出的需求。不要用相似记录补全空缺；缺失值应留空，或按 schema 规定的格式填写。

智能体综合生成最终答复前，可以检查提取出的对象。要求它保留来源标识，并区分直接提取的事实和归纳内容。Extract Data 处理的数据范围较大，可能比普通检索耗时更长。schema 只约束结果结构，不能保证每个字段都准确或完整。
