Skip to main content
如果工作区提供 Extract Data 操作,它可以让智能体在指定时间范围内处理较大范围的数据来源,并提取结构化信息。操作会按设定的 schema 返回对象列表,供智能体生成答复。该操作最高可处理 500,000 个 token 的来源内容;实际可用上限可能因工作区配置而异。 该操作适合从邮件列表生成周期摘要,或从持续产生的客服记录中提取固定字段。它与搜索互补:搜索会返回相关段落,但不保证处理整个来源范围;Include Data 则受自身上下文容量限制,主要面向近期资料。

配置 Extract Data

  1. 如果 Agent Builder 提供此操作,为智能体添加 Extract Data
  2. 选择要处理的数据来源,方式与配置搜索类似。常见来源包括 Slack 频道、由集成填充的文件夹或客服工单来源。只选择工作区已连接、且智能体使用者有权访问的来源。
  3. 如需更多控制项,展开 Advanced Settings(高级设置)
  4. 选择时间范围。默认情况下,操作可以根据对话内容推断期间;任务要求精确区间时,启用手动选择。
  5. 如果结果需要稳定字段,定义提取 schema。可以直接填写 JSON Schema,也可以点击 Generate(生成),根据指令生成草稿后再编辑。如果不指定 schema,操作会根据对话上下文确定结构。
  6. 保存智能体,并先用一段较短且有已知记录的时间范围进行测试。扩大日期范围前,对照来源检查返回对象。

编写有效的提取指令

说明要提取什么、如何处理重复事项,以及字段缺失时怎么办。例如,每周客服摘要可以按公司归并互动,合并同一公司的多次联系,并返回简短要点、未解决问题和明确提出的需求。不要用相似记录补全空缺;缺失值应留空,或按 schema 规定的格式填写。 智能体综合生成最终答复前,可以检查提取出的对象。要求它保留来源标识,并区分直接提取的事实和归纳内容。Extract Data 处理的数据范围较大,可能比普通检索耗时更长。schema 只约束结果结构,不能保证每个字段都准确或完整。